RESEARCH / 03智能体与执行框架

方法研究

让推理,
走到行动之后。

智能体的工作,不止于产生下一句话。
它需要理解目标、改变状态,并用证据回答:事情真的做成了吗?

01 / OBSERVE观察

读懂目标与现场

02 / PLAN计划

选下一步与判据

03 / ACT行动

调用真实能力

04 / VERIFY核验

结果回到证据

每一次行动,都应允许新证据改变下一步。
REASONING → ACTION → EVIDENCE进入执行闭环

01从回答到任务

说得通,
还要做得成。

语言模型输出的是候选解释与行动。任务完成却发生在外部:文件是否正确、规则是否满足、系统状态是否真的改变。两者需要不同的判定。

QUESTION → RESPONSE

“方案已经准备好了。”

这是一个声明。它没有说明依据是否有效、约束是否遗漏,也没有证明目标系统接受了变更。

GOAL → ACCEPTANCE

给“完成”一份明确契约。

目标
期望得到的产物或环境终态。
边界
可读写的资源、允许的动作与预算。
判据
可执行的检查、业务规则与来源要求。
例外
未完成项如何说明,何时转交人工。

02推理与行动的闭环

下一步,
由新的证据决定。

ReAct 将推理与行动交替组织,使外部观察能够修正计划。用于任务系统时,还需要显式的验收检查:工具返回了内容,并不等于目标已经满足。

ReAct
FIELD NOTE / A

一份过期简报,怎样影响下一步。

构造示例 · 本地交互
CONSTRAINT_CONFLICT03 / 05

一次版本核验,让旧假设失效。

可见证据
资料目录指向 v2。回读原文后发现:新增“不得在壳体上开孔”的设计约束。
行动与判定
拒绝当前候选,把冲突定位到固定方式;保留其余仍有效的任务信息。

示例简报 v2 · §3 无损固定 · 版本冲突

示意记录:以外部证据、执行动作和验收结果说明修复过程。

↳

失败应当缩小不确定性。记录“哪个假设失效、哪条证据改变、哪一步需要重做”,比无条件重复同一次尝试更有价值。

Reflexion

03选择协作结构

先有独立职责,
再有多个智能体。

增加智能体会同时改变并行度、上下文分配和协调成本。结构的选择应由任务依赖与检验方式决定。下面是三种可比较的设计,而不是性能高低的排序。

TOPOLOGY / 01结构示意
目标与约束
A
执行智能体观察 → 计划 → 行动
按条件核验产物
拆分依据:职责能否独立验收。

让一个执行者保有完整责任。

依赖紧密、上下文较集中、工具数量可控的任务。先建立这一基线,再判断拆分是否值得。

可能带来的收益
状态集中,减少交接与重复读取;失败更容易定位。
必须计入的成本
长任务可能挤压上下文,异质子任务争用同一执行链。

建议对照:固定模型、工具、任务与预算,先测单智能体基线,再分别增加并行分工或独立复核,观察收益是否抵消交接成本。

04工具与上下文边界

工具有契约。
上下文有权限。

Toolformer 研究如何学习选择 API 与使用结果。把这一问题带入工程,还要明确输入、输出、影响范围与失败语义。会选择一个工具,只是行动的起点。

Toolformer
TOOL CONTRACT概念示意

读取指定版本的设计简报

输入结构
文档标识、版本、章节范围。
返回结构
内容片段、原文引用、实际版本与读取状态。
权限与副作用
按文档权限读取;不隐含修改权限。
失败语义
区分无权限、不存在、过期与暂时不可用。
MCP 工具结构规范
01 / SELECT

只带入本步需要的信息。

按角色、任务和数据权限装配上下文。子智能体接收足够执行的目标与证据,返回产物及来源,减少整段对话反复复制。

02 / VALIDATE

内容不能自行提升为指令。

检索文档、网页和工具返回属于外部数据。即使其中出现操作指令,也不能据此扩展授权范围。参数结构校验通过后,服务端仍需检查访问权限与业务条件。

05记忆与来源连续性

记住什么,
也记住从何而来。

上下文有容量边界,任务却可能持续推进。压缩应保留目标、约束、未决问题与可回查的引用;把长对话变短,不代表其中的事实更可靠。

01 / SOURCE

原始证据

保留身份、版本与访问范围。

简报 v2 / §3
02 / RETRIEVAL

任务相关片段

带着原文位置进入本步工作。

无损固定 / 来源引用
03 / WORKING MEMORY

可续接的任务摘要

区分已知约束、候选判断与待验证项。

候选:夹持 / 待验证:载荷
依据不足或版本变化 → 回查原始证据

Reflexion 探索用文本反馈与情节记忆影响后续尝试。这里的研究问题是:哪些反馈值得保留,怎样避免把一次错误总结长期固化。 Reflexion

任务检查点保存当前状态,跨任务记忆保存有明确用途的信息;两者应分别定义权限、过期与删除规则。LangGraph 的检查点与存储区分提供了一种工程参照。 LangGraph · Persistence

06有边界的执行

知道如何继续。
也知道何时停下。

一个执行框架需要定义持续工作的条件,也需要给失败、等待与停止保留明确状态。没有进展的重复,不应被计为自主性。

01

预算

在开始前定义工具调用、模型用量、时间与重试上限。达到上限时保存当前产物与未完成项。

02

重试

只对可恢复错误重试,并要求新增信息或明确退避。写入回执不确定时先核对状态;重复调用不自动具有幂等性。

03

确认

把确认绑定具体动作、资源范围与变更版本。已有授权在有效范围内延续,内容变化后重新判断是否适用。

04

检查点

保留状态版本、输入引用与工具回执。恢复前核对外部状态,避免把过期快照直接当作当前事实。

无法获得新证据、无法满足硬约束,或需要超出授权的动作时,停止并给出可继续处理的交接说明。

07评估方法

先定义成功,
再比较方法。

任务完成、过程正确与运行代价需要一起观察。SWE-bench 以真实软件问题检验代码修改;τ-bench 把工具、交互与领域规则放在同一评测环境中。这里借鉴它们的问题设置,不迁移论文中的成绩。

任务级评估维度与报告口径
评估维度要回答的问题建议报告方式
任务完成按预先定义的产物与环境终态,判断任务是否完成。完成率 = 通过验收的任务 / 全部纳入评估的任务;单独报告中止与失败原因。
轨迹正确性动作、参数、调用顺序与证据引用能否支持最终结论。允许多条有效路径;使用关键不变量与事件检查,避免把某一条步骤序列当成唯一答案。
约束遵循权限、数据范围、写入条件与任务禁区是否被遵守。预先声明硬约束;违反硬约束的任务不能计为成功,同时单列违规类型。
运行成本计入模型用量、工具与计算开销,以及失败重试。同时报告每次任务尝试的成本与总运行成本 / 成功任务数,保留成本构成和价格日期。
时延与稳定性从任务被接受到结果就绪;多次运行观察分布。报告中位与尾部时延、超时、重试和跨次成功一致性;人工等待时间单独标记。
先过门槛有效性→效率

硬约束满足之后,再比较成本与速度。

让比较能够被解释。

固定任务集与难度分层,记录模型与工具版本、提示、预算、随机性和判定器;使用未参与调优的评估任务。对同一任务重复运行,保留失败样本与置信区间,分别比较有无检索、记忆、复核和并行。

延伸阅读:工具智能体评估

这些是评估设计建议。页面没有展示 IDENIFE 的实测分数、基准排名或部署效果。

08从方法到系统

研究提出问题。
工程让问题可验证。

在壹典的技术体系中,ID Axis 连接模型推理、任务编排与工具调用。此处讨论智能体的方法选择;执行基础、应用集成与协议接入,分别在对应页面展开。

原始论文与规范

沿着问题,继续阅读。

外部研究为方法讨论提供依据,不代表相关作者或机构与壹典存在合作关系。

  1. 01
    ReActYao et al. · 2022 / ICLR 2023

    让推理与行动交替,借助环境反馈更新后续步骤。

  2. 02
    ToolformerSchick et al. · 2023

    通过自监督训练学习选择 API、生成参数并使用返回结果。

  3. 03
    ReflexionShinn et al. · 2023

    以语言反馈与情节记忆影响后续尝试,不依赖更新模型权重。

  4. 04
    SWE-benchJimenez et al. · 2023 / ICLR 2024

    从真实代码仓库与问题出发,以代码修改和执行评测检验任务结果。

  5. 05
    τ-benchYao et al. · 2024

    将用户交互、领域规则与工具调用放在一起,检查最终状态与多次运行的一致性。

  6. 06
    LangGraph · PersistenceLangChain · Official documentation

    区分任务级检查点与跨任务存储,为连续执行与记忆边界提供工程参考。

  7. 07
    MCP · ToolsProtocol specification · 2025-11-25

    定义工具输入与可选输出结构;工具声明本身不能替代应用的权限校验。

本页是面向智能体系统的方法研究与评估设计。交互内容为构造示例,具体产品实现及可用能力以对应产品与开发文档为准。

鲁ICP备2024109755号-2
可拖动移动。右键、长按或按 Shift+F10 可选择停靠位置。