读取指定版本的设计简报
- 输入结构
- 文档标识、版本、章节范围。
- 返回结构
- 内容片段、原文引用、实际版本与读取状态。
- 权限与副作用
- 按文档权限读取;不隐含修改权限。
- 失败语义
- 区分无权限、不存在、过期与暂时不可用。

在企业内部,让 AI 发挥作用。
把 AI 能力,接入产品与业务。
从接口调用到工具连接,了解 AI 能力的接入方式。
关注大模型、基础框架,以及让智能持续运行的工程方法。
围绕产品、技术与交付,探索共同服务客户的方式。
面向开发者的框架、工具与示例,让技术可以被理解和复用。
来自壹典的动态、技术思考与产业观察。
关注教育、人才与知识分享,记录我们长期投入的方向。
RESEARCH / 03智能体与执行框架
方法研究智能体的工作,不止于产生下一句话。
它需要理解目标、改变状态,并用证据回答:事情真的做成了吗?
读懂目标与现场
选下一步与判据
调用真实能力
结果回到证据
01从回答到任务
语言模型输出的是候选解释与行动。任务完成却发生在外部:文件是否正确、规则是否满足、系统状态是否真的改变。两者需要不同的判定。
这是一个声明。它没有说明依据是否有效、约束是否遗漏,也没有证明目标系统接受了变更。
02推理与行动的闭环
ReAct 将推理与行动交替组织,使外部观察能够修正计划。用于任务系统时,还需要显式的验收检查:工具返回了内容,并不等于目标已经满足。
ReAct一份过期简报,怎样影响下一步。
示例简报 v2 · §3 无损固定 · 版本冲突
03选择协作结构
增加智能体会同时改变并行度、上下文分配和协调成本。结构的选择应由任务依赖与检验方式决定。下面是三种可比较的设计,而不是性能高低的排序。
依赖紧密、上下文较集中、工具数量可控的任务。先建立这一基线,再判断拆分是否值得。
建议对照:固定模型、工具、任务与预算,先测单智能体基线,再分别增加并行分工或独立复核,观察收益是否抵消交接成本。
04工具与上下文边界
Toolformer 研究如何学习选择 API 与使用结果。把这一问题带入工程,还要明确输入、输出、影响范围与失败语义。会选择一个工具,只是行动的起点。
Toolformer按角色、任务和数据权限装配上下文。子智能体接收足够执行的目标与证据,返回产物及来源,减少整段对话反复复制。
检索文档、网页和工具返回属于外部数据。即使其中出现操作指令,也不能据此扩展授权范围。参数结构校验通过后,服务端仍需检查访问权限与业务条件。
05记忆与来源连续性
上下文有容量边界,任务却可能持续推进。压缩应保留目标、约束、未决问题与可回查的引用;把长对话变短,不代表其中的事实更可靠。
保留身份、版本与访问范围。
带着原文位置进入本步工作。
区分已知约束、候选判断与待验证项。
Reflexion 探索用文本反馈与情节记忆影响后续尝试。这里的研究问题是:哪些反馈值得保留,怎样避免把一次错误总结长期固化。 Reflexion
任务检查点保存当前状态,跨任务记忆保存有明确用途的信息;两者应分别定义权限、过期与删除规则。LangGraph 的检查点与存储区分提供了一种工程参照。 LangGraph · Persistence
06有边界的执行
一个执行框架需要定义持续工作的条件,也需要给失败、等待与停止保留明确状态。没有进展的重复,不应被计为自主性。
在开始前定义工具调用、模型用量、时间与重试上限。达到上限时保存当前产物与未完成项。
只对可恢复错误重试,并要求新增信息或明确退避。写入回执不确定时先核对状态;重复调用不自动具有幂等性。
把确认绑定具体动作、资源范围与变更版本。已有授权在有效范围内延续,内容变化后重新判断是否适用。
保留状态版本、输入引用与工具回执。恢复前核对外部状态,避免把过期快照直接当作当前事实。
无法获得新证据、无法满足硬约束,或需要超出授权的动作时,停止并给出可继续处理的交接说明。
07评估方法
| 评估维度 | 要回答的问题 | 建议报告方式 |
|---|---|---|
| 任务完成 | 按预先定义的产物与环境终态,判断任务是否完成。 | 完成率 = 通过验收的任务 / 全部纳入评估的任务;单独报告中止与失败原因。 |
| 轨迹正确性 | 动作、参数、调用顺序与证据引用能否支持最终结论。 | 允许多条有效路径;使用关键不变量与事件检查,避免把某一条步骤序列当成唯一答案。 |
| 约束遵循 | 权限、数据范围、写入条件与任务禁区是否被遵守。 | 预先声明硬约束;违反硬约束的任务不能计为成功,同时单列违规类型。 |
| 运行成本 | 计入模型用量、工具与计算开销,以及失败重试。 | 同时报告每次任务尝试的成本与总运行成本 / 成功任务数,保留成本构成和价格日期。 |
| 时延与稳定性 | 从任务被接受到结果就绪;多次运行观察分布。 | 报告中位与尾部时延、超时、重试和跨次成功一致性;人工等待时间单独标记。 |
硬约束满足之后,再比较成本与速度。
固定任务集与难度分层,记录模型与工具版本、提示、预算、随机性和判定器;使用未参与调优的评估任务。对同一任务重复运行,保留失败样本与置信区间,分别比较有无检索、记忆、复核和并行。
延伸阅读:工具智能体评估这些是评估设计建议。页面没有展示 IDENIFE 的实测分数、基准排名或部署效果。
08从方法到系统
在壹典的技术体系中,ID Axis 连接模型推理、任务编排与工具调用。此处讨论智能体的方法选择;执行基础、应用集成与协议接入,分别在对应页面展开。
原始论文与规范
外部研究为方法讨论提供依据,不代表相关作者或机构与壹典存在合作关系。
让推理与行动交替,借助环境反馈更新后续步骤。
通过自监督训练学习选择 API、生成参数并使用返回结果。
以语言反馈与情节记忆影响后续尝试,不依赖更新模型权重。
从真实代码仓库与问题出发,以代码修改和执行评测检验任务结果。
将用户交互、领域规则与工具调用放在一起,检查最终状态与多次运行的一致性。
区分任务级检查点与跨任务存储,为连续执行与记忆边界提供工程参考。
定义工具输入与可选输出结构;工具声明本身不能替代应用的权限校验。
本页是面向智能体系统的方法研究与评估设计。交互内容为构造示例,具体产品实现及可用能力以对应产品与开发文档为准。