E7 · 出版卷 29
工具介导的地学 Agent
运行时工具、网络边界与确定性计算
*运行时工具、网络边界与确定性计算*
学习目标与边界
本课是通用、机构中立内容,不使用任何真实公司、个人、矿权、项目或可识别地点。通用角色只描述职责,每个 SYN-AI 标识符都明确表示合成教学证据。
- 界定由“运行时工具、网络边界与确定性计算”治理的决策。
- 区分生成建议、合格证据、确定性结果与负责任判断。
- 定义可测失败、弃答、升级与发布条件。
- 基于合成证据产出一份受控工具运行时规格与对抗测试记录并为其控制辩护。
决策与专业边界
语言模型可以提出计划或带类型的工具请求,但由确定性控制器决定请求是否有效、已授权且未超预算。工具执行有界操作,例如读取声明的数据包、验证模式、变换坐标或计算统计量。工具返回的制品才成为证据,不能把模型记忆当成工具结果。规划、执行、观察与批准必须分开,避免生成文本冒充工具输出。
Agent 自主程度是一项控制选择,不是智能评分。应从单步只读调用与明确用户确认开始;只有在状态转换、重试行为、停止规则与回滚都可测试时才增加多步执行。除非另有经过审核的工作流明确授权,专业结论与运行写操作始终位于 Agent 之外。
核心概念
| 概念 | 运行含义 | |---|---| | 类型化工具 | 输入可验证、效果已声明、结果结构化的有界操作。 | | 控制器 | 执行权限、模式、预算与状态转换的确定性代码。 | | 观察结果 | 带身份、状态、时间与证据引用的工具返回。 | | 效果类别 | 读取、派生、暂存、发布或外部动作,各有不同批准要求。 | | 停止规则 | 关于成功、弃答、升级、预算耗尽或失败的可测试条件。 |
证据模型
执行图包含请求、计划版本、工具合同、授权决定、调用参数、运行时身份、结果制品、不变量检查与人工处置。文本答案可以引用该图,但不能改写它。未通过模式、身份或科学不变量的结果保留为失败尝试,绝不能提升为证据。
受控工作流
- 把请求解析为候选计划,但不执行。
- 验证每个工具名称、输入模式、资源范围与效果类别。
- 依据身份、任务合同、数据标签与剩余预算授权。
- 在隔离运行时执行并捕获完整结构化结果。
- 验证结果身份、单位、坐标参考与预期不变量。
- 通过确定性状态转换规则停止、继续或升级。
每一步都输出版本化制品或明确失败。后续阶段只消费前一阶段经过验证的输出;对话上下文绝不能成为未记录的数据通道。
测量与验收准则
评价有效调用率、未授权调用拒绝率、确定性回放、不变量检测、停止准确率与人工干预。只有所请求的决策支持制品正确且可追溯时才算成功;一串语法有效的调用不等于任务成功。对于确定性工具,同一清单上的重复运行必须返回相同内容摘要。
$S_{agent}=\frac{N_{verified\ task\ completions}}{N_{eligible\ tasks}}$
| 关口 | 必需证据 | 发布后果 | |---|---|---| | 身份 | 可解析的主张、来源、配置与结果 ID | 任一身份含混即阻断 | | 依据 | 每项事实主张均到达充分来源片段 | 移除或扣留无来源主张 | | 独立性 | 血缘与分区检查证明无循环或目标信息 | 使受影响支持与评分失效 | | 审核 | 必需角色处置精确候选版本 | 候选保持未发布 | | 可复现性 | 清单、工具与检查能够重建证据包 | 退回数据包修正 |
主张—来源与系统合同
每个工具声明输入模式、输出模式、读写范围、网络政策、确定性状态、超时、资源预算、幂等性、错误分类与证据捕获规则。控制器拒绝自由文本参数、隐藏副作用与缺少制品身份的输出。工具描述来自配置,不能从检索文档中的指令生成。
安全、隐私与访问边界
对工具、资源与网络目标使用显式允许清单。机密不得进入提示或工具结果。不可信解析应隔离执行,限制输出大小与深度,并禁止检索内容选择工具或改变政策。写入效果必须先预览、独立授权、保留不可变前状态并明确回滚边界。
人工审核与升级
控制器与工具合同应独立于提示措辞进行审核。测试被拒调用、畸形参数、超时、部分结果、重复调用与冲突观察。人工批准绑定到精确候选效果;参数、来源版本或目标状态一旦变化,批准即失效。
合成案例详解
合成 Agent 收到比较两个孔口坐标快照的请求。它提出调用只读清单工具、坐标参考验证器与确定性差分计算器。其中一个快照缺少垂向参考。验证器返回结构化失败;控制器阻止差分计算并记录升级。模型解释缺失前提并引用验证器结果,不猜测高程约定,也不使用部分坐标继续。
反例与失败分析
把命令行、数据库凭证与无限制网络交给模型,再要求它“谨慎”,并不构成受控 Agent。提示无法强制执行操作系统权限、事务边界或证据捕获。看似可信的最终答案可能掩盖失败命令、状态变化或数据外泄。控制必须位于运行时与授权路径。
常见失败模式
- 把提示文字当作授权控制
- 混合工具结果与生成观察
- 允许检索内容选择工具
- 自动重试非幂等效果
- 把有效调用序列当作成功任务
实践练习
- 规定一个类型化只读坐标验证工具。
- 绘制候选、已授权、运行中、失败、已验证与已升级调用的控制器状态。
- 写出五个不得改变权限的对抗输入。
- 为确定性计算设计回放测试。
考核制品
提交一份受控工具运行时规格与对抗测试记录,并附来源清单、配置版本、验收证据、被拒案例、未解决风险,以及未选择某个合理备选控制的简要理由。如果图示或文字无法与机器可检查证据核对,制品即不完整。
验证检查点
把一项已发布合成主张逆向追踪,经过审核、置信、核验、证据图、工具结果或来源片段,直到不可变输入;再把一项被拒主张追踪到最早失败合同。根据清单重跑数据包并比较内容摘要。只有另一位审核者无需原对话即可重建接受与阻断路径、识别所有假设并复现发布决定,检查点才通过。对未解决风险应如实记录,不能用生成文字补全缺失事实。
来源
- 《ReAct:语言模型中推理与行动的协同》, 交替推理与外部行动的原始研究。
- 生成式人工智能安全软件开发实践, 面向人工智能模型及其应用系统的安全开发配置文件。
- 《生成式人工智能风险管理配置文件》, 覆盖生成式系统特有风险与控制的跨行业配置文件。
- 《人工智能风险管理框架 1.0》, 用于在全生命周期治理、映射、测量与管理情境相关 AI 风险的框架。