加载中...
avatar
文章
30
标签
40
分类
4
首页
归档
标签
分类
说说
友链
关于
搜索
我的博客【前沿】Agent 架构与工程 返回首页
首页
归档
标签
分类
说说
友链
关于
搜索

【前沿】Agent 架构与工程

发表于2026-08-31|更新于2026-09-02|前沿技术
|总字数:7|阅读时长:1分钟
文章作者: Moyon
文章链接: https://moyon.net.cn/2026/08/31/agent-tech-arch-engineering/
版权声明: 本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 我的博客!
多Agent上下文工程Harness评估架构
请作者喝杯咖啡 ☕
  • 微信
    微信
  • 支付宝
    支付宝
cover of previous post
上一篇
【前沿】协议与工程治理
cover of next post
下一篇
【前沿】Agent 记忆与偏好
相关推荐
cover
2026-08-31
【面试】LivIn 技术面试问答

评论
avatar
Moyon
记录代码、阅读与思考
文章
30
标签
40
分类
4
Follow Me
公告
This is my Blog
目录
  1. 1. 目录
  2. 2. 多 Agent 编排架构:从单兵到层级协作
  3. 3. 一、为什么需要多 Agent
  4. 4. 二、两种基本范式:层级 vs 对等
    1. 4.1. 层级编排(Hierarchical)
    2. 4.2. 对等编排(Peer-to-Peer)
    3. 4.3. 什么时候用哪种
  5. 5. 三、子 Agent 的三种实现形态
    1. 5.1. 子 Agent 的通信约束
    2. 5.2. Claude Code 的两种委派方式
  6. 6. 四、Worker 内部的三阶段模式:research → execute → verify
  7. 7. 五、协调税:多 Agent 的隐性成本
  8. 8. 六、审批关卡:人机协作的安全边界
  9. 9. 七、总结
  10. 10. 补充:A2A 通信协议
    1. 10.1. 消息信封
    2. 10.2. 三种路由模式
    3. 10.3. 能力注册与发现
    4. 10.4. correlation_id 贯穿任务链
    5. 10.5. 与”单向通信树”约束的关系
    6. 10.6. 与 ACP 等协议的对比
  11. 11. Harness Engineering:Agent 的操作系统
  12. 12. 一、马具隐喻
  13. 13. 二、概念演进:Prompt → Context → Harness
    1. 13.1. 第一层:Prompt Engineering(2022—2024)
    2. 13.2. 第二层:Context Engineering(2025)
    3. 13.3. 第三层:Harness Engineering(2026)
  14. 14. 三、为什么偏偏 2025 年底到 2026 年初爆发
    1. 14.1. 原因一:模型够强了,系统设计变成主要差异来源
    2. 14.2. 原因二:长任务暴露了裸模型的系统性缺陷
    3. 14.3. 原因三:串联步骤的可靠性数学
    4. 14.4. 原因四:模型趋于商品化
    5. 14.5. 概念的命名归因
  15. 15. 四、Lilian Weng 的理论框架:Harness 是部署系统
  16. 16. 五、头部公司的实践
    1. 16.1. Anthropic:从双 Agent 到三 Agent
    2. 16.2. Google DeepMind:Aletheia 的 Generator-Verifier-Reviser 循环
    3. 16.3. OpenAI:百万行代码的 Codex 实验
    4. 16.4. Vercel:砍掉 80% 工具反而更好
    5. 16.5. Devin:6 个月 5 次完整重写
    6. 16.6. Stripe:给 Agent 和人类工程师一样的环境
  17. 17. 六、成熟 Harness 的六大核心模块
    1. 17.1. 模块 1:上下文工程与知识管理
    2. 17.2. 模块 2:工具编排与权限设计
    3. 17.3. 模块 3:验证机制与硬约束
    4. 17.4. 模块 4:状态管理与记忆持续性
    5. 17.5. 模块 5:可观测性与反馈闭环
    6. 17.6. 模块 6:人类接管与生命周期管理
  18. 18. 七、Harness 的可撕裂性
  19. 19. 八、风险与局限
  20. 20. 九、新瓶装旧酒?还是真正的创新?
  21. 21. 十、总结与行动路径
  22. 22. 补充:运行时控制流与追踪
    1. 22.1. ReAct 主循环 vs 三阶段模式
    2. 22.2. 编排原语:任务图控制流组合子
    3. 22.3. span 树可观测
  23. 23. 上下文工程:让模型在正确时间看到正确信息
  24. 24. 一、核心认知:大窗口 ≠ 好效果
  25. 25. 二、四大策略:Write / Select / Compress / Isolate
    1. 25.1. Write(选择性记录)
    2. 25.2. Select(相关性筛选)
    3. 25.3. Compress(摘要压缩)
    4. 25.4. Isolate(分区隔离)
  26. 26. 三、四类上下文失控
    1. 26.1. 1. Context Pollution(污染)
    2. 26.2. 2. Context Distraction(干扰)
    3. 26.3. 3. Context Confusion(混淆)
    4. 26.4. 4. Context Conflict(冲突)
  27. 27. 四、Context Rot:上下文腐化
  28. 28. 五、工具数量与性能的关系
  29. 29. 六、草稿空间隔离
  30. 30. 七、分层记忆架构
  31. 31. 八、系统提示词:上下文工程的起点
  32. 32. 九、一个反直觉的经验:保留错误记录
  33. 33. 十、总结
  34. 34. 生成-评估分离:为什么 Agent 不能自己批改自己的作业
  35. 35. 一、自评估的系统性缺陷
  36. 36. 二、三 Agent 架构:Generator-Verifier-Evaluator
  37. 37. 三、为什么分离有效
    1. 37.1. 不同的系统提示,不同的”视角”
    2. 37.2. 不同的工具权限
    3. 37.3. 上下文隔离
  38. 38. 四、串联可靠性:为什么必须有验证层
  39. 39. 五、评估的层次:Trajectory vs Response
    1. 39.1. 评测方法的三个演进阶段
    2. 39.2. Trajectory vs Response:Agent 评估的顶层二分法
    3. 39.3. 评测的核心不是堆指标,而是搭桥
    4. 39.4. 四层评估覆盖
  40. 40. 六、观测是评估的基石
  41. 41. 七、LLM-as-Judge 与 Agent-as-Judge
    1. 41.1. LLM-as-Judge
    2. 41.2. Agent-as-Judge
  42. 42. 八、验证门:防止”自进化”变成随机游走
  43. 43. 九、确定性与概率性的配合
  44. 44. 十、主流 Benchmark 与评估工具景观
    1. 44.1. 综合 Benchmark
    2. 44.2. 领域专项
    3. 44.3. 评估工具系统
  45. 45. 十一、总结
最新文章
【前沿】Agent 记忆与偏好
【前沿】Agent 记忆与偏好2026-08-31
【前沿】Agent 架构与工程
【前沿】Agent 架构与工程2026-08-31
【前沿】协议与工程治理
【前沿】协议与工程治理2026-08-31
【前沿】Skill 与自进化
【前沿】Skill 与自进化2026-08-31
【实习】实习经历面试问答
【实习】实习经历面试问答2026-08-31
© 2026 By Moyon框架 Hexo 8.1.2|主题 Butterfly 5.7.0
×