【前沿】Agent 记忆与偏好
发表于|更新于|前沿技术
|总字数:7|阅读时长:1分钟
公告
This is my Blog
目录
- 1. 目录
- 2. 多 Agent 编排架构:从单兵到层级协作
- 3. 一、为什么需要多 Agent
- 4. 二、两种基本范式:层级 vs 对等
- 5. 三、子 Agent 的三种实现形态
- 6. 四、Worker 内部的三阶段模式:research → execute → verify
- 7. 五、协调税:多 Agent 的隐性成本
- 8. 六、审批关卡:人机协作的安全边界
- 9. 七、总结
- 10. 补充:A2A 通信协议
- 11. Harness Engineering:Agent 的操作系统
- 12. 一、马具隐喻
- 13. 二、概念演进:Prompt → Context → Harness
- 14. 三、为什么偏偏 2025 年底到 2026 年初爆发
- 15. 四、Lilian Weng 的理论框架:Harness 是部署系统
- 16. 五、头部公司的实践
- 17. 六、成熟 Harness 的六大核心模块
- 18. 七、Harness 的可撕裂性
- 19. 八、风险与局限
- 20. 九、新瓶装旧酒?还是真正的创新?
- 21. 十、总结与行动路径
- 22. 补充:运行时控制流与追踪
- 23. 上下文工程:让模型在正确时间看到正确信息
- 24. 一、核心认知:大窗口 ≠ 好效果
- 25. 二、四大策略:Write / Select / Compress / Isolate
- 26. 三、四类上下文失控
- 27. 四、Context Rot:上下文腐化
- 28. 五、工具数量与性能的关系
- 29. 六、草稿空间隔离
- 30. 七、分层记忆架构
- 31. 八、系统提示词:上下文工程的起点
- 32. 九、一个反直觉的经验:保留错误记录
- 33. 十、总结
- 34. 生成-评估分离:为什么 Agent 不能自己批改自己的作业
- 35. 一、自评估的系统性缺陷
- 36. 二、三 Agent 架构:Generator-Verifier-Evaluator
- 37. 三、为什么分离有效
- 38. 四、串联可靠性:为什么必须有验证层
- 39. 五、评估的层次:Trajectory vs Response
- 40. 六、观测是评估的基石
- 41. 七、LLM-as-Judge 与 Agent-as-Judge
- 42. 八、验证门:防止”自进化”变成随机游走
- 43. 九、确定性与概率性的配合
- 44. 十、主流 Benchmark 与评估工具景观
- 45. 十一、总结




