加载中...
avatar
文章
75
标签
61
分类
6
首页
归档
标签
分类
说说
友链
关于
搜索
我的博客【前沿】生成-评估分离:为什么 Agent 不能自己批改自己的作业 返回首页
首页
归档
标签
分类
说说
友链
关于
搜索

【前沿】生成-评估分离:为什么 Agent 不能自己批改自己的作业

发表于2026-08-14|更新于2026-08-25|前沿技术
|总字数:7|阅读时长:1分钟
文章作者: Moyon
文章链接: https://moyon.net.cn/2026/08/14/agent-tech-04-generation-evaluation-separation/
版权声明: 本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 我的博客!
评估生成-评估分离验证
请作者喝杯咖啡 ☕
  • 微信
    微信
  • 支付宝
    支付宝
cover of previous post
上一篇
【前沿】Agent 记忆系统:学术算法演进
cover of next post
下一篇
【前沿】上下文工程:让模型在正确时间看到正确信息

评论
avatar
Moyon
记录代码、阅读与思考
文章
75
标签
61
分类
6
Follow Me
公告
This is my Blog
目录
  1. 1. 一、自评估的系统性缺陷
  2. 2. 二、三 Agent 架构:Generator-Verifier-Evaluator
  3. 3. 三、为什么分离有效
    1. 3.1. 不同的系统提示,不同的”视角”
    2. 3.2. 不同的工具权限
    3. 3.3. 上下文隔离
  4. 4. 四、串联可靠性:为什么必须有验证层
  5. 5. 五、评估的层次:Trajectory vs Response
    1. 5.1. 评测方法的三个演进阶段
    2. 5.2. Trajectory vs Response:Agent 评估的顶层二分法
    3. 5.3. 评测的核心不是堆指标,而是搭桥
    4. 5.4. 四层评估覆盖
  6. 6. 六、观测是评估的基石
  7. 7. 七、LLM-as-Judge 与 Agent-as-Judge
    1. 7.1. LLM-as-Judge
    2. 7.2. Agent-as-Judge
  8. 8. 八、验证门:防止”自进化”变成随机游走
  9. 9. 九、确定性与概率性的配合
  10. 10. 十、主流 Benchmark 与评估工具景观
    1. 10.1. 综合 Benchmark
    2. 10.2. 领域专项
    3. 10.3. 评估工具系统
  11. 11. 十一、总结
最新文章
Hello World
Hello World2026-08-25
AI 日报 · 2026-08-25
AI 日报 · 2026-08-252026-08-25
AI 日报 · 2026-08-24
AI 日报 · 2026-08-242026-08-24
AI 日报 · 2026-08-23
AI 日报 · 2026-08-232026-08-23
AI 日报 · 2026-08-22
AI 日报 · 2026-08-222026-08-22
© 2026 By Moyon框架 Hexo 8.1.2|主题 Butterfly 5.7.0
×