加载中...
文章
75
标签
61
分类
6
首页
归档
标签
分类
说说
友链
关于
搜索
我的博客
【前沿】生成-评估分离:为什么 Agent 不能自己批改自己的作业
返回首页
首页
归档
标签
分类
说说
友链
关于
搜索
【前沿】生成-评估分离:为什么 Agent 不能自己批改自己的作业
发表于
2026-08-14
|
更新于
2026-08-25
|
前沿技术
|
总字数:
7
|
阅读时长:
1分钟
请输入密码
Decrypt
文章作者:
Moyon
文章链接:
https://moyon.net.cn/2026/08/14/agent-tech-04-generation-evaluation-separation/
版权声明:
本博客所有文章除特别声明外,均采用
CC BY-NC-SA 4.0
许可协议。转载请注明来源
我的博客
!
评估
生成-评估分离
验证
请作者喝杯咖啡 ☕
微信
支付宝
上一篇
【前沿】Agent 记忆系统:学术算法演进
下一篇
【前沿】上下文工程:让模型在正确时间看到正确信息
评论
Moyon
记录代码、阅读与思考
文章
75
标签
61
分类
6
Follow Me
公告
This is my Blog
目录
1.
一、自评估的系统性缺陷
2.
二、三 Agent 架构:Generator-Verifier-Evaluator
3.
三、为什么分离有效
3.1.
不同的系统提示,不同的”视角”
3.2.
不同的工具权限
3.3.
上下文隔离
4.
四、串联可靠性:为什么必须有验证层
5.
五、评估的层次:Trajectory vs Response
5.1.
评测方法的三个演进阶段
5.2.
Trajectory vs Response:Agent 评估的顶层二分法
5.3.
评测的核心不是堆指标,而是搭桥
5.4.
四层评估覆盖
6.
六、观测是评估的基石
7.
七、LLM-as-Judge 与 Agent-as-Judge
7.1.
LLM-as-Judge
7.2.
Agent-as-Judge
8.
八、验证门:防止”自进化”变成随机游走
9.
九、确定性与概率性的配合
10.
十、主流 Benchmark 与评估工具景观
10.1.
综合 Benchmark
10.2.
领域专项
10.3.
评估工具系统
11.
十一、总结
最新文章
Hello World
2026-08-25
AI 日报 · 2026-08-25
2026-08-25
AI 日报 · 2026-08-24
2026-08-24
AI 日报 · 2026-08-23
2026-08-23
AI 日报 · 2026-08-22
2026-08-22
×