加载中...
avatar
文章
30
标签
36
分类
4
首页
归档
标签
分类
说说
友链
关于
搜索
我的博客【前沿】Skill 与自进化 返回首页
首页
归档
标签
分类
说说
友链
关于
搜索

【前沿】Skill 与自进化

发表于2026-08-31|更新于2026-09-02|前沿技术
|总字数:7|阅读时长:1分钟
文章作者: Moyon
文章链接: https://moyon.net.cn/2026/08/31/agent-tech-skill-evolution/
版权声明: 本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 我的博客!
Skill自进化渐进披露
请作者喝杯咖啡 ☕
  • 微信
    微信
  • 支付宝
    支付宝
cover of previous post
上一篇
【实习】实习经历面试问答
cover of next post
下一篇
【前沿】协议与工程治理

评论
avatar
Moyon
记录代码、阅读与思考
文章
30
标签
36
分类
4
Follow Me
公告
This is my Blog
目录
  1. 1. 目录
  2. 2. Agent Skill 体系:能力封装与渐进式披露
  3. 3. 一、为什么需要 Skill
  4. 4. 二、Skill 的结构
    1. 4.1. SKILL.md 的组成
    2. 4.2. 主体的标准板块
  5. 5. 三、三种目录形态
  6. 6. 四、渐进式披露:核心设计亮点
    1. 6.1. 三级加载
    2. 6.2. 为什么这个设计有效
  7. 7. 五、description:召回的唯一依据
    1. 7.1. 好的 description 模板
    2. 7.2. 单一职责原则
  8. 8. 六、Skill 解决的三个工程问题
  9. 9. 七、Skill 与记忆的关系
  10. 10. 八、总结
  11. 11. 补充:声明式字段与组合
    1. 11.1. 三个声明式字段
    2. 11.2. composable_with:显式组合关系
    3. 11.3. 声明式字段与渐进式披露的配合
  12. 12. Skill 自进化机制:参数派 vs 非参派
  13. 13. 一、两条技术路线的分野
  14. 14. 二、非参进化的底层逻辑
  15. 15. 三、六套代表性方案
    1. 15.1. 参数派(2 套)
      1. 15.1.1. SkillRL:递归技能增强强化学习
      2. 15.1.2. MemSkill:记忆技能自进化
    2. 15.2. 非参派(4 套)
      1. 15.2.1. AutoSkill:无需训练的终身学习
      2. 15.2.2. SkillClaw:多用户交互驱动进化
      3. 15.2.3. SAGER:策略进化 ≠ 记忆进化 ⭐
      4. 15.2.4. SkillOpt:文本空间系统化优化器 ⭐ 当前 SOTA
  16. 16. 四、SkillOpt 五大核心机制详解
    1. 16.1. 机制 1:有界编辑(Edit Budget)= 文本学习率
    2. 16.2. 机制 2:验证门(Held-out Gate)= 防止过拟合
    3. 16.3. 机制 3:拒绝缓冲区(Rejected-Edit Buffer)= 负反馈记忆
    4. 16.4. 机制 4:慢更新(Slow / Meta Update)= 跨 Epoch 长程记忆
    5. 16.5. 机制 5:双模型分工
  17. 17. 五、完整执行流程
  18. 18. 六、六套方案对比总览
  19. 19. 七、从六套方案提炼的设计原则
  20. 20. 自进化 Agent:技术路线全景
  21. 21. 一、什么是自进化 Agent
  22. 22. 二、三问框架:What / When / How
    1. 22.1. What:进化什么
    2. 22.2. When:何时进化
    3. 22.3. How:如何进化
  23. 23. 三、反馈循环框架
  24. 24. 四、四大进化支柱
  25. 25. 五、六条主流技术路线
    1. 25.1. 路线 1:反思与自我批评(Reflection & Self-Critique)
    2. 25.2. 路线 2:强化学习驱动的进化(RL-based Evolution)
    3. 25.3. 路线 3:自博弈与协同进化(Self-Play & Co-Evolution)
    4. 25.4. 路线 4:技能库积累(Skill Library Accumulation)
    5. 25.5. 路线 5:轨迹优化(Trajectory Optimization)
    6. 25.6. 路线 6:自我奖励与评估(Self-Reward & Self-Evaluation)
  26. 26. 六、代表性系统总览
  27. 27. 七、优化阶梯:进化对象的逐级深化
  28. 28. 八、自进化的边界与风险
    1. 28.1. 适用边界
    2. 28.2. 安全边界
  29. 29. 九、六条路线的选择指南
  30. 30. 十、总结
  31. 31. 补充:统计显著性验证与可证伪
    1. 31.1. 统计显著性验证门槛
    2. 31.2. 可证伪原则
    3. 31.3. 小样本与大样本
  32. 32. 自进化闭环工程:从自博弈 Demo 到生产落地
  33. 33. 一、Agent 上线只是开始
  34. 34. 二、三条工程落地路径
  35. 35. 三、Harness 是进化的基础设施
  36. 36. 四、自博弈闭环:五个角色
    1. 36.1. 这个闭环的关键设计
  37. 37. 五、Evaluator 的五维度评估
  38. 38. 六、线上效果回收闭环
    1. 38.1. 策略蒸馏与策略注入:改的核心机制
    2. 38.2. 关键设计:不只发现问题,也发现机会点
  39. 39. 七、夜间自迭代,早上看报告
  40. 40. 八、记忆与持续进化
  41. 41. 九、效果度量
    1. 41.1. 效率提升
    2. 41.2. 质量保证
  42. 42. 十、从客服到通用 Agent
  43. 43. 十一、总结
  44. 44. 补充:候选生成独立步骤与停止阈值
    1. 44.1. 候选生成作为独立步骤
    2. 44.2. CandidateChange 结构
    3. 44.3. improvement_threshold 停止阈值
  45. 45. 补充:评测工程方法论
    1. 45.1. 通用消融实验方法论
    2. 45.2. 自进化曲线
    3. 45.3. 串联可靠性论据
最新文章
【前沿】协议与工程治理
【前沿】协议与工程治理2026-08-31
【前沿】Skill 与自进化
【前沿】Skill 与自进化2026-08-31
【实习】实习经历面试问答
【实习】实习经历面试问答2026-08-31
【面试】开发问题合集
【面试】开发问题合集2026-08-31
【面试】LivIn 技术面试问答
【面试】LivIn 技术面试问答2026-08-31
© 2026 By Moyon框架 Hexo 8.1.2|主题 Butterfly 5.7.0
×