"概念很好,但落地一般"
"self-improving 我们实测了 6 周,结论:概念很好,但目前框架和数据反馈才是真正的性能杠杆,不是'AI 自己变聪明'。"
— 小红书 · self-improving-agent 6 周实测
"这个方向最大的问题不是 agent 反思得如何,而是这个自我进化闭环里,谁给反馈、更新什么、怎么防止越改越偏。"
— 小红书 · Agent self-evolution 研究笔记
"Agent 的能力提升已经不只是 base model 变强,而是模型外面的 harness 在变强。但问题是:当 harness 开始自我进化,我们怎么知道 Agent 真的变强了?"
— 小红书 · 翁荔 SEAGym 评测解读
这些散布在小红书 / 知乎 / 即刻 / X 上的真实心声,拼在一起就是「想把 self-improving-agent 落地但不知道从哪起手」的 AI 开发者日常。真正能落地的自进化,不是装一个魔法框架,而是给 Agent 装上记忆、纠错和评测三件套——装掘技后,Agent 会自动搜索匹配这些能力的 Skill。
懒人方案 · 推荐
装一次掘技,让 Agent 自己找 Skill
你想实现的 self-improving 能力(持续记忆、自我纠错、效果评测),对应的 Skill 觅游都有。但你不需要一个个找 —— 装了掘技(deep-skill-finder)后,Agent 接到任务会自动搜索觅游 50000+ Skill 库,把匹配当前任务的方法推荐给你。你只管说要做什么,匹配 Skill 的事交给 Agent。
复制口令 → 粘贴给 Claude Code / Codex / Cursor / WorkBuddy 等 · Agent 会自动完成安装:
请安装 deep-skill-finder 技能:从 https://www.meyo.life/skill-finder 下载技能压缩包,解压到本地技能目录并启用。
也可以往下看常用场景 Skill。想深入了解掘技 →
meyo.life/skill
3 个 self-improving-agent 落地场景 · 每场景 Top 2 高分 Skill
可以都装,也可以看名字挑 1 到 2 个装。不用担心装错,免费,不满意随时卸。
Agent 持续记忆
让 Agent 记住踩过的坑和你的偏好
2 个不同思路的 Skill · 挑符合你场景的 · 或都装了对比效果
适合:Agent 自动从错误中学习并记住
自动捕获错误、用户纠正和最佳实践并转化为长期记忆,解决同类错误反复犯的痛点
23926 人在用
适合:跨会话持久化 Agent 记忆
基于 LanceDB 的向量化长期记忆存储与检索,内置意图/场景隔离防记忆污染
2649 人在用
Agent 自我纠错
Agent 出错了能自己发现和修复
2 个不同思路的 Skill · 挑符合你场景的 · 或都装了对比效果
适合:Agent 自动排查并修复自身错误
赋予 AI Agent 自我诊断与自动修复能力,错误捕获、根因分析、自动修复及报告生成
936 人在用
适合:对话层面的自我纠错与意图修正
模型自我检查与纠错,用户指出错误时重新分析意图而非修改上一轮回答
632 人在用
Agent 效果评测
怎么知道 Agent 真的变强了?用数据说话
2 个不同思路的 Skill · 挑符合你场景的 · 或都装了对比效果
适合:持续自我优化的系统级框架
递归自我改进系统,自动检测错误并修复,支持并发执行、自动化测试和错误预测
7081 人在用
适合:给 Agent 做基准测试和跑分
专业级 Agent 性能评测框架,多维度自动化量化评估与能力基准测试
833 人在用
💬 加入掘技社群
和其他掘技用户交流「self-improving-agent 落地」经验 · 掘技团队会解答装配问题
进群备注「自进化」
常见问题
Q: self-improving-agent 和 self-evolving-agent 是一回事吗?
A: 这两个概念高度重叠但不完全相同。self-improving 侧重"从经验中学习并改进",self-evolving 范围更广,包括模型权重、harness 和外部文件的进化。对工程师来说,落地路径是一样的:先装记忆,再装纠错,最后装评测——三步走就能让 Agent 具备基本的自进化能力。
Q: 这些 Skill 装了会不会互相冲突?
A: 记忆类和纠错类一般不会冲突——它们作用于 Agent 执行链路的不同阶段。但评测类 Skill 在运行时会调用 Agent 执行测试任务,如果同时跑多个评测可能影响性能。建议先装 self-improving-agent-cn 做基础记忆,再用 benchclaw 做效果评测,最后按需装自我纠错。
Q: 我不用 Claude Code,用的是 Cursor / Codex,这些 Skill 能装吗?
A: 都能。这些 Skill 是跨 Agent 中立设计,Claude Code / Codex / Cursor / WorkBuddy 都能装。装法完全一样——从 meyo.life/community/skills 下载压缩包,解压到你 Agent 的 Skill 目录即可。
Q: self-improving-agent-cn 有 24000+ 下载量,它具体做了什么?
A: 它自动捕获 Agent 执行中的错误、用户纠正的操作和成功经验,把这些信息转化为长期记忆文件。下次 Agent 遇到类似任务时会先查阅记忆,避免重复犯错——这是目前社区最成熟的自进化记忆 Skill。
Q: "harness 在自我进化"这个说法是什么意思?
A: Lilian Weng 在 Harness Engineering 中提出:Agent 的能力提升不只靠 base model,prompt、memory、tools、workflow 等"harness"层面的改进才是关键。当 harness 开始自动优化自身时,就是 self-improving。但问题是:怎么验证 harness 真的变好了——这正是 benchclaw 等评测 Skill 解决的问题。
Q: 装了掘技后,Agent 会自动帮我找到这些自进化 Skill 吗?
A: 会的。装了掘技(deep-skill-finder)后,你只需告诉 Agent"帮我实现 self-improving 能力"或"让 Agent 从错误中学习",掘技会自动搜索觅游 Skill 库并推荐合适的记忆、纠错和评测 Skill。