Skill0:训练时借技能,推理时把技能撤掉

前两篇刚好写了 SGA-MCTS 和 SkillX,今天这篇 SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization 正好能把这条线补完整。 如果说 SGA-MCTS 和 SkillX 都是在讨论“怎么把 Agent 经验放到外部系统里”,那 Skill0 问的是另一个更狠的问题:外部技能库能不能只在训练时用,最后把技能内化到模型参数里,让 Agent 测试时不再依赖 runtime skill retrieval? ...

June 24, 2026 · 5 min · CheaSim

SkillX:给 Agent 预先造一个可复用技能库

昨天写了 SGA-MCTS,今天顺手接一篇很适合放在一起看的论文:SkillX: Automatically Constructing Skill Knowledge Bases for Agents。 SGA-MCTS 更像是在说:Agent 的搜索经验能不能拆成可检索的规划原子。SkillX 则更进一步问:能不能自动把 Agent 的历史轨迹整理成一个 plug-and-play 的技能知识库,让别的 Agent 也能直接拿来用? ...

June 22, 2026 · 5 min · CheaSim

SGA-MCTS:把慢思考缓存成可检索经验

最近看到一篇挺适合拿来做博客开张读物的论文:SGA-MCTS: Decoupling Planning from Execution via Training-Free Atomic Experience Retrieval。 一句话概括:它想把 MCTS 这种“推理时很强但很慢”的搜索能力,提前离线跑完,压缩成一批可以检索的经验原子。真正在线执行任务时,模型不再每次从零开始搜索,而是先把相似的经验捞出来,当作软提示塞回当前上下文。 ...

June 21, 2026 · 4 min · CheaSim