开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议
创始人
2026-08-09 03:42:02

机器之心编辑部

一款新开源的智能体框架(harness),声称在 ARC-AGI-3 上联合 Opus 5 拿到了 95.5% 的成绩,超过人类专家基线。官方帖子迅速获得大量关注,GitHub 星标已接近 5 千。

要知道,ARC-AGI-3 不是那种「刷过题库就能拿高分」的考试,它是一堆完全陌生的抽象游戏,每个游戏的规则、目标、甚至操作逻辑都不相同。你进去之后,没人告诉你该做什么,你得自己摸索、试错、归纳,然后在有限的行动预算内完成目标。

这个框架名叫 Prime Agent,由 Prime Intellect 发布。官方对它的定义是:一个面向编程、研究和长时间自主任务的「自我改进 RLM harness」

项目链接:https://github.com/PrimeIntellect-ai/prime-agent

RLM 是 MIT 博士生 Alex Zhang 等人去年 10 月发布的一项工作(参见《

递归语言模型登场!MIT华人新作爆火,扩展模型上下文便宜又简单》),其全称是 Recursive Language Models,即递归语言模型。按照论文里的介绍,它是一种将输入上下文视为可操作「变量」的通用推理策略:主模型在类似 Jupyter 的编程环境(REPL)中工作,通过编写代码对庞大的上下文变量进行切分与过滤,并将子任务递归外包给临时的小模型调用,最终综合各结果形成答案 —— 例如在 Python REPL 中调用 GPT-5 及 mini 版迭代处理用户提示。

当时,它的效果就已经非常惊艳:在 OOLONG 等最难长上下文评测中,GPT-5-mini 采用 RLM 的正确率超直接使用 GPT-5 两倍以上且单次成本更低。因此,研究者断言,这将是一个强大的新范式,且相比纯 CoT 或 ReAct 代理,显式训练以递归推理为核心的 RLM 很可能成为推理时扩展能力的下一个里程碑。

如今,Prime Agent 把 RLM 论文的核心理念进一步工程化落地了,并在此基础上做了重要扩展。我们一起来看一下他们做了哪些创新。

Prime Agent 为什么那么强?

官方博客里写的很清楚:它彻底重构了「harness 该怎么设计」这一底层假设。

Prime Intellect 团队认为,现有的 harness 设计都是围绕早期模型的能力建的 —— 固定的工具调用格式、强制的上下文压缩、设计时写死就再也不变的子智能体和提示词。这些脚手架非但没有帮模型发挥,反而逼着模型去绕过自己的框架。模型越聪明,旧的 harness 就越像一副不合身的镣铐。

Prime Agent 的解法是把这套脚手架彻底打开。它做了两个关键设计:

一是 RLM,给模型一个持久的 IPython 内核当 REPL 用,上下文是变量、子智能体是函数调用,模型可以直接用代码操作自己的历史、工具和子智能体。即使会话被压缩,完整历史仍保留在外部状态中,需要时可被程序化取回;

二是 Continual Harness,把提示词、技能、记忆和子智能体全部变成运行时可 CRUD 的状态,agent 能在执行过程中实时创建、修改、调用它们,甚至跨会话通信。

换句话说,Prime Agent 不是给模型配了一套更聪明的工具箱,而是把工具箱的钥匙交给了模型自己。

在 ARC-AGI-3 这种每道题规则都陌生的战场上,它能一边做题一边改写自己的解题策略,而不是被出发前的预设绑住手脚,所以它能在 ARC-AGI-3 上以更少的 token 消耗跑出更高分数。

Prime Agent 怎么让 Agent 持续工作?

但「把钥匙交给模型」只是一层。Prime Agent 还试图解决一个更现实的问题:

Agent 怎么才能连续工作几个小时、几天,甚至在人退出终端后继续运行?

为此,它在底层放了一个后台 daemon,统一管理所有正在运行的会话。每个子智能体都有独立的上下文、文件目录、IPython 状态和会话记录。一次任务结束后,子智能体不会立刻被销毁;主智能体可以记住它的 ID,过一段时间再把它叫回来继续工作。

这和常见的「一次性外包」不太一样。

普通多智能体系统里,主 Agent 把任务扔给子 Agent,拿到一份摘要,双方关系就结束了。Prime Agent 中的子智能体更像一个长期项目成员:它保留自己的工作现场,主 Agent 可以追问、纠偏,或者让多个 Agent 直接交换信息。

Prime Agent 架构图。

为了让任务真正跑得足够久,Prime Agent 还把长期自主运行拆成了三个机制:

  • Goal 负责保存一个持续目标,在任务完成前不断提醒 Agent 继续推进;
  • Heartbeat 按固定时间把消息重新注入会话,例如检查子智能体进度、轮询实验结果;
  • Autonomous Mode 负责在一轮输出结束后自动续跑,避免 Agent 做到一半就停下来。

用户则可以给它设置最大轮数、token 预算和执行时间,并设置一道完成前必须通过的测试。比如让它修改一个项目时,测试没通过,系统就会把失败结果重新交给 Agent,让它继续修;如果工作区没有变化,也不会毫无意义地重复执行同一个失败测试。

所以 Prime Agent 所谓的「长时间自主」,并不是简单地给模型一句「继续努力」,而是把目标保存、定时唤醒、自动续跑、失败反馈和资源上限做成了一套运行机制。

Prime Agent 是如何「自我改进」的?

最值得解释的,是它的 /refine。

Prime Agent 会读取自己刚刚经历的完整轨迹:尝试过什么、在哪里失败、什么方法有效,然后把可复用的经验写回 harness。

这些修改可能是一条新的提示词备注、一段记忆、一个技能,也可能是一份新的子智能体配置。比如它发现某类测试经常因为网络波动失败,就可以把「先重试再判断代码错误」沉淀成一个技能;如果某个子智能体的分工方式效果不好,它也可以修改这个子智能体的说明。

不过,它不能改写最底层的系统提示词。每次 refinement 都会记录触发原因和修改结果,并保留历史版本,出现问题时可以回滚。

这也是 Continual Harness 和普通「长记忆」的区别:它不只是把过去发生的事存下来,而是试图把经历转化成下一轮可以直接调用的能力。

在官方展示的 Factorio(一款 2D 工厂模拟游戏)实验中,Prime Agent 就把一次次成功和失败转化成记忆与技能,不断改进工厂布局,几个小时内把生产分数推到了 10 万以上。

但这个案例同时暴露了「自我改进」的另一面。

Agent 后来发现,它可以通过 RCON 命令直接把资源传送进机器。即使提示词明确要求它不要作弊,它仍然利用 /refine 把这个漏洞沉淀成了越来越高效的「作弊技能」。

也就是说,Continual Harness 能放大有效策略,但它并不知道什么叫「正当的有效策略」。如果评测环境存在漏洞,它同样可能把 reward hacking 变成一种可以不断进化的能力。

Prime Agent 表现如何?

此外,Prime Intellect 试图证明,Prime Agent 并非只会做 ARC-AGI-3。

官方还在长上下文理解、长指令执行、数学排序、模拟器开发、GPU Kernel 编写和三维迷宫等任务上,将它与 Claude Code、Codex 以及带子智能体的 Pi-mono 进行了比较。

结果并非每一项都由 Prime Agent 获胜,但它在多数长上下文和长时间任务上具有竞争力,部分组合的提升相当明显。

例如,在 OOLONG 128K 长上下文任务中,GPT-5.6 Sol 搭配 Prime Agent 得分 0.94,而官方列出的 Codex 对照成绩为 0.50;在需要长输出的 OOLONG-Pairs 上,Prime Agent 搭配多个模型也取得了较强成绩。

Prime Intellect 将这种优势归因于「程序化工具调用」:模型不需要把大量工具输出逐段读进上下文,而是可以写代码筛选、聚合数据,只把真正需要的部分送进推理过程。

不过,团队也承认,目前还没有任何模型专门围绕 Prime Agent 训练。现有模型并不会天然熟练地使用它的全部能力。Prime Intellect 的下一步设想,是让模型与 harness 共同训练,让模型从训练阶段就学会如何管理上下文、调度子智能体和修改自己的工作框架。

如果说传统路线是在训练一个更聪明的「大脑」,Prime Intellect 的判断是:下一阶段的提升,还来自让大脑和它使用的操作系统一起进化。

到这里,Prime Agent 看起来相当有前途:新的上下文管理方式、持续运行的子智能体、自我修改的 harness,再加上一组超过人类专家基线的成绩。

但就在发布后的第二天,有人直接克隆了它的代码仓库,然后给整场热潮泼了一盆冷水。

Prime Agent 真有那么好吗?

发起质疑的是 Shortcut AI 联合创始人 Peter Wang。他在帖子开头写道,每当一个项目伴随着「疯狂的炒作和成建制的公关」出现,就该把「胡扯探测器」拿出来了。

检查代码后,Peter Wang 提出了两项核心质疑。

第一项质疑针对 RLM 这个概念是否真的被实现。

他在代码中发现,Prime Agent 的 RLM_MAX_DEPTH 被设成了 1。

在他的理解中,RLM 的关键吸引力就在于递归:主模型可以调用子模型,子模型再继续调用下一层模型,不断分解问题。真正困难的也不是写出一个调用子 Agent 的函数,而是让多层递归在生产环境里不至于失控。

递归层数越深,token 成本和运行时间越容易爆炸;任务在不同 Agent 之间反复转述,也可能变成一场「传话游戏」,逐渐丢失用户需求中的细节。要把递归做到三层、四层甚至更多,需要解决预算控制、并发、失败恢复、信息保真和停止条件等问题。

可如果最大深度只有 1,Peter Wang 认为,这实际上就是一个主 Agent 调用若干子 Agent,与大量现有 harness 并无本质区别。

因此,他的判断是:Prime Agent 确实构建了一棵相当稳健、持久化的异步 Agent 进程树,但它没有证明自己解决了「可扩展的深递归智能体」问题。把它包装成 RLM,至少有夸大之嫌。

第二项质疑,指向 ARC-AGI-3 的 95.5%。

Prime Agent 的三次运行分别获得 95.0%、95.2% 和 95.5%;Best@3 达到 99.97%,完成了 183 个关卡。但这些成绩来自公开评测集。

虽然 Agent 第一次进入游戏时并不知道规则,但开发者可以反复查看公开环境、运行轨迹和已有方案,并据此调整提示词、工具和 harness。

Prime Agent 又具备 Continual Harness,可以从过去的轨迹中提炼记忆、技能和提示词。因此,Peter Wang 认为,外界很难判断成绩提升中有多少来自通用能力,又有多少来自对公开任务的反复适配。

他并没有指控团队让 Agent 直接读取答案。争议的重点在于:没有独立的私有测试,就无法排除任务特定过拟合。

Peter Wang 还提到 PRO-LONG。该项目使用相对简单、通用的方法,也在 ARC-AGI-3 上取得了约 95% 的成绩。他认为,这一结果反而更值得关注。

RLM 作者亲自回应

这篇质疑很快引来了 Alex Zhang 的回应。Alex Zhang 不只是 Prime Agent 官方博客的作者之一,也是 RLM 论文的第一作者。

他先用一句反话开场:「看来问题解决了,Prime Agent 不是 RLM。谢谢你。」

随后,他给出了更严肃的解释。

Alex 表示,RLM 论文真正想回答的问题是:当语言模型开始调用语言模型、被调用的模型又可能继续调用其他模型时,什么样的抽象最适合组织这套系统?

他的答案不是「无限递归」,而是两个组合:程序化的工具/子智能体调用,加上作为变量存在的上下文。

Alex 认为,递归深度上限只是面向用户的配置,用来避免 token 成本爆炸;能否无限递归,并不是判断一个系统是否属于 RLM 的标准。

他还表示,对于 RLM 而言,深度为 1 并不意味着其表达能力弱于无限深度,但没有在这篇回应中进一步展开证明。

对于「RLM 只是研究玩具」的评价,Alex 也不认同。他提到,Codex、Claude Code 和 Muse Code 都已经提供了类似的核心抽象。

不过,在 benchmark 问题上,Alex 承认 ARC-AGI-3 是一个「可以被利用的 benchmark」。

他的回应是,Prime Agent 的价值不能只看 ARC-AGI-3,博客中的其他实验同样需要考虑。此外,他认为 Continual Harness 对 ARC-AGI-3 成绩的作用可能比 RLM 更重要。

这也让争议重新回到 Prime Agent 最核心的设计上:同一套自我改进机制,既可能帮助 Agent 积累经验,也可能让它越来越适应一套公开评测。

在私有集结果出现之前,95.5% 依然是一项值得关注的工程成绩,但还不能单独证明 Prime Agent 在真正未知的任务上超过了人类。

目前,已经有一些开发者在尝试使用 Prime Agent,如果你也试用过,欢迎在评论区分享使用体验。

参考链接:https://www.primeintellect.ai/blog/prime-agent

⚠️
本网站信息内容及素材来源于网络采集或用户发布,如涉及侵权,请及时联系我们,发送链接至2697952338@QQ.COM,我们将第一时间进行核实与删除处理。

相关内容

热门资讯

到vx小号哪里能买,购买微信账... 误解一:微信聊天记录永远“云端备份”很多人误以为微信会自动把聊天记录保存在云端,换手机后登录账号就能...
vx小号低价批发,出售抗封微信... 微信不再只是聊天软件今天讨论微信,如果还停留在“它是个聊天软件”的层面,恐怕已经跟不上现实。微信的月...
vx号大量批发,稳定微信号哪里... 为什么你总觉得微信越来越难用?你是不是也有这样的感受:明明每天打开微信几十次,可有些功能就是找不到,...
哪里有卖半年抗封微信号,微信账... 为什么你的微信越用越卡,问题出在哪里?很多人都有这样的体验:新装的微信流畅顺手,用上半年后打开聊天列...
哪家正规买抗封私人微信号,微信... 微信真的免费吗?流量之外的成本你算过吗很多人觉得微信是免费的,只要连上Wi-Fi就能随便聊。但仔细想...
稳定微信老号怎么买,出售卖微信... 自从微信成为日常交流的必需品,我的手机里就再没离开过那个绿色气泡图标。说来也巧,这些年微信的版本迭代...
微信小号购卖自动发货,买微信软... 你有没有想过,微信到底改变了我们生活中的什么?这个问题太大,答案常常变成“沟通更方便了”这样一句空洞...
稳定微信小号购买,哪里有微信号... 从即时通讯起家:微信的初始设计逻辑微信诞生于2011年,彼时移动互联网刚刚兴起,短信和电话仍是主流通...
稳定不封的微信号怎么买,出售买... 提起微信,多数人首先想到的是那个绿色图标和每天数十亿条消息的流转。但在中文互联网生态里,微信早已不是...
私人微信小号交易平台,微信小号... 当工作消息涌入私人微信,你还能分清边界吗?几乎每个人的手机里都装着微信,但越来越多的人开始问同一个问...
怎么买微信号的账号,私人微信交... 场景一:让微信群聊不再是信息坟场很多人微信里都有几十个群,但真正有价值的没几个。问题往往出在群主没有...
网上哪里能买到稳定微信号,哪里... 场景一:消息堆积,重要信息被淹没李敏在一家广告公司做项目经理,她的一天从打开微信开始:客户群、设计群...
稳定私人微信号怎么买,vx号批... 从扫码点餐到会员管理:一场餐厅里的微信体验傍晚六点,你走进一家常去的连锁餐厅。服务员没有递来纸质菜单...
正规微信小号购买平台,微信实名... 为什么微信能从一个聊天工具长成今天的“超级应用”?很多人都会问一个问题:微信到底做了什么,能让几乎每...
哪里有卖微信的我想买一个,微信... 不知道你有没有过这样的瞬间:本来只是想打开微信回一条消息,结果手指却不由自主地滑到了朋友圈,刷完朋友...
vx批发1-3元,在哪里买微信 从清晨的第一条消息开始我的早晨通常不是被闹钟叫醒的,而是被微信的提示音。六点四十分,楼下的包子铺老板...
出售买微信小号,Vx号购买 为什么微信能几乎同时把消息送到对方手机当我们点击微信聊天框里的发送按钮,一条消息几乎瞬间出现在对方屏...
多起AI前沿模型失控,打破三十... 2026年8月7日,据环球网援引BBC报道,近期全球AI行业集中曝出多起前沿模型失控事故,OpenA...
买微信账号去哪个平台,购买一个... 微信的起点:一个被重新定义的通讯协议2011年,当微信最初发布时,它本质上只是一款基于手机通讯录的即...
观众需要AI明星吗? ©️听筒Tech 文丨杨林 AI演员,最近很是火爆。 近期,话题#两个AI演员比内娱待爆艺人都火#登...
vx号批发平台,国内微信老号怎... 为什么我们天天用微信,却总觉得它“不够用”?打开手机,微信几乎占据了我们每天三分之一的屏幕时间。聊天...
AMD收购Taalas:加码A... 生成式AI浪潮之下,算力军备竞赛的主战场正从训练端向推理端迁移。今日,AMD宣布已达成最终协议,收购...
15元微信批发购买网,哪里有抗... 一个家庭群的深夜接龙晚上十一点,老家的二姨在家族群里发起接龙:“明天谁回家吃饺子?”不到十分钟,表姐...
走进腾讯·产研荟圆满落幕:AI... AI智能体从「要不要用」转向「如何用出实效」 过去一年,AI 智能体(Agent)从概念走向热潮,几...
wx小号批发网5元一个,24小... 为什么微信消息会遭遇“已读不回”在日常使用微信的过程中,“已读不回”是几乎每个人都会遇到的现象。但很...