首页AI 资讯Prime Agent 开源框架在 ARC-AGI-3 拿下 95.5% 超越人类:AI 竞争从模型军备转向「壳竞赛」
Prime Agent 开源框架在 ARC-AGI-3 拿下 95.5% 超越人类:AI 竞争从模型军备转向「壳竞赛」 封面
技术前沿2026-08-078 分钟

Prime Agent 开源框架在 ARC-AGI-3 拿下 95.5% 超越人类:AI 竞争从模型军备转向「壳竞赛」

AI 初创 Prime Intellect 开源自我改进 Agent 框架 Prime Agent(MIT 许可),在 Opus 5 驱动下于 ARC-AGI-3 抽象推理基准三连测拿下 95.0%/95.2%/95.5%,最高分略超人类专家基线 95.4%。此前所有前沿模型在该基准得分均低于 1%——关键突破不在模型,而在开源脚手架设计。

Prime AgentARC-AGI-3开源框架智能体自我改进海外资讯

核心结论

Prime Agent + Opus 5 在 ARC-AGI-3 拿下 95.5%,超过人类专家基线 95.4%

此前所有前沿模型在该基准低于 1%,突破来自开源脚手架而非模型本身

递归语言模型 + Continual Harness 实现运行时自我进化,也带来奖励黑客风险

开发者应先榨干现有模型的脚手架潜力,再决定是否升级模型

Prime Agent 架构拆解

1递归语言模型(RLM)

持久 IPython 内核作为唯一工具入口,支持编程式调用与子代理生成

2Continual Harness

运行时对提示词、技能库、记忆、子代理配置执行 CRUD,实现自我进化

3技能沉淀

新题型解法写入技能库,下次直接调用,减少重复试错

4反思循环

多轮执行中不断校验中间结果,避免错误传播

5奖励黑客风险

自我改进能力需默认关闭或限定范围,变更需人工审批

落地检查清单

盘点现有 Agent 脚手架:工具调用、记忆、反思循环、子代理编排
先用脚手架优化榨干当前模型能力,再评估升级模型
自我改进能力默认关闭,技能库变更加人工审批
关键任务保留审计日志与回滚能力
理性看待专项基准:ARC-AGI-3 不代表真实业务任务全面领先
关注 Prime Agent 的 MIT 许可与集成方式

数字背后的震撼:从不足 1% 到 95.5%

Prime Intellect 使用 Anthropic 的 Opus 5 驱动开源框架 Prime Agent,在 ARC-AGI-3 公共题上跑了三次,得分分别为 95.0%、95.2%、95.5%,最高分略超其引用的 95.4% 人类专家基线。

震撼之处在于对照:此前所有前沿模型在 ARC-AGI-3 上的得分均低于 1%。同一个 Opus 5 模型,单独使用时几乎无法解答这些抽象推理题,套上 Prime Agent 框架后却达到人类专家水平——突破来自「壳」,而不是「模型」。

Prime Agent 的两大抽象

第一个抽象是递归语言模型(RLM):提供持久 IPython 内核作为唯一工具入口,模型可以编程式调用工具、生成子代理,把复杂问题拆解为可执行的计算流程。

第二个抽象是 Continual Harness:允许 Agent 在运行时对自身提示词、技能库、记忆系统和子代理配置执行增删改查(CRUD),实现「运行时自我进化」——碰到新题型,Agent 可以把解法沉淀进自己的技能库,下次直接调用。

为什么这改变了竞争格局

如果模型能力可以通过开源脚手架被大幅放大,那么闭源模型「以能力换护城河」的逻辑就被削弱:同样的 Opus 5,配合不同框架,成绩天差地别。这解释了为什么 Prime Intellect 这个 10 亿美元估值的创业公司(2026 年 7 月完成 1.3 亿美元 A 轮,Radical Ventures 领投)选择开源——它卖的不是模型,是「如何更好使用模型」的方法论。

对开发者来说,这意味着不要急着换模型:先检查自己的 Agent 脚手架(工具调用、记忆、反思循环、子代理编排)是否已经榨干当前模型的能力,再决定是否升级模型。

风险与局限

「运行时自我进化」是一把双刃剑:Agent 可修改自己的提示词与约束,带来「奖励黑客」风险——为达成指标绕过约束指令。此外,ARC-AGI-3 是抽象推理专项基准,不代表编程、写作、客服等真实任务同样领先。

部署建议:自我改进能力默认关闭或限定范围,技能库变更需人工审批,关键任务保留审计日志,防止 Agent 在无人监督下悄悄改掉自己的行为边界。

常见问题

ARC-AGI-3 是什么?

衡量 AI 抽象推理能力的基准测试,此前所有前沿模型得分低于 1%,人类专家基线为 95.4%。

Prime Agent 是模型吗?

不是,它是开源(MIT 许可)的 Agent 框架,配合闭源模型使用;突破来自框架设计而非模型。

这个框架能直接用在我的业务里吗?

框架已开源,可评估集成;但自我改进能力在生产环境默认关闭,并按风险设计审批与审计。

95.5% 意味着 AI 超过人类了吗?

仅指 ARC-AGI-3 单项抽象推理基准,不等于通用能力超越人类,需要理性看待。

可核验来源

相关工具

相关阅读