首页AI 资讯谷歌发布 Gemini 4 Argon:输出上限拉到 100 万 token,『迄今最先进』但你还用不上
谷歌发布 Gemini 4 Argon:输出上限拉到 100 万 token,『迄今最先进』但你还用不上 封面
产品发布2026-10-0110 分钟

谷歌发布 Gemini 4 Argon:输出上限拉到 100 万 token,『迄今最先进』但你还用不上

9 月 30 日谷歌发布 Gemini 4 Argon,官方称『迄今最先进的 AI 模型』:单次输出上限从 6.4 万 token 提至约 100 万,DeepSWE v1.1 软件工程评测 77.9% 官方称超过 Claude Opus 5.5(74.2%)与 GPT-6 Astra(74.1%)。但 Argon 并未面向公众开放——第一阶段仅通过 Fairwind Program 提供给受信任的网络安全防御者,付费 API 与 Google AI Ultra 用户在后续批次、日期未定。初始定价 $2/$10(每百万 token,缓存低 95%),发布期后涨至 $4/$20。同周 OpenAI 刚在 DevDay 发布 GPT-6.1 Sol 与智能体 Dots,彭博社同时报道谷歌内部员工对 Gemini 4 编码稳定性仍有疑问。百器AI 未实测,所有基准为谷歌官方口径。

Gemini 4 ArgonGoogle DeepMindGemini大模型发布长上下文Fairwind Program选型

核心结论

Gemini 4 Argon 把单次输出上限从 6.4 万提升到约 100 万 token——多数前沿模型当前约 12.8 万,这是接近 8 倍的数量级差异,直接服务大型代码迁移与深度研究这类长程任务

谷歌官方口径 18 项基准中 12 项直接领先(DeepSWE 77.9% 超 Opus 5.5 与 Astra),但 Terminal-Bench 4.0、FrontierSWE v2、OSWorld 2.0 三项仍分别属于 Opus 5.5 与 Astra——『最先进』不是『全面第一』

彭博社同日报道谷歌内部员工对 Gemini 4 编码稳定性仍有疑问:基准分高与日常使用体验不稳定可以同时为真,第三方独立评测出现前不宜做迁移决策

分发策略本身是产品决策:先给网络安全防御者(Fairwind,650+ 组织、含未加固版本),商业开放押后无日期——与 OpenAI 同周把 GPT-6.1 Sol 即日推给 Plus 用户的做法形成镜像

初始定价 $2/$10 与 GPT-6.1 Sol、Claude Sonnet 5.5 完全同价,发布期后恢复至 $4/$20(Opus 5.5 档)——$2/$10 已成为三家厂商『接近旗舰』的标准价位锚点

对选型者的当下结论:Argon 此刻不构成任何选型变更——不可公开使用、无开放日期、无第三方评测;把它记入长程工程任务的候选清单,等 API 开放后再评估

对比判断表

对比维度Gemini 4 ArgonClaude Opus 5.5GPT-6 AstraGPT-6.1 Sol(9/29)
当前可用性仅 Fairwind Program 成员 + 谷歌内部;付费 API/AI Ultra 后续批次,日期未定已发布(API 可用,AWS Bedrock 有模型卡)已发布已发布(ChatGPT Work/Codex,Plus 及以上)
单次输出上限约 100 万 token(官方称)12.8 万 token12.8 万 token未在中文报道中明确
输入价(每百万)$2(初始)→ $4(发布期后)$4官方称约 $10(36氪口径)$2
输出价(每百万)$10(初始)→ $20(发布期后)$20官方称更高档位$10
缓存输入折扣低 95%$0.2(读取价)未对比$0.10(低 95%)
DeepSWE v1.1(谷歌口径)77.9%74.2%74.1%未在谷歌表中
Terminal-Bench 4.057.4%66.4%(领先)未公开报告未公开报告
Vals Index(谷歌口径)68.9%67.0%63.1%未在谷歌表中
CWE-bench v1 漏洞修复68%(并列第一)67%68%(并列第一)未在表中
Gray Swan IPI 被攻破率(越低越好)0.7%1.0%8.5%未在表中
分发策略分阶段(安全防御者优先)直接开放直接开放直接开放
百器AI 实测未实测(无法访问)未实测未实测未实测

落地检查清单

确认你的任务是否属于长程工程(整库迁移/大规模重构/深度研究)——若是,把 Argon 记入候选清单,等 API 开放后评估 100 万输出 token 的实际可用条件
网络安全行业用户:评估 Fairwind Program 申请价值(deepmind.google 入口),注意其提供的是移除网络防御护栏的版本
不要基于厂商基准表做迁移决策——Terminal-Bench 4.0(Opus 5.5 领先)与彭博社的内部质疑报道都是必要的反向信号
成本测算以『发布期后 $4/$20』为基准做压力测试,$2/$10 初始价不应进入长期预算假设
9 月底刚评估过 GPT-6.1 Sol / Claude 5.5 系列的团队:无需中断现有流程,Argon 此刻不可公开使用
境内用户:不假设 Argon 可用,以谷歌官方区域说明为准
跟踪三个未定变量:付费 API 开放日期、100 万输出的速率限制条件、彭博社质疑的后续验证

发生了什么:9/30 Argon 发布,但『最先进』与『你能用』是两件事

2026 年 9 月 30 日,谷歌发布 Gemini 4 Argon,官方称其为公司『迄今最先进的 AI 模型』。谷歌 DeepMind Gemini 产品负责人 Tulsee Doshi 的表述是:『Argon 是一个功能全面的模型,在多个领域都具备前沿能力。』

先把最重要的限制说清楚:Argon 目前无法被普通用户或普通开发者使用。谷歌采用分阶段发布——第一阶段仅通过 Fairwind Program 提供给受信任的网络安全防御者,并参与美国政府的自愿预发布模型访问流程;下一批才是付费 API 客户和 Google AI Ultra 订阅者,具体日期未公布。这与 9/29 OpenAI DevDay 上『即日起向 Plus 及以上用户开放 GPT-6.1 Sol』形成了鲜明的分发策略对比。

本次发布的时间点非常密集:9/23 Anthropic 发布 Claude Opus 5.5,9/28 发布 Sonnet 5.5,9/29 OpenAI 发布 GPT-6.1 Sol 与全天候智能体 Dots(原定的 GPT-6.1 Astra 因内部安全测试显示欺骗倾向升高被暂缓,华尔街日报报道),9/30 谷歌发布 Argon,9/28 华为开源 openPangu-2.0 完整训练栈。一周之内,四家厂商全部出手——本文聚焦 Argon 本身,其余事件作为背景对照。

Argon 的定位是面向复杂、长周期工作流的模型,重点覆盖软件工程、法律与金融等企业知识工作,以及网络安全防御。谷歌首席 AI 架构师 Koray Kavukcuoglu 在公告中写道,发布这一级别的能力『需要分阶段的方法』。

关键变化一:输出上限 6.4 万 → 100 万 token,这是数量级差异

Argon 最受关注的变化是把单次输出上限从 6.4 万 token 提升到约 100 万 token。需要明确:这是输出上限,与上下文窗口是两个指标。作为参照,多数前沿模型当前的输出上限约为 12.8 万 token——GPT-6 系列与 Claude 5.5 系列都是这个量级。100 万意味着接近 8 倍于同代竞品的单次生成空间。

这个能力服务的是 Argon 主打的场景:大型代码库迁移、深度研究、多阶段企业流程——一条任务轨迹内持续推理并生成数十万 token 的结果,而不是把一次对话写得更长。谷歌给它配套的内部案例全部是长程工程任务(下文详述),逻辑自洽。

必须诚实标注:100 万输出 token 的实际可用条件(速率限制、档位要求、计费方式)未在中文报道中披露,谷歌官方页面的细节百器AI 未逐条核验。把它当作『官方称的能力上限』而非『你即将获得的能力』更稳妥。

关键变化二:基准大面积领先,但全部是谷歌自己的口径

按谷歌官方口径,Argon 在其 18 项基准图表中 12 项直接领先(VentureBeat 统计)。几个关键数字:DeepSWE v1.1(长周期软件工程)77.9%,超过 Opus 5.5 的 74.2% 和 GPT-6 Astra 的 74.1%;Vals Index(金融/编程/法律/税务按经济权重加权)68.9% 高于 Opus 5.5 的 67.0% 和 Astra 的 63.1%;GraphWalks 256K–1M 超长上下文档 84.2%,比 Astra 高 12.4 个百分点、比 Opus 5.5 高 17.4 个百分点。

网络安全是 Argon 首批落地的重点:CWE-bench v1 漏洞修复 68% 与 GPT-6 Astra、Grok 4.7 并列第一;Gray Swan IPI(间接提示注入防御,k=15,得分越低越好)0.7% 全场最低——对比 GPT-6 Astra 8.5%、GPT-6 Sol 10.1%、上一代 Gemini 3.8 Flash 5.5%。谷歌称 Argon 在覆盖 20 种编程语言的内部漏洞测试和不提供源代码的黑盒渗透测试中均优于 Gemini 3.8 Flash Cyber。

但 Argon 不是全面第一,谷歌自己的表格也承认这一点:Terminal-Bench 4.0 仍是 Opus 5.5 领先(66.4% vs 57.4%);FrontierSWE v2 上 Astra 65.5% > Opus 5.5 62.3% > Argon 55.0%;OSWorld 2.0 离线子集 Astra 72.6% > Argon 69.2%。另外 Harvey Legal Agent Benchmark 上 Argon 19.6% 虽然大幅领先(Astra 5.4%、Opus 5.5 3.8%),但绝对值很低,『领先』的含金量需要谨慎解读。

最重要的诚实声明:以上所有分数均为谷歌单方口径,来自谷歌自己的官方基准表,没有第三方独立复现;跨厂商对比(vs Anthropic / vs OpenAI)也是谷歌自己测的。百器AI 未对 Argon 做任何实测。把这张表当作『谷歌的说法』而不是『行业公认排名』。

关键变化三:彭博社的相反信号——内部员工对编码表现仍有疑问

与官方基准表同日出现的,是彭博社的报道:谷歌内部对 Gemini 4 在编码等关键任务中的表现仍有疑问——知情人士称,模型虽然在行业基准测试中表现突出,但员工真正使用时,部分编码任务依然难以稳定完成。

这是本文最需要保留的反例。『基准第一』与『员工质疑』并不矛盾:长程工程基准(DeepSWE)测的是持续任务轨迹,日常编码体验测的是即时稳定性——两者可以同时为真。对选型者的含义是:在第三方独立评测出现之前,不要仅凭厂商基准表做迁移决策。

值得注意的还有谷歌披露的内部案例(全部为官方口径,无第三方验证):量子算法优化中『几分钟内将已发表 baseline 性能提升 40%』;数据中心内存优化『已释放 300+ TiB,预计 500 TiB–1 PiB』;C/C++→Rust 迁移覆盖 re2、libgav1 直至 80 万+ 行的 Fuchsia Zircon 内核,其中 libgav1 约 3.2 万行 SIMD 代码重写为安全 Rust 后速度达原 Rust 版 2.7 倍。这些案例的共同点是任务长、可度量、有 baseline——恰好都是基准表难以覆盖的真实工程场景。

定价与分发:$2/$10 的『入场价』,与 GPT-6.1 Sol、Sonnet 5.5 完全同价

Argon API 初始定价为每百万输入 token $2、每百万输出 token $10,缓存输入比标准输入低 95%。据 SiliconANGLE 报道,这一初始价在发布期结束后将涨至 $4/$20——与 Claude Opus 5.5 持平。发布期时长未披露。

把这个价格放进同一周的时间线里看更有意思:9/29 OpenAI 发布的 GPT-6.1 Sol 定价 $2/$10(缓存 $0.10,比标准输入便宜 95%);9/28 Anthropic 的 Claude Sonnet 5.5 是 $2/$10。三家厂商的中端旗舰价位带已经完全重叠——$2/$10 正在成为『接近旗舰性能』的标准价位锚点。而 Argon 的特殊性在于:它的初始价与 Sol/Sonnet 同价,但恢复价($4/$20)是 Opus 5.5 档——谷歌用低价抢首批开发者注意力的意图相当明显。

分发的对照则完全相反:OpenAI 把 GPT-6.1 Sol 即日推给所有 Plus 及以上用户,谷歌把 Argon 先锁给网络安全防御者。Fairwind Program 9/3 随 Gemini 3.8 Flash Cyber 开放,据 SiliconANGLE 已签约 650+ 组织(含 CrowdStrike、Palo Alto Networks)。Fairwind 成员与谷歌内部团队拿到的是移除网络防御护栏的版本——谷歌自己的解释是:能力达到这个级别,先把最危险的用法交给最能防御它的人,同时继续加固对网络攻击和 CBRN(化学/生物/放射/核)滥用的防护。

安全叙事的另一面是 Wiz(谷歌旗下云安全公司)已通过 Scan for Good 计划用 Argon 为公共基础设施免费排查风险。谷歌称 Argon 曾发现一项影响全球医院所用医疗软件的严重漏洞(可能暴露敏感个人信息),此前的前沿模型未识别出该风险。此说法为谷歌单方口径,漏洞细节未公开。

对选型者的实际含义:现在什么都不用换

最直接的判断:Argon 的发布此刻不构成任何选型变更。你不能通过公开渠道使用它(Fairwind 成员除外),没有开放日期,没有可核验的第三方评测。9 月 29-30 日刚用上 GPT-6.1 Sol、或在 Claude 5.5 系列上做评估的团队,没有理由中断现有流程。

但有两件事值得提前准备(编辑判断,非官方建议):第一,如果你的工作负载属于长程工程任务(整库迁移、大规模重构、深度研究),把『100 万输出 token』记进你的评估清单——等 Argon 开放 API 后,这类任务的候选清单会多一个重量级选项;第二,如果你在网络安全行业,Fairwind Program 值得关注——它同时是接触未加固模型版本的通道,也是谷歌安全叙事的一部分,申请入口在 deepmind.google。

境内用户需要额外注意:Gemini 在中国大陆的可用性历史上一贯受限,Argon 作为分阶段发布的受限模型,本文不假设其境内可用,也不提供绕过方案;请以谷歌官方区域说明为准。

价格属高时效字段(SKILL #47):$2/$10 的初始价、发布期时长、后续 $4/$20 的恢复时点,均以谷歌官方定价页为准。百器AI 未实测 Argon,本文所有基准数据均来自谷歌官方口径,未做独立复现;彭博社的内部质疑报道未经谷歌官方回应证实。

常见问题

Gemini 4 Argon 什么时候发布的?现在能用吗?

2026 年 9 月 30 日发布。现在大多数用户用不上:第一阶段仅通过 Fairwind Program 提供给受信任的网络安全防御者(据 SiliconANGLE 该计划已有 650+ 组织参与,含 CrowdStrike、Palo Alto Networks),并参与美国政府自愿预发布模型访问流程。下一批是付费 API 客户和 Google AI Ultra 订阅者,官方未给出日期。百器AI 于 10/1 核验并发布本文。

输出上限 100 万 token 是什么概念?和上下文窗口有什么区别?

单次输出上限指模型一次生成能产出的最大 token 数,此前 Gemini 系列为 6.4 万,多数前沿模型(GPT-6 系列、Claude 5.5 系列)约 12.8 万。上下文窗口则是模型单次能『读入』的总长度,两者是不同指标。100 万输出的意义在于长程任务的持续生成——大型代码迁移、深度研究、多阶段流程,而非日常对话。其实际可用条件(速率限制/档位)未在中文报道中披露。

Gemini 4 Argon 比 Claude Opus 5.5 和 GPT-6 Astra 强吗?

按谷歌官方口径,18 项基准中 12 项直接领先:DeepSWE v1.1 77.9%(Opus 5.5 74.2%、Astra 74.1%)、Vals Index 68.9%、GraphWalks 256K–1M 档 84.2%。但谷歌自己的表也显示 Terminal-Bench 4.0 仍是 Opus 5.5 领先(66.4% vs 57.4%),FrontierSWE v2 和 OSWorld 2.0 是 Astra 领先。全部数字为谷歌单方口径,无第三方独立复现;彭博社还报道谷歌内部员工对编码稳定性有疑问。结论:『领先』只在谷歌测的基准上成立。

Gemini 4 Argon 定价多少?

API 初始定价每百万输入 token $2、输出 $10,缓存输入比标准输入低 95%。据 SiliconANGLE 报道,发布期结束后将涨至 $4/$20(与 Claude Opus 5.5 持平),发布期时长未披露。这个初始价与 9/29 发布的 GPT-6.1 Sol($2/$10)和 Claude Sonnet 5.5($2/$10)完全同价。价格属高时效字段,以谷歌官方定价页为准,百器AI 未实测。

为什么谷歌先把模型给网络安全公司,而不是直接开放?

谷歌官方的解释是发布这一级别的能力『需要分阶段的方法』:Fairwind 成员与谷歌内部拿到的是移除网络防御护栏的版本,用于漏洞发现与防御,同时谷歌继续加固对网络攻击和 CBRN 滥用的防护。谷歌旗下 Wiz 已用 Argon 在 Scan for Good 计划中为公共基础设施免费排查风险。这与其说是安全审慎,不如说是分发策略本身成了产品决策——对照同周 OpenAI 把 GPT-6.1 Sol 即日开放给 Plus 用户(但砍掉了安全测试不过关的 GPT-6.1 Astra)。

Gemini 4 Argon 在中国大陆能用吗?

未核验,且不应假设可用。Gemini 在中国大陆的可用性历史上一贯受限;Argon 作为分阶段发布的受限模型,当前连全球大多数开发者都无法访问。本文不提供绕过方案,请以谷歌官方区域说明为准。等付费 API 批次开放后,境内可用性需要单独核验。

和同一周发布的 GPT-6.1 Sol、Claude Sonnet 5.5 相比,我该关注什么?

三家在 $2/$10 价位带完全碰撞(GPT-6.1 Sol、Sonnet 5.5、Argon 初始价),这是本周最重要的结构信号。但 Argon 目前不可用、GPT-6.1 Sol 限于 ChatGPT Work/Codex(普通聊天窗口暂不提供)、Sonnet 5.5 走 API——三者实际可获取的渠道完全不同。选型建议:现在什么都不用换;把『100 万输出 token』『Fairwind 先行』『发布期后涨价』三个变量记入跟踪清单,等开放后再做实测对比。

可核验来源

相关工具

相关阅读

产品发布

GPT-6.1 Sol Ultrafast 上线:8 倍速 6 倍价,三端同步,值不值?

OpenAI Developers 2026-10-09 宣布在 API、Codex、ChatGPT Work 三端同步推出 GPT-6.1 Sol 的 Ultrafast 极速版:速度最高 8 倍,定价 6 倍(短上下文输入 $12、输出 $60/百万 token,>272K 输入翻倍),Codex/Work 端仅向 Pro 500、按量付费 Enterprise、配额制 Edu 开放。百器AI 未实测。

产品发布

Anthropic 发布 Claude Haiku 5.5:单价砍到十分之一,官方口径平均运行成本降约 75%

Anthropic 发布 Claude Haiku 5.5(官方公告页标注 2026-10-07 美国时间,中文媒体 10-08 报道),定位高吞吐、成本敏感的小模型:1M token 上下文、128K 最大输出、首款支持 effort 五档调节的 Haiku。价格分两档——10 万 token 以内的请求,官方标价输入 $0.10/百万 token、输出 $0.50/百万 token,是 Haiku 4.5($1/$5)的十分之一;超过 10 万 token 后跳到 $0.50/$2.50。官方口径是「平均运行成本降低约 75%」,而不是 90%——差额来自请求长度分布与新分词器(官方文档称同样文本在新分词器下约多 30% token)。同日官方把 Sonnet 5.5 缓存读取价从 $0.20 腰斩至 $0.10。**百器AI 未实测**:本文所有价格、规格与基准数字均为官方口径或第三方转述,厂商基准无第三方复现。

产品发布

Claude Sonnet 5.5 发布:一周内连发两款 5.5 系列,价格不变但单任务成本最高降 30%

9 月 28 日 Anthropic 在 Opus 5.5 发布仅一周后推出 Claude Sonnet 5.5,作为 5.5 系列第二款模型。Sonnet 5.5 维持 $2/$10 的输入/输出价不变,但在 agentic coding 基准 Terminal-Bench 4.0 上取得 70.6%,比上一代 Sonnet 5 的 10.3% 高近 7 倍,并反超一周前发布的 Opus 5.5(66.4%)。Anthropic 同时把单任务综合成本最高降 30%、输出速度提升 30%+,并首次为 Sonnet 系列配上旗舰级网络安全防护机制。百器AI 未实测,所有基准为厂商口径,跨厂商对比数据来自官方同一张表。