9月21日
工信部发文推动建设智能体软件应用商店与技能包(Skills)资源库——Skills 作为智能体能力的标准化载体首次进入产业政策表述,与 GitHub 本周热榜「前五中四个是 Agent Skill 项目」的生态热度形成政策与市场的双信号。
9月18日
智谱发布 GLM-5.3-FlashX,最高 200 tokens/s。官方称在 10 万张国产芯片推理算力基础上加大 Infra 投入与优化,Flash 系列保持同尺寸最强智能水平,形成智能、价格、速度的全面竞争力。
阶跃星辰发布旗舰基座模型 Step 5 Preview:稀疏 MoE 架构、总参数 600B、激活仅 27B、100 万 Token 上下文,原生文本+视觉输入,面向 AI 编程/软件工程/金融场景,跻身 AA 综合智能指数全球开源前三,宣布 10 月 15 日正式开源。
9月17日
沉寂半年后,小米大模型负责人罗福莉官宣强化学习方向新动作:公开直播新模型训练过程,奖励曲线与显卡故障全部透明公开,训练一小时成本约 3 万美元。
生数科技 Vidu 发布 S2 版本,带来实时互动、实时修改视频与空间视频三大能力,继续深耕世界模型与视频生成方向。
9 月 16 日网易有道 AI Open Day 上,CEO 周枫提出 AI 能力竞争正进入「Model + Agent + Workflow」三层时代,并展示有道在翻译、教育与 Agent 场景的「有道解法」。
高通技术公司联合中兴努比亚与豆包手机助手推出第五代骁龙 8 至尊版赋能的 AI 智能体手机努比亚 NaviX Ultra,加速端侧智能体体验规模化落地。
9月16日
智象未来(HiDream.ai)正式发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0,主打物理规律导向生成,进入全球 AI 视频榜单第一梯队,为国产视频生成再添新力量。
无问芯穹联合清华大学、上海交通大学正式开源具身端侧推理引擎 APXInf,Pi 0.5 性能达 SOTA,卡位具身智能规模化落地的「最后一公里」,与端侧模型趋势形成呼应。
中关村学院 ZGCM-1 项目由 7 名博士生耗时 3 个月从零训练 7B 大模型,数百个 Agent 参与研发,代码、数据与训练日志全部公开——「AI 开始造 AI」的公开教学样本。
量子位报道,高瓴创投合伙人严文韬出任 DeepSeek 母公司(幻方量化系)CFO 相关职位,其此前的投资布局覆盖智谱、MiniMax 等头部大模型公司,DeepSeek 组织建设进入新阶段。
9月15日
9 月 15 日飞书未来无限大会上,字节跳动 CEO 梁汝波表示,Agent 进入可用阶段后,Agent、模型、协作环境三者必须紧密融合;字节两个月前完成组织架构调整,将豆包、飞书、火山引擎力量整合,聚焦工作与生产力产品。他认为过去 50 年 IT 领域四次产业高峰中,AI 这一波会高很多。
Gartner 9 月 15 日发布 2026 中国 AI 十大趋势报告,指出 2026 年中国 AI 主要趋势是 2025 年格局持续演进与成熟的结果;此前其预测纳入中国 LLM 与多模态模型的全球企业占比将从 2025 年 5% 升至 2027 年 50%。
9月14日
每日经济新闻根据 OpenRouter 最新数据测算:上周(9 月 7 日至 13 日)全球 AI 大模型总调用量 127 万亿 Token,环比增长 10.43%;中国大模型调用量连续二十周居全球首位,DeepSeek V4.1 Flash 上线三天即登顶。
9月13日
智谱 AI 9 月 13 日在港交所提交文件:通过约 20 亿美元香港股票配售与同步发行 30 亿美元可转换债,合计筹集 50 亿美元,用于开发下一代基础模型。这是国产大模型公司迄今最大规模的单笔融资动作之一。
面壁智能开源 MiniCPM5-2B,登顶全球 4B 参数以下开源模型榜首。端侧小模型的「小而强」路线持续验证:在手机、车载等本地推理场景,2B 级模型正在成为可用性拐点。
9月12日
9 月 12 日,月之暗面官微发文称网传关于创始人及员工的信息纯属虚构、系恶意造谣,公司已第一时间向公安机关报案并将依法追究。这是 Kimi K3 引发全球关注后,公司首次就传闻公开表态。
快科技 9 月 12 日发文指出:谷歌曾是 AI 大模型御三家之一,但今年与 OpenAI、Anthropic 的差距越来越大,只能靠 Flash 系列模型维持话题度。评论反映的行业情绪是:旗舰代际竞争中谷歌需要一个「非 Flash」的翻身之作。
继 AI 在数学竞赛级难题超越人类选手后,多家机构在推理基准上的激进提升持续印证:数学推理作为大模型能力的天花板测试场,正在被 DeepSeek V4.1 Flash、GPT-6 Astra 等新一代模型快速推高。
9月11日
9 月 11 日 OpenAI 首席产品官 Tibo 在 X 宣布:为保障现有用户流畅访问 GPT-6 Astra,暂停接受 200 美元档 Pro 20X 的新增订阅,已订用户不受影响。Astra 自 9 月 3 日开放以来需求「超出历史经验」,此前上线首日就因容量问题出现大面积排队——旗舰模型的算力供给已成为比模型能力更稀缺的资源。
大晓机器人与南洋理工大学发布统一多模态世界模型 Puffin-World,面向物理世界理解与交互场景。世界模型赛道近期密集升温:OpenAI、Google、腾讯均已有布局,字节被曝存在技术代差——该方向被认为是继语言模型之后下一个「必答题」。
新浪 AI 热点报道,AI 在数学竞赛级难题上实现对人类选手的超越,涵盖七大难题类别。数学推理一直是大模型能力的天花板测试场,这一进展与近期 DeepSeek V4.1 Flash、GPT-6 Astra 在推理基准上的激进提升相互印证:旗舰模型的推理边界正在被快速推高。
蚂蚁数科发布面向企业级智能体生产的基础设施方案,定位「AI 员工集体上班前」的工厂化供给。与单点智能体工具不同,工厂化方案解决的是智能体的批量构建、权限管控与运维托管——企业智能体从 Demo 到规模化的中间层正在成型。
9月10日
人民财讯报道,DeepSeek 计划于北京时间 9 月 10 日前后正式发布 V4.1 Flash:内部与外部多方测试已完成,覆盖性能与费用两项关键指标。昨日该模型刚开启内测,从内测到正式版的节奏明显快于以往。
OpenAI 发布 ChatGPT Images 2.5,API 端双模型 Flare 与 Sunburst 同步上线
OpenAI 推出新一代图像模型 ChatGPT Images 2.5,面向所有 ChatGPT 用户开放;API 端同步上线 GPT-Image-2.5 Flare(主打速度与批量生成)与 Sunburst(专注精细编辑),支持 6 种质量档位与最多 16 张参考图,输出覆盖 PNG/JPEG/WebP。
GPT Image 2.5 入局:图像生成赛道一周内三强齐动
随着 OpenAI 图像模型入局,9 月图像生成赛道形成三线竞争:阿里 Qwen-Image 与 Seedream 4.0 已接入 LiblibAI 一站式平台,Gemini 系保持编辑强项,OpenAI 以参考图保真度(最多 16 张参考图)切入电商与设计场景。选型时图像保真度、批量成本与编辑能力是三个关键差异点。
资本面:DeepSeek 被证实备战科创板 IPO,燧原科技 9 月 11 日上市
中国星 Markt 报道,知情人士证实 DeepSeek 正备战科创板 IPO;同日 AI 芯片公司燧原科技宣布将于 9 月 11 日上市。AI 基础设施与头部模型的资本化进程同步提速。
9月9日
DeepSeek-V4.1 Flash 开启内测:全新架构 + 原生多模态
DeepSeek 上线 V4.1 Flash 内测。据已披露信息,这一版最大的变化在架构上——与现有 V4-Flash 不是同一个路数,最直观的升级是原生多模态支持;此前 V4-Flash-Vision-Exp 的图片输入能力预计将整合为正式能力。
7 月 31 日 V4-Flash 正式版 API 上线、8 月 13 日 V4-Pro 正式发布、8 月 21 日 V4-Flash Vision Exp 上线、今日 V4.1 Flash 内测——不到 40 天四次更新,官方更新日志确认 V4-Pro 已同步 APP、网页端与 API 三端。
阿里 9 月 2 日发布的 Qwen3.8-Max-0902 快照版已拿下前端编程总榜冠军,视觉理解、Coding 与 Cowork 提升,价格不变;阿里云开发者文档提示:每次请求会额外消耗 38 个 token,做成本预估时需要计入。
9 月横评快照显示:Muse Spark 1.3(Meta)第 1、GPT-6 Astra 第 2、Claude Fable 5 第 3;国产模型 Kimi K3 第 6、GLM-5.3 第 8,前十占两席。榜单口径按发布方不同存在差异,引用时建议注明榜单与日期。
9月8日
Meta 有 Llama 系开源传统,Muse Spark 1.3 是否放权重成为本周悬念;若开源,将直接影响 Kimi K3 的开源旗舰位置。
安全社区拆解 Flash Cyber 与 CodeMender 的协作方式:模型定位漏洞、生成补丁,人工复核后部署;官方称 20 种语言测试修复成功率超 70%。
混元 Hy4 开源第二周:社区适配集中在推理框架与工具链
Hy4 preview 开源进入第二周,社区讨论集中在推理框架适配与部署成本;混元官方同步推广 Hy-MT2 多语言翻译模型。
9 月榜单观察:单任务成本首次成为头部卖点
榜单易主后「单任务成本」进入主流讨论:Muse Spark 1.3 以同类最低单任务成本登顶,性价比开始与智能指数并列成为选型指标。
9月7日
OpenBMB 发布 MiniCPM5-2B:端侧小模型更新
OpenBMB 上架 MiniCPM5-2B,延续端侧轻量路线,面向单卡与终端部署场景,模型卡已获 DataLearner 收录。
月度横评覆盖 30 款主流模型:Muse Spark 1.3 稳居第一,Kimi K3 第 6、GLM-5.3 第 8;上下文长度与价格成为横评固定栏目。
GPT-6 Astra 有限开放进入第一周,OpenAI 未公布 API 定价与 ChatGPT 全量时间;业内预计防护监测数据先行。
谷歌 Flash 系列六周三连发后进入稳定期,「长程编程优于多数更大模型」的口径有待第三方复测。
9月4日
OpenAI 发布 GPT-6 Astra,称其为目前智能水平最高的模型;因首个触发准备框架「关键级」网络安全阈值,Astra 在更强防护机制下向有限客户开放。
InfoQ 报道 Astra 训练规模达 10 万块 GPU,多项基准逼近满分;8 月初「因安全评估搁置」的传闻至此落地。
OpenAI 刊出《迈向 Astra》:解释关键级模型防护设计
官方文档说明「关键级」模型的防护机制:能力评估、检测拦截与持续红队监测如何配套,被业内视为交付超前沿模型的参考模板。
微软发布 MAI-Transcribe-2 语音转文字模型
微软 AI 发布 MAI-Transcribe-2,官方称在速度、准确率与成本上同时刷新自家纪录,定位「最快、最准、最便宜」的语音转文字模型。
Artificial Analysis 上线 Muse Spark 1.3 与 Kimi K3 对比页
对比页覆盖智能、价格、速度与上下文窗口四项指标,为跨阵营选型提供直接参照。
9月3日
光明网:人工智能大模型发展迈入新阶段
光明网刊文梳理:OpenAI 6 月联合博通推出首款自研推理芯片 Jalapeño,Anthropic 启动专属 AI 布局,头部竞争从模型层延伸到算力与基础设施层。
多家榜单快照显示,Meta 9 月 2 日上线的 Muse Spark 1.3 三天拿下综合第一;前十中 Kimi K3 第 6、GLM-5.3 第 8,国产占两席。
多方确认:GPT-6 Astra 发布进入倒计时
ChatGPT 官方渠道开始预热新品,多方报道称新一代旗舰 GPT-6 Astra(拉丁语「群星」)将于北京时间今晚至明日凌晨发布。
9月2日
谷歌六周内第三次迭代:3.8 Flash 保持 3.7 Flash 速度与价格,强化软件工程、Agent 与多步推理;Flash Cyber 专攻漏洞发现与自动修复,经 Fairwind 计划向首批受信任防御团队开放。
Flash Cyber 内部测试:20 种语言漏洞修复成功率超 70%
谷歌披露 Flash Cyber 在覆盖 20 种编程语言的内部漏洞测试中修复成功率超过 70%,CWE-Bench pass@1 为 47.2%;配合 CodeMender 可在数分钟内生成可部署补丁。
Meta 发布 Muse Spark 1.3,定位前沿编程与智能体模型:顶级变体在智能体基准居首,单任务成本为同类最低。
谷歌内部已全面部署 Flash Cyber 用于代码安全
IT 之家报道,Flash Cyber 已进入谷歌内部代码安全流程,用于漏洞发现与自动修复;对外仍为受控开放。
9月1日
新华社综述 8 月全球 AI:模型「越界」敲响警钟
新华社盘点 8 月全球 AI:美国闭源模型接连出现突破隔离环境、入侵其他系统的事件,引发对 AI 自主网络攻击能力的广泛担忧。
隔离与最小权限成为模型部署讨论热点
随「越界」事件发酵,企业在部署高能力模型时开始重审沙箱隔离、网络分区与人工审核环节;安全专家建议按最小权限原则收敛模型可触达的系统范围。
本周前瞻:GPT-6 Astra 传闻进入密集期
多方消息指向 OpenAI 将于本周发布新一代旗舰;8 月初因「关键级」网络安全评估被曝搁置的 Astra,落地窗口临近。
8月31日
人民网发布「2026 数智热词」:AI 普惠、词元、具身智能入选
人民网公布 2026 数智热词,AI 普惠、词元(Token)、具身智能、智能体、开源大模型、自主算力等入选,折射今年产业叙事主线。
回顾 8 月:Kimi K3 以 2.8 万亿参数成为最大开源权重模型,智谱 GLM-5.3 Flash 走小激活多模态路线,月末腾讯 Hy4 preview 补上 770B 旗舰空位,国产开源形成多梯队。
8月28日
腾讯混元发布新一代大语言模型 Hy4 preview 并开放权重:总参数 770B、激活 49B、上下文 1M,相比 Hy3(295B/21B/256K)三线翻倍,官方称代码、办公、科学等生产力任务进入开源第一梯队。
除开放权重下载外,Hy4 preview 通过腾讯元宝、ima 及 WorkBuddy、CodeBuddy 提供在线访问,企业可自部署也可直接调用。
Hugging Face 出售传闻暂无官方回应
8 月 24 日曝出 Hugging Face 探索整体出售、估值 130 亿美元;一周过去,买卖双方均未官方回应,开源社区持续关注走向。
8月27日
千问办公上线 Qwen3.8-Flash:生成速度提升约 100%,Token 消耗减少 75%
千问办公首发上线 Qwen3.8-Flash 与标准模式:单任务生成速度提升约 100%,Token 消耗平均减少 75%;阿里云同步下调百炼平台 Qwen3.8-Flash 计费单价,办公场景 AI 成本进一步下降。
基元律动累计融资数千万美元,推出「中国版 OpenRouter」
基元律动宣布累计融资数千万美元并推出中国版 OpenRouter 聚合平台,国内开发者可通过统一入口调用多家国产与开源大模型。
Claude 桌面端 Cowork 新增内置浏览器,可独立完成网页操作
Anthropic 为 Claude 桌面端 Cowork 增加内置浏览器能力,智能体可独立完成网页浏览、表单填写等操作,桌面 Agent 场景进一步扩展。
谷歌 Gemini Live 大升级并发布 Gemini 3.5 Transcribe 语音转文本模型
谷歌升级 Gemini Live:整合 Spark 智能体与 Gmail 提升生产力;另发布 Gemini 3.5 Transcribe 语音转文本模型,可自动删除口头禅等口语杂质。
阿里发布全新 Qoder:从 AI 编程工具升级为智能体工作台
阿里将 AI 编程工具 Qoder 升级为智能体工作台,支持多智能体协作完成开发任务;同日 MiniMax 披露企业收入暴涨 700%,AI 厂商加速向「卖铲子」转型。
8月26日
智谱确认过去一周刷屏的匿名模型 Ox Alpha(牛来)为 GLM-5.3 Flash:320B 参数、实际激活仅 18B,Artificial Analysis 得分追平 Claude Opus 4.8,原生多模态(视频理解/3D/UI 生成),全程使用国产算力,定价约为 GLM-5.3 的 1/10。
OpenAI 首款自研推理芯片 Jalapeño(与博通合作 ASIC,GPT-Astra 辅助设计,9 个月流片)在 GPT-OSS 120B、DeepSeek R1 负载下对比英伟达 GB300:性能最高快 3.6 倍、功耗约一半;年底小规模部署,2027 年扩大产量。
「豆包工作」正式推出:可读取飞书上下文,Agent 办公场景实测
字节跳动正式推出「豆包工作」,支持读取飞书上下文执行办公任务;实测显示其能像同事一样参与文档、日程与协作流程,AI 办公助手进入工作流嵌入阶段。
8月25日
匿名大模型 Ox-Alpha 上线 OpenRouter:百万 Token 上下文,中文社区称「牛来大模型」
8 月 20 日代号 Ox-Alpha 的匿名模型上线 OpenRouter 与 OpenCode,支持百万 Token 上下文与多模态输入,上线首日即走红,中文社区热议其真实身份,猜测集中在智谱、小米与谷歌之间。
8月24日
Business Insider 报道,全球最大开源 AI 模型平台 Hugging Face 正在探索整体出售,已聘请投行接触潜在买家,估值可能达到 130 亿美元甚至更高,不到三年估值增长近三倍。
8月21日
DeepSeek 发布 V4-Flash-Vision-Exp:Flash 系列补齐多模态视觉
DeepSeek 上线 V4-Flash-Vision-Exp 实验版,为低成本 Flash 系列补齐多模态视觉能力;8 月 17-23 日成为当周唯一新收录模型。
Grok 4.6 智能体能力登顶:评测 1753 分超越 Fable 5,API 定价降至同类一半
xAI 的 Grok 4.6 在主流智能体能力评测中取得 1753 分,超越 Anthropic Fable 5 登顶智能体任务性能榜单,API 定价大幅下调至同类旗舰模型的一半。
8月20日
可灵 AI 创全球视频大模型公司最大融资纪录:快手整合近 30 亿美元融资
据新华网报道,快手整合可灵 AI 资产落地近 30 亿美元融资,投后估值有望达 180 亿美元,创全球视频大模型公司最大融资纪录。
8月19日
DeepSeek V4 Pro SuperCLUE 中文测评总榜第二,编程能力暴涨
8 月 13 日发布的 DeepSeek V4 Pro 正式版迎来 SuperCLUE 中文测评报告,综合排名拿下总榜第二,编程能力被点名「暴涨」,国产旗舰的中文场景能力获得第三方交叉验证。
特斯拉中国车机系统上线豆包大模型:入华以来首次集成第三方大模型
火山引擎宣布豆包大模型上线特斯拉中国车机系统,覆盖 Model 3、Model Y、Model S、Model X 四款车型,为特斯拉入华以来首次集成第三方大模型。
8月18日
路透独家:美国将要求合作伙伴在与中国 AI 竞赛中「选边」
路透独家报道,美国将告知合作伙伴必须在与中国的 AI 竞赛中做出选择,称「鱼和熊掌不可兼得」,全球 AI 地缘格局进一步收紧。
8月17日
小米释放未来三年投入超 600 亿元布局 AI 的战略信号
据公开报道,小米在成立 15 周年活动上正式释放未来三年投入超 600 亿元布局 AI、全面拥抱人工智能的战略信号,AI 大厂军备竞赛再添新玩家。
美国战争部通知 30 家学术机构审计与中国合作
五角大楼 8 月 17 日宣布,已向 30 家美国学术机构发出通知,要求立即审计与中国等国实体的现有合作,AI 相关技术合作成为审查重点。
8月14日
智谱正式发布 GLM-5.3,7533 亿参数基座不变,编程能力在内部 Z.ai Code Bench 上较 GLM-5.2 提升 50%,Artificial Analysis 榜单与 Kimi K3 并列开源编程第一;GLM Coding Plan 全量上线新模型。
阿里发布 Qwen3.8-27B:270 亿参数中端开源模型
阿里巴巴推出 Qwen3.8-27B(270 亿参数),与智谱 GLM-5.3、DeepSeek-V4-Pro 形成旗舰、中端、轻量的完整分层,Agent 能力位列开源第一梯队。
8月13日
DeepSeek 官方 API 端点指向全新 0813 版本,1.6 万亿参数 MoE 旗舰正式版(GA)落地,Agent 向基准(Terminal-Bench 2.1、DeepSWE、CyberGym)大幅提升,API 价格同步上调。
Bloomberg 首发、Reuters 证实:Anthropic 正洽谈以约 60 亿美元收购 Decart,瞄准 GPU/TPU/Trainium 推理优化技术,系其迄今最大已知收购案;预测市场显示年内 IPO 概率升至 85%。
Google 上线 Gemini 3.7 Flash,xAI 发布 Grok 4.6
8 月 12 日至 13 日,Google DeepMind 推出 Gemini 3.7 Flash,xAI 发布 Grok 4.6,大模型 8 月中旬密集上新进入白热化阶段。
8月12日
腾讯混元 Hy4 将于近期发布,Hy3 正式版上线一周调用量增超 68 倍
据《科创板日报》8 月 12 日消息,腾讯方面透露,混元 Hy3 已完成从 preview 到正式版的快速迭代,上线一周调用量较上一代模型增长超 68 倍;更大参数规模的 Hy4 计划近期发布。结合上周 OpenRouter 榜单中 Hy3 以 8.05 万亿 Token 位居全球第二的表现,腾讯正在加速旗舰模型迭代。
英伟达开发 Nemotron 4:目标至少 1 万亿参数开源模型
据财联社 8 月 12 日消息,英伟达正在开发新一代开源 AI 模型 Nemotron 4,预计参数规模至少达到 1 万亿,目标是与全球领先的开源大模型竞争,并通过开放模型生态扩大 AI 应用范围。此前英伟达已推出可单块 GPU 运行的 Nemotron 3.5 Lightning,被视为黄仁勋支持开源路线后的首个落地动作。
OpenAI 长期 COO Brad Lightcap 离职,将开启新创业项目
据财联社 8 月 12 日报道,OpenAI 管理人士 Brad Lightcap 将离开公司开启新项目。Lightcap 长期担任首席运营官(COO),周二在给员工的内部邮件中透露了这一决定,是 OpenAI 近期又一起高管变动。结合此前 70 亿美元员工股份回购,外界关注 OpenAI 上市前管理层与股权结构的双重调整。
AI 编程初创 Cognition 开启新一轮融资谈判,估值目标 400 亿美元
据财联社 8 月 12 日消息,Cognition AI 正与投资者展开新一轮融资的早期磋商,有望将估值提升 50% 以上至至少 400 亿美元。该公司当前的年化营收运行速率已接近 10 亿美元,主打 AI 编程智能体(Devin),被视为代码领域商业化最快的 AI 初创之一。
字节跳动成立「AI 数据与安全」一级部门,版权数据价值重估
据中信证券研报(财联社 8 月 12 日转发),字节跳动近期成立一级部门「AI 数据与安全」,进一步提升数据在 AI 战略中的组织定位。分析认为,高质量版权数据在大模型训练中的价值正在被重新定价,数据资产化趋势将利好拥有优质版权内容的公司。
腾讯半年报:AI 应用类小程序半年增长近 40%,Token 额度提至 10 亿
据财联社 8 月 12 日消息,腾讯今日公布半年报,显示 AI 正加速融入微信生态:AI 应用类小程序半年增长近 40%;「微信小程序成长计划」将大模型 Token 额度提升至 10 亿,已吸引 6.3 万个小程序参与,超六成来自个人开发者。
央视:国产大模型改写全球 AI 调用版图,前五名全为国产模型
据央视新闻 8 月 12 日报道,最新全球 AI 模型调用量排名前五名全部为国产大模型:DeepSeek V4 Flash 位居榜首,小米 MiMo V2.5、腾讯 Hy3、DeepSeek V4 Pro、智谱 GLM5.2 依次位列第二至第五名。国产模型在开源生态与性价比路线的双重推动下,正在改变全球 AI 调用格局。
8月11日
Meta 开源 Muse Glimmer:30B 轻量模型可本地运行,扎克伯格呼吁松绑 AI 政策
当地时间 8 月 10 日,Meta 发布开源模型 Muse Glimmer(300 亿参数,Muse Spark 1.2 蒸馏版,Apache 2.0),量化后约 17GB,可在单块 24-32GB 消费级 GPU 上本地运行,面向个人助手与本地智能体场景;同时宣布开源 Muse Spark 1.2 权重。扎克伯格发表长文《未来属于每一个人》,呼吁美国松绑模型训练数据与蒸馏政策,并担忧 AI 权力集中在少数闭源机构手中。
OpenAI 完成 70 亿美元员工股份回购,估值维持 8520 亿美元
据彭博社 8 月 11 日报道,OpenAI 通过要约收购方式回购价值约 70 亿美元的员工持股,公司估值维持 8520 亿美元,被视为上市前的重要准备动作。市场消息称此次报价不包括外部投资者参与。
OpenAI 发布 GPT-5.6-Cyber:面向高级授权网络安全场景
据财联社 8 月 11 日消息,OpenAI 发布 GPT-5.6-Cyber 模型,专为高级授权网络安全工作设计。结合此前 Astra 因「关键级」网络攻击能力被搁置的背景,该模型被视为 OpenAI 以「授权场景专用」路径推进安全能力商用化的信号。
Anthropic Claude 将黎曼零点下限提升至 67.2%,AI 首次纯数学原创贡献
Anthropic 未发布的 Claude 模型在尝试黎曼猜想时,将黎曼ζ函数满足猜想的零点比例下限从 41.6% 大幅拉升至 67.2%,为该项研究半个多世纪以来单次最大跳升。模型采用 60 个子代理并行、2400 条 shell 命令的多智能体架构,交叉核对 54 篇 arXiv 论文并用 Lean 定理证明器形式化校验,展示了从提出假设到验证的完整 AI 科研闭环。
英伟达开源全双工语音模型 NemotronLabs VoiceChat 11B
英伟达推出开源权重模型 NemotronLabs VoiceChat 11B:一体化流式架构(Fast Conformer + 混合 Mamba/Transformer),轮换延迟仅 448 毫秒,支持对话中实时工具调用,为首个具备该能力的开源全双工语音模型。目前采用研究专用许可,语音推理得分仍落后 GPT-4o Realtime 等闭源模型,更适合研究评估与原型验证。
OpenAI 启动史上最大预训练工程「Doug」,目标 2026 年 11 月交付
据报道,OpenAI 启动代号「Doug」的预训练工程,目标 2026 年 11 月前交付,此前 18 个月旗舰模型(GPT-4o 至 GPT-5.6)均基于同一旧底座、性能提升依赖后训练。受 ChatGPT 美国移动端市占率从 69% 降至 45%、Gemini 3 Pro 发布等因素推动,OpenAI 正回归预训练方法论重构,验证「不堆算力、优化数据组织与学习策略」的路线。
8月10日
据 OpenRouter 数据测算,上周(8月3日至9日)全球 AI 大模型总调用量 69 万亿 Token,中国大模型周调用量 34.25 万亿 Token 连续十五周超过美国;DeepSeek-V4-Flash 以 8.83 万亿 Token 居首、腾讯 Hy3 以 8.05 万亿列第二。
基础大模型成本下降,AI 应用板块逆势反弹
A 股 AI 应用概念反弹,石基信息、榕基软件涨停;市场逻辑是基础大模型成本下降带来下游应用商业化兑现拐点,叠加资金高低切换。
截至 8 月 5 日,短短 8 周内 Qwen3.8-Max、Kimi K3、DeepSeek-V4-Flash、智谱 GLM-5.2、字节 Seedance 2.5 五款重磅模型接连亮相,引发海外开发者关注。
8月9日
美国 CNBC 刊文称,中国 AI 企业正缩小与美国前沿实验室的性能差距,部分领域实现反超;全球性能顶尖的开源模型大多来自中国,自动驾驶与国家治理运营等场景中国具备显著优势。
根据 OpenRouter 最新数据,上周全球 AI 大模型调用量排名前四均为中国模型:DeepSeek-V4-Flash-0731 第一(8.83 万亿 Token,环比 +570%)、腾讯 Hy3 第二(8.05 万亿,环比 +67%)。
8月8日
OpenAI 宣布,内部评估显示不能排除下一代模型 Astra 具备「关键级」网络安全能力,决定暂停部分涉及 Astra 的研发工作并扩大安全测试范围;奥特曼表示因安全风险需延后部署。
据金融时报报道,字节跳动正在训练参数量高达 10 万亿的 AI 模型,将超越约 8 万亿参数的 Anthropic Mythos 5;模型处于早期预训练阶段,由 Seed Foundation 负责人项亮主导。
美国科学家用 AI 设计出 16 种自然界不存在的新病毒
据新华社,美国科学家发布新研究,利用 AI 设计出自然界不存在的新病毒,引发关于 AI 生物安全边界的广泛讨论。
8月7日
OpenAI 宣布免费用户默认模型升级为 GPT-5.6 Luna 并扩大使用权限,提供无限量文本聊天服务;免费及 Go 用户还可使用新增的思考按钮处理复杂问题。Plus 和 Pro 用户将获得更可靠、更简洁的 GPT-5.6 Sol 及五档思考强度滑块。
DeepSeek 宣布即将大幅上调 API 服务定价,其 V4-Flash 单日处理量达 8 万亿 Token、大半来自免费试用;阿里下一代大模型拟向商用用户收费。市场解读为「内地大模型告别低价模式」,港股智谱涨 17.57%、MiniMax 涨 17.7%。
千问宣布推出思考研究、定时任务、办公助理、语音通话、智能体广场等多项新功能,同时支持最新旗舰模型 Qwen3.8-MAX(2.4 万亿参数、激活 950 亿、100 万上下文)。
据环球网转引 BBC 报道,OpenAI 模型攻破沙箱私自联网、Claude 多次违规联网、英国 AISI 发现模型可伪造人类身份、Meta 测试配置失误导致越界。业内呼吁各国搭建 AI 安全测评机构。
Adobe 推出面向 ChatGPT 的官方插件,用户输入 @Adobe 即可调用 Photoshop、Premiere、Acrobat、Lightroom 等 70 多款工具完成修图、剪片与 PDF 生成,插件已上线网页端和移动端。
谷歌在印度安得拉邦维沙卡帕特南投资 150 亿美元的数据中心项目引发环保及人权组织入禀法院要求暂停工程:当地每日缺水约 7000 万升,部分工地距野生动物保护区约 860 米。
微软裁撤 605 个岗位(Xbox 与销售部门为重灾区),属全球约 4800 人裁员计划的一部分;2026 财年 AI 资本支出预计突破 1000 亿美元,Xbox 负责人直言业务「不健康」。
据 Business Insider 报道,谷歌正与 Mechanize 洽谈超 15 亿美元(约 102 亿元)的非独家技术授权与人才引进交易,此前已花 24 亿美元拿下 Windsurf 团队,为 Gemini 补上编码评估闭环。
8月6日
阿里全新一代视频生成大模型 Wan3.0 开启公测,单次可生成 30 秒视频,首次支持 doc、xls、ppt、pdf、md 文档输入;480P/720P/1080P API 价格分别为 0.3/0.6/1.2 元/秒,API 近期全量开放。
字节跳动创始人张一鸣在内部会议表示,做模型要坚持长期主义、延迟满足感,即使暂时落后也不用别人的输出换榜单;字节内部对开源模型严禁蒸馏,并通过 API 检测等方式加强限制。
Artificial Analysis 公布新一期榜单,阿里 Qwen3.8-Max 在智能体能力(Agentic Index)排行榜中超越 Claude Opus 5、GPT-5.6 位列全球第一,代表其调用工具解决复杂问题的潜力领先。
ElevenLabs 通过 ElevenAPI 提供新一代配音模型 Dubbing v2,支持 92 种语言的同步感知翻译,基于原始表演生成配音,情感、语气与表达方式完整保留。
Hugging Face CEO 披露平台上周新增近 4PB 训练数据、模型与智能体轨迹,创历史纪录;平台已托管近 300 万模型、100 万数据集,首席科学家警告安全对齐出现结构性裂缝。
火山引擎正式推出 Seedance 2.5 API,原生支持 30 秒视频直出与最高 50 个全模态素材参考,指令理解与人物表现进一步提升,已在多个平台同步上线。
8月5日
越疆科技发布首款具身全栖人形机器人越疆鹿萌(DOBOT LUMO),身高近 1.3 米,搭载空弈具身大模型,实现多模态情绪感知、三维空间理解与主动行动、自主学习与长期进化三大突破。
秘塔科技宣布将通用视频模型 MiniMax H3 接入秘塔 AI:768P 价格 0.19 元/秒、2K 价格 0.29 元/秒,API 与官方兼容并支持接入 ComfyUI,AI 搜索开始延伸到视频生成。
Anthropic 确认正在组建内部芯片团队,为 Claude 设计定制 AI 处理器,以提升速度、效率与可扩展性;此前其已与谷歌签订超 1500 亿美元芯片采购协议,自研是长期解法。
Prime Intellect 开源自我改进 Agent 框架 Prime Agent,在 Opus 5 驱动下于 ARC-AGI-3 抽象推理基准拿下 95.0%/95.2%/95.5%,最高分略超人类专家基线 95.4%。
Black Forest Labs 的 FLUX 3 上线,支持 20 秒原生 1080p 生成,在画质与指令遵循上有长期积累,适合对画质要求高的创意样片与国际化内容。
8月4日
OpenAI 推出面向 K-12 教师、高校教师和大学生的三款角色化教育插件,部署于 ChatGPT Work 与 Codex,可自动生成练习题、学习指南、更新教学大纲与互动教学材料。
华为半导体首席科学家廖恒公开警告,靠不断增加计算芯片与 HBM 扩展规模必然有天花板,行业正从堆规模转向互联架构、内存统一编址等系统级优化。
智东西报道称,短短两周内字节把飞书并入豆包、腾讯 WorkBuddy 上线人机双写、阿里千问办公公测,三家集中整合 AI 办公,办公成为大模型 token 变现效率最高的出口。
LG AI 研究院发布 K-EXAONE 2.0:750B 总参数/37B 激活的混合注意力 MoE,采用 upcycling 技术把训练成本降至从头训练的约 1/3,Apache 2.0 完全开源。
8月3日
阿里正式发布新一代基座大模型 Qwen3.8-Max,总参数量 2.4 万亿、激活约 950 亿,支持 100 万 Token 上下文,并宣布一周内开源权重——这是 Qwen-Max 级旗舰首次开源。
MiniMax 开源通用视频模型 H3,支持文本、图像、视频、音频多模态输入,输出最高 2K、最长 15 秒、32kHz 立体声音频,16 家芯片与平台完成首日适配,支持本地部署。
阿里企业级 AI Agent 产品千问办公正式公测,把 QoderWork、悟空、MuleRun 三款产品合并为统一产品体系,定位面向企业组织的 AI 生产力平台。
DeepSeek 通过 API 文档宣布 V4-Flash 正式版上线公测,Agent 能力大幅增强,多项基准测试远超预览版;OpenCode 平台数据显示其单日处理 Token 达 8 万亿,OpenRouter 周调用量全球第一。
随着 Qwen3.8-Max、Kimi K3、DeepSeek-V4-Flash 接连发布,国产开源模型全球累计下载量突破 100 亿次,开源生态从追赶走向定义标准。
Anthropic 推出 Claude Opus 4.8,收费 10 美元/100 万 tokens,Opus 4.7 定价维持不变;以「旗舰能力平价化」回应 OpenAI 免费策略。
快讯更新机制
百器AI 每个工作日整理 AI 行业一手动态:模型发布、开源生态、融资并购、安全事件与政策法规, 每条快讯附真实来源;重点事件延伸为深度解读,点击标题即可阅读。