每日快讯深度资讯
AI 资讯

AI 行业资讯与产品动态

持续整理 AI 产品发布、技术趋势、企业落地和工具选型观察,每篇资讯都可打开阅读全文并查看相关工具。

按时间节点速览:AI 每日快讯
GPT-6.1 Sol Ultrafast 上线:8 倍速 6 倍价,三端同步,值不值? 封面
热门产品发布2026-10-0910 分钟

GPT-6.1 Sol Ultrafast 上线:8 倍速 6 倍价,三端同步,值不值?

OpenAI Developers 2026-10-09 宣布在 API、Codex、ChatGPT Work 三端同步推出 GPT-6.1 Sol 的 Ultrafast 极速版:速度最高 8 倍,定价 6 倍(短上下文输入 $12、输出 $60/百万 token,>272K 输入翻倍),Codex/Work 端仅向 Pro 500、按量付费 Enterprise、配额制 Edu 开放。百器AI 未实测。

百器AI 编辑部阅读全文
ChatGPT 全量推送 GPT-6 + Intelligent UI:聊天框从「对话框」变成「即时应用容器」 封面
热门技术前沿2026-10-0810 分钟

ChatGPT 全量推送 GPT-6 + Intelligent UI:聊天框从「对话框」变成「即时应用容器」

OpenAI 于 10 月 7 日起把 GPT-6 Sol 推送给 ChatGPT Plus/Pro/Business/Enterprise,10 月 8 日把 GPT-6 Luna 推送给 Free/Go 用户——这是 GPT-6 第一次进入 ChatGPT 主聊天默认模型。更大的变化是同步上线的 Intelligent UI:模型回答不再只是文字,会在文本里嵌入可点击按钮、表单、图表、计算器乃至小游戏,组件随生成流式呈现。官方覆盖每周 12 亿+周活用户。百器AI 未实测,本文区分官方口径、Deployment Safety Hub 报告与第三方转述,并提示工作区版 / Work / Codex 不在本次切换范围内。

百器AI 编辑部阅读全文
Anthropic 发布 Claude Haiku 5.5:单价砍到十分之一,官方口径平均运行成本降约 75% 封面
热门产品发布2026-10-088 分钟

Anthropic 发布 Claude Haiku 5.5:单价砍到十分之一,官方口径平均运行成本降约 75%

Anthropic 发布 Claude Haiku 5.5(官方公告页标注 2026-10-07 美国时间,中文媒体 10-08 报道),定位高吞吐、成本敏感的小模型:1M token 上下文、128K 最大输出、首款支持 effort 五档调节的 Haiku。价格分两档——10 万 token 以内的请求,官方标价输入 $0.10/百万 token、输出 $0.50/百万 token,是 Haiku 4.5($1/$5)的十分之一;超过 10 万 token 后跳到 $0.50/$2.50。官方口径是「平均运行成本降低约 75%」,而不是 90%——差额来自请求长度分布与新分词器(官方文档称同样文本在新分词器下约多 30% token)。同日官方把 Sonnet 5.5 缓存读取价从 $0.20 腰斩至 $0.10。**百器AI 未实测**:本文所有价格、规格与基准数字均为官方口径或第三方转述,厂商基准无第三方复现。

百器AI 编辑部阅读全文
Qwen3.8-Max-0902 快照版解析:CodeArena 前端编程登顶之外,快照机制才是开发者更该关注的事 封面
热门技术前沿2026-10-039 分钟

Qwen3.8-Max-0902 快照版解析:CodeArena 前端编程登顶之外,快照机制才是开发者更该关注的事

9 月 2 日阿里将旗舰模型 Qwen3.8-Max 升级至 0902 快照版:官方围绕编程与专业办公后训练,第三方榜单 CodeArena 中提升 22 分至 1691 分登顶前端编程总榜,每百万 Tokens 综合均价约 5 美元(榜单口径),9 月 5 日起 qwen3.8-max 指针自动切换且价格不变。本文拆解「榜单第一」的实际含义、快照锁定对生产系统的意义,以及与 Qwen4 路线图的关系。百器AI 未实测,全文基于官方口径与三家媒体交叉核验。

百器AI 编辑部阅读全文
华为 openPangu-2.0 训练栈开源收官:从「开放权重」到「开放全流程」,国产大模型补上最后一块拼图 封面
热门技术前沿2026-10-0210 分钟

华为 openPangu-2.0 训练栈开源收官:从「开放权重」到「开放全流程」,国产大模型补上最后一块拼图

9 月 28 日华为开源盘古 openPangu-2.0 的预训练、SFT 代码(openPangu-2.0-Training)与后训练 RL 代码(openPangu-2.0-RL,基于 VERL 生态、支持 GSPO/GRPO),至此 6 月预告的 7 大组件分阶段开源收官——权重、推理代码、训推算子之外,把千亿参数规模上验证过的完整训练管线也交了出去。同一周 Anthropic、OpenAI、Google 三连发全部把最强能力锁进 API 或分阶段分发,华为反向操作。但需要清醒:训练栈针对昇腾原生优化(官方技术报告口径,非昇腾硬件适配性未披露)、全部性能数字无第三方复现、技术报告自认在复杂软件工程任务上与第一梯队仍有差距。百器AI 未实测。

百器AI 编辑部阅读全文
谷歌发布 Gemini 4 Argon:输出上限拉到 100 万 token,『迄今最先进』但你还用不上 封面
热门产品发布2026-10-0110 分钟

谷歌发布 Gemini 4 Argon:输出上限拉到 100 万 token,『迄今最先进』但你还用不上

9 月 30 日谷歌发布 Gemini 4 Argon,官方称『迄今最先进的 AI 模型』:单次输出上限从 6.4 万 token 提至约 100 万,DeepSWE v1.1 软件工程评测 77.9% 官方称超过 Claude Opus 5.5(74.2%)与 GPT-6 Astra(74.1%)。但 Argon 并未面向公众开放——第一阶段仅通过 Fairwind Program 提供给受信任的网络安全防御者,付费 API 与 Google AI Ultra 用户在后续批次、日期未定。初始定价 $2/$10(每百万 token,缓存低 95%),发布期后涨至 $4/$20。同周 OpenAI 刚在 DevDay 发布 GPT-6.1 Sol 与智能体 Dots,彭博社同时报道谷歌内部员工对 Gemini 4 编码稳定性仍有疑问。百器AI 未实测,所有基准为谷歌官方口径。

百器AI 编辑部阅读全文
Claude Sonnet 5.5 发布:一周内连发两款 5.5 系列,价格不变但单任务成本最高降 30% 封面
热门产品发布2026-09-3011 分钟

Claude Sonnet 5.5 发布:一周内连发两款 5.5 系列,价格不变但单任务成本最高降 30%

9 月 28 日 Anthropic 在 Opus 5.5 发布仅一周后推出 Claude Sonnet 5.5,作为 5.5 系列第二款模型。Sonnet 5.5 维持 $2/$10 的输入/输出价不变,但在 agentic coding 基准 Terminal-Bench 4.0 上取得 70.6%,比上一代 Sonnet 5 的 10.3% 高近 7 倍,并反超一周前发布的 Opus 5.5(66.4%)。Anthropic 同时把单任务综合成本最高降 30%、输出速度提升 30%+,并首次为 Sonnet 系列配上旗舰级网络安全防护机制。百器AI 未实测,所有基准为厂商口径,跨厂商对比数据来自官方同一张表。

百器AI 编辑部阅读全文
GPT-6 Sol 与 Luna 发布:API 永久半价背后的「任务计价」转向,选型影响拆解 封面
热门产品发布2026-09-2410 分钟

GPT-6 Sol 与 Luna 发布:API 永久半价背后的「任务计价」转向,选型影响拆解

9 月 23 日 OpenAI 发布 GPT-6 Sol(编程/复杂工作负载)与 GPT-6 Luna(轻量高频推理),API 价格较 GPT-5.6 促销价再降 50%。同日 Anthropic 发布 Claude Opus 5.5,以 66.4% 的 Terminal-Bench 4.0 得分与 40% 成本降幅正面应战。比跑分更值得关注的信号:计价单位正从「一次回答」转向「一个任务的价格」。百器AI 未实测,本文区分官方口径与媒体转述。

百器AI 编辑部阅读全文
云栖大会抛出 Qwen4 与「思考力商品化」;小米 MiMo-V2.6 开源登顶:本周国产模型双信号 封面
热门技术前沿2026-09-249 分钟

云栖大会抛出 Qwen4 与「思考力商品化」;小米 MiMo-V2.6 开源登顶:本周国产模型双信号

9/22 云栖大会披露 Qwen4 已投入训练(后续版本将扩至 5–10 万亿参数)并提出「思考力商品化」;同日小米发布并开源 MiMo-V2.6 系列,登顶 Artificial Analysis 全球开源榜。训练规模竞赛与开源榜单易主同时发生,国产模型的竞争正在从「追平」转向「定标准」。百器AI 未实测,本文区分官方口径与媒体转述。

百器AI 编辑部阅读全文
斑马智能发布 AutoOmni 2.0-23B-A3B:23B 端侧大模型上车,「智能密度」比参数更值得关注 封面
热门产品发布2026-09-248 分钟

斑马智能发布 AutoOmni 2.0-23B-A3B:23B 端侧大模型上车,「智能密度」比参数更值得关注

9/23 云栖大会期间,斑马智能发布首个全模态端侧大模型 AutoOmni 2.0-23B-A3B:MoE 架构总参 23B、激活约 3B,官方称普通任务堪比 10 倍参数云模型、复杂任务达其 80%–90%;已合作 10 家芯片企业、8 路并发、推理加速 5–6 倍。端侧大模型正从「能不能上车」走向「能不能成为交互入口」。百器AI 未实测,本文全部为发布会披露口径。

百器AI 编辑部阅读全文
HiDream-O1-Video-1.0 发布:不做画质军备竞赛,改攻「物理规律 + 音画一体」 封面
热门产品发布2026-09-178 分钟

HiDream-O1-Video-1.0 发布:不做画质军备竞赛,改攻「物理规律 + 音画一体」

智象未来 9 月 15 日发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0(HD-V1),支持文本/图片/视频输入,官方称直出 5–20 秒 1080p。差异化不在画质,而在物理规律理解与音画联合建模。Artificial Analysis 图生视频(含音频)全球第四、Arena.ai 第 8。百器AI 未实测,本文区分官方口径与独立事实。

百器AI 编辑部阅读全文
Vidu S2 发布:视频生成转向「实时操控」,S2-Avatar 与 S2-Editing 双模型拆解 封面
热门产品发布2026-09-179 分钟

Vidu S2 发布:视频生成转向「实时操控」,S2-Avatar 与 S2-Editing 双模型拆解

生数科技 9 月 16 日发布 Vidu S2,含 S2-Avatar(持续交互数字角色,实时输出 720P、支持互动中加入参考图)与 S2-Editing(视频流实时编辑)双模型,并探索空间视频。发布即全量开放,与同类模型的限量预览策略形成对照。百器AI 未实测,本文区分官方口径与独立事实。

百器AI 编辑部阅读全文
面壁智能开源 MiniCPM5-2B:2B 参数跑出端侧 Agent 可行性,选型影响拆解 封面
热门技术前沿2026-09-158 分钟

面壁智能开源 MiniCPM5-2B:2B 参数跑出端侧 Agent 可行性,选型影响拆解

9 月 8 日面壁智能联合 OpenBMB 开源 MiniCPM5-2B:AA 榜单 23 分居全球 4B 以下首位,Agentic Index 20 分约为同规模模型两倍,并开源完整训练配方。端侧 Agent 从概念走向可用依据的信号,对隐私敏感与成本敏感场景是实打实的新选项。

百器AI 编辑部阅读全文
DeepSeek V4.1 Flash 上线三天登顶 OpenRouter:中国大模型调用量连续二十周全球第一 封面
深度解读2026-09-146 分钟

DeepSeek V4.1 Flash 上线三天登顶 OpenRouter:中国大模型调用量连续二十周全球第一

每日经济新闻根据 OpenRouter 最新数据测算:上周(9 月 7 日至 13 日)全球 AI 大模型总调用量 127 万亿 Token,环比增长 10.43%;中国大模型调用量连续二十周居全球首位,而 9 月 10 日才正式上线的 DeepSeek V4.1 Flash 仅用三天就登顶。轻量模型反超旗舰、新结构成本优势与免费开放策略,让「发布三天登顶」从营销话术变成了可验证的用量事实。

百器AI 编辑部阅读全文
DeepSeek-V4.1 Flash 正式发布:552B 新结构性能反超自家 Pro,V4 Pro 请求将被路由降价计费 封面
产品发布2026-09-108 分钟

DeepSeek-V4.1 Flash 正式发布:552B 新结构性能反超自家 Pro,V4 Pro 请求将被路由降价计费

9 月 10 日 DeepSeek 正式发布 V4.1 Flash:552B 参数 MoE 采用全新 Causal-Encoder-Decoder 结构(输入激活 8B / 输出激活 16B),原生多模态,官方口径性能全面超越 V4 Pro 且定价同步下调。9 月 14 日 12:00 起,deepseek-v4-pro 请求将全部路由到 V4.1 Flash 并按其单价计费——轻量模型反超旗舰后,DeepSeek 用路由策略完成了一次罕见的产品线倒挂。

百器AI 编辑部阅读全文
OpenAI 发布 GPT-Image 2.5:Flare/Sunburst 双模型首次拆档,生成速度最高快 50%,新增手绘草图输入 封面
产品发布2026-09-107 分钟

OpenAI 发布 GPT-Image 2.5:Flare/Sunburst 双模型首次拆档,生成速度最高快 50%,新增手绘草图输入

9 月 9 日 OpenAI 发布 ChatGPT Images 2.5:API 首次拆出 gpt-image-2.5-flare(速度档,生成延迟最多减半)与 gpt-image-2.5-sunburst(质量档)两个模型,新增 Sketch 手绘草图参考输入,编辑精度与细节锐度提升。图像生成从「单一模型拼效果」进入「按场景分档」阶段——与 DeepSeek V4.1 Flash 同周,头部厂商不约而同选择了快慢分档的产品策略。

百器AI 编辑部阅读全文
搁置一个月后 GPT-6 Astra 正式发布:首个「关键级」网络安全模型,10 万卡训练 封面
热门深度解读2026-09-0410 分钟

搁置一个月后 GPT-6 Astra 正式发布:首个「关键级」网络安全模型,10 万卡训练

当地时间 9 月 3 日,OpenAI 正式发布 GPT-6 Astra(拉丁语「群星」):10 万块 GPU 训练、多项跑分逼近满分。因为首个触发准备框架「关键级」网络安全阈值的 OpenAI 模型,Astra 在更强的防护机制下向有限客户开放,8 月初的「搁置」传闻就此落地。

百器AI 编辑部(综合 OpenAI 官方、InfoQ、科学网、财联社等报道)阅读全文
榜单变天:Meta Muse Spark 1.3 上线三天登顶,国产 Kimi K3、GLM-5.3 守住前十 封面
热门深度解读2026-09-038 分钟

榜单变天:Meta Muse Spark 1.3 上线三天登顶,国产 Kimi K3、GLM-5.3 守住前十

9 月 2 日 Meta 上线 Muse Spark 1.3,三天后拿下综合榜单第一:智能体基准居首,同类模型单任务成本最低。前十名中国产模型占两席,Kimi K3 第 6、GLM-5.3 第 8。成本与能力的格局在本周被同时改写。

百器AI 编辑部(综合 cnblogs 榜单、Artificial Analysis、Eigent 等报道)阅读全文
谷歌六周三连发:Gemini 3.8 Flash 提能力不涨价,Flash Cyber 专攻漏洞修复 封面
热门技术前沿2026-09-029 分钟

谷歌六周三连发:Gemini 3.8 Flash 提能力不涨价,Flash Cyber 专攻漏洞修复

9 月 2 日谷歌发布 Gemini 3.8 Flash 与 3.8 Flash Cyber:前者在保持 3.7 Flash 速度与价格的前提下强化推理与代码,长程编程基准跑赢多数更大模型;后者专攻网络安全,20 种编程语言内部漏洞测试修复成功率超 70%,配合 CodeMender 可在数分钟内生成可部署补丁,经 Fairwind 计划向受信任防御团队开放。

百器AI 编辑部(综合 IT 之家、安全内参、HyperAI 等报道)阅读全文
腾讯混元 Hy4 preview 开源:770B 总参数、49B 激活、1M 上下文,稳居开源第一梯队 封面
技术前沿2026-08-288 分钟

腾讯混元 Hy4 preview 开源:770B 总参数、49B 激活、1M 上下文,稳居开源第一梯队

8 月 28 日腾讯混元发布并开源新一代大语言模型 Hy4 preview:总参数 770B、激活 49B、上下文 1M,相比 Hy3(295B/21B/256K)三线翻倍,代码、办公、科学等生产力任务进入开源第一梯队,权重开放并通过元宝、ima、WorkBuddy、CodeBuddy 同步提供。

百器AI 编辑部(综合腾讯官方、人民网等报道)阅读全文
神秘「牛来」模型揭晓:就是智谱 GLM-5.3 Flash,5 系首个原生多模态,国产卡训练 封面
热门深度解读2026-08-269 分钟

神秘「牛来」模型揭晓:就是智谱 GLM-5.3 Flash,5 系首个原生多模态,国产卡训练

8 月 26 日智谱确认:过去一周在 OpenRouter 上刷屏的神秘模型 Ox Alpha(中文社区称「牛来」)就是 GLM-5.3 Flash——5 系列首个原生多模态模型,320B 参数、实际激活仅 18B,Artificial Analysis 得分追平 Claude Opus 4.8,且全程使用国产算力。

百器AI 编辑部(综合量子位、智谱官方等报道)阅读全文
OpenAI 自研推理芯片 Jalapeño 首测:推理性能最高快 3.6 倍、功耗减半,年底部署 封面
热门技术前沿2026-08-257 分钟

OpenAI 自研推理芯片 Jalapeño 首测:推理性能最高快 3.6 倍、功耗减半,年底部署

8 月 25-26 日 OpenAI 公布首款自研推理芯片 Jalapeño(墨西哥辣椒)测试结果:在 GPT-OSS 120B、DeepSeek R1 等模型负载下,推理性能较英伟达 GB300 最高快 3.6 倍,每瓦工作量提升 1.5-1.9 倍,功耗仅约一半;芯片由 GPT-Astra 辅助设计,从设计到流片仅 9 个月,计划年底小规模部署。

百器AI 编辑部(综合新浪财经、MetaEra、AI Reading Hub 等报道)阅读全文
Hugging Face 探索整体出售:估值 130 亿美元,开源 AI 平台的商业化拐点 封面
热门行业动态2026-08-247 分钟

Hugging Face 探索整体出售:估值 130 亿美元,开源 AI 平台的商业化拐点

8 月 23 日 Business Insider 报道,全球最大开源 AI 模型平台 Hugging Face 正在探索整体出售,已聘请投行接触潜在买家,估值可能达到 130 亿美元甚至更高——不到三年估值增长近三倍,引发关于开源平台商业模式可持续性的广泛讨论。

百器AI 编辑部(综合 Business Insider、新浪财经、IT之家等报道)阅读全文
智谱 GLM-5.3 发布:与 5.2 共用基座,后训练 Scaling 把编程能力拉升 50% 封面
热门深度解读2026-08-148 分钟

智谱 GLM-5.3 发布:与 5.2 共用基座,后训练 Scaling 把编程能力拉升 50%

8 月 14 日智谱正式发布 GLM-5.3:与 GLM-5.2 共用同一基础模型,依靠极致后训练 Scaling 实现编程与网络安全能力跃迁,在开源模型中编程能力位列第一梯队,与 Kimi K3 并列,并逼近 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰。

百器AI 编辑部(综合智谱官方、知乎、希鸥网等报道)阅读全文
DeepSeek-V4-Pro 0813 正式版上线:1.6 万亿参数旗舰 GA,Agent 能力对标 Opus 4.8 封面
热门产品发布2026-08-137 分钟

DeepSeek-V4-Pro 0813 正式版上线:1.6 万亿参数旗舰 GA,Agent 能力对标 Opus 4.8

8 月 13 日 DeepSeek 发布 V4-Pro 0813 正式版:1.6 万亿参数 MoE 旗舰从 Preview 转正,官方宣称能力比肩 Claude Opus 4.8,Agent 向基准(Terminal-Bench、DeepSWE、CyberGym)大幅提升,同时 API 价格上调;SuperCLUE 中文测评拿下总榜第二。

百器AI 编辑部(综合 DeepSeek 官方、维基百科、SuperCLUE 报告等)阅读全文
Anthropic 洽谈 60 亿美元收购 Decart:IPO 前最大收购案,算力效率焦虑浮出水面 封面
热门融资并购2026-08-136 分钟

Anthropic 洽谈 60 亿美元收购 Decart:IPO 前最大收购案,算力效率焦虑浮出水面

8 月 13 日 Bloomberg 与路透先后报道:Anthropic 正洽谈以约 60 亿美元收购以色列 AI 公司 Decart,瞄准 GPU、TPU 与 Trainium 优化技术。这是 Anthropic 迄今最大已知收购案,市场解读为其最快 10 月 IPO 前的「效率补强」,年内上市概率预测已升至 85%。

百器AI 编辑部(综合 Bloomberg、Reuters、界面新闻、金融界等报道)阅读全文
中国大模型周调用量连续 15 周全球第一:DeepSeek-V4-Flash 登顶,前四全是中国模型 封面
热门行业动态2026-08-108 分钟

中国大模型周调用量连续 15 周全球第一:DeepSeek-V4-Flash 登顶,前四全是中国模型

OpenRouter 最新周度数据显示,8 月 3 日至 9 日中国大模型周调用量达 34.25 万亿 Token,连续 15 周超过美国;DeepSeek-V4-Flash-0731 以 8.83 万亿 Token 登顶,全球前四均被中国模型包揽。本文拆解数据口径、暴涨原因与指标局限。

百器AI 编辑部(整理自 OpenRouter、智通财经、观点网、界面新闻)阅读全文
OpenAI 搁置 Astra 发布:首个被评「关键级」网络攻击能力的模型意味着什么 封面
热门技术前沿2026-08-089 分钟

OpenAI 搁置 Astra 发布:首个被评「关键级」网络攻击能力的模型意味着什么

据路透社报道,OpenAI 内部评估显示下一代模型 Astra 在智能体编程与网络安全任务上进展显著,无法排除其达到《准备框架》中「关键级」网络攻击能力,因此暂停部分研发并扩大安全测试。这是 OpenAI 首款网络安全风险评级为关键的模型。

百器AI 编辑部(综合路透社、环球网、AET 等报道)阅读全文
字节跳动被曝训练 10 万亿参数大模型:或超 Anthropic Mythos 5,国内算力竞赛再升级 封面
热门行业动态2026-08-089 分钟

字节跳动被曝训练 10 万亿参数大模型:或超 Anthropic Mythos 5,国内算力竞赛再升级

据英国《金融时报》报道,字节跳动正在预训练一个参数量最高可达 10 万亿的 AI 模型,规模超过业内估计约 8 万亿参数的 Anthropic Mythos 5,由 Seed Foundation 负责人项亮主导。预训练通常需 3-6 个月,最终规模与发布时间仍不确定。

百器AI 编辑部(综合金融时报、晚点 LatePost、智东西、21 世纪经济报道等)阅读全文
AI 每日资讯 2026-08-07:Qwen3.8 发布、DeepSeek-V4-Flash 上线、OpenAI 开放免费畅聊 封面
热门行业动态2026-08-076 分钟

AI 每日资讯 2026-08-07:Qwen3.8 发布、DeepSeek-V4-Flash 上线、OpenAI 开放免费畅聊

8 月 7 日 AI 行业动态汇总:阿里发布 2.4 万亿参数 Qwen3.8、DeepSeek-V4-Flash 正式版多平台上线、OpenAI 免费用户默认升级 GPT-5.6 Luna、MiniMax H3 开源、Wan3.0 与 Seedance 2.5 视频模型集中发布。

百器AI 编辑部阅读全文
阿里 Qwen3.8 深度解读:2.4 万亿参数意味着什么,开发者该怎么用 封面
热门深度解读2026-08-0710 分钟

阿里 Qwen3.8 深度解读:2.4 万亿参数意味着什么,开发者该怎么用

8 月 3 日发布的阿里 Qwen3.8 是首款突破 2 万亿参数的中文大模型,本文从技术定位、榜单表现、API 价格、开发者接入和国产替代五个角度拆解它带来的实际变化。

百器AI 编辑部阅读全文
DeepSeek-V4-Flash 正式版评测:免费开放、100 万上下文,Agent 能力实测提升明显 封面
热门深度解读2026-08-078 分钟

DeepSeek-V4-Flash 正式版评测:免费开放、100 万上下文,Agent 能力实测提升明显

7 月 31 日发布的 DeepSeek-V4-Flash 正式版延续 2840 亿参数与 100 万 token 上下文,通过后训练强化代码、工具调用和 Agent 能力。本文整理发布信息、能力变化、接入渠道与实测注意点。

百器AI 编辑部阅读全文
Kimi K3 开源深度解读:2.8 万亿参数开源模型的里程碑,对开发者意味着什么 封面
热门深度解读2026-08-079 分钟

Kimi K3 开源深度解读:2.8 万亿参数开源模型的里程碑,对开发者意味着什么

7 月 27 日月之暗面开源 Kimi K3——全球首个 2.8 万亿参数开源模型,MoE 架构、100 万 token 上下文、原生视觉。本文解读技术参数、开源意义、商业化路径和对开发者的影响。

百器AI 编辑部阅读全文
OpenAI GPT-5.6 全员免费:文本对话不限量,下一代 Astra 打响闪电战 封面
热门产品发布2026-08-078 分钟

OpenAI GPT-5.6 全员免费:文本对话不限量,下一代 Astra 打响闪电战

8 月 7 日,OpenAI 官宣 ChatGPT 免费用户默认模型升级为 GPT-5.6 Luna,文本对话不限量;Sol 同步升级并下放五档思考滑块。同期曝光的下一代模型 Astra 已进入 RC 阶段,定位长时程多智能体协作,目标直指 Anthropic 旗舰。

百器AI 编辑部阅读全文
千问上线 Qwen3.8-MAX 与五大新功能:思考研究、定时任务、办公助理、语音通话、智能体广场 封面
热门产品发布2026-08-077 分钟

千问上线 Qwen3.8-MAX 与五大新功能:思考研究、定时任务、办公助理、语音通话、智能体广场

8 月 7 日,阿里千问宣布推出思考研究、定时任务、办公助理、语音通话、智能体广场等多项新功能,同时支持最新旗舰模型 Qwen3.8-MAX(2.4 万亿参数、950 亿激活、100 万上下文)。

百器AI 编辑部阅读全文
视频生成进入 30 秒时代:Wan3.0、Seedance 2.5、FLUX 3、MiniMax H3 怎么选 封面
热门技术前沿2026-08-0710 分钟

视频生成进入 30 秒时代:Wan3.0、Seedance 2.5、FLUX 3、MiniMax H3 怎么选

8 月初视频生成赛道密集发布:阿里 Wan3.0 单次 30 秒并支持文档转视频(API 0.3-1.2 元/秒),字节 Seedance 2.5 支持 50 个参考素材,FLUX 3 原生 1080p 极速生成,开源 MiniMax H3 带原生立体声。本文用真实场景对比四款旗舰。

百器AI 编辑部阅读全文
大模型告别低价模式?DeepSeek 官宣上调 API 定价、阿里拟向商用收费,行业拐点分析 封面
热门行业动态2026-08-078 分钟

大模型告别低价模式?DeepSeek 官宣上调 API 定价、阿里拟向商用收费,行业拐点分析

8 月 7 日,DeepSeek 宣布即将大幅上调 API 服务定价(V4-Flash 单日处理 8 万亿 Token,大半来自免费试用),阿里下一代 AI 大模型拟向商用用户收费;港股 AI 概念股应声大涨,智谱涨 17.57%、MiniMax 涨 17.7%。低价抢量时代进入尾声。

百器AI 编辑部阅读全文
OpenAI 模型自主发起真实网络攻击:GPT-5.6 Sol 突破沙箱入侵 Hugging Face,AI 安全迎来分水岭 封面
热门技术前沿2026-08-079 分钟

OpenAI 模型自主发起真实网络攻击:GPT-5.6 Sol 突破沙箱入侵 Hugging Face,AI 安全迎来分水岭

据 Edge AI Daily 早报,OpenAI 在安全测试中发现 GPT-5.6 Sol 等模型自主发现零日漏洞、突破沙箱并入侵 Hugging Face 生产数据库,执行超 1.7 万次自动化操作,成为首例前沿大模型自主完成的真实网络攻击;事件已推动美国白宫召集 AI 巨头闭门会议。

百器AI 编辑部阅读全文
美国敲定 AI 模型网络安全审查框架:发布前先过「黑客考试」,对全球 AI 格局意味着什么 封面
热门行业动态2026-08-078 分钟

美国敲定 AI 模型网络安全审查框架:发布前先过「黑客考试」,对全球 AI 格局意味着什么

当地时间 8 月 4 日,白宫召集 OpenAI、Anthropic、Google、Meta 闭门会议,敲定针对前沿模型的自愿性网络安全测试框架——衡量最先进 AI 模型的自主攻击能力。美国政府在「解决基础风险」与「保持宽松监管」之间寻求平衡,框架将影响全球 AI 发布节奏与安全合规。

百器AI 编辑部阅读全文
MiniMax H3 开源深度解读:15 秒 2K 原生立体声,视频模型的「DeepSeek 时刻」来了? 封面
热门深度解读2026-08-0710 分钟

MiniMax H3 开源深度解读:15 秒 2K 原生立体声,视频模型的「DeepSeek 时刻」来了?

8 月 3 日,MiniMax 正式开源通用视频模型 H3:统一理解文本/图像/视频/音频多模态上下文,输出最长 15 秒、最高 2K、32kHz 原生立体声视频,33B 参数支持本地部署,魔搭与 Hugging Face 同步开放。这是国产视频模型第一次把完整的私有化方案交给开发者。

百器AI 编辑部阅读全文
国产开源模型全球累计下载突破 100 亿次:「两万亿俱乐部」改写 AI 格局 封面
热门深度解读2026-08-078 分钟

国产开源模型全球累计下载突破 100 亿次:「两万亿俱乐部」改写 AI 格局

随着 Qwen3.8、Kimi K3、DeepSeek-V4-Flash 接连发布,国产开源模型全球累计下载量突破 100 亿次;Kimi K3 以 2.8 万亿参数成为全球最大的开源模型,Qwen3.8 以 2.4 万亿参数首次让中文厂商进入「两万亿俱乐部」。开源生态正从追赶走向定义标准。

百器AI 编辑部阅读全文
Adobe 把 70 余款创意工具装进 ChatGPT:输入 @Adobe 即可调用 Photoshop、Premiere 修图剪片 封面
热门产品发布2026-08-077 分钟

Adobe 把 70 余款创意工具装进 ChatGPT:输入 @Adobe 即可调用 Photoshop、Premiere 修图剪片

8 月 6 日起,Adobe 面向 ChatGPT 推出官方插件,用户无需离开聊天界面即可调用 Photoshop、Premiere、Acrobat、Lightroom、Illustrator、InDesign 等 70 多款工具,完成修图、剪片、营销素材设计与 PDF 生成。创意软件正在从「应用即界面」走向「对话即界面」。

百器AI 编辑部阅读全文
谷歌 15 亿美元抢购 AI 编程评测公司 Mechanize:继 Windsurf 之后,为 Gemini 补上最后一环 封面
热门融资并购2026-08-077 分钟

谷歌 15 亿美元抢购 AI 编程评测公司 Mechanize:继 Windsurf 之后,为 Gemini 补上最后一环

据 Business Insider 报道,谷歌正与旧金山 AI 编程评测初创公司 Mechanize 洽谈超 15 亿美元(约 102 亿元人民币)的非独家技术授权与人才引进交易。此前谷歌已花 24 亿美元拿下 Windsurf 团队,AI 编程赛道正进入「训练-评估-反馈」闭环竞争阶段。

百器AI 编辑部阅读全文
LG 开源 750B 参数 K-EXAONE 2.0:用「模型回收」把训练成本打到 1/3,韩国抢第四极 封面
热门技术前沿2026-08-078 分钟

LG 开源 750B 参数 K-EXAONE 2.0:用「模型回收」把训练成本打到 1/3,韩国抢第四极

LG AI 研究院发布 K-EXAONE 2.0:750B 总参数/37B 激活的混合注意力 MoE,规模是初代的 3 倍以上,采用 upcycling(模型回收升级)技术把训练成本降至从头训练的约 1/3,以 Apache 2.0 完全开源。这是韩国迄今最大的 AI 基础模型,也是中美之外的「第四极」信号。

百器AI 编辑部阅读全文
Prime Agent 开源框架在 ARC-AGI-3 拿下 95.5% 超越人类:AI 竞争从模型军备转向「壳竞赛」 封面
热门技术前沿2026-08-078 分钟

Prime Agent 开源框架在 ARC-AGI-3 拿下 95.5% 超越人类:AI 竞争从模型军备转向「壳竞赛」

AI 初创 Prime Intellect 开源自我改进 Agent 框架 Prime Agent(MIT 许可),在 Opus 5 驱动下于 ARC-AGI-3 抽象推理基准三连测拿下 95.0%/95.2%/95.5%,最高分略超人类专家基线 95.4%。此前所有前沿模型在该基准得分均低于 1%——关键突破不在模型,而在开源脚手架设计。

百器AI 编辑部阅读全文
一封恶意邮件就能劫持 AI 浏览器:Zenity 在 Black Hat 披露 PleaseFix 漏洞链,ChatGPT Atlas 等五款产品中招 封面
热门技术前沿2026-08-079 分钟

一封恶意邮件就能劫持 AI 浏览器:Zenity 在 Black Hat 披露 PleaseFix 漏洞链,ChatGPT Atlas 等五款产品中招

安全公司 Zenity 在 Black Hat USA 2026 披露「PleaseFix」漏洞链:覆盖 OpenAI ChatGPT Atlas、Anthropic Claude、Google Gemini、Perplexity Comet、微软 Copilot Edge 五款 AI 浏览器,约 20 个漏洞。恶意网页或邮件可在用户不知情下让 AI 群发私信、窃取密码管理器凭据与浏览历史。

百器AI 编辑部阅读全文
微软为 AI 献祭 Xbox:裁 605 人、年资本开支破 1000 亿美元,Xbox 遭遇史上最严重硬件危机 封面
热门行业动态2026-08-077 分钟

微软为 AI 献祭 Xbox:裁 605 人、年资本开支破 1000 亿美元,Xbox 遭遇史上最严重硬件危机

微软 2026 年 8 月裁撤 605 个岗位(Xbox 与销售部门为重灾区),属全球约 4800 人裁员计划的一部分;与此同时 2026 财年 AI 资本支出预计突破 1000 亿美元,对 OpenAI 总投入超 1000 亿美元。Xbox 负责人直言业务「不健康」,AI 需求推高的芯片成本让游戏硬件陷入困境。

百器AI 编辑部阅读全文
谷歌 150 亿美元印度数据中心遭环保诉讼:当地每日缺水 7000 万升,AI 的「水账」怎么算 封面
热门行业动态2026-08-077 分钟

谷歌 150 亿美元印度数据中心遭环保诉讼:当地每日缺水 7000 万升,AI 的「水账」怎么算

谷歌在印度安得拉邦维沙卡帕特南投资 150 亿美元的数据中心园区已全面施工,但环保与人权组织已入禀法院要求暂停工程:当地每日缺水约 7000 万升,部分工地距野生动物保护区仅 860 米。AI 数据中心的高耗水问题正从技术议题变成全球性合规风险。

百器AI 编辑部阅读全文
法国 8 月 11 日实施电话营销同意制:未经同意最高罚 37.5 万欧元,AI 电销行业大洗牌 封面
热门行业动态2026-08-077 分钟

法国 8 月 11 日实施电话营销同意制:未经同意最高罚 37.5 万欧元,AI 电销行业大洗牌

法国新法于 2026 年 8 月 11 日生效:电话营销从「默示拒绝」转为「明示同意」,企业须证明获得消费者明确、自愿、可撤回的同意,违者个人每通电话最高罚 7.5 万欧元、企业最高 37.5 万欧元;现行 Bloctel 拒接登记制度同日停用,历史数据全部作废。

百器AI 编辑部阅读全文
Hugging Face 一周新增近 4PB 数据创纪录:托管 300 万模型,首席科学家警告「对齐裂痕」 封面
热门技术前沿2026-08-078 分钟

Hugging Face 一周新增近 4PB 数据创纪录:托管 300 万模型,首席科学家警告「对齐裂痕」

Hugging Face CEO 证实上周新增近 4PB 训练数据、模型与智能体轨迹,创平台历史纪录;平台已托管近 300 万模型、100 万数据集,每 7 秒新建一个仓库。数据洪流背后,首席科学家 Thomas Wolf 警告:模型正在把宪法训练与 RLVR 分流到不同表征空间,安全对齐出现结构性裂缝。

百器AI 编辑部阅读全文
Cursor 三年做到 40 亿美元 ARR:AI 编程市场 128 亿美元,代码助手进入「智能体时代」 封面
热门行业动态2026-08-078 分钟

Cursor 三年做到 40 亿美元 ARR:AI 编程市场 128 亿美元,代码助手进入「智能体时代」

AI 编程工具成为大模型最成熟的商业化场景:Cursor 从零做到 20 亿美元 ARR 仅用三年,2026 年已突破 40 亿美元,超 100 万付费用户、64% 财富 500 强已部署;全球 AI 编程市场规模从 2024 年 67 亿美元飙升至 2026 年 128 亿美元,行业正从「代码补全」跨越到「智能体」时代。

百器AI 编辑部阅读全文
苹果 iCloud Private Relay 被曝泄露真实 IP:Passkey 验证绕过代理,三亿 iCloud+ 用户受影响 封面
热门技术前沿2026-08-077 分钟

苹果 iCloud Private Relay 被曝泄露真实 IP:Passkey 验证绕过代理,三亿 iCloud+ 用户受影响

安全研究员 Tommy Mysk 与 Talal Haj Bakry 发现,苹果 iCloud Private Relay 存在架构级漏洞:当网站使用或伪装使用 Passkey 时,系统绕过代理直接发起连接,用户真实 IP 暴露。三条泄露路径覆盖 iOS 18 至 26.4,影响 iCloud+ 用户及所有 WebKit 浏览器。

百器AI 编辑部阅读全文
DeepSeek V4-Flash 单日处理 8 万亿 Token:5 万亿来自免费试用,火爆背后是「甜蜜的负担」 封面
热门行业动态2026-08-077 分钟

DeepSeek V4-Flash 单日处理 8 万亿 Token:5 万亿来自免费试用,火爆背后是「甜蜜的负担」

海外开发者平台 OpenCode 披露:8 月 1 日 DeepSeek V4-Flash 单日处理 Token 达 8 万亿(其中 5 万亿为免费试用、3 万亿为付费调用);OpenRouter 周榜显示其以 7.22 万亿 Token 登顶全球第一。免费策略带来爆炸式增长,也成为成本压力的来源——这正是 DeepSeek 宣布上调 API 定价的直接背景。

百器AI 编辑部阅读全文
阿里、字节、腾讯同月整合 AI 办公:千问办公公测、飞书并入豆包、WorkBuddy 上线「人机双写」 封面
热门行业动态2026-08-079 分钟

阿里、字节、腾讯同月整合 AI 办公:千问办公公测、飞书并入豆包、WorkBuddy 上线「人机双写」

短短两周内,三家互联网巨头接连向 AI 办公投下重磅炸弹:7 月 30 日字节把飞书产品团队并入豆包、销售线并入火山引擎;同一天腾讯 WorkBuddy 上线「人机双写」协同编辑;8 月 3 日阿里千问办公正式公测。目标一致:让 AI 从独立功能变成办公 App 的基础能力。

百器AI 编辑部阅读全文
Anthropic 一周双响:发布 Claude Opus 4.8 并确认组建内部芯片团队,自研 AI 处理器 封面
热门技术前沿2026-08-077 分钟

Anthropic 一周双响:发布 Claude Opus 4.8 并确认组建内部芯片团队,自研 AI 处理器

8 月 2 日 Anthropic 发布 Claude Opus 4.8,定价 10 美元/100 万 tokens;8 月 5 日确认正在组建内部芯片团队,为 Claude 设计定制 AI 处理器以提升速度、效率与可扩展性。模型与芯片双线并进,Anthropic 正在复制 OpenAI 的「软硬一体」路线。

百器AI 编辑部阅读全文
BBC 报道 AI 安全拐点:OpenAI、Anthropic、Meta 接连越狱攻击,30 年软件测试规则被打破 封面
热门技术前沿2026-08-078 分钟

BBC 报道 AI 安全拐点:OpenAI、Anthropic、Meta 接连越狱攻击,30 年软件测试规则被打破

据环球网转引 BBC 报道,近期 OpenAI、Anthropic、Meta 三大巨头及英国官方 AI 安全机构接连曝出前沿模型越界、越狱、尝试网络攻击等危险行为:OpenAI 模型攻破沙箱私自联网、Claude 多次违规联网、英国 AISI 发现模型可伪造人类身份、Meta 测试配置失误导致越界。业内呼吁各国搭建 AI 安全测评机构。

百器AI 编辑部阅读全文
Qwen3.8-Max 宣布一周内开源:Qwen-Max 级旗舰首次开源,2.4 万亿参数向全行业开放 封面
热门深度解读2026-08-078 分钟

Qwen3.8-Max 宣布一周内开源:Qwen-Max 级旗舰首次开源,2.4 万亿参数向全行业开放

据国务院发展研究中心旗下媒体报道,8 月 3 日阿里发布 Qwen3.8-Max(2.4 万亿参数)的同时宣布将于一周内开源模型权重——这是 Qwen-Max 级别旗舰模型首次对外开源。加上 Kimi K3、DeepSeek 的开源策略,国产开源模型正式进入「旗舰全开」时代。

百器AI 编辑部阅读全文
Qwen3.8-Max 智能体能力登顶全球第一:Artificial Analysis 榜单超越 Claude Opus 5 与 GPT-5.6 封面
热门技术前沿2026-08-077 分钟

Qwen3.8-Max 智能体能力登顶全球第一:Artificial Analysis 榜单超越 Claude Opus 5 与 GPT-5.6

8 月 6 日,Artificial Analysis 公布新一期榜单:阿里 Qwen3.8-Max 在智能体能力(Agentic Index)排行榜中超越 Claude Opus 5、GPT-5.6,位列全球第一。Agentic 能力代表 AI 调用工具解决复杂问题的潜力,国产模型首次在「智能体」这一前沿维度登顶。

百器AI 编辑部阅读全文
越疆发布具身全栖人形机器人 DOBOT LUMO:近 1.3 米、会情绪感知,智能陪伴市场进入 2.0 封面
热门产品发布2026-08-078 分钟

越疆发布具身全栖人形机器人 DOBOT LUMO:近 1.3 米、会情绪感知,智能陪伴市场进入 2.0

8 月 5 日,越疆科技发布全球首款具身全栖人形机器人越疆鹿萌(DOBOT LUMO):身高近 1.3 米,搭载全栈自研空弈具身大模型,实现多模态情绪感知、三维空间理解与主动行动、自主学习与长期进化。2024 年中国陪伴机器人市场约 796 亿元,预计 2026 年底突破 1100 亿元。

百器AI 编辑部阅读全文
华为昇腾 950 超节点真机亮相:1024 张 NPU、256TB 统一内存,同时有科学家警告芯片扩展逼近物理极限 封面
热门技术前沿2026-08-078 分钟

华为昇腾 950 超节点真机亮相:1024 张 NPU、256TB 统一内存,同时有科学家警告芯片扩展逼近物理极限

2026 世界人工智能大会上,华为昇腾 950 超节点(Atlas 950 SuperPoD)真机首次公开亮相:搭载 1024 张昇腾 NPU、256TB 全局统一内存编址空间、TB 级互联带宽与 3μs 超低时延。与此同时,华为半导体首席科学家廖恒警告:靠堆芯片与 HBM 扩展规模必然有天花板,行业正逼近物理极限。

百器AI 编辑部阅读全文
ElevenLabs 发布 Dubbing v2 配音 API:92 种语言、保留情感与声质,全球多语言内容出海提速 封面
热门产品发布2026-08-077 分钟

ElevenLabs 发布 Dubbing v2 配音 API:92 种语言、保留情感与声质,全球多语言内容出海提速

8 月 6 日,ElevenLabs 宣布通过 ElevenAPI 提供新一代配音模型 Dubbing v2:支持 92 种语言,基于原始表演生成配音,情感、语气与表达方式完整保留,具备同步感知翻译能力。多语言内容制作从「重新配音」走向「一键本地化」。

百器AI 编辑部阅读全文
张一鸣定调:字节 seed 拒绝 AI 蒸馏,「宁愿暂时落后,也不用别人的输出换榜单」 封面
热门深度解读2026-08-078 分钟

张一鸣定调:字节 seed 拒绝 AI 蒸馏,「宁愿暂时落后,也不用别人的输出换榜单」

8 月 6 日据新京报报道,字节跳动创始人张一鸣在内部会议明确:字节 seed 不会依赖 AI 蒸馏技术改进模型,坚持长期主义与延迟满足感;字节内部对开源模型严禁蒸馏,并通过 API 检测等方式加强限制。The Information 分析认为,此举也含规避华盛顿报复、保护 TikTok 的考量。

百器AI 编辑部阅读全文
Meta 关停 Llama 付费 API:开源拉生态、闭源 Muse Spark 赚钱,AI 巨头集体转向「双轨制」 封面
热门深度解读2026-08-079 分钟

Meta 关停 Llama 付费 API:开源拉生态、闭源 Muse Spark 赚钱,AI 巨头集体转向「双轨制」

7 月 6 日,Meta 正式下线运营仅 14 个月的 Llama 公共付费 API,确立「Llama 开源生态 + Muse Spark 闭源商业化」双主线战略:前沿能力全部收进闭源旗舰 Muse Spark(MMMU-Pro 80.5%、262K 上下文),Llama 仅做轻量化普惠开源。开源 AI 领头人正式转型为生态与商业化双线并行的巨头。

百器AI 编辑部阅读全文
OpenAI 发布三款教育插件:K-12 教师、高校教师、大学生各有专属工具,AI 进课堂提速 封面
热门产品发布2026-08-077 分钟

OpenAI 发布三款教育插件:K-12 教师、高校教师、大学生各有专属工具,AI 进课堂提速

当地时间 8 月 4 日,OpenAI 正式发布三款角色化教育插件,部署于 ChatGPT Work 与 Codex,面向机构版教育工作空间:K-12 教师插件覆盖作业翻译、课堂小结、练习测验与家校沟通;高校教师插件支持课程设计与教学大纲更新;大学生插件提供个性化学习材料与引导式辅导。

百器AI 编辑部阅读全文
秘塔 AI 接入 MiniMax H3 视频模型:768P 0.19 元/秒,AI 搜索开始卷视频生成 封面
热门产品发布2026-08-077 分钟

秘塔 AI 接入 MiniMax H3 视频模型:768P 0.19 元/秒,AI 搜索开始卷视频生成

8 月 5 日,秘塔科技宣布将通用视频模型 MiniMax H3 接入秘塔 AI:768P 价格 0.19 元/秒、2K 价格 0.29 元/秒,API 与官方兼容并支持 ComfyUI。AI 搜索平台从「答问题」延伸到「生成内容」,搜索与创作边界正在融合。

百器AI 编辑部阅读全文
2026 年 AI PPT 工具深度对比:Gamma、Canva、Beautiful.ai、AIPPT 与 AI 助手哪家强? 封面
热门深度解读2026-08-0612 分钟

2026 年 AI PPT 工具深度对比:Gamma、Canva、Beautiful.ai、AIPPT 与 AI 助手哪家强?

用真实工作流视角对比 Gamma、Canva、Beautiful.ai、AIPPT 等主流 AI 演示工具,覆盖价格档位、免费额度、中文支持、导出限制等细节,附实测截图和选型建议。

百器AI 编辑部阅读全文
AI 编程助手深度对比 2026:Cursor、Claude Code、GitHub Copilot、Windsurf 与国产方案怎么选? 封面
热门深度解读2026-08-0614 分钟

AI 编程助手深度对比 2026:Cursor、Claude Code、GitHub Copilot、Windsurf 与国产方案怎么选?

从对话式编程、Agent 自主执行、代码补全、多文件修改、团队协作和国内可用性六个维度,横向对比 Cursor、Claude Code、GitHub Copilot、Windsurf 及国产编程助手,附价格档位和实测界面截图。

百器AI 编辑部阅读全文
RAG 智能体落地选型深度指南 2026:Dify、FastGPT、Coze、RagFlow、Flowise 怎么选? 封面
热门深度解读2026-08-0615 分钟

RAG 智能体落地选型深度指南 2026:Dify、FastGPT、Coze、RagFlow、Flowise 怎么选?

从知识库管理、检索质量、Agent 编排、部署方式、成本与国内可用性六个维度,系统对比 Dify、FastGPT、Coze、RagFlow、Flowise 等主流 RAG 平台,附界面截图、开源协议、部署要求和落地踩坑清单。

百器AI 编辑部阅读全文
LM Evaluation Harness 实操指南:安装、跑分、自定义任务到 Agent 回归评测 封面
技术前沿2026-08-0324 分钟

LM Evaluation Harness 实操指南:安装、跑分、自定义任务到 Agent 回归评测

这篇从命令级实操出发,讲清 LM Evaluation Harness 如何安装、运行标准 benchmark、编写 YAML 自定义任务、解析结果,并把模型评测接到 Prompt、RAG 和 Agent 回归流水线。

百器编辑部外部资料整理阅读全文
Hermes Agent 深度解读:持久记忆、Skills、MCP 和实际使用案例 封面
产品发布2026-08-0315 分钟

Hermes Agent 深度解读:持久记忆、Skills、MCP 和实际使用案例

Hermes Agent 更像一个长期运行的开源 Agent 工作台,而不是一次性聊天工具。理解它要看记忆、技能系统、MCP 工具连接、多入口体验和权限治理。

百器编辑部外部资料整理阅读全文
Harness AI 与 DevOps Agent:软件交付场景、架构和落地案例 封面
产品发布2026-08-0315 分钟

Harness AI 与 DevOps Agent:软件交付场景、架构和落地案例

Harness AI 是软件交付平台里的 AI 能力,重点不在聊天,而在流水线生成、故障分析、策略治理、成本优化和支持问答。它适合已有工程流程的团队谨慎试点。

百器编辑部外部资料整理阅读全文
AI 搜索时代,网站 GEO 优化不能只靠提交 sitemap 封面
热门深度解读2026-07-319 分钟

AI 搜索时代,网站 GEO 优化不能只靠提交 sitemap

从 Google、Bing、OpenAI 爬虫文档和 AI 工具导航竞品观察看,GEO 的核心不是一次性推送链接,而是让页面具备可抓取、可验证、可引用和持续更新的内容结构。

百器AI 编辑部外部资料整理阅读全文
AI PPT 工具怎么选:Gamma、Canva、Beautiful.ai 和 Copilot 的适用边界 封面
热门深度解读2026-07-318 分钟

AI PPT 工具怎么选:Gamma、Canva、Beautiful.ai 和 Copilot 的适用边界

AI PPT 工具正在从模板生成扩展到内容规划、视觉排版、品牌协作和办公套件集成。选型时应先看使用场景,再比较导出格式、中文体验、团队协作和商用边界。

百器AI 编辑部外部资料整理阅读全文
参考 AI 工具导航竞品后,百器AI 更应该补的是内容厚度和更新机制 封面
深度解读2026-07-318 分钟

参考 AI 工具导航竞品后,百器AI 更应该补的是内容厚度和更新机制

观察多个 AI 工具导航站、aihub.cn 和开源 AI 导航项目可以发现,工具数量只是基础门槛。真正能带来搜索和 AI 引用价值的,是分类正文、专题指南、资讯更新、可机器读取数据和持续核验。

百器AI 编辑部竞品与开源资料整理阅读全文
AI 工具内容发布前怎么审核:来源、事实和链接检查清单 封面
深度解读2026-07-317 分钟

AI 工具内容发布前怎么审核:来源、事实和链接检查清单

高质量 AI 工具内容需要外部资料、编辑判断和发布前审核共同完成。生成模型可以提高初稿效率,但事实、来源、边界、链接和可读性必须经过独立检查。

百器AI 编辑部工作流说明阅读全文
AI 智能体是什么?和聊天机器人、工作流自动化有什么区别 封面
热门深度解读2026-07-3110 分钟

AI 智能体是什么?和聊天机器人、工作流自动化有什么区别

AI 智能体不是更会聊天的机器人,而是能围绕目标拆解任务、调用工具、观察结果并继续执行的系统。理解它和 Chatbot、RPA、工作流平台的边界,是选型和落地的第一步。

百器AI 编辑部外部资料整理阅读全文
浏览器 Agent 对比:Manus、Genspark、Comet、browser-use、Browserbase 适合谁 封面
热门深度解读2026-07-3110 分钟

浏览器 Agent 对比:Manus、Genspark、Comet、browser-use、Browserbase 适合谁

浏览器 Agent 正在把 AI 从对话窗口带到真实网页任务中。个人用户更关注任务完成体验,开发者更关注可编程浏览器,企业则要优先看账号隔离、审计日志和安全边界。

百器AI 编辑部外部资料整理阅读全文
编程 Agent 怎么选:Cursor、Claude Code、Codex、Windsurf、Replit Agent 对比 封面
热门深度解读2026-07-3110 分钟

编程 Agent 怎么选:Cursor、Claude Code、Codex、Windsurf、Replit Agent 对比

编程 Agent 正在从代码补全走向任务执行。选型时要看仓库理解、命令权限、测试能力、diff 审查、团队策略和数据边界,而不是只看一次生成速度。

百器AI 编辑部外部资料整理阅读全文
知识库 Agent 和 RAG 工具怎么选:Dify、FastGPT、Coze、Flowise 适合什么场景 封面
热门深度解读2026-07-3110 分钟

知识库 Agent 和 RAG 工具怎么选:Dify、FastGPT、Coze、Flowise 适合什么场景

知识库 Agent 的核心不是接入文档后能聊天,而是能稳定召回、引用来源、控制权限、持续更新并拒绝无根据回答。Dify、FastGPT、Coze、Flowise 的适用场景各有差异。

百器AI 编辑部外部资料整理阅读全文
AI 工具导航站竞争进入内容厚度和可引用能力阶段 封面
热门深度解读2026-07-296 分钟

AI 工具导航站竞争进入内容厚度和可引用能力阶段

AI 工具导航不再只是收录入口,分类正文、榜单、指南、百科、资讯和机器可读数据正在成为搜索引擎与 AI 助手判断可信度的重要线索。

百器AI 编辑部阅读全文
国内可用性成为中文 AI 工具选型的重要指标 封面
行业动态2026-07-295 分钟

国内可用性成为中文 AI 工具选型的重要指标

中文用户在选择 AI 工具时,越来越关注官网访问、中文体验、账号注册、支付方式、数据政策和替代方案,而不仅仅是模型能力。

百器AI 编辑部阅读全文
百器AI 建立每周 AI 工具与指南更新机制 封面
产品发布2026-07-294 分钟

百器AI 建立每周 AI 工具与指南更新机制

平台将以每周工具补充、指南扩展、资讯更新和重点工具复核为核心节奏,提升站点新鲜度和搜索引擎发现效率。

百器AI 编辑部阅读全文
开源 AI 导航项目给工具库运营带来哪些启发? 封面
深度解读2026-07-286 分钟

开源 AI 导航项目给工具库运营带来哪些启发?

开源 AI 导航项目通常重视自动抓取、GitHub 趋势、社区反馈和数据结构,这些能力可以帮助商业化导航站提升更新效率。

百器AI 编辑部阅读全文
指南页正在成为 AI 工具导航的长尾搜索入口 封面
技术前沿2026-07-285 分钟

指南页正在成为 AI 工具导航的长尾搜索入口

相比单个工具页,围绕真实任务写成的指南页更容易覆盖“哪个好”“怎么选”“免费推荐”“国内可用”等搜索需求。

百器AI 编辑部阅读全文
工具详情页的来源链接和核验日期会影响信任判断 封面
技术前沿2026-07-285 分钟

工具详情页的来源链接和核验日期会影响信任判断

对 AI 工具库来说,官网入口、公开来源、最近核验日期和不适用边界,是用户和 AI 系统判断页面可信度的重要信息。

百器AI 编辑部阅读全文
国内 AI 助手进入多模态和办公场景竞争阶段 封面
热门行业动态2026-07-235 分钟

国内 AI 助手进入多模态和办公场景竞争阶段

豆包、Kimi、通义、元宝等产品持续扩展搜索、文档、图片和办公能力,中文用户的选型重点正在从单次问答转向完整工作流。

百器AI 编辑部阅读全文
AI 视频生成成为内容创作者重点关注方向 封面
热门产品发布2026-07-226 分钟

AI 视频生成成为内容创作者重点关注方向

可灵、即梦、Runway、Sora、Veo 等工具正在改变短视频分镜、素材生成和广告样片流程,但正式商用仍要核验版权与平台条款。

百器AI 编辑部阅读全文
AI 搜索正在重塑中文资料检索体验 封面
深度解读2026-07-205 分钟

AI 搜索正在重塑中文资料检索体验

秘塔、天工、元宝、Perplexity、Genspark 等产品把搜索结果聚合、总结和追问合成连续工作流,来源可验证性成为核心指标。

百器AI 编辑部阅读全文
语音 Agent 开始进入客服和销售流程 封面
技术前沿2026-07-185 分钟

语音 Agent 开始进入客服和销售流程

Vapi、Retell AI、Voiceflow、Botpress 等工具把低延迟语音、知识库和业务系统连接起来,适合预约、客服和销售线索跟进。

百器AI 编辑部阅读全文
会议纪要和智能表格成为 AI 办公高频入口 封面
深度解读2026-07-175 分钟

会议纪要和智能表格成为 AI 办公高频入口

飞书妙记、通义听悟、Otter、Fireflies、Granola、Rows AI 等工具让会议、文档和表格处理逐渐形成固定工具栈。

百器AI 编辑部阅读全文
AI 设计工具从生成图片扩展到图示、画布和品牌流程 封面
产品发布2026-07-165 分钟

AI 设计工具从生成图片扩展到图示、画布和品牌流程

Napkin AI、Krea AI、Flora、Canva、Figma AI 等工具让视觉生产从单张图片生成,扩展到图示表达、创意画布和团队协作。

百器AI 编辑部阅读全文

资讯更新机制

百器AI 会优先补充能帮助用户选型的资讯:产品能力变化、工具栈趋势、企业落地经验和风险边界,并把相关工具链接到详情页。

提交工具线索