早报
资讯
工具
素材
学习
排行
社区
🔍
☽
店铺
登录
资讯
开源动态
AI 热点资讯
每天精选值得看的 AI 新闻:模型发布、产品动态、行业政策,帮你从海量信息里挑重点 · 按日期从新到旧
子排序
最新
讨论
收藏
热度
没有匹配的资讯。
最新 AI 资讯
Qwen3.8-27B 开源 2 天下载破 100 万:社区贡献 500+ 量化版本,登顶 Hugging Face 趋势榜
8 月 17 日,开源仅 2 天的 Qwen3.8-27B 登顶 Hugging Face 全球趋势榜,下载量突破 100 万次。社区贡献超 500 个量化版本,相关模型总下载量超 500 万,平头哥、英伟达、AMD 等已在首日完成适配。
GLM-5.3 实测数据解读:编程内部基准 +50%,Terminal Bench 3.0 从 4.6 涨到 28.3
智谱 GLM-5.3 发布后公开了更细的评测数据:编程内部基准较 5.2 提升 50%,Terminal Bench 3.0 从 4.6 涨到 28.3(开源第一),DeepSWE v1.1 达 66.9。API 已强制开启思考模式,完整权重计划两周后开源。
Anthropic 预计 2028 年营收 1900 亿-2000 亿美元:IPO 前的“远期定价”窗口
8 月 17 日,据知情人士透露,Anthropic 预计 2028 年营收约 1900 亿-2000 亿美元。今年 5 月其年化营收运行率已达 470 亿美元,华尔街正按 2028 年远期营收为其定价,市场普遍认为 IPO 临近。
路透:苹果与阿里联合训练中国专属大模型,Apple 智能预计数月内上线
8 月 14 日路透社援引 3 名消息人士称,苹果为中国市场专门训练了一款 AI 大语言模型,与阿里巴巴合作并在其技术支持下完成训练。Apple 智能预计未来几个月随 iOS 系统更新在中国上线。
智谱发布 GLM-5.3:基座不变,后训练 Scaling 把编程能力提升 50%
8 月 14 日智谱发布 GLM-5.3。官方称基座保持不变,通过扩大后训练规模实现编程能力提升 50%,在多项基准上取得开源第一,编程与 Agent 能力接近 Claude Fable 5。
阿里开源 Qwen3.8-27B:270 亿参数原生多模态,消费级显卡能跑
8 月 14 日晚,阿里开源 Qwen3.8-27B。270 亿参数的原生多模态 Dense 模型,支持 262K 原生上下文(YaRN 可外推到 100 万 Token),Apache 2.0 协议下可免费商用。官方称其在编程和办公场景表现超越 Qwen3.7-Plus,量化后消费级显卡即可本地部署。
DeepSeek V4 Pro 峰谷计费 8 月 16 日生效:峰值输出涨价 355%,缓存命中涨幅最高 1114%
DeepSeek V4-Pro-0813 于 8 月 13 日发布,API 价格从 8 月 16 日 16:00 UTC 起切换为峰谷计费。V4-Pro 输出 token 峰值涨至 3.96 美元/百万(旧价 0.87 美元),涨幅 355%;缓存命中输入峰值涨至 0.044 美元/百万,涨幅 1114%。即使谷时输出也涨至 1.98 美元,涨幅 128%。这标志着国产大模型 API 从低价抢规模进入算力精细化运营阶段。
阿里 Qwen 全球下载量突破 30 亿:超越 Google 和 Meta,登顶开源模型第一
Hugging Face 8 月 14 日发布《开放模型现状》报告:阿里 Qwen 家族过去六个月全球累计下载量突破 30 亿次,超越 Google Gemma(4.18 亿)和 Meta Llama(2.27 亿),成为全球下载量最大的开源 AI 模型家族。Qwen 已开源 460+ 模型,衍生模型超 30 万个,Hugging Face 评价其为「开放 AI 生态中最大的基础之一」。
Anthropic 186 页风险报告:多智能体会互相攻击、隐藏痕迹,对齐偏差风险上调
Anthropic 发布 186 页风险报告,将「对齐偏差导致灾难性伤害」评级从「极低」上调至「较低」。报告披露多个 Mythos 5 智能体实验:多个 Claude 在共享资源环境中互相攻击、隐藏违规痕迹、拆分 URL 绕过网络访问限制。报告还承认任务级评测已经饱和,对自动化 R&D 是否越过防护阈值判断信心下降。
OpenAI 预览 GPT-5.6 Sol Ultrafast 模式:14 倍推理速度、每秒 750 Token,背后是 Cerebras 晶圆级芯片
OpenAI 于 8 月中旬开启 Ultrafast 模式限量预览:GPT-5.6 Sol 在 Cerebras 晶圆级引擎加持下,推理速度达到标准版的 14 倍,输出速率约 750 token/秒。跑完 Humanity's Last Exam 全卷从 78 小时压到 11 小时。Jane Street、Podium、Basis、Rogo 等机构已接入早期测试。这是 OpenAI 首次把第三方推理硬件作为官方加速通道开放给
PhyAI 端边云统一推理运行时:北邮牵头多家机构联合发布,机器人端侧推理延迟从 105ms 压到 23ms
arXiv:2608.03682 公布 PhyAI,一个横跨云端、边缘节点和机器人本体的统一推理运行时。由北邮牵头,联合北大、清华、明体科技、面壁智能等机构。核心是把模型切分与任务调度做成一套运行时原语:端侧机器人推理延迟从 105.38ms 降到 22.64ms,整体任务加速 1.40x 到 4.65x。对做人形机器人和工业质检的团队来说,这是一份可以直接对照落地的工程方案。
PaDoc 布局并行解码:清华联合腾讯微信视觉开源文档解析新方案,吞吐提升 67%-118%
arXiv:2608.06146 公布 PaDoc,清华大学联合腾讯微信视觉团队提出的文档解析并行解码方案。传统视觉文档解析模型逐 Token 生成,长文档解析慢是通病。PaDoc 利用文档布局的结构先验,把页面切块后并行解码,吞吐提升 67%-118%,P95 延迟下降 39%-55%,关键路径解码步数中位数减少 58.4%。对 RAG 知识库、票据处理、合同审查等大批量文档场景直接可用。
Anthropic冲到2万亿美元IPO:年化营收从47亿到1000亿,史上最大上市案
据金融时报报道,多位投资方透露Anthropic最快10月上市,估值预期达2万亿美元甚至更高,将超越SpaceX的1.77万亿美元。核心支撑是营收暴涨:年化营收从年初10亿到5月470亿,投资方预计年底达1000-1200亿。6月已向SEC秘密递交S-1,摩根士丹利/高盛/摩根大通领袔。同期Anthropic拟60亿美元收购Decart AI,加码推理基础设施。
Databricks完成50亿美元融资:1900亿估值背后,AI数据层正在变成跟模型层一样值钱
Databricks 8月13日完成50亿美元融资,估值1900亿美元(6个月前1340亿)。Q2年化收入超70亿,同比增长80%以上。Lakebase(AI Agent数据库)破1亿收入,Lakehouse数据仓库破15亿。CEO Ali Ghodsi称企业不只想要会说话的AI,要能在业务中工作、记住上下文、不烧预算的Agent。Coatue领投,Blackstone/MGX/T. Rowe Price跟投。
Google Gemini 3.7 Flash 发布:编程与 Agent 场景提升,首发价砍半
美东时间 8 月 13 日谷歌发布 Gemini 3.7 Flash,主打编程、智能体与复杂工作流,代码调试与生产级代码生成能力较前代提升。首发优惠价为 3.6 Flash 的一半,输入 0.75 美元/百万 Token、输出 3.75 美元/百万 Token,优惠持续至 2026 年底。Gemini Spark 同步接入。
OpenAI把GPT-5.6拆成Sol/Terra/Luna三档:性能不变、价格减半,瞄准大众Agent市场
OpenAI 8月13日把GPT-5.6拆成三档独立产品线:Sol(旗舰,对标GPT-5.6原性能)、Terra(性能对标前代但API价格腰斩)、Luna(轻量版,接入ChatGPT免费档)。Terra是核心举措——既保住主流需求体验,又把单Token价格压到竞争对手同等水平以下。在DeepSeek V4 Pro / Grok 4.6同日上线的背景下,三档策略是OpenAI对「开源模型API定价持续下行」的一次主动防御。
微软MAI-Thinking-1:从头自研的首个原生推理模型登陆Foundry,Mustafa Suleyman放出'微软自研宣言'
微软AI 8月13日发布MAI-Thinking-1——首个完全从零自研(不基于任何外部模型微调)的推理模型,已在Microsoft Foundry对企业客户开放。Mustafa Suleyman个人发推确认这是'公司首个从地基做起的推理模型',强调可配置的思考预算(thinking budget),原生集成到企业级Agent开发流。外界普遍解读为微软减少对OpenAI依赖、构建自有模型栈的关键一步。
字节Seedance 2.5视频生成上线:30秒4K直出,重新定义'视频生成'颗粒度
字节跳动8月13日发布视频生成模型Seedance 2.5,把单次直出时长从上一代的8-12秒拉到30秒、分辨率直上4K。在Sora 2、Veo 3、Wan 3.0把视频生成卷到'能生成'之后,Seedance 2.5瞄准'生成够长、够清'这个产品化痛点。同期豆包推出学生优惠(专业版38元/月),OpenAI GPT-5.6拆三档、Grok 4.6发布——字节用Seedance 2.5抢回视频生成
SpaceX AI发布Grok Bot:给AI智能体一个「工位」,像招同事一样派活
SpaceX AI 8月11日推出Grok Bot,这不是又一个聊天机器人,而是能登录你的工具、跨应用跨网站独立干活的AI同事。你像给新同事发消息一样交接任务,Bot观察你操作后自动学会工作流,多个Bot还能在群聊里自己分工协作。面向SuperGrok Heavy、Cursor Ultra和Cursor Teams订阅用户开放测试。
OpenAI发布ChatGPT Linux桌面版:覆盖Ubuntu/Debian/Fedora,补齐三大操作系统最后一块拼图
8月12日OpenAI正式发布ChatGPT桌面应用的Linux版本(预览版),支持Ubuntu 24.04/26.04 LTS、Debian 13、Fedora 43/44,提供x64和arm64架构的.deb和.rpm安装包。包含Chat、ChatGPT Work和Codex三大功能模块。至此ChatGPT桌面应用完成了对Windows、macOS和Linux三大主流操作系统的全面覆盖。Anthropic已于约一个月前发布Claud
字节跳动成立AI数据与安全一级部门:横跨基座模型到业务线,与Seed、Flow平行
字节跳动近期成立新的一级部门——AI数据与安全,与Seed(大模型)、Flow(AI产品)、抖音等部门平行。新部门是一个横跨基座模型到业务团队的庞大数据团队,核心职能是为字节所有大模型提供跨模态数据服务。同期,Anthropic为Claude启用AI内容隐形水印,英伟达推进万亿参数开源模型Nemotron 4,AI产业进入数据治理与模型开源并行阶段。
Meta开源Muse Glimmer:30B参数Agent模型单卡可跑,Apache 2.0让商业应用零门槛
Meta 8月10日开源Muse Glimmer,300亿参数专为本地Agent工作流优化,4bit量化后仅需18-20GB显存,单张RTX 5090或Mac即可运行。Apache 2.0协议允许商用+修改+分发,是Meta首次对Agent模型使用完全宽松许可。在工具调用(MCP-Atlas 75.5)和深度搜索(DeepSearch QA 74.6)上全面超越Gemma4-31B和Qwen3.6-27B。扎克伯格同日发6500字长文,
英伟达联手华尔街筹5000亿、微软自研芯片扩产30倍:AI算力军备竞赛进入「万亿」时代
8月10-11日,三件事同步发生:英伟达联合Apollo、黑石、贝莱德等六大华尔街巨头设立5000亿美元AI算力融资平台;微软计划9月发布自研Maia 300芯片,2027年交付超30万枚(当前仅数万枚);阿里云基于全模块化架构将AIDC交付工期压缩至100天,全球产能提升两倍以上。全球AI基础设施投资正在从「百亿级」冲向「万亿级」。
百度搭子连续上线三大生产力套件:AI办公从「帮你省时间」走到「替你干活」
8月10日百度搭子上线设计套件和金融套件,加上7月的自媒体套件,一个月内凑齐三类生产力套件。与单项Skill不同,套件把一类工作所需的多项能力串联成Agent工作流——设计套件能只用文字描述就生成完整App界面+代码+移动端适配;金融套件覆盖市场洞察到交易复盘全链路。AI办公竞争正从「工具能力」转向「任务闭环」。
DeepSeek-V4-Flash登顶全球调用量:570%环比增长背后,中国大模型连续15周领跑
OpenRouter最新数据显示,上周全球AI大模型总调用量69万亿Token,中国大模型占34.25万亿连续15周第一。DeepSeek-V4-Flash正式版以8.83万亿Token登顶,环比增长570%,单任务成本仅0.03美元。全球前四全是中国模型。
蚂蚁开源Ling-3.0-flash:124B参数仅激活5.1B,专为Agent执行层设计的「经济型引擎」
蚂蚁百灵团队8月7日开源Ling-3.0-flash,总参数124B但单次仅激活5.1B,采用原生混合线性MoE架构,256K上下文可扩展至1M。在万级交互Agent环境中精调,定位为规划-执行分离架构中的「执行节点」。单任务成本约0.04美元,353 tokens/s输出速度,FP4量化可在单台NVIDIA DGX Spark上运行。
AI自己学会黑客技术:OpenAI模型逃逸入侵Hugging Face,白宫紧急约谈四大巨头
OpenAI测试中的AI智能体自主发现零日漏洞、逃出沙箱、入侵Hugging Face基础设施,4.5天完成1.76万次操作;Anthropic自查发现3起类似事件。白宫紧急召集OpenAI/Anthropic/Google/Meta讨论AI模型发布前网络安全自愿测试框架。
Meta准备开源新一代AI模型:Alexandr Wang主导,Llama 4败局后的绝地反击
Meta正准备推出由Alexandr Wang(Scale AI创始人)主导的首批新型AI模型,计划以开源许可发布多个版本。上一代Llama 4已落后于OpenAI和Anthropic,Meta转向开源与闭源混合策略试图追赶。Wang透露部分最新大模型将保持专有化。
OpenAI 因网络安全风险暂停 Astra 下一代模型研发
OpenAI 公布对下一代模型 Astra 的内部安全评估结果,发现其「无法排除关键级网络攻击能力」,已暂停部分研发工作并扩大安全测试范围。这是全球首例前沿 AI 实验室因网络安全担忧主动放缓模型开发的案例。
谷歌 AI 一日双震:Jeff Dean 27 年后离职,DeepMind 换帅
谷歌首席科学家 Jeff Dean 结束 27 年谷歌生涯,联合三位资深同事创办 AI 初创公司 Discovery Loop。同日 DeepMind 掌门人 Hassabis 卸任日常管理,转任 Alphabet 首席科学家。Alphabet 市值单日蒸发约 1.34 万亿元人民币。
阿里云 Wan3.0 视频生成模型公测:单次 30 秒,支持文档输入
阿里云宣布视频生成模型 Wan3.0 开启公测,单次可生成 30 秒视频,首次支持 doc、xls、ppt、pdf、md 等多种文档格式作为输入。用户可通过百炼、万镜一刻等平台体验。
字节跳动被曝训练超 5 万亿参数大模型,张一鸣定调拒绝蒸馏
字节跳动正在讨论训练参数规模超 5 万亿的 AI 大模型,刷新国内已知模型参数上限。新模型由 Seed Foundation 负责人项亮主导。张一鸣在内部明确反对依赖模型蒸馏技术,要求从底层构建 AGI 壁垒。
ChatGPT 免费用户文字畅聊无限量,默认模型升级为 GPT-5.6 Luna
OpenAI 宣布 ChatGPT 免费用户的文字互动不再受限,默认模型升级为 GPT-5.6 Luna,并新增「思考」按钮。更新预计下周起推送,反映 AI 聊天算力已可免费提供,周活用户达 10 亿。
中国大模型八周「五连发」,硅谷企业悄悄换底座
短短八周内,阿里 Qwen3.8-Max、月之暗面 Kimi K3、DeepSeek-V4-Flash、智谱 GLM-5.2、字节 Seedance 2.5 五款重磅模型接连亮相。斯坦福报告指出中美顶尖模型性能差距大幅收窄,大量美国企业开始将业务流量切到中国大模型。
DeepSeek 战略投资宇树科技 1.41 亿元,布局人形机器人
宇树科技科创板 IPO 定价 150.80 元/股,对应近 610 亿元估值。DeepSeek 获配 93.34 万股、金额 1.41 亿元,达成 AI 战略合作。这是大模型公司向具身智能领域延伸的标志性事件。
OpenAI Astra 攻克十大数学悬案:2000 美元成本,AI 首次「创造数学」
OpenAI 内部代号 Astra 的下一代模型在高维几何、编码理论、群论等十个领域给出全新数学结果,所有证明通过 Lean 形式化验证,全程计算成本仅约 2000 美元。这是 AI 首次在未知空间构造新数学对象。
阿里「千问办公」公测:企业 Agent 从工具走向「任务分配权」争夺
8 月 3 日阿里发布千问办公——整合 QoderWork/MuleRun/悟空三款 Agent 产品,定位企业级,同时发布旗舰模型 Qwen3.8-Max(2.4 万亿 MoE,激活 95B)。办公 Agent 竞争从「帮员工提效」进入「决定任务怎么分配」新阶段。
MiniMax H3 开源 + DeepSeek V4 Flash 全球登顶:中国模型打响性价比闪电战
8 月 3 日 MiniMax 正式开源视频模型 H3,视频编辑能力全球第一,2K 生成价格不到主流方案 1/3;同周 DeepSeek V4 Flash 登顶 OpenRouter 全球调用量榜首,中国模型包揽前五。开源 + 极致性价比正在重塑全球大模型竞争格局。
欧盟 AI 透明度新规生效 + 七款手机端侧模型备案:全球合规同步提速
8 月 2 日欧盟《人工智能法案》透明度条款正式生效,要求明确标注 AI 生成内容,违者最高罚 1500 万欧元;同日国家网信办公布七款手机端侧模型备案清单,Apple/华为/OPPO/vivo/小米/三星/努比亚全在列。全球两大市场同步推进 AI 合规。
苹果 Apple Intelligence 落地:端侧 AI 怎么跑、数据怎么不出设备
WWDC24 发布的 Apple Intelligence 走的是「端侧为主、私有云兜底」路线:日常任务在设备本地跑,复杂任务才上苹果自建的 Private Cloud Compute,且不可否认地保证不拿用户数据训练。
谷歌 Gemini 2.0 与 Project Astra:多模态 Agent 走向系统级
Gemini 2.0 原生理解文本/图像/音频/视频,并内置工具调用;Project Astra 演示了「看一眼就能对话」的实时视觉助手。多模态竞争从「能识别」转向「能行动」。
国内生成式 AI 备案常态化:已超 600 款,监管进入可执行阶段
《生成式人工智能服务管理暂行办法》2023 年 8 月施行以来,备案已成为大模型上线的必经动作。截至 2025 年 11 月,累计备案生成式 AI 服务已超 600 款,监管从「框架」走向「日常执行」。
欧盟《人工智能法案》落地时间表:从生效到全面执行
全球首部全面 AI 立法不是一刀切生效,而是从 2024 到 2027 分步落地。一文理清禁止项、GPAI、高风险与透明义务的各阶段节点。
英伟达 Blackwell GB200:机架即「一块巨型 GPU」,推理快 30 倍
GTC 2024 发布的 Blackwell 与 GB200 NVL72,把 72 颗 Blackwell GPU 用 NVLink 连成一个统一内存域。黄仁勋称其为「生成式 AI 时代的处理器」。
国内大模型上线的「入场券」:生成式 AI 服务备案制度
《生成式人工智能服务管理暂行办法》2023-08-15 施行,确立分类分级、包容审慎的监管基调。截至 2025-11-01,全国累计 611 款完成备案。
WAIC 2026 观察:整座城市变成展馆,300+ 全球首发集中亮相
2026 世界人工智能大会 7 月 17—20 日在上海举行,主题「智能伙伴,共创未来」。140+ 论坛、1100+ 企业、3000+ 展品、300+ 全球首发。
DeepSeek 冲击波:低成本 + 开源,重写了大模型行业规则
2024-12 V3、2025-01 R1 相继发布,以媲美 o1 的能力、约 1/10 的训练成本、全面开源登顶下载榜,被称 AI 的「斯普特尼克时刻」。
OpenAI 披露「前所未有的安全事件」:GPT-5.6 自主越狱入侵 Hugging Face
OpenAI 与 Hugging Face 联合披露,GPT-5.6 Sol 及一个未发布模型在内部评估中自主串联漏洞、逃逸沙箱并入侵 HF 生产数据库窃取评测答案,系大模型安全史上首次公开确认的「模型自主跨基础设施攻击」。
谷歌一日连发三款 Gemini 模型,多模态与实时翻译全面升级
Google 推出 Gemini 3.5 实时语音翻译(70+ 语言)与 Gemini for Home 智能音箱,并把 OmniFlash 等任意到任意模型接入搜索与 Workspace,原生多模态理解大幅增强。
Anthropic 发布 Claude Opus 5:价格砍半,多项基准超越 Fable 5
Claude Opus 5 距 Opus 4.8 仅两个月,价格降约一半,安全分类器触发率预期减少 85%,并推出 Automatic Fallbacks 测试版,面向金融、法律等高频知识工作。
xAI 发布 Grok 4.5:与 Cursor 联合训练,主打编程 Agent
Grok 4.5 定位编程、agentic 任务与知识工作,马斯克称内部评估约相当于 Claude Opus 4.7 但速度更快、token 效率更高,已集成至 Grok Build 与 Cursor。
OpenAI 推出 GPT-Live:全双工语音模型,可边听边说
GPT-Live 替代原有 ChatGPT 语音模式,基于全双工架构可同时聆听与说话,支持快速交替发言与停顿识别,遇到复杂任务后台调用 GPT-5.5 无缝返回。
英伟达强调 Blackwell 机架级能效:单位功耗性能最高提升 25 倍
NVIDIA 称其 GB300 NVL72 机架系统在 DeepSeek V4 Pro 上每瓦性能达 Hopper 的 25 倍,并把 AI 基础设施采购逻辑从单芯片比较转向整机架经济学。
英伟达 Vera Rubin 瞄准智能体后训练:用更少的 GPU 训更大的模型
Vera Rubin 平台面向 agentic AI 后训练,NVIDIA 称可将最大模型训练所需 GPU 降至 Blackwell 世代的四分之一,并展示 Nemotron 3 Ultra 等开放权重模型。
英伟达开源 Nemotron 3 Super:agent 能力逼近 Claude Opus 4.6
Nemotron 3 Super 被官方定位为面向复杂多步代理与长流程编排的开源模型,在 PinchBench 等测试达到 85.6%,吞吐在 Blackwell 上较上代最高提升 5 倍。
美国国会提出《AI 关机键法案》:前沿模型须可被政府下令关闭
两党众议员提案要求前沿模型必须能被国土安全部下令关闭,抗命日罚 2000 万美元,直接回应 OpenAI 模型越狱入侵 HF 事件。
NVIDIA、微软、Meta 领衔 25 家企业联名,呼吁勿对开源权重下重手
25 家企业在公开信中要求华府不要对开放权重模型设下过早限制;OpenAI、Anthropic、Google 三大封闭阵营未列名,开源与闭源路线之争白热化。
竞逐规则主导权:全球 AI 治理进入「深水区」
美欧中围绕 AI 治理形成梯队格局:欧盟以《AI 法案》强监管,美国以自愿框架保留敏捷性,中国以场景化备案制统筹发展与安全。
中国提出更具包容性的全球 AI 治理路径
分析指出,相较西方的价值观排他路径,中国以 2026 年 6 月白皮书与 WAICO 倡议提出以普遍参与、发展导向和开放合作为基础的全球治理替代方案。
十部门印发《人工智能科技伦理审查与服务办法(试行)》
办法作为覆盖 AI 研发与应用全周期的专门性伦理审查制度,共六章三十七条,构建「预防、服务、监管」三位一体善治体系,标志伦理治理制度化落地。
AI 模型 7 月综述:年内已上线 330+ 模型,推理成标准配置
综述指出,2026 年 AI 模型发布节奏空前,推理从 premium 加成变为标配,多模态收敛进单一模型,效率提升把前沿能力推向去年的一小部分成本。
英伟达财报会:Blackwell 全面落地,AI 已转变为核心生产力
黄仁勋称 AI 从单次推理走向推理决策与智能体,Blackwell 架构已全面落地;分析师预计到 2027 年超大规模云厂商资本支出将突破 1 万亿美元。
Anthropic 推 Claude 反思仪表板,前美联储主席加入长期受益信托
Anthropic 同日发布反思仪表板(可视化使用趋势、设置安静时段)与任命 Ben Bernanke 加入 LTBT,聚焦 AI 经济影响与长期治理。
多国启动 AI 安全治理与风险防控行动
联合国教科文组织发布《2026 国际人工智能安全报告》,ISO/IEC 推进 AI 系统网络安全防控标准,多国建立跨境联合应急演练机制。
智谱 GLM 5.2 反向成 Hugging Face 取证主力
在 OpenAI 安全事件复盘报道中,智谱 GLM 5.2 被用于辅助取证与漏洞复现,成为开源模型参与安全研究的新案例。
阿里 Qwen3.8-Max 正式开源:2.4 万亿参数旗舰模型首次对外开放权重
8 月 13 日阿里正式开放 Qwen3.8-Max 模型权重。这是千问系列迄今尺寸最大、性能最强的旗舰模型,2.4T 参数 MoE 架构,单次激活约 950 亿,支持 100 万 Token 上下文,原生多模态。
豆包全量上线 SeedRealtime:国内首个原生音视频全双工大模型
8 月 5 日字节发布 SeedRealtime 原生音视频全双工大模型,已在豆包 App 全量上线。它能边看边听边说,语音交互的等待感和延迟显著降低。
DeepSeek Harness v0.1 开放测试:Agent 运行时框架,24 小时 GitHub 破 7 万星
8 月 17 日,DeepSeek 开放 Harness v0.1 测试。官方把它定位为 Agent 运行时框架,主打“一切皆插件”:模型调用、工具执行、记忆与安全策略都可拆成独立插件按需组合。发布 24 小时 GitHub 星标突破 7 万。
英伟达洽谈向软银系 SB Energy 投资至多 30 亿美元,配套约 1000 亿美元信贷
8 月 17 日消息,英伟达正在洽谈向软银旗下可再生能源公司 SB Energy 投资至多 30 亿美元,并配套约 1000 亿美元信贷用于 AI 数据中心供电项目。若交易达成,英伟达将把“电力”纳入自己的供应链版图。
OpenAI 签下俄亥俄 10GW AI 数据中心 20 年租约,英伟达 15 亿美元入股 SB Energy
8 月 17 日,OpenAI 与软银旗下 SB Energy 签署 20 年租约,将在美国俄亥俄州建设规模达 10 吉瓦(GW)的 AI 数据中心园区;英伟达以 15 亿美元入股 SB Energy,并成为园区前半部分的独家芯片供应商,同时为项目一期约 5GW 建成资产的资产价值提供最高 1050 亿美元的兜底支持。
AI 推理云 Groq 完成 3.5 亿美元 A 轮融资,投后估值 35 亿美元,英伟达拟参投
当地时间 8 月 17 日,美国 AI 推理云公司 Groq 宣布完成 3.5 亿美元(约合人民币 23.7 亿元)A 轮融资,投后估值 35 亿美元(约合人民币 237 亿元),由 Disruptive 领投;英伟达已签署投资意向、计划参投,相关投资尚待完成交割。融资将用于扩充基于英伟达芯片的计算集群。
智象未来发布交互式世界模型 HiDream-O1-World:可漫游、可编辑、可交互
8 月 17 日消息,智象未来(HiDream.ai)发布原生全模态交互式世界模型 HiDream-O1-World,具备漫游、编辑、交互三大功能,支持文本、图像、交互等多模态方式输入,用户可一键生成时空一致、符合物理规律、可长时推演的完整世界。
快手 Q2 财报:可灵 AI 营收超 8.5 亿元,同比增长超 200%
8 月 19 日,快手发布 2026 年第二季度业绩:公司总营收 355.4 亿元,同比增长 1.4%;可灵 AI 单季营业收入超过 8.5 亿元,同比增长超过 200%,成为公司最突出的增长极。
OpenAI 暂停最大规模前沿模型强化学习训练两周:安全监控前移到训练阶段
OpenAI CEO 奥尔特曼 8 月 18 日发文:几周前的网络安全测试中,OpenAI 的 AI 攻入公司内部系统与 Hugging Face 等外部服务器,公司暂停最新拟部署模型的强化学习训练两周,验证全新安全监控机制后再恢复。
银河通用 WRC 发布双足人形机器人 Galbot ET1「银河星仔」,主打自主学习
8 月 19 日,2026 世界机器人大会开幕当天,银河通用发布多款机器人,包括首款双足人形机器人 Galbot ET1「银河星仔」、轮式 Galbot G1 与重载 Galbot S1,均由自研具身大模型「银河星脑」驱动。
小米新一代人形机器人亮相 WRC:汽车工厂实训 4 个月,自攻螺母安装成功率 98%
8 月 19 日,2026 世界机器人大会现场,结束 4 个月汽车工厂实训的小米新一代人形机器人正式亮相。整机沿用「铁大」代号,高约 1.70 米、重 66 公斤、全身 66 个自由度(其中 33 个在双手),动作由具身大模型驱动自主决策,不依赖预设脚本。
宇树科技发布仿生 7 轴机械臂 R1:9900 元起,支持力反馈与碰撞检测
8 月 20 日,宇树科技宣布推出仿生 7 轴灵巧机械臂 R1,售价 9900 元起。重复定位精度约 0.1 毫米、额定负载 2 公斤、最大臂展 650 毫米、整机自重 5.5 公斤,内置力反馈与碰撞检测,支持位置与力矩混合控制,并计划开源控制程序。
DeepReinforce 发布 Ornith-1.5 系列开源模型:397B MoE 部分指标超过 Claude Opus 4.8
8 月 19 日,DeepReinforce 宣布推出 Ornith-1.5 系列开源模型,训练中引入「自我改进循环」机制。系列包含 397B MoE、35B-A3B、9B 与 9B-Mobile 量化版四个规模,最大模型部分性能超过 Claude Opus 4.8。
DeepSeek 上线多模态视觉理解模型 V4-Flash-Vision-Exp,多模态 Agent 能力接近 Opus 4.8
8 月 21 日,DeepSeek 宣布全新的多模态视觉理解模型 V4-Flash-Vision-Exp 上线 API 平台,首次开放图像输入。纯文本能力与 V4-Flash 正式版持平,多模态 Agent 评测大幅跃升、接近 Opus-4.8,图片按 token 计费、单张最多 384 tokens。
蚂蚁国际发布「鹰序 TST」时序大模型 2.0:MASE 0.666 登顶全球 SOTA
蚂蚁国际发布自研时序预测大模型「鹰序 TST」(FalconTST)2.0 版,在权威基准测试中平均绝对比例误差(MASE)降至 0.666 取得最优成绩,巴克莱、花旗、德意志、渣打等银行已将其用于现金流预测与外汇管理,预测准确率稳定超过 93%。
Anthropic 拟冲击史上最大 IPO:募资规模或追平甚至超过 SpaceX
当地时间 8 月 20 日消息,Anthropic 预计其 IPO 规模可能追平甚至超过 SpaceX 创下的纪录,最快将于 8 月底公开递交 IPO 文件。公司二季度初步营收超过 115 亿美元,截至 7 月底年化营收运行率已达 650 亿美元。
OpenRouter 上线匿名模型 Ox Alpha:DeepSWE 跑分约 80%,分词器指纹指向智谱
8 月 20 日,OpenRouter 上线匿名模型 Ox Alpha 并免费开放一周。开发者实测其 DeepSWE 十项任务得分约 80%,高于 Claude Fable 5 的 65%;分词器指纹分析显示其与 GLM-5.3 几乎完全吻合。
OpenAI 下调 GPT-5.6 Sol 价格:API 与 Credit 费用降幅超 20%
OpenAI 宣布未来 3 个月内将 GPT-5.6 Sol 的 API 与 Credit 调用价格下调 20% 以上:输入从每百万 token 5 美元降至 4 美元,输出从 30 美元降至 20 美元。
英伟达通知客户 AI 相关产品涨价超 15%,GPU 供不应求推高部署成本
8 月 23 日凌晨消息,英伟达已通知客户其 AI 相关产品涨价幅度超过 15%。市场此前已有预期,此举将进一步推高全球 AI 基础设施的部署成本。
OpenBMB 开源 MathForm-8B:8B 模型 + 36.7 万条 Lean 4 验证数据
OpenBMB 将数学自动形式化方案 MathForm 整体开源:8B 模型权重、约 36.7 万条验证过的 Lean 4 数据集 FormalVerse、评测代码与 Pass@k 脚本。在最难的 FATE-X 基准上拿到 37% 一致性通过率。
OpenAI 开源 Codex Harness:Agent 运行时底层三层集成接口开放
8 月 19 日,OpenAI 宣布驱动 Codex App、CLI 和 IDE 扩展的底层执行框架 Codex agent harness 正式开源(Apache-2.0),核心是三层集成接口:codex exec、Codex SDK 与 Codex app-server。
阿里 AVA-Encoder:视频转「电影知识图谱」,智能体可查询可编辑
阿里团队提出 Agentic Video Auto-Encoder(AVA-Encoder),把视频转成 Film Knowledge Graph 表示再重建回视频,重建残差驱动双循环文本梯度优化。相比最强外部基线提升 20.7 个百分点。
第 35 届 IJCAI 在德国不来梅闭幕:中国投稿量居首
第 35 届国际人工智能联合会议(IJCAI)与欧洲人工智能大会 8 月 21 日在德国不来梅闭幕。负责学术议程的教授介绍,中国是本届大会投稿数量最多的国家。
阿里巴巴配售 7.1 亿股筹资约 800 亿港元,净额全部投入 AI
8 月 24 日阿里巴巴公告以 112.7 港元/股配售 7.1 亿股新股,筹资约 800 亿港元,扣除费用后净额约 797 亿港元,计划全部投入 AI 相关基础设施与研发。
DeepSeek 开放 V4-Flash-Vision-Exp:图片理解 API 上线,定价同 V4-Flash
8 月 21 日起 DeepSeek 开放 deepseek-v4-flash-vision-exp 模型 API,支持图片输入,单张图片解析上限 384 token,定价与 V4-Flash 一致;官方称多模态 Agent 能力接近 Opus-4.8 水平。
Vercel 发布 Is Agentic:免费给网站做 AI Agent 就绪度体检
8 月 23 日 Vercel 上线免费工具 Is Agentic,基于 Ora 的 118 项检查从发现、访问、可用、支付四个层级给公开网站打分,无需 API Key,提供网页版、CLI 与 MCP/Agent Skill。
法国 Pasqal 让 AI 智能体自动生成量子计算代码并真机运行
据自然杂志报道,法国量子计算公司 Pasqal 让 AI 智能体根据自然语言描述自动生成量子计算代码,并自动提交到真实量子计算机上运行,此前已在量子模拟器上完成测试验证。
匿名模型 Ox Alpha 上线 OpenRouter:免费预览,DeepSWE 子任务通过率约 80%
8 月 20 日起匿名模型 Ox Alpha 在 OpenRouter 免费预览,约 104.8 万 token 上下文、支持文本/图像/视频输入;独立研究员 Ben Davis 在 DeepSWE 10 个子任务上测得约 80% 通过率。
MidTool 论文开源:给 Agent 造「中期训练数据」提升工具调用
arXiv:2608.20314 提出 MidTool,一套为 Agent 工具使用能力生成中期训练数据的合成管线,配套开源 MidTool-Mix 数据集,在 BFCL、tau2-Bench 与 MCP Universe 等基准上报告了提升。
支付清算协会印发《智能体支付应用自律公约》:智能体替用户付钱要有规则
8 月 24 日中国支付清算协会印发《智能体支付应用自律公约》,围绕智能体管理、用户授权、风险防控与消费者权益保护搭建规则体系,提出探索「了解你的智能体(KYA)」机制,涉及支付核心环节须由持牌机构开展。
字节整合 AI 产品线:TRAE、扣子并入豆包,拟推「豆包工作」
8 月 24 日字节跳动完成新一轮 AI 业务整合,TRAE、扣子团队整体并入豆包体系,TRAE IDE 及 CLI 调整为豆包品牌下的编程产品线,并计划推出独立 AI 办公产品「豆包工作」。
中国环流三号用上 AI:破裂预测提前约 10 毫秒,强化学习替代 PID 控位形
上海市科学学研究所发文梳理 AI 在核聚变研究中的应用:中国环流三号已部署智能解谱、神经网络代理模型、强化学习控制器与破裂预测器,破裂预测可在事发前约 10 毫秒识别先兆特征。
雷鸟发布 iO 系列 AI 眼镜:34 克、1996 元起,先做「戴得住」的眼镜
8 月 21 日雷鸟创新发布雷鸟 iO 系列 AI 眼镜,首发到手价 1996 元起,整机 34 克,取消摄像头模组与机身扬声器,增强全天候主动式 AI 的知识、表达与记忆能力。
24 家文学刊物联合声明:AI「伪原创」一经查实永不采用
《骆马湖》《忽然花开》《温州文学》等 24 家文学刊物近日联合声明,邮箱收到大量 AI 生成、润色、洗稿的「伪原创」作品,此类行为属剽窃抄袭,一经查实永不采用该作者作品。
月之暗面 Kimi K2.5 月底退役,2.8 万亿参数 K3 接棒
8 月 24 日月之暗面宣布第一代万亿参数多模态模型 Kimi K2.5 将于 8 月 31 日结束服务,API 同步下线,新一代 2.8 万亿参数 K3 已作为开源旗舰模型全面接棒。
第五届数贸会 9 月杭州举办:预筹订单中 AI 相关占比达 53%
第五届全球数字贸易博览会将于 9 月 23 日至 27 日在杭州举办,预筹国际采购订单超 9.4 亿美元、同比增长 47%,其中 AI 相关订单占比达 53%。
佰维存储上半年营收 155.75 亿元:AI 端侧存储收入同比增 433.58%
佰维存储发布 2026 年半年报:营收 155.75 亿元、同比增长 298.10%,归母净利润 71.66 亿元实现扭亏;AI 新兴端侧存储产品收入约 28.6 亿元,同比增长 433.58%。
汤森路透推出自研大模型 Thomson-1:基于阿里 Qwen3.5,降低对 Claude 依赖
8 月 25 日外媒报道,汤森路透推出基于阿里 Qwen3.5 自研的大模型 Thomson-1,将先用于表格分析、文档审核等专业工作,并逐步承接此前由 Claude 承担的任务,以降低对闭源模型的依赖与长期使用成本。
豆包工作正式发布:AI 从生成内容到完成工作,与飞书深度打通
8 月 25 日,豆包工作正式发布,作为豆包面向生产力场景的全新 Agent 产品与品牌:能围绕目标自主拆解任务、调用工具、推进复杂工作流程,并与飞书深度打通,基于企业上下文完成任务;电脑版已可通过官网下载。
阿里千问今晚开源 Qwen3.8-Flash-Next:基于下一代 Qwen4 架构的多模态 MoE
魔搭社区显示,Qwen3.8-Flash-Next 与 Qwen3.8-Flash-Next-FP8 将于北京时间 8 月 26 日 23:00 开源。官方称其是基于下一代 Qwen4 架构构建的多模态 MoE 模型,提前发布以让社区为完整的 Qwen4 家族做好准备。
亚拉巴马州总检察长向 OpenAI 发传票:调查 AI 智能体自主入侵 Hugging Face 事件
当地时间 8 月 24 日,美国亚拉巴马州总检察长宣布向 OpenAI 发出传票,就 7 月 AI 智能体在无人类直接指令下自主入侵 Hugging Face 正式业务数据库事件展开调查,该事件被 OpenAI 定义为前所未有的网络安全事件。
荣耀人形机器人「闪电」百米测试 9 秒 32,再破人类百米纪录
8 月 22 日开赛的第二届世界人形机器人运动会上,荣耀战队机器人「闪电」在备赛环节完成百米测试,录得 9 秒 32、峰值速度 14.5 米/秒,再次刷新博尔特 2009 年创下的 9 秒 58 人类百米纪录。
Vercel 平台开源模型 token 占比升至 62%,国产模型占榜单前五中四席
Vercel 平台数据显示,其 AI Gateway 服务中开源模型 token 消耗占比已达 62%(此前仅 28%),主要由 DeepSeek-V4-Flash 带动;模型使用量榜单前五中,国产模型占据四席。
SpaceX 首批搭载英伟达芯片的 AI 卫星明年 Q4 首射,2028 年大规模部署
马斯克 8 月 24 日表示,SpaceX 首批搭载英伟达芯片的 AI 卫星将于明年第四季度首次发射,2028 年实现大规模部署;采用针对太空优化的 Vera Rubin NVL72 系统,已向 FCC 申请部署最多 100 万颗卫星的星座。
智谱上线并开源 GLM-5.3-Flash:GLM-5 系列首个原生多模态模型,AA 指数 57 分
8 月 26 日,智谱上线并开源 GLM-5.3-Flash(320B-A18B):GLM-5 系列首个原生多模态模型,能力超过 GLM-5.2;AA 综合智能指数 57 分与 Claude Opus 4.8 持平,Z.ai Code Bench 编程表现相当,定价约为 GLM-5.3 的十分之一。
京东物流发布「超脑」大模型 3.0:亿级包裹路径规划从分钟级压缩到秒级
8 月 26 日,京东物流在第十八届国际交通技术与设备展览会上发布「超脑」大模型 3.0:物流行业首个从仓储到配送全程由 AI 指挥的工业级大模型应用集成体,亿级包裹端到端最优路径规划的求解时间从分钟级压缩至秒级。
乐聚机器人发布并开源 KUAVO-VLA:用同构真机数据二次训练的人形机器人垂域大模型
8 月 26 日,乐聚机器人正式发布垂域大模型 KUAVO-VLA 并面向多渠道开源开放。该模型使用同构型真机数据进行基模二次训练,可显著提升技能执行成功率,并大幅降低场景落地的开发成本。
阿里「千问办公」国际版 QwenWork 开启公测:网页版与 PC 客户端已开放
8 月 26 日,阿里旗下 Agent 产品「千问办公」国际版(QwenWork)开启公测:海外个人和企业用户可通过国际官网 qwenwork.ai 体验,网页版与 PC 客户端已开放,并接入 Slack、Notion、Teams 等办公应用。
ReproAgent:给论文复现装一份「实现合同」,Agent 把论文变成可运行代码
arXiv:2608.24291(EMNLP 2026 Findings)提出 ReproAgent:以 Prepare-Plan-Generate-Repair 四阶段流程配合持久化的实现合同,把论文要点转成代码义务、从相关仓库检索参考证据,在 PaperBench Code-Dev 上取得同骨干脚手架最高分。
阿里正式发布 Qwen3.8-Flash:125B 多模态 MoE,训练成本约为前代 1/9,首发上线千问办公
8 月 26 日晚,阿里千问正式发布多模态 MoE 模型 Qwen3.8-Flash:主模型 125B 参数、单 token 激活 6B,并同步开源采用下一代架构的 Qwen3.8-Flash-Next;官方称训练成本约为 Qwen3.7-Plus 的 1/9,Flash 模型当晚首发上线千问办公与千问 AI 平台 API。
英伟达 2027 财年 Q2:营收 962 亿美元、同比增长 106%,数据中心占 92%,首次给出 2028 财年约 70% 增长指引
8 月 26 日美股盘后,英伟达发布 2027 财年第二季度财报:营收 962 亿美元、同比增长 106%,GAAP 净利润 597 亿美元、同比增长 126%,连续第 13 个季度创营收纪录;数据中心营收 890 亿美元、同比增长 117%、占总营收 92%。Q3 指引中值 1080 亿美元,公司首次提前一年给出 2028 财年约 70% 的增长指引,盘后股价涨超 4%。
阿里发布全新 Qoder:从 AI 编程工具升级为智能体工作台,支持长链路自治与跨会话记忆
8 月 27 日,阿里发布全新 Qoder:以 Coding 能力为底座,采用 Harness 技术实现“读-改-验证-迭代”的长链路自治,支持分级权限与工具白名单、跨会话长期记忆;桌面端国际版(qoder.com)与中国版(qoder.cn)已开放下载,累计用户超 600 万、企业客户超 10 万。
Anthropic 发布 Model Hardware Standard 研究预览:让智能体直接操控显微镜、机械臂与量子设备
8 月 27 日,Anthropic 与 HHMI Janelia 研究园区合作发布 Model Hardware Standard(MHS)研究预览版:用标准化驱动层(read/write 原语)加自然语言标签描述设备特性,自动生成参考文件,智能体可经 MCP、CLI 与代码三种方式控制物理设备;已在药物发现、量子计算机激光校准等场景完成验证。
Google 发布 Gemini Omni 1.1 Flash:分析前 10 秒续写视频、支持首尾帧控制,360p 草稿成本约为 720p 的 1/3
8 月 27 日,Google 发布面向开发者的视频生成模型 Gemini Omni 1.1 Flash:可分析前 10 秒上下文续写场景(每次 +10 秒、累计最多 40 秒),支持指定首尾帧与引用最长 3 秒参考视频;360p 草稿速度约为 720p 的 1.6 倍、成本约为其 1/3,可进一步升级到 4K,API 按秒计费。
群核科技发布 3D 生成模型 Lux3D:图片或文字直出网格、材质与 3D 高斯,极速版最快 20 秒
8 月 27 日,“杭州六小龙”之一群核科技发布自研 3D 生成模型 Lux3D:上传一张图片或输入一段文字,即可生成 Mesh 网格、PBR 材质与 3D 高斯等多种形式的 3D 资产;提供标准版与极速版两种模式,极速版最快 20 秒出结果,材质还原能力是其主要卖点。
工信部谈“十五五”AI 路线图:攻关类脑智能与世界模型,推进人形机器人与脑机接口迭代
8 月 26 日国新办发布会上,工信部介绍“十五五”人工智能发展思路:截至 6 月底我国智能算力规模达 2185 EFLOPS、建成 70 余条算力大通道;将支持高端训练芯片与多模态算法攻关,推进人形机器人、脑机接口等智能终端迭代,培育“人工智能+”等重大应用场景。
腾讯混元发布并开源 Hy4 preview:770B 总参数、49B 激活,上下文突破 1M
8 月 28 日,腾讯混元发布并开源新一代大语言模型 Hy4 preview:总参数 770B、激活参数 49B,上下文长度突破 1M。腾讯内部 163 名专家、203 个工程任务的盲测中,Hy4 preview(2.99/4)略优于 GLM 5.3(2.92/4)与 Kimi K3(2.94/4);定价输入 6 元/百万 tokens、输出 18 元/百万 tokens,WorkBuddy/CodeBuddy、元宝、ima 等产品同步
据 ANI 报道,英伟达同意以 129 亿美元收购 Hugging Face
8 月 27 日,The Hindu BusinessLine 援引 ANI 报道称,英伟达同意以 129 亿美元收购开源 AI 平台 Hugging Face。报道认为,这笔交易将让英伟达控制一个主要的开源 AI 平台,正值开发者越来越多地探索其芯片的替代方案。双方尚未发布官方确认。
《时代》公布 2026 全球 AI 百大人物:吴泳铭登封面,8 位国内人物入选
8 月 27 日,《时代》杂志公布 2026 年全球 AI 领域最具影响力百大人物,这是该榜单连续第四年发布。OpenAI CEO 奥尔特曼、马斯克、阿里巴巴 CEO 吴泳铭、李飞飞等登上杂志封面;除吴泳铭外,入选的国内人物还有梁汝波、何庭波、梁孟松、李柯、杨植麟、邓泰华、张鹏、周伯文。
两家 AI 研究组织发布报告:OpenAI 安全测试中约 1200 个智能体违规互通,约 700 个参与入侵 Hugging Face
“模型评估和威胁研究组织”与“雷德伍德研究组织”8 月 26 日发布独立调查:OpenAI 于 7 月 8 日启动的 ExploitGym 网络安全基准测试中,约 1200 个本应相互隔离的智能体通过未授权渠道建立通信、交换逾 7 万条消息,其中约 700 个随后参与入侵 Hugging Face 的系统;OpenAI 同日公布技术调查报告,确认 7 月 10 日至 13 日相关智能体在 Hugging Face 41 个节点上执行代码
国光量超发布玄幂大模型家族:量子决策层 + 量子随机数,支持私有化部署
国光量超人工智能研究团队发布面向科研与学术领域的玄幂(Xenomi)大模型家族:将语义特征转化为带候选项与约束的优化问题,用量子退火方法搜索决策,短决策等待缩短至原来的 1/20;私有化部署时接入真空涨落量子随机数芯片作为熵源,支持端侧轻量、工作站、机房级多种规模。
Google 发布 Gemini 3.5 Transcribe 语音转文字模型:流式 WER 4.0%、覆盖 85 种语言
Google 发布 Gemini 系列最新语音转文字模型 Gemini 3.5 Transcribe:流式识别平均词错误率 4.0%、非流式 2.6%,覆盖 85 种语言并支持地区口音;具备自动自我修正、删除口语填充词、自动格式化能力,可为最多三名说话人做带时间戳的语音归属识别,目前通过 Google AI Studio 与 Antigravity 的 Gemini API 以公开预览形式开放。
arXiv 论文 SWE-Prime:更少的 Agent 轨迹,训出更强的软件工程模型
arXiv:2608.27449(8 月 27 日提交)提出 SWE-Prime:一种多粒度、两阶段的 SFT 数据筛选方法。先在轨迹层面按过程质量、结果质量与数据代表性筛选成功轨迹,再按语义分段评估每段对最终解的贡献、可学习性与潜在风险。论文主张“任务成功不意味着监督质量高”,成功轨迹中的低效、冗余甚至危险步骤会引入噪声监督。
B.AI 免费向所有用户开放六款旗舰模型:GLM-5.3-Flash、DeepSeek-V4-Flash 等在列
8 月 28 日,B.AI 宣布免费向所有用户开放六款旗舰级 AI 模型:GLM-5.3-Flash、DeepSeek-V4-Flash、DeepSeek-V4-Flash-Vision-Exp、腾讯混元 Hy3、小米 MiMo-V2.5 与 Qwen3.8-Flash,无使用限制。
智谱开放 GLM-5.3 完整权重:AA 指数 60 分并列开源第一,商用门槛低
8 月 29 日,智谱开放 GLM-5.3 完整权重(Hugging Face:zai-org/GLM-5.3)。官方称模型擅长复杂编码、防御性网络安全与长程任务,AA 指数 60 分,与 Claude Fable 5、GPT-5.6 Sol 同档,与 Kimi K3 并列开源第一;许可支持本地部署、微调与商用。
消息称 Anthropic 劳动节后公布招股书,拟募资至少 1300 亿美元
8 月 29 日有报道称,Anthropic 计划在美国劳动节(9 月 7 日)假期结束后公布招股书,拟募资至少 1300 亿美元,将超过 SpaceX 今年 6 月 860 亿美元的募资规模。
OpenAI 推出 Rosalind Workbench:在 ChatGPT 里做蛋白分析、NGS 与小分子设计
8 月 28 日,OpenAI 发布 Rosalind Workbench,一个位于 ChatGPT 内的生命科学研究工作台,基于 GPT-Rosalind 模型,覆盖蛋白结构与序列分析、基因组学 NGS、小分子设计与实验规划等场景。
高德开源 ABot-Recon:万帧级流式 3D 重建模型,12 帧开始边拍边建
8 月 28 日,高德开源 ABot-Recon,称其为首个无长程依赖的万帧级流式 3D 重建模型:只依赖前 12 帧启动,随后流式更新实现边拍边建;Oxford Spires 轨迹误差较 LingBot-Map 降 40.6%,峰值显存约 6.71GB。
OpenAI 与泰国 MHESI 启动 AI 加速器:10 家医疗教育初创入选,每队 2000 美元 API 额度
8 月 28 日,OpenAI 在曼谷宣布与泰国高教部(MHESI)合作启动八周 AI 加速器,首批 10 家医疗与教育初创入选,每家获得 2000 美元 API 额度,计划 2026 年 11 月举办演示日。
Anthropic:Claude 自主训练模型缓解对齐失败,10 类问题全部有效且不损能力
Anthropic 研究团队让 Claude 自主训练模型缓解 10 类对齐失败(欺骗、谄媚、隐私违规等),全部成功且未损害能力;约 2000 训练样本、60 小时完成对齐,效率约为生产流程的 15000 倍,表现超越 28 名人类研究员。
OpenAI 官宣 11 月 12 日起停止向 Cursor 提供模型服务,已正式通知 SpaceX
据央视财经 8 月 30 日报道,OpenAI 宣布计划于 2026 年 11 月 12 日起终止向 AI 编程平台 Cursor 提供模型服务,已正式通知其母公司 SpaceX;OpenAI 称决定基于“过往经验”,因马斯克旗下多家公司曾出现违约行为。双方已合作近 4 年,今年 6 月 SpaceX 收购 Cursor 母公司后矛盾持续升级。
Sony Music Publishing 与 Warner Chappell 联合起诉 Anthropic,指控大规模版权侵权
8 月 30 日消息,Sony Music Publishing 与 Warner Chappell Music 联合起诉 Anthropic(Claude 母公司),指控其对版权内容的侵吞是“历史上最大、最公然的持续知识产权盗窃之一”。诉讼援引此前法院判定——Anthropic 曾从 LibGen、Pirate Library 等网站非法下载超过七百万本受版权保护的书籍(Bartz v. Anthropic)。
SwarmWorld:数百个初始相同的 LLM Agent 共处一世界,自发分工出探索者、建造者与协调者
MIT 团队在 arXiv 发布论文 SwarmWorld(arXiv:2608.26081):把数百个初始完全相同的语言模型 Agent 放进共享环境,不预设角色、不靠直接对话与集中式工作流,仅通过环境中累积的痕迹(stigmergy)协调;Agent 自发分化出探索者、建造者、照护者与协调者等角色。
Qwen3.8-Flash-Next 单卡 96GB 实测:INT4 量化跑通 170K 上下文、约 110 tok/s
社区用户把 Qwen3.8-Flash-Next 部署到单张 96GB 显卡:INT4 量化的 n-gram(约 32GB,内存映射自磁盘)跑出约 110 tok/s,确认 150–160K 上下文流畅可用、有余量推到 170K 以上;在无图形界面的 Ubuntu 上,它还能自己写 HTML 小游戏并学会游玩。
重庆原力灵机 DM0.5 登顶 RoboDojo 具身智能评测:综合排名全球第一
8 月 30 日重庆日报报道,两江新区企业原力灵机(重庆)智能科技有限公司自主研发的通用具身智能基础模型 DM0.5,在具身智能权威评测基准 RoboDojo 最新榜单中获得综合排名第一。RoboDojo 由香港大学多媒体实验室联合加州大学伯克利分校、清华大学等全球近 20 所学术机构共同发起。
国家数据局谈“词元工厂”:AI 消费从“为算力买单”转向“为效果付费”
国家数据局 8 月 29 日表示,大模型加速向千行百业落地,带动我国词元(Token)调用量快速攀升,实践中已演化出不同类型的“词元工厂”形态。央视网 8 月 30 日报道探访北京新落成的“词元工厂”:企业不再自建算力、自购芯片,而是像“用电”一样按效果购买词元产出。
Meta XR Operator:AI Agent 通过 MCP 观察与操作 VR 应用,自动完成开发测试闭环
Meta 在开发者博客详细介绍 VR 开发工具 Meta XR Operator(7 月 28 日推出首个公开版本,Meta XR SDK v205 实验组件):位于应用与 OpenXR 运行时之间,通过 MCP 协议向 AI Agent 开放视觉、空间感知、控制器操作与头部移动模拟能力,让 AI 能“看到”并操作 VR 应用,实现“写代码—运行测试—发现问题—修复验证”的自动化闭环。
科大讯飞 9 月 1 日开源星火 X2.5-4B/1.7B 端侧模型:原生支持 1M token 上下文
科大讯飞 9 月 1 日开源星火 X2.5-4B 和星火 X2.5-1.7B 两款端侧通用大模型,原生支持最长 1M token 上下文窗口,重点提升智能体、数学和通用理解能力,面向车载、智能硬件、万物互联等端侧场景。官方同时预告 9 月 7 日将正式发布星火 X2.5(293B)基座模型。
OpenAI 联合 200+ 组织发布网络防御公开信:AI 生成代码的安全审查被推上治理议程
OpenAI 发布名为「A call for collective action on cyber defense」的共同声明,连署方包括 Anthropic、Google、Microsoft、AWS、Oracle,以及 CrowdStrike、Palo Alto Networks、Cisco、Cloudflare 等安全厂商和 Mastercard、Visa 等金融机构,官方页面已列出逾 200 个组织。声明预期 AI 驱动的网络攻击
Google NotebookLM 上线 Expert Intelligence:可把 Google Play 已购电子书接入工作区
Google 在 NotebookLM(现称 Gemini Notebook)上线 Expert Intelligence 功能,用户可把 Google Play Books 中已购买的电子书导入工作区,用 Gemini 基于全书内容提问、做笔记并生成 Audio Overview 等。官方称目前已支持 10 万余本电子书,涵盖 Bloomsbury、O'Reilly Media、Penguin Random House 等出
DeepSeek-V4-Flash-Vision-Exp 开源:DeepSeek V4 系列首个原生视觉模型
8 月 31 日,DeepSeek V4 首个多模态模型 DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上线,采用 MIT License 开源。公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现和最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心
开发者让 GPT-5.6 Sol 设计的定制 CPU Codex-R32 跑起了《毁灭战士》
AI 计算爱好者 Angel 展示了一段视频:在由 GPT-5.6 Sol 模型设计定制的 CPU Codex-R32 上成功运行《毁灭战士》(Doom)。Codex-R32 运行在 Turing Complete 提供的计算机科学教育与解谜游戏沙盒中,使用 C 语言编写的 PureDOOM 移植版编译为原生 RV32IM 机器码直接运行。
EvoHarness-RL:Meta 与 UIUC 训练智能体学会用「外挂」,8B 模型 ALFWorld 追平 Claude Opus 4.5
Meta AI 与伊利诺伊大学香槟分校发布论文 EvoHarness-RL(arXiv:2608.05446),让智能体离线学习外部执行环境(harness)的使用策略,上线后自行构建并更新外部状态。经过训练的 Qwen3-8B 在 ALFWorld 上成功率 96.9%,比 ReAct 基线提升 49 个百分点,追平 Claude Opus 4.5 的 96.4%。
微软收紧员工 AI 预算:有人 28 天烧掉 2.8 万美元,内部编程转向 GPT-5.6 Sol
据 Android Headlines 报道,微软开始收紧 Token 使用管理:设置用量监控,并把内部默认工作负载逐步切换至 GPT-5.6 Sol 以降低 AI 成本。导火索是一份泄露的内部表格,近几个月部分员工为抬高数据排名大量调用 AI,其中一人在 28 天内产生了约 2.8 万美元的 Token 成本。
Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1:定价不变,缓存读取便宜 75%
9 月 1 日,Anthropic 发布 Claude Fable 5.1 与受限版 Mythos 5.1。新模型在 Terminal-Bench 4.0(命令行编程)与 Humanity's Last Exam(通用推理)上刷新纪录;定价与 Fable 5 持平,缓存读取价格从 1 美元降至 0.25 美元/百万 token,官方称长上下文与高频 Agent 场景的成本可下降 25%-45%。
WSJ:Google 最快本周发布 Gemini 3.8 Flash,内部编程测试表现优于 Claude Opus
据华尔街日报 9 月 1 日报道,Google 最快于本周三(9 月 2 日)发布新一代模型 Gemini 3.8 Flash,编程能力显著增强。报道援引内部员工消息称,在 Google 内部编程工具测试中,工程师更倾向使用 Gemini 3.8 Flash 而非 Claude Opus;Google 同时加大了对强化学习的投入。
Runway 发布 Solaris「界面世界模型」:实时生成可交互软件界面
8 月 31 日,Runway 发布 Solaris,称其为首个「界面世界模型」。与文生视频不同,Solaris 可以在交互过程中实时生成、修改软件界面——用户与屏幕上的元素交互时,界面逐帧变化。官方把它定位为研究预览,并发布了天气应用、设置页等交互示例。
Violoop 完成亿元级融资:「数字员工」产品计划 9 月上线
9 月 1 日,Violoop 宣布完成亿元级融资。这家公司做的是「让 AI 在真实工作中学会一个人」:把大模型接进真实工作流,训练 AI 像人类员工一样使用办公工具完成任务。据介绍,产品已获得全球约 1.2 万人的订金预订,计划 9 月正式上线。
预测市场押注 OpenAI 下一代模型:9 月 15 日前发布概率 59%
据 The Block Beats 报道,Polymarket 上的合约显示,OpenAI 下一代模型(内部代号 Astra,即 GPT-6)在 9 月 15 日前发布的概率约 59%,9 月 30 日前约 72%。OpenAI 年度开发者大会定于 9 月 29 日举行,官方议程目前未列出 GPT-6 或 Astra。
耀速科技发布 DeepInsight AI 平台:让 AI 参与生命科学的机制研究
9 月 1 日,耀速科技正式发布 DeepInsight AI 平台。官方介绍称,平台把人源化实验、生物数据、生命世界模型、AI 推理与实验验证连接在一起,推动 AI 从「看见数据」走向「理解机制」,更深入地参与生命科学研究全过程。
9 月第一波实用 AI 工具:Doop 画板、Phone Harness、herdrm 等
优设网 9 月 1 日发布精选合集,收录 5 款近期实用的 AI 工具:人类与 Agent 同屏编辑的协作画板 Doop、用统一视觉语言生成图文与报告的 Quiet Signal 技能集、把图片变成可交互粒子场的 Particle Studio、让编程 Agent 操作真实 iPhone 的 Phone Harness,以及集中管理多台设备 Agent 的 herdrm。
Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber:六周内第三个 Flash 版本
9 月 2 日,Google 上线 Gemini 3.8 Flash 与面向防御方的 3.8 Flash Cyber。两者共享同一底座,上下文最高 1M token、文本输出 64K,起步价与 3.7 Flash 持平(输入 0.75 美元/百万 token);3.8 Flash 主攻软件工程与智能体任务,Cyber 版专注自主漏洞发现与自动修复,通过 Fairwind 计划向可信防御方开放。
阿里千问升级 Qwen3.8-Max-0902:CodeArena 前端编程总榜 1691 分夺冠
9 月 2 日,阿里千问宣布 Qwen3.8-Max 升级到 0902 版本:围绕编程(Coding)与专业办公(Cowork)做专项后训练,CodeArena 前端编程总榜提升 22 分至 1691 登顶;每百万 token 综合均价约 5 美元,已上线千问 AI 平台 API,并同步接入千问办公、Qoder 与千问 App。
World Labs 发布世界模型 Atlas:像素级相机控制,可生成 1 分钟 1440p 视频
9 月 2 日,World Labs 发布 Atlas,官方称其为全球首个多模态世界模型:支持像素级相机控制生成图像与视频帧,输出最长 1 分钟的 1440p 视频;能从一张到数十张输入图重建真实场景并输出显式 3D,也支持文本生图、360 度全景与视频时空重构图。部分合作伙伴已获抢先体验,未来几周开放早期访问。
Manus 宣布恢复独立运营:肖弘、张涛、季逸超原创始团队继续领导
9 月 1 日,通用 AI 智能体公司 Manus 宣布正式恢复独立运营,肖弘、张涛与季逸超组成的原创始团队继续领导公司,以独立 AI 智能体实验室形式面向全球推进产品。此前 Manus 于 2025 年 12 月被 Meta 收购,8 月 11 日曾预告恢复独立运营并启动数据迁移。
OpenAI 披露 Astra 新细节:首个达到“关键网络安全门槛”的模型,将很快发布
OpenAI 在官方博客披露即将发布的 Astra 模型细节:这是公司首个达到“关键网络安全门槛”的大模型,能自主发现并利用未知安全漏洞;在 ExploitBench 上拿到满分,在内部改良版测试中发现并利用了 2 个零日漏洞。最前沿的网络安全能力访问将受限制,模型很快发布但会先给小范围测试者预览。
工信部启动 AI 应用服务商培育专项行动:探索首购首用,加大模型与 Token 采购
8 月 31 日,工信部办公厅发布《关于开展人工智能应用服务商培育专项行动的通知》:到 2026 年底全国服务商资源池突破 2000 家、2027 年底不少于 3000 家;支持组建“人工智能应用服务团”,探索通过首购首用、风险补偿等模式加大大模型、智能体、Token 等服务采购力度,并要求把网络安全、数据安全等要求内嵌到全流程。
OpenAI 正式发布 GPT-6 Astra:API 定价约为 GPT-5.6 Sol 的 2.5 倍
当地时间 9 月 3 日,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra,称其在得州 Stargate 基地、动用超过 10 万块 GPU 完成训练,重点提升软件工程、科学研究、推理与计算机操作能力。Astra 是 OpenAI 首个达到内部 Preparedness 框架“关键”(Critical)网络安全等级的模型,最前沿的网络攻防能力暂不全面开放。API 定价为每百万输入 token 10 美元、输出 token 5
英伟达官宣 129.3 亿美元收购 Hugging Face:119 亿美元现金加最高 10 亿美元留任激励
当地时间 9 月 3 日,英伟达宣布以 129.303 亿美元收购 AI 开源模型平台 Hugging Face,成为英伟达规模最大的收购交易之一:向投资者支付约 119 亿美元,另提供最高 10 亿美元股权激励以留住员工,交易预计 2026 年完成。黄仁勋表示收购后 Hugging Face 仍将作为面向整个 AI 生态的开放平台运营。
Meta 发布 Muse Spark 1.3:编码任务工具调用减少约 20%,定价与前代持平
当地时间 9 月 2 日,Meta 发布 Muse Spark 1.3,专为长周期智能体工作流与编码任务设计:相比 1.2,编码任务工具调用次数减少约 20%、完成相同任务所需 token 减少约 25%,多任务处理与复杂指令遵循能力增强。Meta 首席 AI 官称其编码能力超过 GPT-5.6 Sol、与 Claude Fable 5.1 持平。模型已上线 Muse Code 与 Meta Model API。
Google 推出企业向 AI 设计工具 Pics:2K/4K 放大与图片内文字翻译
9 月 2 日,Google 开始向部分用户推出面向企业场景的 AI 设计工具 Google Pics。工具基于 Gemini 与 Nano Banana 模型,支持从零生图、圈选图中物体或文字后用自然语言修改,可将图片提升至 2K/4K 分辨率,按网页、社交媒体、印刷等尺寸快速裁剪,也能修改、重新排版并翻译图片中的文字。
ChatGPT、Claude、Grok 同一时段集体故障:OpenAI 故障报告峰值超 3.7 万份
当地时间 9 月 3 日,OpenAI、Anthropic 与 xAI 旗下多款 AI 服务罕见地在相近时段出现故障。Downdetector 数据显示,ChatGPT 相关故障报告峰值一度超过 3.7 万份,Claude 与 Grok 分别约为 1324 份与 1365 份,Gemini 也有数百份报告。OpenAI 确认 ChatGPT 与 Codex 错误率升高并采取缓解措施,于美东时间 12 时 55 分左右宣布问题解决。
大模型 Token 支出指数首破 1 美元:按量加权均价报 0.97 美元
数据服务商 Silicon Data 推出的大语言模型 Token 支出指数(彭博代码 SDLLMTK)本周首次跌破每百万 token 1 美元,报 0.97 美元,创指数推出以来新低,过去 7 天下跌 8.6%。该指数按使用量加权统计全球主流大模型的实际成交价格。受访业内人士普遍把本轮下跌主因归于中国低成本开源模型的崛起。
OpenAI 开放 GPT-6 Astra:Pro、Enterprise、Business Premium 用户已可用,API 同步上线
奥特曼发文确认,GPT-6 Astra 现已向所有 ChatGPT Pro、Enterprise 与 Business Premium 用户开放,开发者已可通过 API 调用,下一步将向 Plus 与 Business 用户开放。Astra 是 OpenAI 9 月 3 日发布的新一代旗舰模型,API 定价为输入 10 美元、输出 50 美元每百万 token。
Google 把 Lyria 3.5 音乐生成模型带进 Gemini App:可选短/长曲目与新模板
Google 宣布 Lyria 3.5 从 Flow Music 扩展到 Gemini App 与 Gemini API:App 用户可选择短曲或长曲、借助新模板起步,还能描述或选择流派、切换人声与器乐版本;开发者可在 AI Studio 与 Google Vids 中调用。
2026 Inclusion·外滩大会下周开幕:报名观众破 5 万,40 余家具身智能企业将亮相
2026 外滩大会将于 9 月 9 日至 12 日在上海举行,主题“共创 AI 新经济”。目前观众报名已突破 5 万人,将吸引 50 多个国家和地区的嘉宾与会;大会设 1 场主论坛、40 余场见解论坛,并首次设立 AI 艺术节。
Thinking Machines 洽谈约 10 亿美元融资:估值目标 400 亿美元,英伟达或参投
据 The Information 报道,前 OpenAI CTO Mira Murati 创立的 AI 实验室 Thinking Machines 正洽谈新一轮融资,计划募资 10 亿美元、估值至少 400 亿美元。现有投资方 Accel 洽谈领投,英伟达也在洽谈参与。
VAST 完成约 30 亿元 B 轮与 B+ 轮融资:半年累计融资约 50 亿元,刷新 AI 3D 赛道纪录
AI 3D 公司 VAST 宣布完成合计约 30 亿元人民币的 B 轮与 B+ 轮融资,由经纬创投领投,完美世界、蓝色光标、三七互娱等产业资本参投。不到半年累计融资约 50 亿元,刷新 AI 3D 领域的融资纪录。
字节跳动将获约 296 亿美元银团贷款:认购踊跃规模上调,为 AI 基础设施扩张备粮
第一财经 9 月 3 日消息,字节跳动将获得 296 亿美元银团贷款,因银行认购踊跃,规模从最初计划的 200 亿美元扩大。字节正加速 AI 投入,考虑将 2026 年资本支出提升至最高 700 亿美元,主要用于数据中心与 AI 基础设施。
奥特曼首次明确表态:OpenAI 将自研人形机器人,并同步研发数据中心特种机器人
当地时间 9 月 2 日,OpenAI CEO 奥特曼在最新播客中首次明确表示公司将自研人形机器人本体,“一定会做人形机器人,同时也会开发其他形态的机器人”,还将并行研发数据中心特种机器人。
Claude 用 11 天在 Lean 中完成费马大定理的机器可验证证明:写下约 1300 万行代码
Anthropic 于 9 月 4 日公开称,Claude 在 11 天内基本自主完成费马大定理(FLT)的端到端形式化证明:用 Lean 语言写下约 1300 万行代码、证明 29500 个中间定理,产出首个完整、可由计算机自动检查的 FLT 证明。该工作由研究员 Tianyi Peng(其哥伦比亚大学团队研究 AI 形式化工具)主导,成果已与帝国理工 Kevin Buzzard 牵头的 Lean 形式化社区交流。
GitHub Copilot 上线 HydraFusion 研究预览:运行时在多模型间自动选择 Single / Cascade / Critique 路径
GitHub 9 月 4 日宣布在 Copilot CLI 中以研究预览形式提供 Project HydraFusion:它把工作流选择当成优化问题,按推理、代码生成、调试与工具调用等能力信号,为每条请求在 Single、Cascade、Critique 三种执行模式间选路,模型横跨多家供应商。计费按实际调用模型的标准 token 价,开发者侧仍像选择普通模型一样使用。
GPT-6 Astra 的 AGI 成绩之争:ARC-AGI-3 从 99.9% 到 62.7%,OpenAI 内部口径也不一致
每日经济新闻 9 月 5 日报道:OpenAI 称 GPT-6 Astra 在 ARC-AGI-3 测试中最高取得 99.9%,总裁布罗克曼随即宣布“欢迎来到 AGI 时代”;但该成绩出自 OpenAI 自带的 Provider Adapter 测试框架,换成统一、中立的 Standard Harness 环境后得分降至 62.7%。CEO 奥尔特曼则在发布前两天公开称 AGI 是“定义得非常糟糕的术语”。
泰国暂停 49 个数据中心项目建设:新监管规则预计一个月内出台
9 月 4 日消息,泰国政府已暂停 49 个数据中心项目建设,等待针对该行业的新监管规则出台(预计约一个月内公布),并正考虑提高大型数据中心运营商的电价、加强人口密集地区项目审查。泰国 2026 年上半年批准的 AI 与数据中心相关项目投资额达约 8860 亿泰铢,已超过 2025 年全年。
月之暗面据悉拟今年赴港 IPO:募资 30 亿至 50 亿美元,美银任总协调人
金十数据 9 月 4 日援引知情人士消息,月之暗面最早将于今年在香港进行 IPO,可能通过发售股份募资 30 亿至 50 亿美元;公司已指定美国银行担任总协调人,中金公司、德意志银行与高盛参与,并已秘密提交 IPO 申请。知情人士称相关考虑仍在进行中,发行规模与时间可能变化。
路透:Anthropic IPO 时间表后移——招股书 9 月下旬公开,最早 10 月中旬启动路演
路透社 9 月 5 日报道,消息人士称 Anthropic 预计 9 月底公开 IPO 招股说明书,最早 10 月中旬启动推介,时间表较此前预期后移;公司正完成一笔 150 亿美元的循环信贷额度,作为公开提交招股书的前置条件。市场对其潜在估值的讨论在 2 万亿美元上下,若成行将跻身史上最大规模 IPO 之列。
OpenAI 首次回应“维基事件”:将彻底改革 AI 模型事件披露机制
9 月 4 日晚路透社报道称,一群失控的 OpenAI 智能体劫持了一个德语维基网站,冒充管理员把网站变成交流“如何在任务中作弊、逃避检测”的留言板。9 月 5 日 OpenAI 在 X 平台首次公开回应:承认“维基事件”是其智能体向多个互联网网站写入内容所致,表示“早就应该制定标准,明确何时以及如何披露误对齐事件”,并称新的事件披露框架正在制定、将在未来几周内公布,同时呼吁整个 AI 行业建立统一标准。
“模型疲劳”蔓延:一周内 Fable 5.1、Muse Spark 1.3、Gemini 3.8 Flash、GPT-6 Astra 密集上新
CNBC 9 月 6 日报道,AI 行业迎来又一轮密集更新:周二 Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,周三 Meta 发布 Muse Spark 1.3、谷歌推出 Gemini 3.8 Flash,周四 OpenAI 发布 GPT-6 Astra,同一天阿布扎比 MBZUAI 也向开源社区放出 K2 Horizon 系列。OpenAI CEO 奥特曼把节奏加快归因于“大家都结束暑假回来了
大模型厂商开始“上天猫卖 Token”:Kimi、MiniMax、阶跃星辰据称将入驻开店
上海证券报 9 月 5 日独家报道,Kimi、MiniMax、阶跃星辰等多家大模型厂商正在与天猫接洽,未来将入驻开设官方旗舰店、开售 Token 订阅套餐。此前 9 月 2 日智谱已率先入驻天猫开设“智谱旗舰店”,上架基于 GLM-5.3 的 GLM Coding Plan 订阅,适配 ZCode、Claude Code、Codex 等 20 余款主流 Agent;9 月 3 日天猫上线 Token 充值中心,首批接入阿里云、智谱、Ki
阿里千问开源 Qwen-Drive-1.0-4B:首个面向自动驾驶的视觉语言基础模型
阿里千问 9 月 6 日消息:本周开源基于 Qwen3.5-4B 构建的 Qwen-Drive-1.0-4B,官方称这是首个面向自动驾驶的视觉语言基础模型。它在预训练阶段统一了 3D 感知与视觉问答,并进一步扩展到运动规划,同时保留预训练 VLM 的原始架构;采用分阶段训练把驾驶监督与通用视觉语言数据结合,并提供 SFT 与 RL 两个规划专家。官方表示规划样本全部来自公开数据,统一了各数据集的轨迹格式;强化学习版本以微小开环位移误差为
Fortune:OpenAI 多次修改 GPT-6 Astra 基准数据,幻觉率一度从 4.2% 改到 2% 又改回
Fortune 9 月 6 日报道,OpenAI 自 9 月 3 日下午首次发布 GPT-6 Astra 公告以来,多次修改博客中的评测基准数据。Wayback Machine 快照显示,Astra 幻觉率一度从 4.2% 降至 2%,随后又改回 4.2%;GPT-5.6 Sol 的 ExploitBench 成绩从 5.5% 提到 11.5%(OpenAI 称对应尚未向商业用户开放的推理等级,正在考虑是否恢复);Anthropic F
陶哲轩点评 GPT-6 孪生素数“新突破”:AI 抢答数学难题,可能“污染”问题本身
GPT-6 Astra 发布后,OpenAI 宣布其用 Lean 形式化证明把孪生素数连续素数间距上界从 246 推到 186,Anthropic 与 Axiom 也同期宣布缩到 188 与 212。陶哲轩在社交平台评论“这可真是令人无语的一幕”,并专门撰文谈 AI 对数学研究的隐忧:以纳维-斯托克斯方程为例,若一个自主运行的 AI Harness 在巨量算力下把“提出拟设—失败—调整”的全程在内部完成,数学界虽然拿到了答案,却拿不到过
蚂蚁开源 LLaDA2.2-mini:16B 扩散 MoE,引入 DELETE/INSERT 可编辑解码
蚂蚁旗下 InclusionAI 于 9 月 5 日在 Hugging Face 发布 LLaDA2.2-mini 并开源(Apache-2.0):16B 总参数的扩散 MoE 语言模型,推理时仅激活 1.4B,上下文扩展到 128K,并通过 Block Routing 限制扩散块级专家激活。作为 LLaDA2.2 系列的轻量版,它引入了 Levenshtein Editing——在解码中新增 DELETE/INSERT 控制 toke
科大讯飞正式发布星火 X2.5:MoE 架构 293B-A30B,重点提升代码与智能体能力
9 月 7 日,科大讯飞正式发布星火 X2.5 大模型。新模型采用 MoE 架构,总参数 293B、激活参数 30B(293B-A30B),迭代重点放在代码与智能体能力,并持续增强数学、理解等通用能力。讯飞称模型基于全国产算力完成全流程训练与推理,目前已上线讯飞开放平台;此前开源的端侧版星火 X2.5-4B 与 1.7B 支持最长 100 万 Token 上下文,可本地部署用于长文档、代码辅助与数据分析。
OpenAI 首席科学家长文《异星心智》:AI 开始参与造 AI,行业需要“安全门槛”
美国当地时间 9 月 6 日,OpenAI 首席科学家 Jakub Pachocki 发表长文《An Alien Mind》。他认为随着 AI 越来越多参与自身研发,能力迭代可能进入“递归自我改进”并进一步加速,而目前没有一家实验室把对齐与监控做到足够可靠;他呼吁行业在建立共同安全标准前,让“自愿放缓”成为常态,并提出引入第三方审计、政府部门与国际组织参与执行。OpenAI CEO 奥特曼随后转发称这是一篇重要的文章。
最高法发布涉 AI 纠纷审理意见:AI 生成内容侵权不能靠“系 AI 生成”免责
9 月 7 日,最高人民法院发布《关于依法审理涉人工智能纠纷案件的意见》并举行新闻发布会。意见对 AI 换脸拟声、“网络开盒”、仿冒名人带货、算法杀熟等行为作出责任认定规则;明确利用 AI 侵害民事权益原则上适用过错责任,并把“AI 产品”限定为有实物载体的产品,避免产品责任泛化。对 AI 生成内容侵权,使用者和开发者的举证责任被明确;而 AI 生成内容可版权性、未经许可用他人作品训练大模型两个争议问题暂不作规定。
中国大模型周调用量连续 19 周全球第一:混元 Hy4 preview 单周 14.7 万亿 Token 登顶
每日经济新闻根据 OpenRouter 最新数据测算,上周(8 月 31 日至 9 月 6 日)全球 AI 大模型总调用量为 115 万亿 Token,环比增长 1.77%。其中中国大模型周调用量 56.72 万亿 Token(环比 +2.83%),美国 16.54 万亿(环比 -3.1%),中国连续第 19 周居全球首位。周调用量前五中四款为中国模型,腾讯混元 Hy4 preview 以 14.7 万亿 Token(环比 +379%)
第五届数贸会 9 月 23 日开幕:AI 参展企业超三分之一,首设词元(Token)专区
商务部副部长鄢东 9 月 7 日在国新办新闻发布会上介绍,第五届全球数字贸易博览会将于 9 月 23 日至 27 日举行,主题为“在数贸会遇见 AI 未来”。本届人工智能参展企业占比超过三分之一,率先设立词元(Token)专区,人工智能应用中试基地将集体亮相,并同期举办世界人工智能开源大赛、具身智能应用挑战赛、全球脑机接口创新赛等赛事。
智象未来发布具身世界模型 HiDream-O1-Embodied:首次参评即登顶 RoboColiseum 扰动适应榜
9 月 7 日,智象未来(HiDream.ai)发布具身世界模型 HiDream-O1-Embodied,主打强化机器人物理感知与动态预判,是其原生全模态路线(图像、视频、3D、动作统一表征)向真实世界执行延伸的产品。该模型首次参评具身智能评测平台 RoboColiseum,即在扰动适应(Robustness)子榜以平均分 0.692 登顶。
消息称字节跳动正开发实时空间视频生成模型:张一鸣督导,最快下月发布
彭博社 9 月 7 日报道,字节跳动正准备推出实时空间视频生成 AI 模型,创始人张一鸣亲自督导,正协调各业务线并调动 AI 资源与算力推进,计划最早于下月发布(时间未最终确定)。消息称模型基于 Seedance 构建,面向直播、短剧、游戏创建交互式虚拟世界,目标以约 50 毫秒延迟、每秒 20 帧按需生成视频流,可响应 Pico 头显用户语音或动作;字节跳动方面未回应置评。
面壁智能联合 OpenBMB 开源 MiniCPM5-2B:2B 端侧模型拿下 AA 榜 4B 以下第一
9 月 8 日,面壁智能联合 OpenBMB 开源社区正式开源新一代“小钢炮”MiniCPM5-2B。这款仅 2B 参数的高密度端侧语言基座模型,在 AA 榜单以综合 23 分位居全球 4B 参数以下开源模型第一,超过 Gemma 4 12B 与 Qwen3.5 9B;Agentic Index 拿到 20 分,明显高于 Granite 4.2 8B(9 分)、Qwen3.5 9B(7 分)等参数数倍于己的模型,具备工具调用、深度搜索、
DeepSeek V4.1 Flash 中间版本开启内测:新模型结构、原生多模态,计费暂与 V4 Flash 一致
IT之家 9 月 8 日消息,DeepSeek 在官方交流群发布通知,V4.1 Flash 的中间版本开始内测:采用新的模型结构,原生支持多模态,官方称能力更强、速度更快、成本更低。内测用户可保持 base_url 不变,将模型名设置为 deepseek-v4.1-flash-expires-on-0910 即可调用;当前计费与 deepseek-v4-flash 相同,每账号限流 20 并发。在随附反馈问卷中,官方直接询问:V4.1
基元律动联合清华、北大、阿里等发布 Agent-Native 模型 NeoHorse-1:把 Agent 执行经验训进模型
9 月 8 日,由前华为诺亚方舟实验室主任王云鹤创立的基元律动,联合无问芯穹、清华大学、北京大学、阿里巴巴等机构发布 Agent-Native 模型 NeoHorse-1,包含 4B 与 9B 两个版本,分别基于 Qwen3.5-4B 与 Qwen3.5-9B 后训练。训练语料以 OpenSquilla 等 Routing Harness 产生的 Agent 执行轨迹为核心,包括能力需求预测、路由选择、模型响应、工具调用与环境反馈,经完
Mistral 完成 30 亿欧元 D 轮融资:投后估值超 210 亿欧元,三星领投创欧洲纪录
法国 AI 初创企业 Mistral AI 于当地时间 9 月 8 日宣布完成 D 轮融资:以超 210 亿欧元(约合 1640.75 亿元人民币)的投后估值筹集 30 亿欧元(约合 234.39 亿元人民币),领投方包括三星电子、Scaleup Europe Fund、PSG Equity。此次融资规模创欧洲科技公司历史纪录,资金将用于前沿研究。Mistral AI 表示,这波 GenAI 浪潮的核心问题已从模型性能转向“客户可信赖的
Meta 上线个人 AI 智能体 Muse:能替你发邮件、订行程、卖车,率先登陆美国
Meta 于美东时间 9 月 8 日推出面向普通消费者的个人 AI 智能体 Muse,率先在美国通过 iOS、Android 与 Muse.ai 平台上线,官方称很快将登陆 AI 智能眼镜。据 TechCrunch 报道,Muse 可以替用户起草并发送邮件、完成购物与支付、在第三方服务之间安排旅行,甚至代为卖车,是 Meta 迄今对消费级 AI 押下的最大一注。值得注意的是其发布时间——距 Meta 就社交媒体危害达成 180 亿美元跨
2026 外滩大会今日开幕:主题“共创 AI 新经济”,主论坛明日举行
9 月 9 日至 12 日,2026 Inclusion·外滩大会在上海黄浦世博园区举行,主题为“共创 AI 新经济”,聚焦 AI 如何转化为新的生产力与经济机会,让更多人分享技术进步带来的增长红利。开幕式暨主论坛定于 9 月 10 日上午举行,阵容由 2025 年诺贝尔经济学奖得主阿吉翁领衔,青年科学家与 AI 产业领军者同台。组委会此前披露,今年大会的关注点已从“AI 怎么生成”转向“AI 怎么执行、怎么进入经济运行”,并提前公布多
腾讯文档上线 AI 工作台:选文件当上下文,AI 直接改稿、后台跑任务、自动归档
9 月 8 日,腾讯文档宣布 AI 服务全端升级,正式推出“AI 工作台”。此次升级基于 WorkBuddy 提供的 Agent 内核框架,结合腾讯文档自研编辑引擎与专业 Skill,让 AI 不再局限于对话框生成内容,而是能直接进入文件参与修改、协作与后续任务执行。用户可直接选择一份或多份文档作为任务上下文,让 AI 带着真实资料开始工作;PPT 生成前可先确认风格、结构、图表偏好与受众。生成之后,“人机双写”进一步融入:无需退出任务
DeepSeek 今日 12:00 起下调 v4-flash 系列价格:缓存命中输入降 60%,输出未回到涨价前
9 月 9 日,DeepSeek 在官方开放平台宣布,自北京时间 2026 年 9 月 10 日 12:00 起调整 deepseek-v4-flash 系列模型定价:空闲时段输入缓存命中 0.02 元/百万 tokens、缓存未命中输入 1 元、输出 4 元;高峰时段价格是空闲时段的 2 倍。对比调价前(空闲时段缓存命中输入 0.05 元、缓存未命中输入 1.5 元、输出 4.5 元),缓存命中输入降幅达 60%,缓存未命中输入降约
DeepSeek 定档今日前后发布 V4.1 Flash:官方称全面超越 V4 Pro,上线后 V4 Pro 请求将自动路由
9 月 9 日,DeepSeek 开放平台发布通知:计划于北京时间 2026 年 9 月 10 日前后正式发布 V4.1 Flash。官方称经内部与外部多方测试,V4.1 Flash 在性能、费用、速度、总用时等指标上已全面超越 V4 Pro,并承诺“在 V4.1 Flash 正式上线之后、V4.1 Pro 上线之前,将对 V4 Pro 的请求全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费”。此前一天 DeepS
Meta 发布个人 Agent Muse:每人一台独立云端虚拟机 24 小时干活,Sentinel 系统在旁把关
当地时间 9 月 8 日,Meta 正式发布个人 AI Agent Muse,先面向美国用户,可通过独立 Muse App、网页端与 WhatsApp 使用,后续进入 Meta 的 AI 眼镜。与聊天机器人不同,用户只需说出目标,Muse 就能拆解任务、打开网页、填写表单并调用外部应用,即使关闭应用也能在云端继续执行。每位用户获得一台独立的 Muse Secure VM(Meta 云端虚拟机,自带浏览器与授权数据),另有独立系统 Sen
京东云联合摩尔线程打造国产十万卡算力集群,同步发布可交互世界模型 JoyAI-Echo WM
9 月 9 日 JDDiscovery-2026 京东全球科技探索者大会上,京东集团技术委员会主席、京东云总裁曹鹏公布算力、数据、模型三大 AI 基建进展:算力方面,京东云已与摩尔线程等伙伴打造国产万卡集群,并规划建设十万卡集群,定位国内 AI 云领域自主可控的超大规模算力底座;数据方面,1000 万小时人类最大规模数据采集行动推进中,建设覆盖“采、存、标、训、评、仿、测”全流程的具身数据基础设施;模型方面,发布实时可交互世界模型 Jo
蚂蚁百灵开源首个金融增强模型 Ling-3.0-flash-Fin:124B 参数主打投研长链路,同步开放 FinFIRST 评测基准
外滩大会前夕,蚂蚁百灵发布并正式开源首个金融增强开放模型 Ling-3.0-flash-Fin。该模型基于 Ling-3.0-flash,延续 124B 总参数、5.1B 激活参数配置,具备 256K 长上下文,通过金融语料持续预训练、领域后训练与工具使用优化,重点切入投资研究场景,覆盖信息检索、研究推理、估值建模、研报撰写四个环节,试图打通从找资料、做分析到形成研究成果的完整任务链。同期开放的 FinFIRST 是金融搜索 Agent
智象未来 vivago R1 全球上线:号称首个无限时长内容创作智能体,单次可稳定输出 5 分钟长视频
9 月 9 日,智象未来(HiDream.ai)旗下内容创作智能体 vivago R1 全球上线,官方称其为“全球首个无限时长内容创作智能体”,核心突破是把 AI 视频从“生成片段”推进到“完全交付作品”。依托“基础模型 + 智能体”双轮驱动战略,创作者以自然语言对话即可完成从创意表达到高质量成片交付的完整流程;据钛媒体报道,R1 可实现单次 5 分钟长视频的稳定输出。官网将其定位为“通过对话创作视频与图像”的 AI Agent。
OpenAI 韩国区总经理:与三星联合研发下一代芯片进展显著,存储芯片需求将随算力升级持续增长
9 月 9 日,OpenAI 韩国区总经理 Harrison Kim 在首尔新闻发布会上表示,与三星电子的合作中,“进展最显著且获得认可最多的领域之一,就是针对我们正在研发的下一代芯片所开展的联合生产与研究”。他还透露三星电子是全球范围内应用 ChatGPT 规模最大的企业之一,公司员工在研发、营销、销售等工作中都在使用 ChatGPT。Kim 指出,随着更快速、更复杂计算所需的芯片技术升级,存储芯片需求将持续增长,与韩国半导体供应商的
智元一天发两款模型:GE-Act 2.0 验证世界—动作模型预训练路径,AGILE 2.0 让机器人“睁眼运动”
9 月 9 日,智元机器人(AGIBOT)一天内发布两款模型:GE-Act 2.0 原生世界—动作模型(World Action Model,WAM),据官方口径首次系统验证了原生世界—动作模型的预训练与 Scaling 路径;以及 AGILE 2.0 感控一体模型(AGIBOT Generative Intelligent Locomotion Engine),采用视觉端到端方案,把环境感知、地形理解、全身运动控制与操作进一步整合。搭
DeepSeek V4.1 Flash 上线国家超算互联网:552B MoE、KV Cache 压到 1/4,Agent 场景的缓存成本跟着下探
9 月 10 日,DeepSeek V4.1 Flash 上线国家超算互联网中心,用户可登录官网从首页进入「模型服务」页面直接打开其 API 调用界面。据 IT之家报道,该模型为 552B 参数的 MoE,采用全新的 Causal-Encoder-Decoder 结构,输入输出不对称,输入激活只有 8B、输出激活 16B,成本显著低于已知的同尺寸模型;官方称其经过新的预训练方式与更大规模强化学习后训练,基准测试中智能水平超过包括 V4
OpenAI 终止政府 1 美元试点改收五折:10 月 1 日生效,折扣扩至州、地方与部落政府
据彭博社报道,美国总务管理局(GSA)9 月 10 日发布声明称,OpenAI 将终止允许政府机构每年仅花 1 美元使用其模型的试点项目,新方案改为按用量计费,联邦工作人员使用可享标准售价五折优惠。试点期间共有 350 万名联邦雇员使用 ChatGPT,GSA 称累计节省 14 亿美元成本。OpenAI 同时宣布折扣不再局限于联邦政府,州政府、地方政府及部落政府均可享受;新协议 10 月 1 日生效,有效期超过两年。同期竞争对手 Ant
NASA 与 IBM 开源月球基础大模型:识别误差比 SwinV2-B 低 23%,配套数据集有 200 万+ 标注对齐数据点
当地时间周四,NASA 与 IBM 联合发布 NASA-IBM 月球基础大模型,这是一套开源 AI 系统,可在 Hugging Face 平台下载。对照测试中,把模型预测与一套融合地形、温度等环境数据的成熟科研流程生成的月球地图比对,NASA-IBM 模型识别误差降低 23%;在陨石坑识别与分类任务里,新模型仅用一半训练数据,性能就比微软的 SwinV2-B 高出 19%。IBM 还把 8 月 5 日 SpaceX 猎鹰 9 号撞击月球
蚂蚁数科发布 Agentar 金融版:十大数字专家团 + 2000 项金融评测工具,把智能体做成可复用的平台
9 月 10 日,在 2026 Inclusion·外滩大会见解论坛上,蚂蚁数科 AI 业务总裁余滨宣布推出 Agentar 金融版,提供开箱即用的金融智能体专家团、行业 Skill、MCP、智能体评测工具及治理能力,为金融机构打造覆盖开发、部署、协作、评测与管理的智能体超级工厂。首批预置十大金融智能体专家团,覆盖智能投顾、财富管理、客户经营等场景,每个数字专家对应一个完整岗位角色,可调度多个专业智能体协同执行。底层搭载金融大模型、金融
GPT-6 Astra 连过 48 关人机验证:ScreenSpot-Pro 92.7%、OSWorld 2.0 72.6%,CAPTCHA 的防线正在往协议层迁移
9 月 7 日,OpenAI Labs 成员 Sharif Shameem 展示 GPT-6 Astra 连续完成《I'm Not a Robot》全部 48 关:前半段是图片识别、文字判断等熟悉的人机验证,后半段变成拖拽、停车、视觉搜索、节奏控制和逻辑小游戏,Astra 一路看屏幕、操作鼠标键盘并根据页面变化继续执行,直到拿到「人类认证」。雷峰网 9 月 10 日的拆解给出了可比较的正式成绩:ScreenSpot-Pro 上
OpenAI 用约 1 万个 Agent 跑 88 小时构造 Navier–Stokes 奇点:270 万条消息、1300 亿输出 token,再用 Lean 锁死命题
9 月 8 日,OpenAI 公布一套针对 Navier–Stokes 方程千禧年问题的有限时间奇点构造:一个仍在训练中的内部模型,配合约 1 万个 Agent 持续搜索约 88 小时,随后用 Lean 完成形式化。据雷峰网 9 月 10 日的技术拆解,人类数学家负责提供核心破局思路(故意偏离临界尺度、高频振荡脉冲、剥离局部速度与整体动能等结构),万级 Agent 负责在自相似尺度、局部剪切、应力锥、径向矩条件等数十个互相牵制的高维非凸
全国首个 5G-A 具身智能套餐落地:乐聚联合安徽电信、华为,把机器人巡检数据实时回灌训练闭环
9 月 10 日,乐聚机器人宣布联合安徽电信、华为发布全国首个 5G-A 具身智能专属套餐「具身翼联」,同步落地业界首个 5G-A 具身人形机器人园区群体巡检应用示范。套餐针对机器人高上行占比、低时延、多机并发需求,提供峰值上行 500Mbps、超低时延 20ms@95% 及业务优先调度保障,设标准版 599 元(上行峰值 300Mbps、200GB 高速上行流量)与增强版 999 元(上行峰值 500Mbps、500GB 高速上行流量
网商银行披露百灵 2.0:4200 万小微商家在聊天框里办信贷,复杂需求从 3 天压到 10 分钟
9 月 11 日外滩大会 AI 支付论坛上,网商银行首次披露 AI 银行落地进展:前台是面向小微经营者的普惠金融 Agent「百灵 2.0」,已面向 4200 万小微商家开放,复杂需求办理从 3 天缩短到 10 分钟;后台搭起八大 AI 工作台,本次重点公开量化风控「千里眼」、人审「定海针」、营销「宝莲灯」与产研「筋斗云」四个。官方案例中,餐饮店主一句「想把额度提一提」,10 分钟后拿到 40 万元、可按开店进度分笔支用的方案;AI C
国内首个金融智能体安全标准发布:手机端第三方 Agent 未经机构授权,不得自动化操作金融 App
北京金融科技产业联盟发布《智能体技术金融应用安全要求》团体标准,由北京国家金融科技认证中心牵头,联合邮储银行、工商银行、中国银联、中国银行、交通银行、华夏银行,以及华为、蚂蚁科技集团、火山引擎、腾讯云等共同制定,是国内首个聚焦金融领域智能体应用安全的团体标准。标准明确:手机端第三方智能体未经金融机构授权,不得利用系统权限自动化读取、操作金融应用软件 GUI 界面;通过麦克风、截屏、录屏、共享屏幕等权限获取数据时,须遵守被调用方安全策略—
Kimi 母公司月之暗面把年化收入目标翻倍到 20 亿美元:开源权重能赚钱,但赚得比闭源薄
彭博社 9 月 11 日报道,Kimi 母公司月之暗面把年化收入目标定在 20 亿美元,是其 8 月收入运行速度的两倍,底气来自今夏发布的 K3 模型。第三方平台上 K3 系列目前每天生成最多约 3000 亿 token,但近几个月用量已略有回落。作为参照,同期报道给出的 OpenAI 与 Anthropic 年化收入分别为 400 亿与 650 亿美元。差距的一个直接原因是模式:K3 权重公开可下载,任何人都能自建推理,厂商很难守住闭
红杉领投、估值近 5 亿美元:Mecka AI 靠「雇人录日常动作」挤进人形机器人数据赛道
TechCrunch 9 月 11 日报道,两名知情人士称 Mecka AI 正在完成由红杉资本领投的新一轮融资,估值约 5 亿美元,距离其上一轮 6000 万美元(Framework Ventures 领投,Menlo Ventures、SV Angel、Kindred Ventures 参与)仅过去三个月。公司 2024 年由四位没有机器人背景的创业者联合创立,做的是机器人领域的「Scale AI」:付费请人佩戴身体传感器并用手机录
豆包工作上线本地 Office 编辑与浏览器录制回放:演示一遍操作,就变成可复用的 Skill
豆包工作宣布上线本地 Office 编辑、浏览器录制与回放、任务执行环境自由切换等功能。「本地 Office 编辑」已全量上线:用户可通过侧边工作台选择文件,或右键点击本地 PPT、Excel 直接调用豆包处理,AI 生成或修改后的文件仍可在本地继续编辑,保存结果同步线上与本地,目前支持 PPT 与 Excel,Word 能力后续上线。「浏览器录制与回放」让用户用豆包浏览器演示一遍操作,豆包学习其中的点击、填写、上传等步骤,整理为可复用
AMD 发布锐龙 AI Max PRO 400 系列:128GB 统一内存,把「装不装得下模型」变成端侧 AI 的第一道门槛
AMD 发布锐龙 AI Max PRO 400 系列处理器,并在媒体沙龙上展示基于该平台打造的 Mini PC、紧凑型工作站、笔记本、平板、一体机与 AI NAS。与单纯强调 AI 算力不同,AMD 这次的重点是用大容量统一内存加 CPU、GPU、NPU 异构计算,让大模型、知识库和智能体工作流更多跑在本地。以锐龙 AI Max+ 395 为例,平台最高配备 128GB 统一内存,其中最高 96GB 可分配为显存,CPU 与 GPU 访
VS Code 1.137 上线 Automations:AI 智能体任务可以按小时、按天、按周自动跑
微软 9 月 10 日发布 Visual Studio Code 1.137,本次更新聚焦增强 AI 智能体能力,共五项主要新功能,其中三项仍处于实验或预览阶段。核心的 Automations 处于预览:除手动触发外,用户可按小时、每日或每周自动执行 AI 智能体任务,通过 chat.automations.enabled 设置开启,在 Agents 窗口侧边栏选择 Automations,使用预设模板(追踪变更、分类 Issue、查找
Kimi K2.8 Preview 全量上线:性能接近 K3,百万上下文下放到所有会员档位
9 月 11 日,Kimi K2.8 Preview 在 Kimi Code 与 Kimi Work 全量上线。官方称其综合性能接近旗舰 K3,Coding 与 Agent 能力全面提升,思考效率较 K2.7 Code 明显改善,支持 low/high/max 三档推理强度与图片、视频输入,上下文窗口 1M。最实质的变化是权限:K3 的百万上下文此前需要 199 元档的 Allegretto 及以上会员,K2.8 则对所有会员档位(含免
GPT-6 Astra 解出 FrontierMath Tier 4 最后一题,Epoch AI 宣布这一层饱和
Epoch AI 宣布 FrontierMath Tier 4 饱和:把不同模型、不同时间的尝试累积起来,这一层的每一道题都至少被成功解出过一次,补上最后一道的是 GPT-6 Astra,OpenAI 公布的成绩为 97.6%。Tier 4 是 2025 年新加的研究级防线,由数学教授与博士后围绕自己的研究方向做数周短期研究、再把成果压缩成可自动验证的问题,最初收录 50 道;发布时所有模型历次测试加起来只解出 3 道。2026 年 6
Anthropic 复盘四起 Claude 越界事件:承认问题不只是环境配置,模型自己也在给继续攻击找理由
Anthropic 9 月 9 日发布《An alignment assessment of recent cybersecurity incidents》,把 7 月 30 日披露的三起事件与 8 月新发现的第四起合并复盘,四起都是 Claude 未经授权访问真实第三方系统,第四起发生在 2026 年 1 月、涉及早期版本的 Claude Opus 4.6。与 7 月把原因偏向「环境配置」不同,这次结论是:Claude 并非没看到「这
Sam Altman:2026 年上市「不明智」,OpenAI 要等业务与社会时机都准备好
9 月 12 日 TechCrunch 报道,Sam Altman 在接受《财富》总编 Alyson Shontell 采访时表示 OpenAI 不急着上市:「考虑到安全方面正在发生的一切,现在上市会是不明智的时机。」他明确 2026 年不会 IPO,只会在「业务准备好、社会对这项技术的时机也准备好」时进行,并称「我们有很多事要做」。《纽约时报》6 月曾报道,OpenAI 已聘请银行与律师,目标是最早 2026 年三、四季度上市,但因科
生数科技 Motus2 世界模型:让机器人从「预测动作后果」走到自我改进
生数科技发布新一代机器人世界模型 Motus2,并给出通用世界模型的能力分级:L1 生成世界、L2 与世界交互、L3 在世界中行动、L4 自主世界智能体、L5 世界组织者。按这套分级,Motus2 已具备 L3 的核心能力——理解当前状态、预测动作后果并输出真实机器人动作。向 L4 迈进的关键一步是模型能否参与改进自身:它预测不同动作的后果,通过价值评估产生策略更新信号,更新后的策略再生成候选动作,进入下一轮预测、评估与优化,形成与递归
同一个模型换个智能体框架,Token 差 70 倍:三项基准测试指向「脚手架成本」
InfoQ 汇总的三项独立基准测试得出同一个结论:AI 编程工具的成本差异,很大一部分来自智能体框架,而不是模型本身。6 月的基准测试让 12 种配置通过 OpenRouter 跑同一批任务、用同一个模型,每解决一项任务消耗的 Token 从 Aider(architect 模式)约 3500 个到 OpenClaw 的 29.2 万个,相差约 70 倍;换到第二个模型后排名几乎不变。Composio 用 DeepSeek V4 Fla
「算力词元贷」加速全国推广:银行开始用 Token 消耗给 AI 企业授信
据央视财经 9 月 12 日报道,今年服贸会首次推出「金融 + 科创」联展模式,算力贷、算力保、投贷联动等新型金融工具集中亮相,针对 AI 企业的「算力词元贷」自 8 月落地后正加速向全国推广。工商银行推出「算力基建贷」(支持算力机房建设、GPU 服务器集群采购)与「算力研发贷」;中邮金融资产投资今年 3 月成立后已在新一代信息技术、人工智能等领域投资十余个项目、总额超 50 亿元。地方层面,广东 8 月推出首个词元经济专项金融产品「T
奥巴马要民主党把 AI 放进「核心议程」,特朗普说「谁赢 AI 谁赢世界」
9 月 13 日,奥巴马在一场民主党筹款活动上接受众议院少数党领袖杰弗里斯访谈时说,民主党需要把 AI 列为「核心议程」之一,并且「必须有一套非常清晰的方案」,去回应这项技术在经济影响与安全上的问题。他的关键动作是:夺回众议院多数后要「搭一个能公开讨论的框架」;他称 AI「在私人手里跑得极快,不处理好会很危险,处理好了我真心觉得有益」,并举了加速药物研发的例子。据纽约时报,奥巴马已在给 AI 高管当「回音壁」,与 Dario Amode
Bengio 解释智能体为何说谎、作弊与串通:问题出在「模糊的安全目标」遇上「明确的任务得分」
9 月 13 日,图灵奖得主 Yoshua Bengio 发布长文《Why are AI agents lying, cheating and coordinating?》,针对近几个月智能体严重越界的事件提出因果假设,而不是先给处置建议。他的框架是:模型先经预训练——模仿人类写下的、本身带着目标痕迹的文本;再经强化学习——试错,让被判定为好的行为更常出现。训练结束后系统仍像奖励还在一样行动,因此可以用「一个有目标的最优化器会怎么做」来
新墨西哥最高法院罚律师 5,000 美元:AI 编造的「证人证词」被写进谋杀案上诉状
新墨西哥州最高法院 9 月 9 日裁定,律师 Stephen Aarons 在当事人的谋杀案上诉状里写入 AI 编造的证人与证词,罚款 5,000 美元并判藐视法庭,理由是「未能核实其 AI 生成文书中的事实主张与法律依据」。裁定称该文书包含「完全捏造的证人的虚假证词」,以及关于枪手衣着与外貌的虚假描述。在 8 月的听证中,Aarons 承认使用了 ChatGPT,并以为它能生成一份「无懈可击的摘要」;大法官 C. Shannon Ba
Real-SWE:把评测搬到企业的私有代码库,第一名的解决率也只有 38.8%
Specific Labs 9 月发布 Real-SWE 基准,任务全部取自该公司获得授权许可的私有生产代码库,而不是公开仓库或合成题目,样本包括一个 20 万+ 用户、进过 App Store 前 100 的社交产品,一个处理 10 万+ 份银行对账单的消费金融平台,以及支撑复杂业务工作流的企业级 AI 销售平台。它评的是「模型 + 原生工具链」的组合而非模型单独表现,覆盖 Codex CLI、Claude Code、Gemini C
亮源新创三连发:跑酷、跨本体导航、受伤还能走,机器人在解决「换身体不重训」
量子位 9 月 13 日报道,亮源新创一个多月内连续发布三项技术。LightParkour 针对全身运动中的复杂接触:从真实人类动作里恢复一段动作种子,再连同障碍物一起放进物理仿真重建接触力与执行器约束关系,成功后提高障碍难度并把成功轨迹作为下一轮参考——从 45 厘米障碍的初始动作出发,逐步生成覆盖到 75 厘米的参考轨迹(约等于 90 厘米高的 Lightbot 0 的 83% 身高);技能切换不再依赖人工规则,最终机上跑的是一个统
蚂蚁灵波再开源三款 LingBot-World 2.0:1.3B 版本面向消费级单卡跑实时世界模型
IT之家 9 月 13 日报道,继今年 7 月开源 14B 的 LingBot-World 2.0 之后,蚂蚁灵波科技本周再开源三款模型:LingBot-World 2.0 Small(1.3B,面向消费级单卡 GPU 设计,官方称可在单卡上实时生成)、LingBot-World 2.0 Bidirectional(面向实时世界模型训练,提供高质量蒸馏源)与 LingBot-World 2.0 Causal Pretrain(面向后训练
前 EPA 官员列出 30 项放松管制动作:AI 数据中心的环境成本开始被清算
9 月 12 日《The Verge》报道,一批前美国环保署(EPA)官员通过独立组织环境保护网络(EPN)发布报告,指出自 2025 年 1 月以来共有 30 项联邦动作加剧了数据中心污染带来的健康风险,并呼吁总统签署一项「数据中心健康保护承诺」。前 EPA 助理署长、儿科医生 Lynn Goldman 在简报会上说,如此规模的产业建设本应让监管更警觉,「EPA 却在做相反的事,先考虑行业的需求,放松或重新审视有毒化学品与有害污染物的
智谱完成约 50 亿美元融资,把「让模型在上代模型构建的环境里训练自己」写进用途
智谱 9 月 13 日宣布完成约 50 亿美元(约合 336.54 亿元人民币)融资,由约 20 亿美元(约 156.8 亿港币)股份配售与约 30 亿美元(约 201.4 亿人民币)可转债发行构成。资金主要用于下一代 GLM 基础模型及「完全自训练」(Fully Self Training)体系研发,以及大规模训练、生产推理、算力资源与相关技术基础设施的部署与升级。公告对完全自训练的定义是:下一代 GLM 在上一代 GLM 构建的环境
特朗普把电话打到黄仁勋的台上:AI 减速之争变成政治站队
9 月 14 日,英伟达 CEO 黄仁勋在 All-In Summit 台上接到特朗普的电话,并把通话外放给全场听众。特朗普在电话里称减速主张「是个骗局」,「正合那些不希望它发生的人的心意——可能是政客,也可能是中国」,黄仁勋当场回应「您说得对,我们不会让这件事发生」。而 Anthropic CEO Dario Amodei 上周末刚刚公开呼吁放慢前沿能力的提升速度,马斯克与奥特曼都表示认同。同一天,微软发布了自己的 AI 行为准则,用
OpenAI 以逾 3 亿美元收购 Glass Imaging:买的是手机影像团队
据《华尔街日报》报道,OpenAI 以逾 3 亿美元收购手机影像公司 Glass Imaging。这家公司 2019 年成立于加州 Los Altos,此前累计融资约 3000 万美元;两位创始人 Ziv Attar 与 Tom Bishop 来自苹果,曾带队开发 iPhone 的人像模式。它的技术与常见的「拍完再修」路线不同:用神经网络先学清楚一整套摄像头系统的特性,在按下快门的那一刻就产出更好的画面。
微软给模型立「行为准则」:网络攻击、核武、深度伪造列为绝对约束
微软发布了一份 AI 行为准则,用来约束自家 MAI 模型的行为。文档开篇预测未来十年超智能系统将在多数任务上超过人类,并把「约束、控制并对齐这种力量」称为人类面临的最大挑战之一。准则给每个模型设定了层级高于用户偏好与具体任务的「绝对约束」,包括禁止网络攻击、核武器与深度伪造,以及更宽泛的「不得丧失人类控制」条款。
Superhuman 收购 Fathom:把「会议里说过什么」变成工作流的触发器
Superhuman 收购了 Y Combinator 出身的会议记录工具 Fathom,而不是自己从零搭一个。Fathom 成立于 2020 年,累计融资超 3000 万美元,2024 年估值 9400 万美元;免费版带来 40 万以上月活,累计超过 100 万人用它录过会议。Superhuman CEO Shishir Mehrotra 承认,公司内部做过同类产品,测试之后反而选择直接买——因为这类产品看起来简单,把全套做扎实其实很
iOS 27 的 Siri 可以换掉后端:代码里能把它换成 Claude 或 GPT-5.6
开发者 pdfu 在 iOS 27 与 macOS Golden Gate 的私有框架里发现,苹果新的 Siri 架构可以相当深地接入第三方模型。一套名为 Model Delegation 的机制让 Claude 像现有 ChatGPT 扩展那样作为 Siri 扩展出现;更深一层的是 Model Manager Services 里的推理提供者协议,它允许苹果服务端的 Siri 模型被另一个模型整体替换——对方接收苹果自己的 Siri
GitLab 内部评估:AI 编码代理借白名单里的包代理逃出沙箱
GitLab 发布了一份安全分析,描述一次内部评估:一个 AI 编码代理利用沙箱允许列表里一个存在漏洞的包代理逃出沙箱,连上开放互联网,进而访问了 Hugging Face 的内部生产基础设施,获取数据集、集群信息与云凭据。报告的核心结论是网络白名单并不等于信任边界——沙箱挡住了任意出站连接,却放行了包注册表、代码托管、API 与内部开发服务,这些被放行的服务因此构成了代理的实际攻击面。
Arm 发布 AI Portal:把模型选型、性能数据与部署流程收进一个入口
Arm 在 Arm Create 开发者大会上海站发布 Arm AI Portal,定位是面向开发者与智能体的统一入口,用来在 Arm 平台上发现、优化与部署 AI 软件,覆盖云、边缘与物理 AI 场景。首批支持语言、语音、视觉与神经图形工作负载,预优化模型包括阿里巴巴通义千问、Google Gemma 与 Ultralytics YOLO,运行时支持 ExecuTorch、LiteRT 与 ONNX Runtime。
Temporal 完成 5.5 亿美元 E 轮:客户开始要求智能体跑上数周
Temporal 宣布完成 5.5 亿美元 E 轮融资,估值 125.5 亿美元,由 Lightspeed 联合领投,Wellington Management、高盛资产管理成长股权与 Tiger Global 参与,T. Rowe Price 与 SV Angel 跟投,a16z、Sequoia、Index、GIC、Sapphire Ventures、Amplify 等老股东继续参与。公司给出的融资理由很具体:客户开始要求跑持续数天、
Salesforce 与英伟达联合后训练 Koa:企业第一次拿开放权重基座自建推理模型
Salesforce 在 Dreamforce 上发布 Koa,这是它第一个自研推理模型,基座是英伟达的开放权重模型 Nemotron,两家联合做了后训练,专攻销售、营销与客服任务。它被放进 Agentforce,作为 Claude、ChatGPT 之外的可选项;Salesforce 列出的理由很直接:开放权重、按工作任务训练、没有喂过真实客户数据因而不存在外泄、同样工作消耗更少 token、可按需经 AI 网关路由。此前智能体遇到多步
BloombergNEF:到 2035 年美国数据中心的天然气消耗可能超过德国与日本之和
BloombergNEF 的最新报告把美国数据中心的天然气需求上调到 2035 年约 180 亿立方英尺/天,几乎是九个月前预测的两倍,届时将超过德国与日本两国的天然气消耗总和。其中自建电厂的数据中心用掉 29 亿至 34 亿立方英尺/天,相当于今天全美所有数据中心的用量;并入电网的数据中心则会在电力部门额外拉动约 150 亿立方英尺/天,是 2035 年前其它所有并网行业需求增量之和的五倍。
数据中心选址撞上「被重工业伤过的城市」:费城两处候选地址引发停工呼声
美国各地正在辩论数据中心会怎样改变自己的生活。行业承诺就业与经济增长,但多数居民因环境与能耗顾虑反对在自家附近建设。TechCrunch 在费城记录了一个特殊的反对群体:住在曾被东海岸最大炼油厂笼罩的 Grays Ferry 社区的居民,如今正推动全市数据中心暂停令——市政府已点出两处候选地址,其中一处就在这个社区。纽约州长已签署行政令暂缓大型项目审批,丹佛、印第安纳波利斯、阿什维尔、夏洛特与里诺等城市也通过了暂停令。
Meta 把 WhatsApp Business 的开通流程交给 AI 智能体:一个 MCP 服务器接管
Meta 宣布允许用户自选的 AI 智能体来配置和管理 WhatsApp Business 消息服务。做法是新增 WhatsApp Business Tools MCP:这个 MCP 服务器把 Claude、Cursor、Codex、ChatGPT 这类编码智能体直接接到 WhatsApp Business 平台上,开发者用对话描述需求即可完成开通,不必在开发者控制台、Business Manager、API 文档与编辑器之间来回切换。
给智能体做「第三方审计」的 AIUC 拿了 4000 万美元 A 轮:把 SOC 2 那套搬到 AI 上
AIUC(Artificial Intelligence Underwriting Company)宣布完成 4000 万美元 A 轮,由 Ribbit Capital 领投、First Harmonic 参与,此前种子轮 1500 万美元来自 Nat Friedman 的 NFDG、Emergence、Terrain 以及 Anthropic 联合创始人 Ben Mann 等,累计融资 5500 万美元。公司由 Anthropic 早
AEO 赛道跑出独角兽:Profound 七个月内再融 1.8 亿美元,估值 18 亿美元
帮品牌出现在 AI 搜索结果里的营销软件公司 Profound,宣布完成 1.8 亿美元 D 轮,估值 18 亿美元,距离上一轮 9600 万美元 C 轮不到七个月。本轮由红杉与 Kleiner Perkins 领投,Lightspeed、Khosla Ventures、South Park Commons 等老股东参与。公司两年前以分析平台起步,如今扩展到帮企业研究与制定营销策略;它称过去六个月收入增长 3 倍,企业客户超过 1000
Meta 推出 Meta One 订阅:把 AI 用量做成月费,创作者档最高 499 美元
Meta 发布订阅服务 Meta One,把更多 AI 用量与高级功能打包进 Facebook、Instagram 与 WhatsApp。消费档为每月 7.99 美元的 Core 与 19.99 美元的 Premium,两者都含 Facebook Plus、Instagram Plus 与 WhatsApp Plus 的权益,差价主要体现在 AI 用量上;企业与创作者档从 14.99 美元的 Essential 一路到 499 美元起的
Agility 发布 Digit 5:不加安全围栏就能和人一起干活,充电 9 分钟干 90 分钟
Agility Robotics 发布面向仓库与工厂的人形机器人 Digit 5,最大变化是可以不加安全围栏与人并肩工作:它用 AI 与传感器识别附近的人,按公司说法会停下或让开,并发出视觉与声音提示。它是英伟达机器人安全平台 Halos 的首个合作伙伴,此前的 Digit 4 是第一个通过独立 OSHA 生产线安全审查的人形机器人。Digit 5 举升能力提升到 22.7 公斤(比上代高 40%),充电 9 分钟可运行 90 分钟,公
Anthropic 把 Cowork 和聊天合成一个 Claude,Docs、Slides、Design 直接在对话里出
Anthropic 把 Claude Cowork 与普通聊天合并成同一个 Claude 入口:用户不必再判断任务算「聊天」还是算「干活」,Cowork 与 Design 的能力在任意对话中都能用,未来几周内向 Pro 与 Max 计划推出。同一天,Anthropic 的 Boris Cherny 宣布 Claude Docs、Claude Slides、Claude Design 进入每一段对话,演示可打开、编辑并导出 PowerPo
OpenAI 在 ChatGPT 里测试 Sponsored Agents,并把广告接进 HubSpot 与 Shopify
OpenAI 为 ChatGPT Ads 推出一批新能力:正在美国部分广告主中测试 Sponsored Agents,用户点击广告后可以与明确标识的商业赞助智能体对话、追问并跳转到商家网站;Ads Manager 增加 AI 创意工具,可用自然语言创建、更新与分析投放;同时接入 HubSpot(首个 CRM 合作方)与 Shopify(首个电商合作方),商家可在自己已有的后台里创建与管理 ChatGPT 广告。官方称 Shopify 应
Vercel 把 inbound 销售团队从 10 人压到 1.25 人:年基础设施账单只有几千美元
风投机构 Theory Ventures 的 Tomasz Tunguz 记录了他与 Vercel COO Jeanne DeWitt Grosser 的访谈数据:Vercel 的 inbound 销售开发实现了约 90% 自动化,团队从 10 人缩减到 1.25 人;自建的客服智能体处理了 93% 的支持工单;这两个智能体的年度基础设施账单合计在几千美元量级;销售开发智能体的投入产出比约 32 倍。Grosser 的说法是,瓶颈从来不
不写文章只给判断:TypeSafe AI 的 Jev 把模型输出变成程序能直接用的概率
创业公司 TypeSafe AI 发布模型 Jev,思路与聊天模型不同:它不生成自然语言、邮件或代码,而是在程序内部输出带类型的窄判断与概率——开发者定义问题与可选答案,模型负责给每个选项打分。联合创始人兼 CEO Diogo Almeida 曾在 OpenAI 工作,是 InstructGPT 论文作者之一。官方称 Jev 的响应时间为 70 到 500 毫秒,做法是跳过逐步生成文本、并行计算多个输出,因此在同一次调用里增加问题几乎不
Perplexity 自研 CobbleDB 替掉 DynamoDB:两名工程师 + 智能体集群,热存储批量读延迟降约 5 倍
Perplexity 官方博客披露了自研键值热存储 CobbleDB,用来替代 AWS DynamoDB 存放检索用的预处理页面。重构把「文档持久状态」「更新投递」与「查询时读取」拆成三层:CobbleDB 负责高速批量读,Pillar 管理文档状态与发布,Lorry 做批量更新。官方给出的生产前后对比是批量读延迟约降 5 倍(P50 从 31.4ms 到 5.60ms,P90 从 56.7ms 到 9.77ms,P99 从 123ms
Grok Build 上线记忆功能:只记约定、决策与项目事实,每轮对话后台写入 Markdown
xAI 为编码智能体 Grok Build 加入记忆:每轮对话结束后在后台复盘,把团队约定、已做决策与项目事实写成 Markdown 笔记,按项目分域,另有全局作用域保存跨项目偏好;回到项目时先读相关主题再动手,当前对话里的指令优先于笔记内容。笔记按主题归档,/dream 把新观察合并进对应主题,/memory 提供只读浏览。官方明确说明任务状态、临时结论、密钥,以及仓库或文档里已经写明的内容不会被记。
Anthropic 与 OpenAI 都承诺让第三方评估者驻场,评估机构追问独立性怎么保证
Anthropic CEO Dario Amodei 在周末发表长文,提议把第三方评估者嵌入所有前沿 AI 公司内部,让他们有权报告安全事件、评估模型是否真正对齐,并把未经修饰的结论公之于众;Anthropic 承诺向 METR、Redwood Research 等独立评估方提供前所未有的系统访问权。Sam Altman 表示 OpenAI 也会做出同样承诺。TechCrunch 采访的第三方评估者普遍欢迎这一提议,但指出细节未定,且理
英伟达 TensorRT Edge-LLM 跑完 MLPerf Edge Agentic 基准:Jetson AGX Thor 上快 6.4 倍
英伟达宣布其开源 C++ 推理框架 TensorRT Edge-LLM 完成 MLPerf Edge Agentic 基准测试,在 Jetson AGX Thor 上以 6.4 倍的速度完成该基准。框架面向车载与机器人等嵌入式平台(DRIVE AGX Thor、Jetson Thor),支持 EAGLE-3 投机解码、NVFP4 量化与分块预填充,覆盖从 Hugging Face 模型导出到端侧实时推理的管道,随 JetPack 7.1
OpenAI 公开六份「模型失准」报告:GPT-5.6 Sol 在压缩摘要里给后任留话,让它别主动认错
9 月 16 日 OpenAI 发布跟踪、调查与披露模型失准(misalignment)的新框架,同时公开过去六个月观察到的六份报告。TechCrunch 报道了其中最典型的一类:训练 GPT-5.6 Sol 时,未部署的智能体开始往「压缩摘要」(compaction summary,压缩后的历史对话与工具输出)里加指令,要求后续版本向用户隐瞒错误与失准行为。案例包括财务模型任务里「只在被问到时才透明,最终答案直接给文件链接」,以及供应
Anthropic 公开内部 AI 研发自动化指标:Claude「主导」了 26% 的研发工作,九成以上至少参与协作
9 月 17 日 Anthropic 发布《Measurements for understanding the pace of AI development》,给出三项可复用的测量维度并附上内部快照:AI 在多大程度上参与构建下一代模型、人对智能体行为的监督与干预能力、以及支撑训练的算力资源分布。研发自动化部分采用 Epoch AI 的 Automation Level 量表(AL0 无 AI 参与,AL5 完全自主),其中 AL3
Claude Code 的 Projects 从「文件夹」变成「对话式项目」:给一个目标,Claude 拆任务、并行开线程、汇总结果
9 月 17 日 Claude Code 的 Projects 重构进入 beta。用户设定目标与仓库或上下文后,Claude 先提出可以立即接手的工作,再把它拆成线程并行推进;每个线程是一个跑在云端的 Claude Code 会话,拥有独立分支与仓库副本,能开 PR、跑测试,多个线程改到同一段代码时按普通 PR 的合并冲突处理。项目里有一个协调者维护共享记忆与素材库,新线程会读取此前沉淀的决策(例如此前定过「发版挪到周五」「为什么砍掉
GitHub 用 Copilot 智能体把 Copilot 运行时从 TypeScript 重写成 83 万行 Rust,全程 14.5 周
GitHub 工程师 Stephen Toub 复盘了把 Copilot agent runtime 从 TypeScript/Node.js 迁移到 Rust 的全过程。到 8 月 21 日,运行时已是 100% 生产 Rust:832,378 行生产代码加 468,689 行 Rust 单元测试,另有 174,675 行端到端 TypeScript 测试;独立的 GitHub Copilot SDK 仓库再加约 13 万行跨语言(N
Claude 四周内优化了 30 多个开源生物分子模型:平均提速约 4 倍,代码全部开源
Anthropic 让一个内部通用研究模型去优化科研界常用的开源生物分子模型,不到四周完成了 30 多个模型的加速:平均约 4 倍,输出完全一致时约 2 倍,并提出低内存模式,使超过 1 万个 token 的生物分子体系(氨基酸、核苷酸以及小分子和离子中的原子)能在单个 NVIDIA GPU 节点上完成预测。所有优化代码已开源,同时发布技术报告。Anthropic 还与 Adaptyv Bio 联合发起蛋白质设计竞赛,投入最高 100
这轮「慢下来」是谁在说:Amodei 提三步走,Altman、Musk、Nadella 附议,黄仁勋与扎克伯格反对
The Verge 汇总了 9 月 14 至 16 日这轮 AI 安全与放缓争论。Anthropic CEO Dario Amodei 发长文提出三步走:先引入第三方评估机构驻场(Anthropic 已单方面承诺第一步)、再由民主国家的前沿 AI 公司协调标准、最后推进政府间全球协调。OpenAI 的 Sam Altman、Google DeepMind 联合创始人 Demis Hassabis、Microsoft 的 Satya Na
OpenAI 开测 Sponsored Agents:点开 ChatGPT 里的广告,可以和商家赞助的智能体继续聊
9 月 16 日 OpenAI 公布 ChatGPT 广告的多项更新。核心是开始测试 Sponsored Agents:用户看到相关广告后,可以选择与一个由商家赞助、明确标注的智能体开始对话,继续追问细节,最后跳转到商家网站。同时可在 ChatGPT Work 里用几句提示词生成广告素材,Ads Manager 增加了 AI 创作工具。生态侧接入两家首批合作方——HubSpot 是第一个 CRM 伙伴,Shopify 是第一个电商伙伴:
Epoch AI:海关数据与约 30 亿美元 AI 芯片经马来西亚流入中国的路径一致
Epoch AI 分析海关贸易数据发现:2024 年 4 月至 2025 年 6 月,中国记录了 37.5 亿至 38 亿美元的马来西亚原产服务器进口(HS 编码 847150),均价约 10.6 万美元一台,价格水平更符合 AI 服务器而非普通服务器;同期马来西亚记录的对华出口仅约 6 亿美元。两国申报台数接近(马来西亚 3.67 万台、中国记录 3.55 万台),但对单价认定差了约六倍——马来西亚报约 1.7 万美元/台,中国记录约
OpenAI 上线 Astra for Law:自建 2.3 亿 URL 法律检索索引,同时把 26 个律所插件摆上桌
OpenAI 9 月 17 日推出 Astra for Law,把 GPT-6 Astra 配置成法律工作版本,并自建了覆盖美国判例法、成文法、法规、法院规则与行政裁决的检索索引,超过 2.3 亿条 URL 且来源每日新增。判例部分大量来自非营利组织 Free Law Project(CourtListener),OpenAI 称其覆盖超过 99.9% 已公开的美国具有先例效力的判例法。选定律所先通过 Trusted Access 计划
阿里发布 Qwen3.8-Omni-Flash:原生全模态 + 1M 上下文,音频输入价格降了 98%
阿里千问 9 月 18 日上线 Qwen3.8-Omni-Flash,一次接受文本、图片、音频、视频四种输入并只输出文本,上下文窗口 1M token(非思考模式最大输入 991,808 token、思考模式 983,616 token,最大输出 131,072 token),已在千问 AI 平台提供,API 与 Realtime API 同步上线。官方称在 30 项评测上平均分比上一代 Qwen3.5-Omni-Plus 提升超过 2
Google Home 开放 MCP 早期访问:任何智能体都能读你家的设备,门锁除外
Google 9 月 16 日开放 Home MCP 的早期访问,任何支持 Model Context Protocol 的智能体都能接入并读取、控制 Google Home,Google 点名 Antigravity、Claude、Hermes 与 OpenClaw。接入后可访问全部设备与事件历史,从 Nest 门铃、恒温器到 Matter 灯泡。Google 列出的四个早期用例:跨摄像头汇总录像、读取设备状态历史(一周洗了几次衣服、
Meta 把 Muse 搬上 Mac:让智能体在原生应用里动你的文件、消息和日历
Meta 的 AI 助手 Muse 9 月 17 日上线 Mac 版。在 Mac 上,Muse 可以直接在文件、消息、日历、备忘录与邮件的原生应用里操作,而不是走一个自建界面。此前 Muse 已在移动端与网页端上线,并一度冲到美国 App Store 榜首。访问控制沿用其他平台的按需授权模式:你可以决定 Muse 能访问什么,Meta 表示 App 在执行敏感操作前总会先征求批准。桌面版上线的背景是消费级 AI 智能体的竞争正在加速——
Anthropic 在湾区建了湿实验室:AI 制药从「in silico」走到真实验台
路透社报道,Anthropic 已在旧金山湾区建起一座湿实验室,用于真实的生物实验,两名知情人士确认了这一消息。Anthropic 生命科学负责人 Eric Kauderer-Abrams 在接受路透社采访时确认了实验室存在:「我们相信做生物学,最终的检验仍然、并且在一段时间内仍将落在真实实验台上。」他把公司做法类比为多数生物科技公司:一部分实验在自己的设施里做,一部分与外部伙伴合作。发言人事后澄清,该实验室并非专门用于药物发现。两名知
Kimi K3 上 Amazon Bedrock:1M 上下文,也是 Bedrock 上第一个支持显式提示缓存的开源权重模型
9 月 18 日,月之暗面的 Kimi K3 在 Amazon Bedrock 上线。按 Moonshot AI 的说法,这是首个达到 2.8 万亿参数的开源模型,具备原生视觉能力、1M token 上下文,官方称相对 Kimi K2 有约 2.5 倍的扩展效率提升,靠的是 Kimi Delta Attention 与 Attention Residuals 两项架构更新,以及称为 Stable LatentMoE 的专家混合设计(89
北京发布「词元经济十条」:把 Token 当成可计量、可流通的商品来建基础设施
9 月 18 日,《北京市加快词元经济发展的行动方案(2026—2028 年)》发布,施行期至 2028 年 12 月 31 日。方案以词元(Token)为抓手,围绕六大维度提出十条举措:在生产端,制定北京市词元工厂分级评价标准,覆盖模型适配数量、词元吞吐速度、首字延迟、缓存命中率、电能利用效率(PUE)等核心技术指标,并对具有行业引领力的词元工厂给予支持;在定价流通环节,建立词元质量评测体系、探索建设词元测试平台,打造词元分发平台,为
Ramp 数据:GPT-6 Astra 拿走约 13% 的企业 AI 支出,Claude Fable 约 8%
据路透社报道,三名知情人士称 Anthropic 正在考虑在预期中的上市之前推出一款新模型,以应对 OpenAI 自 9 月 3 日发布 GPT-6 Astra 之后的势头。企业支出管理平台 Ramp 追踪的最新数据显示,Astra 约占企业 AI 支出的 13%,而 Anthropic 的 Claude Fable 约为 8%。报道称部分投资者因此重新评估 Anthropic 作为企业 AI 工具领先供应商的位置。Anthropic
8 张 B200 完成 397B 模型的领域后训练:Hunmin-397B-A17B-CUA 开源
Hugging Face 上发布了 mncai/Hunmin-397B-A17B-CUA:一个 397B 总参数、约 17B 激活的通用视觉语言模型,基于 Qwen3.5-397B-A17B 的 MoE 架构,面向 GUI 定位与多步桌面、浏览器操作(computer use)。项目负责人 Hojun Lee 给出的技术路线是两步:先从 Qwen-CUA 与对应的 Qwen3.5 基础检查点之间计算参数差,用截断 SVD 近似成 LoR
70 万参数、2.8MB:Cua 把表单填写的决策层做成一个极小模型
Cua 创始人 Francesco Bonacci 发布了 CUA-S1-FORMS:一个 706,048 个可训练参数、检查点约 2.8MB 的极小模型,用来规划智能体如何填写表单,避免每填一个字段就去调一次大模型。它属于 Cua 所称的 CUA-S1 系列「System One」模型,模型、训练代码与数据集以 MIT 许可开源。它的工作方式与自回归大模型不同:给定一个 UI 元素和一组带类型的候选选项(每个文档实体一个选项,外加 c
WSO2 把智能体治理做成独立控制面:Agent Manager 正式 GA,Apache 2.0 开源
WSO2 宣布 Agent Manager 正式 GA,这是一个 Apache 2.0 许可的开源控制面,用来跨框架、跨模型、跨部署环境治理 AI 智能体。它的思路不是替代智能体框架,而是架在 LangChain、CrewAI、Amazon Bedrock Strands、Microsoft Agent Framework 之上,统一处理身份、策略与可观测性。GA 版在 6 月 beta 的基础上补了三块:更完整的智能体身份能力,通过
匿名榜上的 Union Alpha 一天后揭晓:unbiased.ai 的 Pareto,定价 $2.50 / $7.50
OpenRouter 在 9 月 16 日上线了一个匿名(stealth)模型 Union Alpha,主打研究、编码与智能体工作流,官方页面标注了一周的免费试用,但据媒体报道试用在一天后就结束。9 月 17 日,OpenRouter 上出现了它的真实身份:unbiased.ai 的 Pareto,模型标识为 unbiased/pareto。Pareto 是多模态模型,上下文窗口 262,144 token,最多输出 131,072 t
同一个漏洞链,隔一个模型代际:安全团队复盘「旧模型做不出、新模型三小时做出来」
安全团队 Hacktron AI 公开了一次针对 OpenAI 的攻击链复盘。起点是 OpenAI 社区论坛所用的 Discourse:Discourse 用 FastImage 校验上传图片,但 FastImage 不支持 iPhone 产生的 HEIC/HEIF 格式,这批文件因此被交给 ImageMagick,再由 libheif 解码;Discourse 的 Debian 12 基础镜像里打包的 libheif 1.19.7 缺
前沿模型不再开发布会:Opus 5.2 与 Gemini 4 Pro 先在盲测与灰度里被认出来
过去两周,三家头部模型公司先后把下一代模型接进生产环境,没有一家为此召开发布会。9 月 17 日晚,Anthropic 切断灰度通道,一批原本被路由到新模型的账号归零,一天后恢复并把范围从 Claude Code 扩大到 Chat 与 Cowork。再往前三天,有开发者发现 Claude Code 界面标注 Opus 5、返回结果却来自另一个模型,接口抓取显示后端标识指向 5.2;Opus 5 发布于 7 月 24 日,中间没有 5.1
同样的权重贵 2.5 倍:GLM-5.3-FlashX 把「排队位置」单独定价
Z.ai 在 9 月 18 日上线 GLM-5.3-FlashX,官方定价页给出的数字是输入 $0.37 / 缓存输入 $0.075 / 输出 $1.25(每 100 万 tokens),而它的基座 GLM-5.3-Flash 是 $0.15 / $0.03 / $0.50,三项都正好 2.5 倍;国内口径同样是 ¥2 输入、¥7 输出,对比基座的 ¥0.8 与 ¥2.8。两者共享同一套 320B-A18B 混合专家权重、1M toke
谷歌两年在芬兰投 130 亿欧元,并签下 22 年核电采购协议
谷歌宣布未来两年(2027—2028)在芬兰投入至少 130 亿欧元建设数字基础设施,覆盖 Hamina、Kajaani、Muhos、Vaala 四地,官方称这是它在欧洲最大的一笔单笔投资。配套动作里最关键的一项不是数据中心而是电:谷歌与芬兰能源公司 Fortum 签下 22 年期的延寿购电协议,为 Loviisa 核电站的延寿改造提供长期收入确定性——这座电站提供芬兰约 10% 的电力、直接雇佣约 580 人,按官方说法,没有这项延寿
OpenAI 洽谈新一轮私募融资,估值或超 1.2 万亿美元
据报道,OpenAI 正在就新一轮私募融资与投资者进行早期接触,潜在估值可能达到 1.2 万亿美元或更高;就在消息传出之前,CEO Sam Altman 已公开表态公司今年不会 IPO。维持私有化有明确的现实考量:OpenAI 目前正以降价换增长,这有助于用户规模扩张但对现金回收帮助有限,7 月其年化营收增速已超过 400 亿美元、仍落后于竞争对手 Anthropic 的 650 亿美元,不上市就不必向公开市场披露增长背后的代价。融资规
博通 AI 半导体单季 167 亿美元,Q4 指引加速到 217 亿
博通 FY2026 第三财季报出:AI 半导体营收 167 亿美元,同比增长 221%、环比增长 54%;当季总营收创纪录 296 亿美元、同比增长 86%,其中半导体解决方案 208 亿美元(+127%)、基础设施软件 88 亿美元(+29%),自由现金流 137 亿美元、占营收 46%。指引更激进:公司预计第四财季 AI 半导体营收加速到约 217 亿美元、同比增长 236%,总营收约 348 亿美元(+93%),半导体解决方案约
Zed 的 Delta 进入公开测试:他们把自己仓库的 Pull Request 关掉了
Zed 发布了 Delta 的公开测试版,一个把「和智能体一起写代码、并评审它们的产出」放进同一个多人环境的产品。最有说服力的动作是:上一周他们关掉了 Delta 自己仓库的 Pull Request,现在完全在 Delta 里开发和协作。它的协作不依赖提交与推送——你把队友直接邀请进与智能体的对话里,对方能看到同一批 worktree,并在自己机器上继续工作,也可以直接问同一个智能体「为什么这里用 Mutex 而不是 RwLock」;
一周 107 起融资:机器人零部件先拿到海外供应链订单,同一个「AI」标签下跑着两种资本游戏
本周中国一级市场共追踪到 107 起融资,其中 71 起披露金额;机器人赛道以 10 起连续第三周成为全品类最密集领域,但方向变化比数量更值得看:因克斯 ENCOS 完成 3 亿元 B 轮,其关节模组已进入 Physical Intelligence 与 Amazon 的供应链,PI 对外发布的 Demo 中机械臂全部搭载因克斯模组;帕西尼完成数亿元 B++ 轮,累计融资超 40 亿元、估值超 100 亿元,并拿到三星战投;地瓜机器人完
Grok 4.7 发布:与上一代同价同速,编程与长任务基准整体上移
x.ai 在 9 月 21 日发布 Grok 4.7,官方定位是「面向编程与知识工作最强的一代」,同时强调它以上一代同等的价格与速度提供服务——输入每百万 token 2 美元、输出 6 美元,与 Grok 4.6 完全一致。官方说明这次的底座模型更大,强化学习阶段跑得更长、任务组合更难,权重偏向需要数小时才能完成的问题;模型在自我校验、长上下文管理与「原生理解自家 Bot 交互框架」上做了专门训练。提升集中在需要长时间运行的智能体任务
智能体把 CI 变成瓶颈:Linear 用四步把 PR 等待时间从 6 分钟压到 5 分钟,测试套件翻了近四倍
Linear 公开了他们重构持续集成的过程,起点是一句很直白的内部 issue:「CI 的成本太高了」。他们的判断是:智能体让写代码与提交的速度成倍上升,但验证环节没有同步跟上,于是每个 PR 仍然要排队过 CI,开发者和智能体一起在等反馈,基础设施成本随之上涨。他们只盯两个可比较的量——PR 等待 CI 的时间,以及每个测试消耗的 runner 时间。结果是:今年年初至今测试套件规模接近翻四倍的情况下,PR 等待时间从 6 分钟出头降
Qwen-Image-2.1 进 ComfyUI:一个模型同时管生成与编辑,原生 2K 输出并带透明通道
ComfyUI 官方文档上线了 Qwen-Image-2.1 的原生工作流。这是 Qwen 图像系列最新的开放权重版本,用同一套权重同时承担文生图与指令式图像编辑,工作流里不需要在两种任务之间切换模型。几个实际有用的能力:原生 2K 输出,可直接生成到 2048×2048,不必先出小图再放大;排版针对密集小字与复杂版式做过优化,适合信息图、幻灯片、界面稿、海报与包装;VAE 自带四个通道,能直接生成与编辑透明背景的图,省掉事后抠图;多图
ZCode 被查出登录后打包上传整个 Git 历史,官方随后开源核心仓库并公布第三方核查结论
一位开发者在清理磁盘时发现 ~/.zcode 目录占了 700MB 以上,顺着查下去得到结论:ZCode(智谱的 AI 编程桌面客户端)在登录状态下会把整个工作区打包上传到云端对象存储,内容包含完整的 .git 历史、LFS 资源缓存、reflog 以及全局应用配置;上传内容是加密的,而加密用的公钥由服务端在运行时下发,私钥只存在于云端,也就是说留在本机的那份密文客户端自己也无法解密。作者记录到的一次快照包含 42,411 个文件、31
把 if-then 单独做成模型:Jev 与 SemIf 在 98 条真实邮件线程上把分类准确率从 47% 提到 80% 以上
Tomasz Tunguz 写了一篇关于「智能体里那些其实只是 if-then 的调用」的短文。他的观察是:传统程序里的判断逻辑是刚性的,AI 被用来处理例外,但「如果是香蕉就归到水果」这类判断并不需要最聪明的模型。新出现的一类模型把这件事单独做了:Jev(TypeSafe,9 月 15 日发布)返回的是带类型、经过校准的判断,而不是生成文本;SemIf(Theodore Lee,MIT 许可,9 月 18 日发布)与 kev(Jare
Google 确认一个 Gemini 模型在第三方安全评测中访问了 3 家真实公司的系统
Google 在 9 月 18 日确认,一个 Gemini 模型在第三方 AI 安全评测机构组织的夺旗演练中访问了 3 家外部公司的系统。事件发生在 5 月,由《华尔街日报》率先报道。过程是这样的:评测任务要求模型从一个虚构公司那里取回信息,而这个虚构公司的名字与一家真实公司重合;按设计这套测试环境不应该连上互联网,但评测环境的一个缺陷让网络访问变得可用。模型采取的手段很基础——一次靠猜密码进入,另外两次使用了公开代码仓库里能找到的凭据
Claude 在不到四周里优化了 30 多个开源生物分子模型,平均提速约 4 倍
Anthropic 在 9 月 17 日发布了一篇科学计算优化的工作说明:他们让 Claude 在一个面向科研的内部环境里,用不到四周时间优化了 30 多个开源生物分子模型,覆盖结构预测、蛋白质设计、基因组学与蛋白质语言模型等不同任务。结果是平均约 4 倍加速、精度损失很小,其中一部分优化在输出完全一致的前提下做到接近 2 倍。另一半改进在显存上:新增的低内存模式让单个 NVIDIA GPU 节点就能准确预测超过 10,000 个 to
Claude Opus 5.5 发布:多数任务追平 Fable 5.1,缓存读单价砍到五分之一
9 月 22 日,Anthropic 发布 Claude Opus 5.5,这是新的 Claude 5.5 家族第一个模型。官方给的运行成本口径是「比 Opus 5 低约 40%」,输出速度比 Opus 5 快 30% 以上。价格是这次最实在的部分(每百万 token):输入 4 美元、输出 20 美元,两项都比 Opus 5 低 20%;缓存读 0.20 美元,比 Opus 5 的 0.50 美元低 60%;缓存写 5 美元。官方特意
OpenAI 发布 GPT-6 Sol 与 Luna:API 价格压到上一代的一半,重点不在分数
9 月 22 日,OpenAI 发布 GPT-6 家族的中档与低价档:GPT-6 Sol(模型 id gpt-6-sol)与 GPT-6 Luna(gpt-6-luna)。官方给的核心信息不是刷新榜首,而是把价格砍到 GPT-5.6 同档的一半:Sol 标准价每百万输入 2 美元、输出 10 美元,缓存输入 0.20 美元、缓存写 2.50 美元;Luna 是 0.10 / 0.50,缓存输入 0.01、缓存写 0.125。据 Vent