早报
资讯
工具
素材
学习
排行
社区
🔍
☽
店铺
登录
☀
AI 早报
每天清晨更新 · 不只报资讯,更给结论 · 3 分钟看懂今天 AI 圈
🕒
加载中…
今日 AI 早报
Google 发布 Gemini 4 Argon:18 项基准里 12 项第一,但先只交给受信任的网络安全防守方
9 月 30 日 Google 发布新一代前沿模型 Gemini 4 Argon,官方定位是长程复杂流程——真实软件工程、法律与金融这类企业知识工作、以及网络安全防御。在 Google 自己列出的 18 项基准里,Argon 12 项独占第一、1 项并列第一;对照的 GPT-6 Astra 独占 3 项、Claude Opus 5.5 独占 2 项。领先幅度最大的几项都落在企业场景:Harvey 法律 Agent 基准 19.6%(As
Manus 2.0 与 Cue:给每个 Agent 配独立邮箱、手机号和钱包,再拉进同一个群
9 月 30 日 Manus 发布恢复独立运营后的第一个大版本 Manus 2.0,同时上线新的个人 Agent 应用 Cue。Cue 与 Manus 共用底层基础设施,面向手机与桌面;里面的每个 Agent 都有独立身份——自己的邮箱、电话号码、钱包和一台电脑,因此可以对外发消息、在用户设定的预算内付款、在自己的机器上执行任务,还能代接电话并留下通话摘要。多个 Agent 可以按不同职责拉进同一个群聊协作,官方给的例子是筹备一场发布会
把「下一步做什么」变成一道显式推理:给长任务 Agent 加一个控制器,程序重建从 58.0 涨到 71.5
arXiv 2609.38147《Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning》研究的是 agent 跑长任务时一个常被交给模型直觉的环节:这一步该基于哪部分已有工作继续、要不要推倒重来、什么时候停。作者的解法是把它拆成显式结构:worker 做任务级计算,controller 负责整理这一轮已经确立了哪些结论、枚举下一步候选、按剩余