<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>AI呀（aiya.pw）· 每日 AI 早报</title>
    <link>https://aiya.pw/briefing.html</link>
    <description>每天清晨整理的当日 AI 早报：重大新闻、新工具与论文速读。</description>
    <language>zh-CN</language>
    <atom:link href="https://aiya.pw/rss/briefing.xml" rel="self" type="application/rss+xml" />
    <image>
      <url>https://aiya.pw/icons/icon.jpg</url>
      <title>AI呀（aiya.pw）</title>
      <link>https://aiya.pw</link>
    </image>
    <category>AI</category>
    <ttl>180</ttl>
    <lastBuildDate>Wed, 30 Sep 2026 22:21:21 GMT</lastBuildDate>
    <item>
      <title>[早报 2026-10-01] Google 发布 Gemini 4 Argon：18 项基准里 12 项第一，但先只交给受信任的网络安全防守方</title>
      <link>https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/</link>
      <description>9 月 30 日 Google 发布新一代前沿模型 Gemini 4 Argon，官方定位是长程复杂流程——真实软件工程、法律与金融这类企业知识工作、以及网络安全防御。在 Google 自己列出的 18 项基准里，Argon 12 项独占第一、1 项并列第一；对照的 GPT-6 Astra 独占 3 项、Claude Opus 5.5 独占 2 项。领先幅度最大的几项都落在企业场景：Harvey 法律 Agent 基准 19.6%（Astra 5.4%、Opus 5.5 3.8%）、Zapier 的 AutomationBench 51.3%（42.5% / 41.4%）、长上下文图遍历 GraphWalks 84.2%（71.8% / 66.8%）、Vals 金融 Agent v2 65.4%（58.6% / 53.5%）、长程软件工程 DeepSWE v1.1 77.9%（74.2% / 74.1%）、长视频理解 LVBench 91.7%（87.5% / 83.7%）；漏洞修复 CWE-bench v1 与 Astra 并列 68%。它也有明确短板：FrontierSWE v2 与 Terminal-Bench Science 0.1 都落后 Astra 10.5 个百分点，Terminal-bench 4.0 落后 Opus 5.5 约 9 个百分点。规格上官方把单次输出上限从 64K 提到 100 万 token，入门价 $2 / $10（每百万输入 / 输出 token），缓存命中输入按输入价打 95% 折扣（即 $0.10）。发行方式更值得注意：Argon 现在只通过 Fairwind 计划开放给一批受信任的网络安全防守方，同时参与美国政府的预发布模型访问流程，之后才逐步开放给开发者、企业和消费者。Google 同时公开了内部用法——用 Argon agent 把 C/C++ 代码库迁到 Rust（含 80 万行以上的 Fuchsia Zircon 内核）、给数据中心省出 300 TiB 内存，以及把 libgav1 的 3.2 万行 SIMD 代码重写成安全 Rust 后跑快 2.7 倍。 — 早报结论：这次真正的新信息不是分数，而是发行方式——最强的一版先发给防守方，而不是所有人；前沿模型正在从「发布」变成「分圈层放行」。影响谁：把「等新模型上线就切过去」写进排期的产品团队，以及要判断自家 agent 权限边界的工程与安全团队。可行动的一步：把 Argon 放进观察名单而不是路线图——排行榜领先不等于明天能用，先按现有模型把成本和评测口径做扎实，同时借鉴 Google 公开的内部用法，检查自己的 agent 有没有「可自动验证的产出」这一步。下一步该盯的是 Fairwind 的准入条件与正式定价，那才是它进入你采购清单的时间依据。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">aiya-briefing-2026-10-01-0</guid>
    </item>
    <item>
      <title>[早报 2026-10-01] Manus 2.0 与 Cue：给每个 Agent 配独立邮箱、手机号和钱包，再拉进同一个群</title>
      <link>https://manus.im/</link>
      <description>9 月 30 日 Manus 发布恢复独立运营后的第一个大版本 Manus 2.0，同时上线新的个人 Agent 应用 Cue。Cue 与 Manus 共用底层基础设施，面向手机与桌面；里面的每个 Agent 都有独立身份——自己的邮箱、电话号码、钱包和一台电脑，因此可以对外发消息、在用户设定的预算内付款、在自己的机器上执行任务，还能代接电话并留下通话摘要。多个 Agent 可以按不同职责拉进同一个群聊协作，官方给的例子是筹备一场发布会：一个找场地、一个整理候选名单、一个起草演示稿，用户负责定方向和最后拍板。桌面端则升级为 Manus Studio，在文档、表格、PDF、幻灯片之外加了视频剪辑与做游戏，AI 产出之后人可以随时接手修改。Cue 目前是邀请制抢先体验，先面向海外，Manus 同时表示面向国内市场的产品在筹备中。发布的时间点也值得注意：这距离曾经的收购方 Meta 的个人 Agent Muse 登顶美国 App Store 免费榜大约 10 天。 — 早报结论：Agent 产品的竞争焦点正在从「模型多聪明」转到「有没有身份和支付能力」——能对外发消息、能付钱、有自己的一台机器，才谈得上替你办事。影响谁：做个人助手与自动化 agent 的团队，以及要给 agent 发凭证的企业安全团队。可行动的一步：如果手上已经有 agent 在跑，先把它能做的事收成三件——能联系谁（白名单）、能花多少钱（硬预算上限）、哪一步必须人工确认；把「给 agent 一个邮箱和一个钱包」当成一次授权设计，而不是一个功能开关。下一步该看的是这类 agent 身份由谁签发、怎么吊销，以及平台之间会不会形成统一的身份与支付协议。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">aiya-briefing-2026-10-01-1</guid>
    </item>
    <item>
      <title>[早报 2026-10-01] 把「下一步做什么」变成一道显式推理：给长任务 Agent 加一个控制器，程序重建从 58.0 涨到 71.5</title>
      <link>https://arxiv.org/abs/2609.38147</link>
      <description>arXiv 2609.38147《Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning》研究的是 agent 跑长任务时一个常被交给模型直觉的环节：这一步该基于哪部分已有工作继续、要不要推倒重来、什么时候停。作者的解法是把它拆成显式结构：worker 做任务级计算，controller 负责整理这一轮已经确立了哪些结论、枚举下一步候选、按剩余预算评估每个候选值不值，再把选中的工作连同从持久记忆取来的上下文派发出去；两次决策之间 controller 只带一份紧凑的运行记录，不重放完整历史。对照基线包括生产级编码 agent，以及同 worker、同预算额度的 Direct Control Agent。在考验长程能力的程序重建基准 ProgramBench 上，配 GPT-5.5 时它拿到 71.5%、Codex 58.0%；配 Opus 4.8 时 67.2%、Claude Code 65.5%。在抽象推理、多领域长程推理与证明生成等基准上，跨三个前沿模型平均比直接控制高 3.6 到 4.2 分，并且在直接控制已经饱和的预算区间还在往上走；预算很小时，控制层自身的开销反而会拖累成绩。 — 早报结论：长任务的瓶颈可能不在「模型会不会做」，而在「谁来决定下一步做什么」——把这层控制写成显式、可记账的推理，比再多堆一点算力更值。影响谁：在做编码 agent、深度研究 agent，以及任何要跑几十步以上流程的团队。可行动的一步：先给现在的 agent 记一笔账——每一步确定了什么、有哪几个候选、按什么标准选的，看看有多少步在重复或推翻前面；再把「选下一步」单独交给一次结构化决策，worker 只管执行。下一步值得看的是这类控制层的 token 开销能不能压下来：论文自己也承认预算小的时候它是负担，所以真正的问题是「多长的任务才回本」。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">aiya-briefing-2026-10-01-2</guid>
    </item>
  </channel>
</rss>
