<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>AI呀（aiya.pw）· AI 应用实操</title>
    <link>https://aiya.pw/apps.html</link>
    <description>教你怎么动手做的 AI 应用教程：安装、配置、场景实战与踩坑经验。</description>
    <language>zh-CN</language>
    <atom:link href="https://aiya.pw/rss/apps.xml" rel="self" type="application/rss+xml" />
    <image>
      <url>https://aiya.pw/icons/icon.jpg</url>
      <title>AI呀（aiya.pw）</title>
      <link>https://aiya.pw</link>
    </image>
    <category>AI</category>
    <ttl>180</ttl>
    <lastBuildDate>Wed, 30 Sep 2026 22:21:21 GMT</lastBuildDate>
    <item>
      <title>给 agent 的每一步记一份可复核的台账：六个字段、一份事件流、一个回归门禁</title>
      <link>https://aiya.pw/article.html?id=aa90&amp;type=app</link>
      <description>长任务 agent 出问题时的第一反应通常是换更强的模型，但换模型解决不了「不知道它从哪一步开始走偏」。这篇给的是一套轻量的记账办法：把每一步的动作类型、输入摘要、判断依据、成本与可验证性记成一份只能追加的事件流（JSONL，一行一步），再用它回答三个问题——预算花在哪、失败集中在哪类动作、哪些步骤能自动验证；最后把代表性失败案例固化成回归集，改提示词、换模型之前先跑一遍。 — 结论：agent 上生产卡住的往往不是模型不够强，而是出了偏差没人能说清是哪一步、为什么——先把台账和回归做出来，换模型才有意义。影响谁：所有在调长任务 agent、又靠肉眼判断「这次好像好一点」的团队。可行动的一步：今天就把六字段台账接上（步号、动作类型、输入摘要、判断依据、成本、产出与可验证性），跑一天真实任务，然后统计两个比例——「无显式依据」的步骤占比、可自动验证的步骤占比。下一步该看的是自动化程度能不能提上去：如果绝大多数步骤只能靠人看，说明它还不能放出去自己跑，该补的是验证方式而不是模型。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa90&amp;type=app</guid>
    </item>
    <item>
      <title>让 agent 接管你的收件箱：从只读开始，一步步放开权限</title>
      <link>https://aiya.pw/article.html?id=aa91&amp;type=app</link>
      <description>把邮箱交给 agent 是个人 agent 里最容易上手、也最容易出事的一件事：读邮件没什么风险，替你回复和替你做决定完全是另一个量级。这篇给的是一条分阶段放权的路径——先只给读权限并验证理解是否准确，再放开「起草但不发送」，然后是「在既定模板内自动回复」，最后才是有限度的自主处理；同时说清每一步该监控什么、出错时怎么回收，以及为什么凭证要独占而不是跟人类账号共用。 — 结论：个人 agent 的风险几乎全部来自「你能不能收回权限」，而不是「它够不够聪明」——所以收件箱这类场景应该按能力一档一档放开，而不是一次授权到底。影响谁：准备把邮箱、日历、聊天工具交给 agent 的个人用户，以及要给员工配 agent 账号的团队。可行动的一步：第一周只给读权限，让它每天输出「哪些邮件需要你处理、判断依据是什么」，你只需要核对它有没有漏掉和误判；准确率稳定之后才放开起草，并强制所有外发都走人工确认。下一步该看的是凭证能不能单独吊销：如果邮箱和密码是跟你本人共用的，那么无论 agent 表现多好，都不要放开写权限。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa91&amp;type=app</guid>
    </item>
    <item>
      <title>在本机跑一个 744B 的 MoE：SSD、内存与显存各该分多少</title>
      <link>https://aiya.pw/article.html?id=aa88&amp;type=app</link>
      <description>大模型搬回本机，卡点通常不是算力而是内存。这篇用 Colibrì 的分层推理思路，把「哪些权重必须常驻内存、哪些可以留在 SSD 上按需读」这条切分线讲清楚，再给出硬件怎么配的判断顺序：先看预取命中率与各存储层命中比例，再决定花钱的方向。同时说明这套办法的适用边界——它依赖 MoE 的稀疏性，也不适合需要低延迟的线上服务。 — 结论：把大 MoE 搬回本机的关键不是算力，而是「常驻多少、临时读多少」这条切分线——钱应该花在决定下限的内存和决定速度的缓存命中率上。可执行的顺序是先跑一遍看预取命中率与分层命中比例，再决定加内存还是加显卡；如果命中率上不去，说明你的任务在专家分布上太分散，这时换硬件不如换模型。最后接受一个现实：能跑通不等于能用，六七 token/s 只够做验证和批处理，别拿它接线上流量。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa88&amp;type=app</guid>
    </item>
    <item>
      <title>把 agent 的固定步骤写进代码：从提示词到状态机的落地清单</title>
      <link>https://aiya.pw/article.html?id=aa89&amp;type=app</link>
      <description>长流程 agent 最烦的失败方式是不稳定：有时跳过某一步，有时顺序做反，还复现不出来。这篇给出一套可执行的改造顺序——先判断流程属于「步骤固定」还是「需要临场判断」，再从真实执行记录里数出被跳过的步骤，把「该做哪一步」从提示词搬进显式的前置与后置条件，最后用固定回归集回放验证没有回退。 — 结论：把固定步骤写进代码比换更强的模型更划算，前提是先分清哪些步骤该写死、哪些必须留给模型判断——判据是这一步有没有明确的完成条件。落地顺序是：翻执行记录数出被跳过的步骤，补上缺失的前置与后置条件，再用固定回归集回放验证没有回退。最容易忽略的一步是保留历史记录的回归集，没有它你永远分不清是真改好了，还是这次刚好没踩到。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa89&amp;type=app</guid>
    </item>
    <item>
      <title>给个人网站接一个 AI 客服：从知识库整理到上线的完整步骤</title>
      <link>https://aiya.pw/article.html?id=aa82&amp;type=app</link>
      <description>把 AI 客服接进网站，真正的难点不在接接口，而在「让它答得准」。这篇按实际做过一遍的顺序拆开：先整理知识库、再定回答边界、然后处理兜底与转人工，最后才是上线与观察。每一步都附上容易踩的坑。 — 结论：接 AI 客服的顺序应该是资料整理 → 边界定义 → 兜底设计 → 上线观察，而不是反过来。把「答不准时怎么说」设计好，体验的下限就守住了。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa82&amp;type=app</guid>
    </item>
    <item>
      <title>用 AI 做行业研究的实际流程：从三十篇资料到一页结论</title>
      <link>https://aiya.pw/article.html?id=aa83&amp;type=app</link>
      <description>AI 让「读完三十篇资料」变得容易，但容易读完之后仍然写不出一页结论。这篇记录一套实际跑通的流程：怎么定问题、怎么筛资料、怎么让模型对照而不是复述、以及最后怎么把结论压到一页。 — 结论：用 AI 做研究的关键是提问方式——让它对照而不是复述，让它列证据而不是下结论。最后一页的判断，仍然要自己写。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa83&amp;type=app</guid>
    </item>
    <item>
      <title>让模型输出稳定可用的五个写法：结构、示例、边界与自查</title>
      <link>https://aiya.pw/article.html?id=aa84&amp;type=app</link>
      <description>同一个模型，不同人用出来的效果差好几倍，差别基本都在提示词的结构上。这篇收了五个立刻能用、且不依赖特定模型的写法：先给结构、再给示例、说清边界、要求自查、以及把长任务拆成有中间产物的几步。 — 结论：这五个写法的共同点是——把模糊的期望换成可核对的约束。提示词的质量不体现在词藻上，而体现在模型能不能自己判断「做完了没有」。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa84&amp;type=app</guid>
    </item>
    <item>
      <title>在自己电脑上跑开源模型：显存、量化与推理框架怎么选</title>
      <link>https://aiya.pw/article.html?id=aa85&amp;type=app</link>
      <description>本地跑模型的失败大多不是装不上，而是选错了组合：模型太大、量化太低、框架不适配自己的硬件。这篇按「先看显存 → 再定量化 → 最后挑框架」的顺序讲清楚怎么选，并给出几种常见硬件的可行配置思路。 — 结论：本地跑模型的正确顺序是显存 → 模型规模 → 量化档位 → 推理框架。先降规模再降量化，能最大限度保住输出质量。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa85&amp;type=app</guid>
    </item>
    <item>
      <title>AI 处理会议纪要：录音、转写、纪要三段各自的坑</title>
      <link>https://aiya.pw/article.html?id=aa86&amp;type=app</link>
      <description>会议纪要看起来是 AI 最容易替代的活，实际落地时问题集中在三段：录音这一段的合规与拾音、转写这一段的人名与术语、纪要这一段的信息取舍。这篇把三段拆开讲，并给出各自可操作的解决办法。 — 结论：会议纪要落地要把三段分开治——录音守合规与拾音，转写靠术语表与说话人区分，纪要靠固定字段约束。缺了任何一段，最终产出都不可靠。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa86&amp;type=app</guid>
    </item>
    <item>
      <title>给 AI 助手接上自己的工具：MCP 的接入思路与调试方法</title>
      <link>https://aiya.pw/article.html?id=aa87&amp;type=app</link>
      <description>MCP 解决的是「让 AI 用上你手边的工具与数据」这件事。这篇不铺概念，直接讲接入思路：怎么划分工具粒度、参数怎么写模型才用对、权限边界放在哪一层，以及调试时按什么顺序定位问题。 — 结论：MCP 接入的关键不在协议本身，而在工具粒度、参数设计、权限边界与描述清晰度这四件事。调试时先验证工具、再验证描述、最后看编排，效率最高。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa87&amp;type=app</guid>
    </item>
    <item>
      <title>用 video-shots 给一条片子拉片：切点交给 ffmpeg，判断交给模型，15 道门逐条对账</title>
      <link>https://aiya.pw/article.html?id=aa81&amp;type=app</link>
      <description>reelbench-skills 里的 video-shots 是一个装在编码智能体里的拉片技能：把一条成片拆成逐镜头分析表（时长、景别、类别、运镜、画面、节奏），最后产出一份单文件交互报告。它的规矩很硬——镜头边界由 ffmpeg 场景检测量出来、时长由切点相减、每镜的实测运动量来自逐帧差分，模型只负责景别、类别、运镜、画面与节奏这五件事，做完还要过 15 道代码质量门；声称推拉摇移而实测几乎不动会被直接拦下。只依赖 node 与 ffmpeg，零 npm 依赖、零 API key。 — 结论：这个技能值得学的不是拉片本身，而是它把「模型该做什么」划得极窄的那种做法——所有能测量的数字都交给代码，模型只填它真正能判断的字段，而且每条判断都要有代码可对账。如果你的流程里也有「模型报出一个数字，你没法验证」的环节，照这个分工重切一遍通常立竿见影。上手建议：先拿一条 1 到 3 分钟的片子跑完整流程，重点体会两处——联系表先把「哪几个镜头判不准」筛出来，只在这些镜头上回去看单帧；以及 validate 那一步不要跳，它拦下来的多半正是你会漏掉的幻觉。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa81&amp;type=app</guid>
    </item>
    <item>
      <title>Laya 上手：把 agent 里的分类判断换成 33 毫秒的决策模型</title>
      <link>https://aiya.pw/article.html?id=aa79&amp;type=app</link>
      <description>agent 里大量的调用其实在做判断而不是写作——意图路由、工单分类、内容审核、工具选择。Laya 把这一层单独拆出来：输入一个状态（文本、邮件、工单、JSON）加一组带类型的问句（choice / score / noul），单次前向返回带校准概率的答案，不生成任何文本。本文走一遍安装、跑通、阈值设定与自托管的完整路径，并写清它不适合哪些调用。 — 结论：把「判断」从生成式模型里拆出来，收益是延迟与账单两笔同时降，但前提是你接受它的边界——它给答案和概率，不给理由，也不生成文本。落地的正确顺序是：先挑一条流量最大、结果可自动核对的判断链路（工单分类、意图路由、审核放行），用历史样本画出置信度分布选一档能接受误放行率的阈值，再决定是否自托管；不要一上来就替换所有判断类调用，也不要拿它去做需要解释「为什么」的场景。多语言流量为主的团队把 Router 默认检查点改成多语言版即可，别自己写语言判断。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa79&amp;type=app</guid>
    </item>
    <item>
      <title>Ming-Image-0.1-Design 上手：本地部署 6B 设计模型，并把一张成品图拆回图层</title>
      <link>https://aiya.pw/article.html?id=aa80&amp;type=app</link>
      <description>Ming-Image-0.1-Design 系列有两个 6B 模型：Design 从文字生成 UI、信息图、海报这类文字密集的设计稿并支持 RGBA 透明输出；Design-Layer 把扁平设计图拆成可编辑的 RGBA 图层。本文走一遍本地安装与两个任务的完整命令，附官方推荐参数、显存底线与几条容易踩的坑。 — 结论：这套模型真正的分界线是显存——官方验证配置是单张 80GB 显存的卡，消费级显卡想跑就得把分辨率降到 1024 甚至 512，并接受质量回落，所以先量硬件再谈流程改造。落地顺序建议这样：先用 Design 出一版稿子验证是否符合你团队的版式规范，再用 Design-Layer 拿一张真实项目图做拆层，重点看图层数量与合并关系是否达到交付标准，而不是只看生成图好不好看。最后提醒两点——透明背景不是自动的，要在提示词里加官方指定的 RGBA 短语；许可虽然是 MIT，商用前仍要走一遍自己的合规流程。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa80&amp;type=app</guid>
    </item>
    <item>
      <title>把 AI 代码评审接进提交前：OpenCodeReview 的安装、配置与接入实战</title>
      <link>https://aiya.pw/article.html?id=aa77&amp;type=app</link>
      <description>OpenCodeReview 是阿里开源的 AI 代码评审 CLI，思路和多数同类工具不同：能确定性完成的事（选文件、打包上下文、匹配规则、拿评审意见和 diff 校验）走流水线，只有代码分析交给带工具调用能力的 LLM 智能体。它读 git diff，把改动文件交给可配置的模型，产出带行号定位的评审意见，智能体可以读完整文件、检索代码库、查看其它改动文件来补上下文；除 diff 评审外还有 ocr scan 用来整文件扫描存量代码。本文给出安装、配置模型端点、跑第一轮评审、接入 CI 与本地编辑器的完整路径，并说明哪些意见可以进门禁、哪些只该当提醒。 — 结论：把它接进来的正确姿势是「先当提醒、再当门禁」——评审意见只有在同一份 diff 上能稳定复现，才够资格拦住合并；模型调用天然带随机性，把不稳定的意见写进门禁等于给团队装一个噪音源。真正决定收益的不是模型多强，而是规则集：内置规则只覆盖空指针、线程安全、XSS、SQL 注入这类通用缺陷，你把自己的历史故障转成规则才有净收益，这一步必须人工做。还要注意它对内部使用规模（服务数万开发者、发现数百万缺陷）的描述是项目自述，别拿来做收益预估。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa77&amp;type=app</guid>
    </item>
    <item>
      <title>Delta 上手：在没有 Pull Request 的仓库里做一次评审</title>
      <link>https://aiya.pw/article.html?id=aa78&amp;type=app</link>
      <description>Delta 是 Zed 推出的多人协作环境，把「和智能体一起写代码」和「评审它们的产出」放进同一个界面。它的关键取向是：协作不再以提交与推送为边界——你把队友邀请进与智能体的会话，对方看到同一批 worktree，可以在自己机器上继续干活，也能直接问同一个智能体为什么某个实现这么写；评审是带着原始上下文的子线程，每个评审还拿到父线程 worktree 的隔离副本。Zed 把自己仓库的 Pull Request 关掉了，现在完全在 Delta 里协作。本文给出一条低风险的试用路径与需要提前定好的边界。 — 结论：值得先试的是它的评审模型，而不是它的编辑器——当代码主要由智能体产出，评审者缺的是「为什么这么改」的上下文，把大 diff 拆得更碎解决不了这个问题，而把评审挂在原始会话上能解决。给团队的动作是先在一个小仓库上完整跑一遍「修 issue—队友评审—合并」，用结果判断上下文优先的评审是否真的比看 diff 高效，再决定要不要迁移。铺设前必须先定三件事：哪些仓库允许共享会话与工作树、权限怎么划、以及退出路径（它与 Git 兼容，所以随时可以回到 PR 流程）。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa78&amp;type=app</guid>
    </item>
    <item>
      <title>给编码智能体划一条边界：用 Brig 在本机 microVM 里跑 Claude Code 与 Codex</title>
      <link>https://aiya.pw/article.html?id=aa76&amp;type=app</link>
      <description>让编码智能体在本机跑最大的顾虑不是它写得对不对，而是它能碰到什么：你的家目录、钥匙串、SSH agent，还能联网装包。Brig 的思路是把智能体整个放进一个 microVM：一条 brig run claude ~/code/demo 启动沙箱并在其中运行智能体，只有指定的项目目录以读写方式挂进 /work/&lt;name&gt;，沙箱启动时不携带任何凭据，宿主机其它目录、钥匙串与 SSH agent 都不进虚拟机。会话用 &lt;agent&gt; 或 &lt;agent&gt;@&lt;label&gt; 标识，同一智能体的不同会话各有独立沙箱。已内置 Claude Code、Codex、Cursor、Gemini、Grok、opencode 等策展配置，也支持自带 OCI 镜像。本文给出安装、首次运行检查、把项目挂进去以及需要留意的平台限制。 — 结论：这套方案换来的不是更强的模型，而是「出事时损失有上界」——智能体只能改你挂进去的那个项目，拿不到凭据，也够不到家目录。它适合两类人：让智能体在无人看管时跑长任务的人，以及代码或凭据敏感、不希望智能体顺手读点别的东西的人。代价要提前算清：沙箱里的智能体没有你已有的登录态，需要各自完成一次登录；只在 macOS 15+（Apple 芯片）与安装了 nerdctl/containerd/urunc 的 Linux 上可用；每个会话占一份独立的沙箱与凭据，数量多了要做清理。落地建议是先在单个项目上跑一轮完整任务，确认挂载范围与登录流程都符合预期，再考虑扩大使用。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa76&amp;type=app</guid>
    </item>
    <item>
      <title>把用户反馈变成可回滚的模型更新：Reef 接入实战</title>
      <link>https://aiya.pw/article.html?id=aa74&amp;type=app</link>
      <description>Reef 针对的是智能体「持续学习」缺工程载体这件事：模型能从真实交互里学，但训练产物怎么发布、发坏了怎么退、更新时服务断不断，过去都得自己搭。它把「服务请求 → 记录交互 → 匹配反馈 → 产出更新 → 评估候选 → 提交进版本历史」串成一条闭环，并且明确要求切换版本时服务在线。本文按官方文档走一遍接入：装依赖（artifact 与 checkpoint 依赖 git-lfs）、先用纯推理模式把链路跑通、再打开训练配方、用评分接口回传反馈、看候选更新如何被评估与提交，最后对照三种目标（训练权重 / 优化 harness / 测试时训练）各自的前置条件。 — 结论：Reef 值得关注的不是它把训练框架包了一层，而是把「哪一次更新可以被放上线」变成一道有评估器、有选择策略、有版本历史的闸门——持续学习真正的风险从来不是模型学不会，而是它在没人看住的时候学歪了还退不回来。它适合已经有稳定反馈来源（人工评分、自动评测或业务指标）的团队；纯对话类、拿不到可靠反馈信号的产品先别急，进训练批次的数据本身就是噪声。接入顺序建议照文档来：先用纯推理模式跑通服务链路，再开 harness 路线（这一条不需要本地 GPU），最后才考虑权重训练。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa74&amp;type=app</guid>
    </item>
    <item>
      <title>把 27B 模型塞进车机与机器人：TensorRT Edge-LLM 的端侧部署路径</title>
      <link>https://aiya.pw/article.html?id=aa75&amp;type=app</link>
      <description>在服务器上跑大模型有成熟推理栈，把同一个模型放进 Jetson、DRIVE 这类边缘平台却要重新处理算子、显存与量化，多数团队会掉进自己写一次性推理代码的坑。TensorRT Edge-LLM 是英伟达维护的 C++ 端侧推理运行时，覆盖文本、视觉、音频、语音与动作模型。本文说明它近几个版本补上的能力：0.10.1 支持双 DGX Spark 上 TP=2 推理并重写了实验性 OpenAI 兼容 server（冷启动更快、内存更省）；0.10.0 给 Qwen3.8-27B 做了 Day-0，加入 Nemotron-3.5 Lightning（MTP 与 DFlash）、Cosmos3-Edge、DiffusionGemma、流式 ASR 与 DSpark 投机解码，以及不走 ONNX 直接构建引擎的路径、多轮 KV-cache 复用与视频输入；0.9.x 补齐 Gemma 4 全家族与 NVFP4。 — 结论：英伟达把端侧推理做成了有版本节奏的产品线，而不是一次性示例代码，做车机、机器人、边缘盒子的团队可以直接跟着版本走；代价是绑定 TensorRT 与英伟达平台，换芯片等于重做一遍。判断标准不复杂：延迟与内存紧到通用运行时装不下、或者要同时吃视觉与语音输入，这套投入才划算；只是把 3B 以下模型跑在单板机上，没必要为几个性能数字增加维护负担。落地时把「连续运行后的降频」和「量化后的任务级精度」当成必测项，而不是可选项。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa75&amp;type=app</guid>
    </item>
    <item>
      <title>把 AI 编程会话变成自己的数据集：导出、脱敏、编目三步走（ai-data-extractor 实战）</title>
      <link>https://aiya.pw/article.html?id=aa72&amp;type=app</link>
      <description>ai-data-extractor 是把各家 AI 编程助手本地会话统一导出为 JSONL 的工具包，纯标准库、Python 3.9+ 即可运行，覆盖 Claude Code、Codex CLI、Cursor、Windsurf、Trae、Continue、Gemini CLI、OpenCode、Cline / Roo Code 与 Aider 十类客户端。它不只是「备份」：导出的字段含时间戳、会话 ID、项目路径与模型名，能直接用于个人使用分析或微调数据准备。本文给出实际执行顺序——先跑 --list 看清机器上装了哪些工具，再用 --all --merge 全量导出到一个文件，然后做脱敏（密钥、内部域名与 IP、客户名、路径中的用户名）与编目（按项目、时间、任务类型建索引），最后说明留存与访问策略。注意导出物包含你的代码片段与可能出现的凭据，脱敏必须默认全量执行，不要直接丢进共享盘。 — 结论：这套流程的价值不在「拿去微调」，而在于先把数据主权拿回来——客户端清库、存储格式换代、账号被封，历史就没了，而这份记录是唯一能证明你团队在哪些任务上反复返工的材料。建议今天先做一次全量导出，再按本文的脱敏清单过一遍并归档到自己可控的存储；编目时优先建「是否产生返工」这个标签，它比任何主观的效率评价都更能指路。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa72&amp;type=app</guid>
    </item>
    <item>
      <title>让计划活在磁盘上：planning-with-files 的安装与用法（长任务不再被 /clear 清空）</title>
      <link>https://aiya.pw/article.html?id=aa73&amp;type=app</link>
      <description>planning-with-files 针对的是「编码智能体一重置上下文就丢掉工作记忆」：它把 task_plan.md、findings.md、progress.md 三个文件落在项目里，并通过生命周期钩子把选定的计划上下文注入每一轮，使计划能熬过上下文压缩、/clear、崩溃与会话恢复，恢复过程只读项目文件。若需要跨会话统计或有限回放，必须显式开启 catchup 模式才会去读同项目的本地会话记录。它按 Agent Skills 标准分发，可安装到 60 多个智能体上，对 Claude Code、Codex CLI、Pi 与 Hermes Agent 提供原生插件。本文给出安装与落地做法：三个文件各写什么、什么时候该更新、多人协作时如何避免互相覆盖，以及如何用对照实验验证它是否真的改善了长任务表现——作者给出的 3/3 盲测 A/B 胜出属于自测结果，接入前建议自己跑一遍。 — 结论：这类工具的价值不在「多一个文档」，而在把计划从模型的上下文里搬到可版本控制的磁盘上——这意味着计划能被 review、能 diff、能在换模型或换工具后继续用。适合长周期重构、跨天任务以及多人共用同一个仓库的智能体工作流；如果你的任务都是单文件小改动，额外的三个文件反而增加维护成本。落地时先在一个跨天任务上试，重点看两件事：崩溃或 /clear 之后恢复是否真的只依赖项目文件，以及 others 的改动会不会把计划覆盖掉。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa73&amp;type=app</guid>
    </item>
    <item>
      <title>ABot-Earth 0.7 功能拆解：一张卫星图 10 分钟生成公里级 3D 城市，3D 原生世界模型能怎么用</title>
      <link>https://aiya.pw/article.html?id=aa71&amp;type=app</link>
      <description>9 月 10 日高德发布全球首个 3D 原生城市世界模型 ABot-Earth 0.7，依托 3D 原生技术架构与高德积累的时空数据，支持从星球到街景的一体化全尺寸 AI 生成，把多种空间信息组织为可连续进入、自由探索、实时交互的三维数字孪生世界，覆盖超过 196 个国家和地区。输入一张卫星图像或一段文字描述，模型仅用 10 分钟就能在一块消费级 GPU 上生成公里级 3D 城市场景，官方称效率比传统模式提升 1000 倍。体验官网已上线，相关能力也已用于飞行街景 2.0。 — 结论：ABot-Earth 0.7 把「数字地球」从只能浏览推进到能自由进入和交互，值得关注的是它换了一条技术路线——3D 原生生成，而不是把卫星影像拼贴到球面上。对做文旅、地产、车机与具身智能的团队来说，现在就该拿一块自己熟悉的区域去官网上试，重点看三点：地标细节是否可辨认、城市到街景切换时空间结构是否保持一致、生成耗时在你的目标硬件上能不能接受；差距在哪，决定了它现在能不能进你的生产流程。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa71&amp;type=app</guid>
    </item>
    <item>
      <title>Meta Muse 功能拆解：独立虚拟机 24 小时在线、Sentinel 监督，个人 Agent 的权限课代表</title>
      <link>https://aiya.pw/article.html?id=aa69&amp;type=app</link>
      <description>Meta 于 9 月 8 日（美国时间）发布的个人 AI Agent Muse，与聊天机器人最大的区别是背后有一台“能干活”的虚拟机：用户说出目标（订行程、比价谈判、整理账单），Muse 拆解任务、调用网页与应用持续执行，用户退出 App 也不停；每个用户一台独立的 Muse Secure VM，配合 Sentinel 监督系统在向外发信息前做审查，发邮件、支付等敏感操作会停下等用户批准，全程留审计记录。目前面向美国用户，可通过 Muse App、网页端与 WhatsApp 使用，免费版每周约 1 亿 Token，另有每月 20/100 美元订阅。国内暂不可用，本文基于官方发布信息做功能拆解，供理解新一代 Agent 的权限设计。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa69&amp;type=app</guid>
    </item>
    <item>
      <title>vivago R1 功能拆解：用对话交付 5 分钟长视频，创作智能体怎么把“成片”当产出</title>
      <link>https://aiya.pw/article.html?id=aa70&amp;type=app</link>
      <description>9 月 9 日全球上线的 vivago R1 是智象未来（HiDream.ai）的内容创作智能体，官网定位为“通过对话创作视频与图像”的 AI Agent。与单次只出几秒片段的视频工具不同，R1 把产出单位从“片段”改成“成片”：创作者用自然语言描述创意，智能体负责拆解脚本、调度生成模型并组织成可交付的长视频，媒体口径下可实现单次 5 分钟长视频的稳定输出。本文基于官方发布与公开报道做功能拆解，覆盖它能做什么、适合谁、验收时该看什么。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa70&amp;type=app</guid>
    </item>
    <item>
      <title>把 Claude Code 的 token 花销砍 90%：Portal by Spotify 的 AiKA Modes 路由实战</title>
      <link>https://aiya.pw/article.html?id=aa67&amp;type=app</link>
      <description>Spotify 工程师在 9 月发布的博文里，用自家 Portal by Spotify 的 AiKA Modes 给 Claude Code 加了一层模型路由：大文件读取交给 Gemini 2.5 Flash 做批量摘要、样板代码让便宜的 worker 直接写盘，Claude 只处理真正需要前沿模型的推理。对 Java monorepo 的四种场景实测，bulk-read 平均省约 90% token；同时也坦白了三类做不了的事：编辑、深度推理与小文件的往返延迟。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa67&amp;type=app</guid>
    </item>
    <item>
      <title>Minke 上手：把 DeepSeek Harness 变成本地优先的桌面工作区</title>
      <link>https://aiya.pw/article.html?id=aa68&amp;type=app</link>
      <description>Minke 是一个第三方桌面客户端，把 DeepSeek Harness 的智能体能力收进一个本地优先工作区：对话、项目文件、终端、浏览器与插件分屏常驻，Agent 能在可见标签页里搜索与操作网页，你随时可以接管同一个标签再交还。支持 macOS/Windows/Linux 与中英界面，可选接入 LM Studio、Ollama 等本地模型，也能通过 Tailscale/Cloudflare 暴露的 Web 端或微信、Telegram、Discord 从手机继续任务。项目仍处活跃开发期，非 DeepSeek 官方产品。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa68&amp;type=app</guid>
    </item>
    <item>
      <title>爪爪 Paw Work 上手：把网页里选中的东西变成可编辑文件</title>
      <link>https://aiya.pw/article.html?id=aa66&amp;type=app</link>
      <description>Paw Work 是一个 Chrome 扩展形态的浏览器 Agent：开着网页、选中内容、在侧边栏描述想要的结果，就能拿回可继续编辑的表格、文档、演示文稿或网页，而不是一段聊天总结。模型密钥由你自己配置、数据留在本地。本文按官方说明整理它的安装方式、典型用法与限制。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa66&amp;type=app</guid>
    </item>
    <item>
      <title>Gemini 3.8 Flash 上手：把 effort 参数和任务难度对齐</title>
      <link>https://aiya.pw/article.html?id=aa64&amp;type=app</link>
      <description>9 月 2 日发布的 Gemini 3.8 Flash 已上线 Google AI Studio 与 Gemini API，起步价与 3.7 Flash 一致。它的特点是“复杂任务肯多花力气”：通过 effort 低/中/高三档调节推理深度与 token 消耗。本文讲清楚不同任务怎么选档位、有哪些坑。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa64&amp;type=app</guid>
    </item>
    <item>
      <title>Langfuse 接入：给 AI 应用的每次调用留账单、留证据</title>
      <link>https://aiya.pw/article.html?id=aa65&amp;type=app</link>
      <description>对话应用排障靠“再问一次”，Agent 应用不行：十几步工具调用，错在哪、花了多少 token，日志很难拼出来。Langfuse 是开源的大模型可观测平台，把每次调用的输入输出、模型、token、成本与延迟串成一条 trace，支持自托管。本文讲清它的接入方式与使用场景。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa65&amp;type=app</guid>
    </item>
    <item>
      <title>AgentCore Harness 上手：两次 API 调用，从定义到跑通一个 Agent</title>
      <link>https://aiya.pw/article.html?id=aa62&amp;type=app</link>
      <description>AWS Bedrock AgentCore Harness 把 Agent 的托管循环封装成两个 API：CreateHarness 定义模型、系统提示词与工具，InvokeHarness 运行对话；每个会话跑在隔离 microVM 里，自带文件系统与 shell，适合代码生成、数据分析、深度研究这类需要沙箱执行的任务。本文梳理从创建到调用的最小步骤与几个容易踩的坑。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa62&amp;type=app</guid>
    </item>
    <item>
      <title>Meta XR Operator：给 AI 装上眼睛和手，让它自己测 VR 应用</title>
      <link>https://aiya.pw/article.html?id=aa63&amp;type=app</link>
      <description>Meta XR Operator 是 Meta XR SDK v205 的实验组件：在应用与 OpenXR 运行时之间插入一层，把画面截图、房间几何、手柄操作与头部移动通过 MCP 开放给 AI Agent。搭配 Claude Code 等支持 MCP 的编程助手，可以让 AI 自动跑一遍 VR 应用测试——它看得见画面、点得动按钮、还能把失败证据截下来。</description>
      <pubDate>Wed, 30 Sep 2026 22:21:21 GMT</pubDate>
      <guid isPermaLink="false">https://aiya.pw/article.html?id=aa63&amp;type=app</guid>
    </item>
  </channel>
</rss>
