早报
资讯
工具
素材
学习
排行
社区
🔍
☽
店铺
登录
全部工具
上手指南
开发工具
精选 Skills
免费 API
AI 工具集
收录
244
个热门 AI 工具,按场景分好类,看到好用的就收进来
没有匹配的工具。
AI 工具集
ChatGPT
[热门] 通用对话式 AI 助手,覆盖问答、写作、代码、推理等场景,插件与生态最成熟,适合作为日常第一入口。
Claude
[热门] 以长上下文与严谨写作见长的对话模型,适合长文档处理、代码与需要稳定风格的写作任务。
DeepSeek
[热门] 国产对话与推理模型,API 价格极低、中文与代码能力突出,适合接入自有产品或对成本敏感的场景。
Gemini
Google 多模态 AI,与搜索、Workspace 等生态深度整合,长上下文与实时信息能力强。
Grok
马斯克出品,接入 X 平台实时数据,语气幽默、观点鲜明,适合追热点与开放讨论。
豆包
面向中文日常用户的免费对话助手,内置绘画、写作、办公等能力,入口轻量、上手快。
通义千问
阿里系通义大模型对话产品,支持多模态理解与中文场景,可联动钉钉、淘宝等生态。
文心一言
百度系中文创作助手,覆盖文案、公文、营销与多模态生成,与搜索、文库等场景联动。
智谱清言
清华系大模型,代码与逻辑推理能力强,提供 GLM 系列与智能体能力。
MiniMax
国产多模态大模型,语音、音乐与视频生成能力突出,提供开放平台与 API。
讯飞星火
国产大模型,语音识别与多模态能力强,适合教育、办公与硬件集成场景。
零一万物
李开复发起的开源大模型公司,Yi 系列模型性能优秀,提供开放 API 与企业方案。
百川智能
王小川发起的国产大模型,搜索增强与金融场景表现突出,提供 Baichuan 系列。
Perplexity
对话式 AI 搜索引擎,答案附带来源引用与后续追问,适合快速调研与事实核查。
Poe
多模型聚合聊天平台,一个入口调用 GPT、Claude、Llama 等众多模型,按需切换。
Character.AI
AI 角色扮演平台,可与海量虚拟角色深度对话,适合娱乐、陪伴与语言练习。
Hugging Face Chat
开源社区提供的免费聊天,可一键切换众多开源模型,生态与模型库最丰富。
Qwen
阿里通义千问旗舰模型聊天入口,支持超长上下文、工具调用与多模态输入。
Grok 4
xAI 最新旗舰,多智能体协同、百万级上下文,编码与实时信息能力更强。
Kimi
擅长超长文档阅读与资料梳理的助手,适合论文、报告、合同等长文场景,支持联网检索。
Cursor
[热门] AI 原生代码编辑器,支持多文件理解、自然语言改代码与 Agent 自动修复,显著提升开发效率。
GitHub Copilot
深度集成 VS Code 的 AI 编程助手,提供行内补全、对话与命令行代理,企业采用度高。
Windsurf
轻量 AI 编辑器,Cascade 模式可主动理解工程并跨文件修改,交互流畅。
Claude Code
终端 AI 编程助手,对大型项目的理解力最强,可自主执行多步工程任务。
Codex CLI
OpenAI 开源的终端 AI 编程助手,支持 Agent 模式与本地代码库操作。
Trae
字节 AI 编程工具,对国内开发者友好,内置对话、补全与 Builder 模式。
Devin
AI 软件工程师,可自主完成需求分析、编码、测试与部署等完整开发任务。
Replit
在线编程环境,AI 辅助开发并支持一键部署,适合快速原型与教学。
Tabnine
AI 代码补全工具,支持本地模型离线运行,注重代码隐私与企业合规。
Amazon Q
AWS AI 编程助手,与云服务、代码仓库深度整合,适合云上开发。
Codeium
免费 AI 代码补全,支持 70+ 编程语言与多种编辑器。
MarsCode
国产 AI 编程助手,以 IDE 插件形式提供,免费使用、上手简单。
OpenCode
开源终端 AI 编程工具,支持多模型切换,轻量可自托管。
Cline
VS Code 开源 AI 编程插件,支持 Claude / GPT 等多模型,社区热度最高。
Continue
开源 AI 编程插件,自由切换模型,提供 Tab 补全与对话两种模式。
Aider
终端 AI 编程助手,Git 感知、支持多模型,适合在已有仓库中协作修改。
Gemini Code Assist
Google AI 编程助手,深度整合 Cloud 与 GitHub,补全与审查能力均衡。
OpenAI Codex
GPT 驱动的自主编码工程平台,可接管完整开发任务并交付可运行结果。
Bito AI
AI 编程辅助,提供代码生成、解释、评审与单元测试,支持主流 IDE。
OpenRouter
多模型 API 聚合服务,统一接口调用数百款开源与闭源模型,按量计费。
WorkBuddy
腾讯 AI 编程助手,云端协作与高效编码一体,适合团队工程场景。
Midjourney
[热门] 以高质感图像生成著称的绘画模型,风格化与艺术表现力强,常用于概念图、海报与插画。
Stable Diffusion
开源最强绘画模型,可本地部署、可控性强,配合 ComfyUI 等生态玩法极多。
Canva
AI 驱动的在线设计平台,模板丰富、上手零门槛,适合海报、社媒图与简易品牌物料。
即梦 AI
[热门] 字节旗下 AI 绘画与视频生成工具,中文提示词友好,适合快速出图、做海报与短视频素材。
Recraft
矢量图标与品牌设计 AI,可生成风格统一的设计素材,适合产品与品牌视觉。
Clipdrop
AI 图像编辑工具,去背景、扩图、重绘一条龙,适合电商与社媒修图。
Adobe Firefly
Adobe 官方 AI,与 PS / AI 生态无缝整合,生成结果更偏商用安全。
Design.com
AI 自动设计 Logo 与品牌素材,输入名称即可生成多套方案。
Leonardo AI
游戏资产与概念设计 AI 生成平台,提供模型训练与一致角色生成。
Ideogram
文字渲染能力最强的 AI 绘画工具,适合生成带标语的海报与标题图。
Krea AI
实时 AI 绘画与设计生成平台,边画边生成,适合创意迭代。
Tensor.Art
Stable Diffusion 模型分享与在线生成社区,海量微调模型即开即用。
Removal.ai
AI 自动去背景,支持批量处理,适合电商与证件照抠图。
Figma
协作式 UI 设计工具,AI 功能持续增强,适合产品与原型设计。
Imagen
Google 最新图像生成模型,质量与速度兼备,深度整合于谷歌生态。
Nano Banana PRO
AI 高清 4K 图片生成,擅长手绘风手办与质感细节表现。
Sora
[热门] OpenAI 视频生成模型,画质天花板,理解复杂提示词与镜头语言。
Luma
AI 视频生成,物理效果真实、运动连贯,适合创意短片与特效。
Runway
AI 视频编辑与生成功能最全面的平台,涵盖文生视频、抠像、补帧等。
Pika
AI 视频生成,风格多样、编辑功能丰富,适合社媒短视频。
HeyGen
AI 数字人视频生成,口播逼真、多语言,适合营销与教学讲解。
可灵 AI
[热门] 高质量 AI 视频生成工具,支持文生/图生视频与运动控制,人物动作与一致性突出。
Vidu
国产 AI 视频生成,清华团队出品,参考视频与多镜头一致性较强。
剪映 / CapCut
面向短视频的剪辑工具,内置智能字幕、成片、配音等 AI 能力,国内最流行。
Videobolt
AI 视频模板与动画制作平台,套用模板快速产出品牌视频。
Udio
AI 音乐生成,音质细腻、风格多样,适合做 demo 与背景配乐。
Suno
通过一句话生成带人声的完整歌曲,支持风格、歌词与编曲控制,适合短视频配乐。
Veo
Google 最新视频生成模型,控制力更强并支持原生音频。
Seedance
多镜头电影级视频生成,支持原生音频,镜头连贯性与叙事强。
Lucid AI
免费 AI 视频创作,提供编辑与动画制作能力,适合轻量内容生产。
ElevenLabs
AI 语音克隆与合成,音质顶级,支持多语言与情感控制,适合有声书与配音。
Stable Audio
AI 音频生成,开源可控,适合生成氛围音乐与音效。
Murf AI
AI 语音合成,自然逼真、多语言,适合企业培训与营销视频配音。
Descript
像编辑文档一样剪音视频,支持转录、去除口癖与 AI 配音。
Notion AI
内置于 Notion 的 AI 写作与总结能力,可在文档中直接起草、续写、翻译与问答。
Grammarly
英文写作纠错与 AI 润色,实时语法、语气与清晰度建议。
Jasper
专业 AI 内容营销写作,支持品牌语气定制与多渠道内容批量生成。
Copy.ai
AI 营销文案生成利器,覆盖电商、社媒与邮件等多种场景。
Gamma
AI 一键生成 PPT / 文档 / 网页,设计感强、排版自动。
Beautiful.ai
AI 自动排版 PPT,设计规范自动对齐,省去手动调版。
Elephas
Mac 平台 AI 写作助手,系统全局调用,适合日常文案与邮件。
Otter.ai
实时语音转文字,自动生成会议记录与要点,适合复盘与协作。
MindShow
AI 一键生成 PPT,支持 Markdown 直接转演示文稿。
Obsidian
本地 Markdown 笔记,双向链接知识图谱,注重隐私与长期知识管理。
Kitmul
100+ 免费 AI 浏览器工具,无需注册即可使用,覆盖多种轻量场景。
飞书 AI
飞书内置 AI 助手,可基于文档、表格、会议纪要做总结、起草与自动化。
腾讯文档 AI
AI 辅助写作与表格处理,协作流畅,适合团队在线文档场景。
WPS AI
文档 / 表格 / PPT 全场景 AI,国产办公首选,深度集成 WPS。
Google Workspace
Gmail / Docs / Sheets 的 AI 整合,Gemini 加持下的协同办公套件。
Microsoft Copilot
Office 全家桶 AI 整合,Word / Excel / PPT 全支持,企业采用度高。
腾讯 ima
基于混元大模型的 AI 智能工作台,知识库与问答一体。
ChatPDF
与 PDF 对话问答,快速提取长文档信息,适合论文与报告研读。
Acrobat AI
PDF 文档 AI 问答,支持多文件处理与摘要,适合合同与资料审阅。
ChatDOC
AI 文档对话,与文件交谈获取精准答案,支持表格与图表解析。
Zapier
AI 自动化工作流,连接 7000+ 应用,适合把重复任务串成流水线。
Make
可视化自动化工作流平台(前 Integromat),节点灵活、逻辑可控。
n8n
开源工作流自动化,可自部署,适合开发者定制复杂集成。
Coze(扣子)
零代码搭建 AI Bot,工作流与插件丰富,适合快速发布智能体。
ggwk
AI API 聚合服务,支持 Claude / GPT / Gemini 等模型统一调用。
DeepL
以译文自然流畅著称的机器翻译服务,支持文档翻译与术语表,适合专业与商务场景。
沉浸式翻译
浏览器双语对照翻译插件,支持网页、PDF、视频字幕实时翻译,阅读外文资料效率高。
Grok Bot
[热门] SpaceX AI推出的AI智能体产品,定位「全天候在线的智能助手团队」。用户可像给同事发消息一样分配任务,Bot能登录常用工具、跨应用跨网站独立工作,观察用户操作后自动学习工作流。多个Bot可放入群聊自行协作分配任务,仅在需要最终判断时才征求用户意见。面向SuperGrok Heavy、Cursor Ultra和Cursor Teams订阅用户开放测试。
BUZZ
[热门] Jack Dorsey创建的开源去中心化协作平台,专为AI优先团队设计。允许多个AI Agent与人类在同一频道内协作,支持Claude Code、Codex、Goose等开源编码Agent。团队可以部署自己的实例保证隐私和控制权,像Slack一样使用但内置AI Agent协作能力。
Vercel v0 Enterprise
Vercel的v0 UI生成工具推出企业版,新增私有模式确保生成的UI组件不会被用于共享模型训练。生成质量大幅提升,尤其在无障碍组件模式方面表现突出。适合构建专有设计系统的团队使用,消除数据泄露顾虑。支持自然语言描述生成React组件,可直接集成到Next.js项目。
千问办公(QwenWork)
[热门] 阿里巴巴旗下企业级 Agent 办公产品,网页端与 PC 客户端已开放,可体验 Qwen3.8、GLM-5.3、DeepSeek V4 Pro 等旗舰模型;支持文档、表格、演示等办公任务的智能体协作,近期已接入企业微信。
HiDream.ai(智象未来)
[热门] 智象未来 AI 视觉创作平台,提供图像生成、视频生成与交互式世界模型 HiDream-O1-World;支持文本、图像、交互等多模态方式输入,一键生成时空一致、符合物理规律、可长时推演的完整世界。
Manus
通用型 AI Agent 平台,把任务拆解为多步执行:自主规划、调用工具、访问网页并交付完整结果,支持云端异步运行与移动端实时查看任务进度。
库库AI
百度文库网盘通用智能体 GenFlow 的中文品牌,8 月 14 日在百度 AI Day 正式定名,并推出 PC 客户端、网页端、小程序与企业版独立端。支持 Office 三件套及 AI 海报、思维导图、代码等跨模态文件生成与转换,模型池包含 DeepSeek、智谱 GLM 等外部模型。
Alpha派(PaiWork)
讯兔科技旗下的 AI 投研工作台,8 月接入腾讯混元 Hy3 作为基座模型之一,支撑专业问答、取数、建模与生成 PPT 等多步骤长链路投研任务;配合 Alpha派 App 提供纪要、直播等投研信息服务。
MiniMax Design
MiniMax 8 月 20 日发布的多模态创作 Agent 工作台,基于原生多模态视频模型 H3 构建。用自然语言表达创作意图,系统自动拆解任务并调用模型能力,完成从素材生成到成片交付的全流程;内置「3D 导演台」可预演镜头构图,支持自动剪辑与字幕,可接入 ComfyUI 等现有工作流。
ComfyUI
开源的节点式 AI 图像与视频生成工作流工具,通过可视化节点连线编排 Stable Diffusion、FLUX 等模型的采样、ControlNet、LoRA 与后处理流程,支持本地部署与云端运行,是当前最主流的图像生成工作流框架之一,也被 MiniMax Design 列为可接入的工作流生态。
ConversationalVoice
开源的全双工语音训练数据获取管道,把播客、访谈等真实录音经 VAD 切分、说话人分离与质检,转为结构化双人对话训练数据,保留轮次、停顿、重叠与非语言线索;基于 Celery + PostgreSQL + 对象存储,每个阶段为独立可部署的 worker,可产出说话人分离音轨与对话扩展数据。
Codex Harness
OpenAI 开源的 Agent 运行时底层框架(Apache-2.0),驱动 Codex App、CLI 与 IDE 扩展运行。核心提供三层集成接口:codex exec 轻量非交互调用、Codex SDK 程序化编排、Codex app-server 持久会话驱动,支持把 Codex Agent 嵌入自有产品,并可替换为任意 OpenAI 兼容模型端点。
MathForm
OpenBMB 开源的数学自动形式化方案(Apache-2.0):含 MathForm-8B 模型权重、约 36.7 万条经 Lean 4 验证的数据集 FormalVerse、评测代码与 Pass@k 脚本。通过检索 Mathlib 加编译器反馈迭代生成可验证的 Lean 4 命题,8B 模型在多个基准上超过 32B 专用形式化模型,BF16 加载约需 16GB 显存即可本地运行。
Is Agentic
Vercel 推出的免费网站 Agent 就绪度评测工具,基于 Ora 的 118 项检查,从发现、访问、可用、支付四个层级给公开网站打分,分数回归为 Essential 80 + Recommended 20 + Bonus 5。提供网页版、CLI(npx is-agentic <域名>)与 MCP/Agent Skill,无需 API Key。
OpenBot
CopilotKit 开源的 AI 同事(Agent)框架,每个 Agent 拥有独立的浏览器、登录态与文件空间,只开放你授予的工具权限,动作在执行前决策、执行后留痕,适合把真实工作交给 Agent 的场景。
Memento
论文「Fine-tuning LLM Agents without Fine-tuning LLMs」的官方开源实现:通过记忆增强的在线强化学习,让 LLM Agent 在不更新模型权重的情况下持续学习,经验存入情景记忆、策略靠记忆读取改进,在 GAIA 验证集取得 top-1(Pass@3 87.88%)。
agent-skill
Rust 编写的 AI Agent 技能管理库与 CLI:用于安装、管理和卸载 SKILL.md 技能,兼容 Claude Code、Codex、Cursor 及 70+ 编码 Agent,支持从本地或远程源安装技能包。
Agent Lightning
微软开源的轻量级 Agent 强化学习训练框架(约 3500 行代码):让 Agent 在真实工具环境中训练,v1.0 支持 Kubernetes 原生运行;官方示例中仅用 6K 训练样本把 Qwen3.5-9B 的 SWE-bench Verified 从 41.8% 提升到 56.4%。
OpenClaw
开源的跨平台个人 AI 助手:支持任意模型、任意设备与任意聊天渠道,可接入 WhatsApp、Telegram、Slack、Discord、飞书等消息服务,本地优先运行,并提供安全边界控制与插件扩展。
Z.ai(GLM 开放平台)
智谱官方大模型开放平台:GLM-5.3-Flash(320B-A18B)等模型在线体验与 API 调用,提供 Z.ai Code Bench 代码评测;8 月 26 日随 GLM-5.3-Flash 上线并开源同步上新,AA 指数 57 分的原生多模态模型可直接体验。
ModelScope 魔搭社区
阿里达摩院开源模型社区:Qwen 等系列权重、数据集与微调示例的国内下载入口;SGLang/vLLM 设置 SGLANG_USE_MODELSCOPE=true / VLLM_USE_MODELSCOPE=true 即可自动从魔搭拉取模型,是 Qwen3.8-Flash-Next 等新权重国内部署的常用路径。
Qoder(智能体工作台)
阿里 8 月 27 日发布的全新 Qoder:以 Coding 能力为底座,采用 Harness 技术实现“读-改-验证-迭代”的长链路自治,支持分级权限与工具白名单、跨会话长期记忆;桌面端国际版(qoder.com)与中国版(qoder.cn)均已开放下载。
Gemini Omni 1.1 Flash
Google 8 月 27 日发布的视频生成模型:可分析前 10 秒上下文续写场景(每次 +10 秒、累计最多 40 秒),支持指定首尾帧与引用最长 3 秒参考视频;360p 草稿速度约为 720p 的 1.6 倍、成本约为其 1/3,可升级 4K。
Gemini 3.5 Transcribe
Google 最新语音转文字模型:流式识别平均词错误率 4.0%、非流式 2.6%,覆盖 85 种语言并支持地区口音;支持自动自我修正、删除口语填充词、自动格式化,可为最多三名说话人做带时间戳语音归属识别,支持自定义词汇表。通过 Google AI Studio 与 Antigravity 的 Gemini API 以公开预览形式使用。
B.AI
AI 聚合平台,免费向所有用户开放六款旗舰模型:GLM-5.3-Flash、DeepSeek-V4-Flash、DeepSeek-V4-Flash-Vision-Exp、腾讯混元 Hy3、小米 MiMo-V2.5 与 Qwen3.8-Flash,官方称零限制。适合在一个入口对比多家国产模型的实际表现。
Rosalind Workbench(OpenAI 生命科学研究工作台)
位于 ChatGPT 内的生命科学研究工作台,基于 GPT-Rosalind 模型,覆盖蛋白结构与序列分析、基因组学 NGS(FASTQ 质控、bulk RNA-seq、单细胞)、小分子设计与实验规划,内置分子结构与序列比对等可视化组件。Explore 模式开放,Research 模式需机构验证。
pico-faces(单片机上的人像生成)
开源项目:用约 1 美元的 RP2350(Raspberry Pi Pico 2 芯片)跑 128×128 人像扩散模型(DiT),模型经 int8 QAT 蒸馏,单张生成约 5-20 秒,支持 VGA 与 USB 串口输出,配套 Python viewer 可直接查看生成结果。
Amazon Bedrock AgentCore Harness(两条 API 拉起生产级 Agent)
AWS 的托管式 Agent 循环:CreateHarness 定义 Agent(指定模型、系统提示词与工具),InvokeHarness 单次调用即可运行,由服务处理编排、工具执行、记忆管理与回复生成。每个会话运行在隔离 microVM 中,自带文件系统与 shell 访问,支持代码生成、数据分析、深度研究等场景,也可自带容器镜像;与 CrewAI、LangGraph、LlamaIndex 等开源框架及任意基础模型搭配使用。
Meta XR Operator(AI Agent 自动开发与测试 VR 应用)
Meta 推出的 VR 开发工具,作为 Meta XR SDK v205 实验组件开放(首个公开版本 7 月 28 日推出)。它位于应用与 OpenXR 运行时之间,拦截运行时调用,把 XR 状态与输入控制通过 MCP 协议开放给 AI Agent:获取模拟器截图、读取房间几何、模拟按钮/摇杆/扳机操作与头部移动,让 Agent 完成“写代码—运行测试—发现问题—修复验证”的自动化闭环,无需修改应用代码。
NotebookLM(Gemini Notebook)
Google 的 AI 笔记本工具,可上传文档、网页、PDF 与视频,生成笔记、问答与音频概览。8 月底上线 Expert Intelligence 功能,可把 Google Play Books 中已购的 10 万余本电子书接入工作区,基于全书提问、做笔记并交叉引用多本书。
Ollama(本地大模型一键部署)
本地运行开源大模型的命令行工具,支持 Llama、Qwen、DeepSeek、星火等模型的一键拉取与运行,自带 OpenAI 兼容 API,适合端侧调试、私有化部署与离线使用。
Doop(人机协作设计画板)
开源的多人在线设计画板,每个 Canvas 由多个 Frame 组成,Frame 直接渲染真实 HTML。内置 MCP 服务,Claude Code、Codex 等 Agent 可创建、修改并截图检查 Frame;Agent 写入时人能看到光标、状态与逐步出现的页面。可用 Docker 自托管。
herdrm(多设备 Agent 控制台)
macOS 原生控制台,集中查看由 herdr 运行的 Claude Code、Codex、Gemini、Grok 与 OpenCode 会话,可同时连接本机与多台 SSH 设备,在侧边栏按阻塞/完成/工作/空闲排序,点击即进入对应终端。
Langfuse(LLM 可观测性)
开源的大模型应用可观测与评测平台:记录每次调用的提示词、模型、token 用量、成本与延迟,支持在线评测、数据集管理与线上回归对比,可以自托管。做 Agent 或 RAG 应用排障、做 prompt 迭代回归时比较实用。
Replicate(模型推理 API)
模型托管与推理 API 平台:可调用社区公开的开源模型,也可上传自己的模型一键部署,图像、视频、语音等推理按秒计费,免去自建 GPU 推理环境。适合想快速把开源模型接进产品验证效果的开发者。
爪爪 Paw Work(页面选择式浏览器 Agent)
一个“先选中、再生成”的 Chrome 浏览器 Agent(MV3 扩展):在已打开的网页上圈选图片、表格、文字或链接,再到侧边栏描述想要的结果,就能拿回可继续编辑的表格、文档、演示文稿或网页,而不是一段聊天总结。自带模型密钥(BYOK)、无云端服务、无账号,数据与生成的代码都留在本地。适合经常需要从网页里提取、对比和导出资料的用户。
Atlas(World Labs 世界模型平台)
World Labs 于 9 月发布的多模态世界模型产品:输入文字或图片即可生成空间一致、支持像素级相机控制的图像与视频,输出最长约 1 分钟、最高 1440p,也支持 360 度全景与显式 3D 重建。目前处于向部分合作伙伴开放早期访问的阶段,适合影视预演、游戏场景与视觉设计的前期探索。
Tripo Studio(AI 3D 工作站)
VAST 推出的一站式 AI 3D 工作站,把文生 3D、图生 3D、材质贴图与格式转换收进同一套工作流,底层是自研 Tripo 系列 3D 基座模型。8 月发布的 Tripo P2.0 Preview 号称全球率先能在数秒内生成高质量四边面网格的 3D 大模型,单面数上限提升到 5 万三角面。适合游戏、影视、电商的 3D 素材生产与个人创作者。
Gemini App 音乐生成(Lyria 3.5)
Google 的音乐生成模型 Lyria 3.5 于 9 月初接入 Gemini App 与 Gemini API:App 内可选短曲或长曲,用模板起步,描述或点选流派并切换人声与器乐版本;开发者可在 Gemini API、AI Studio 与 Google Vids 中调用。适合快速做配乐、Demo 与创意试听,不需要懂编曲。
Google Pics(Nano Banana 图像套件)
Google 推出的 AI 图像生成与编辑工具,基于最新的 Nano Banana 模型,2026 年 9 月初面向企业大规模开放,并陆续集成到 Google Docs、Slides 与 Drive。除了文生图、图生图,重点在精确编辑:可以单独选中画面里的一个物体做移动、缩放或替换,还能独立修改、翻译图片内的文字,成片直接落到 Workspace 文档中使用。个人创作者一般随 Google AI Pro/Ultra 或 Workspac
Concat(开源剪辑,原 WolfCut)
开源免费的本地视频剪辑工具,原名 WolfCut,定位是 CapCut 的开源替代:无水印、无账号、无订阅,素材都在本地处理。底层是 Rust 原生引擎,提供多轨时间线、字幕、本地 TTS 配音与模板,覆盖 Windows、macOS 和 Linux,目前处于 Beta 阶段,适合在意隐私、或不想被会员制绑架的视频创作者。
m3e-canvas(Material 3 UI 画布)
浏览器里的 Material 3 Expressive 界面拼装工具:从模板或组件库搭出页面,把多个屏幕连接起来就能直接点击试玩交互流程;完成后可一键导出成适合喂给 AI 编程工具的 vibe-coding 提示词,让 Cursor、Claude Code 这类编码助手照着实现真实界面。适合做 UI 快速验证和设计到代码的过渡。
goldie(iOS 截图与预览生成)
让 Coding Agent 在 iOS 模拟器里替你重放 App 的核心操作流程,自动生成带设备边框的 App Store 截图与预览视频。开发者不用再手工截图、摆机型、录屏,把上架素材这件事交给 Agent 一键完成,对要发海外商店的团队尤其省时间。
codex-with-chatgpt(ChatGPT 思考 + Codex 执行)
把 ChatGPT 网页版接进 Codex 工作流的开源插件:让 ChatGPT 扮演规划和代码审查的大脑,Codex 保留文件修改与命令执行的手脚,两端通过会话互相传递任务。适合希望复用 ChatGPT 的推理能力、又不想放弃 Codex 本地执行能力的用户。
FrontierAgent(开源 Agent 终端)
开源的 Agent Runtime 与终端产品,原生 CLI/TUI 交互,一条命令即可运行,无需预装一堆依赖、也不强依赖 Docker。提供两种模式:ReAct 模式按顺序单 Agent 推进;Agent Team 模式由协调者维护任务板、并行派出多个子 Agent 再汇总,适合把复杂任务拆给多个 Agent 并行攻坚。
Refly(自然语言自动化工作流平台)
面向非技术人群的“Vibe Workflow”平台:用自然语言加可视化画布编排自动化流程,覆盖内容创作、数据整理、调研与发布等场景,官方称几分钟内即可搭出第一个流程。内置 AI 构建器能把一句话需求转成结构化流程,并提供文件库、应用集成与社区模板;用户把流程发布到市场后,别人每次运行都可获得积分分成。
Augment Code(Cosmos 软件交付自动化)
面向团队与企业的 Agentic 软件开发平台,核心是 Cosmos“软件工厂”:用 Agent 承担 PR 评审、工单到 PR、测试覆盖、告警排查与安全修复等重复环节,工程师在质量闸口做最终把关,可用自然语言搭建并调优整套交付循环。原生支持 CLI 与 MCP,提供上下文引擎,各套餐均不使用客户代码训练模型。
3AGameFactory(开源 3A 游戏生成框架)
开源 3A 游戏生成 Skill 与资产框架:让 Coding Agent 按一句话需求直接产出可用于游戏构建的资产与引擎代码,覆盖图片、3D 资产、动作、音频与 CG 视频生成,支持 UE5、Blender、Unity、Godot 4 与 three.js。仓库提供对战、FPS、赛车等不同美术风格的实机演示录屏,角色常用 Meshy、枪械载具用 Hunyuan3D,再由项目自带的 Puppeteer + MoMask 链路完成绑骨与动
Minke(DeepSeek Harness 桌面客户端)
把 DeepSeek Harness 搬上桌面的本地优先工作区:对话、项目文件、终端、浏览器与原生桌面操作集中在一处,Agent 可以在可见的浏览器标签里搜索并操作网页,用户也能随时接管同一个标签再交还。右侧与底部面板并排放置文件、终端、浏览器与插件;会话与历史默认留在本机,可选通过 Web、微信、Telegram、Discord 等继续远程任务,并支持接入 LM Studio、Ollama 等本地 OpenAI 兼容服务。项目处于活跃
NVIDIA Personal AI Router(PAIR)· 把闲置电脑拼成本地推理集群
NVIDIA 发布并开源的本地推理路由器:发现同一局域网内兼容的 Windows/Linux/macOS 电脑作为节点,统一管理 Ollama、LM Studio 等推理引擎,向应用与 Agent 暴露 OpenAI/Ollama 兼容的代理端点,再把独立的推理请求路由到当前负载合适的节点——相当于把几台闲置电脑组织成一个私有推理集群,prompt 与响应默认不离开本地网络。桌面应用提供节点总览(含实时 GPU/显存占用)、引擎安装、模
ApeAdmin(FastAPI + Vue3 的 AI 应用后台管理框架)
面向现代 AI 应用的中后台开发框架,基于 FastAPI + Vue3 搭建,内置 RBAC 权限管控、审计日志、插件市场等企业级能力。特色是集成了 MCP-SSE 网关:底座与业务插件的功能可自动注册为标准 AI 工具(Tools/Resources/Prompts 三原语,自动从函数签名推断 JSON Schema),AI Agent 只能看到当前用户有权限调用的工具,让传统业务系统与智能体打通的同时保留完整后台管理。支持安装向导
Termexo(Windows 多 Agent 编程工作台)
MIT 开源、仅在本地运行的 Windows 多 Agent 编程工作台:把 Claude Code、Codex CLI 与 OpenCode 放进同一套工作区与真实 PTY 终端网格,统一管理多个项目的会话、模型供应商、MCP 配置与任务看板。支持跨项目会话搜索与恢复(claude --resume / codex resume)、随终端联动的 Git 视图、以及远程访问——开启后在手机或另一台电脑的浏览器里驱动同一批正在运行的终端。
vivago R1(智象未来 · 内容创作智能体)
9 月 9 日全球上线的内容创作智能体,官网定位为“通过对话创作视频与图像”的 AI Agent:用自然语言描述创意,由智能体拆解脚本、调度多款生成模型并组织成连贯成片,媒体口径下单次可稳定输出 5 分钟长视频,主打从“生成片段”到“完全交付作品”。适合短视频、广告与内容团队用真实脚本试长视频的稳定交付与可控修改。
易创(Easy Writing):纯本地 AI 网文写作桌面软件
纯本地、开源的 AI 网文写作桌面软件(Tauri + Vue3 构建):支持小说创作与 AI 辅助写作、自带 Key(BYOK)与自定义提示词,数据保存在本机,可接入 OpenAI 兼容接口。适合写长篇网文、在意稿子隐私与本地可控的作者。
ABot-Earth 0.7(高德 · 3D 原生城市世界模型)
9 月 10 日高德发布的全球首个 3D 原生城市世界模型:使用涵盖空间与时间的时空数据训练,端到端一次性生成 3DGS(三维高斯泼溅)格式的城市场景。输入一张卫星图像或一段文字描述,模型仅用约 10 分钟即可在一块消费级 GPU 上生成公里级 3D 城市,官方称效率比传统重建模式提升约 1000 倍;支持从星球到城市、再到街景地标的一体化全尺寸连续生成,覆盖超过 196 个国家和地区。体验官网已上线,相关能力也已用于飞行街景 2.0。
LingBot-World 2.0 轻量版(蚂蚁灵波 · 1.3B 开源实时世界模型)
蚂蚁灵波把 7 月开源的 LingBot-World 2.0 做成能在消费级单卡上实时跑的版本,刚放出的轻量版参数只有 1.3B。它和「生成一段视频」不是一回事:角色往前迈一步、视角转向一侧,画面都得接着生成,模型是在持续生成一个可交互的世界。官方仓库公开模型与代码,技术报告见 arXiv 2607.07534,授权为 CC BY-NC-SA 4.0(非商用)。适合想在本地跑世界模型、做可交互 Demo 或研究长时生成稳定性的开发者。
deepseek-recipe(DeepSeek 官方 · 多格式 API 请求统一转换库)
DeepSeek 官方开源的 Rust 库 + Python 绑定:把 Messages、Chat Completions、Responses 三种格式的 API 请求统一转换成 DeepSeek 的 Conversation 格式,再编码成模型提示词,最后把模型输出转回调用方要求的格式。支持流式响应、文本/图像/思考内容与客户端工具调用,覆盖 DeepSeek V4 与 V4.1 的会话编码、thinking 模式、reasoning
Data Maskit 数据面具(大模型本地隐私脱敏网关)
跑在本地的隐私脱敏与还原网关:把发往大模型请求里的敏感信息自动结构化打码,模型回复再按映射流式还原,全程本地运算、无遥测。支持 Cursor、Claude Code、Codex 等任何可自定义 Base URL 的工具,相当于在客户端和模型 API 之间插一层「模型看不到原文」的代理。适合把代码、客户数据或合同交给云端模型前必须先脱敏的团队,也适合个人用来降低日常对话里的信息暴露面。
Penelopa.ai(AI 编程会话的持续改进看板)
接上 Codex 与 Claude Code 之后读取真实的编码会话,找出反复出现的工作流模式,把它们整理成可复用的技能、检查项、提示词与建议,呈现在个人看板或桌面端。安装脚本会拉取一个独立的 Node/npm 运行时并配置 hooks,不需要 Git、Python、系统 npm、Homebrew 或 Xcode 作为前置;桌面端支持 macOS 13.5+(Apple Silicon/Intel)与 Windows 10 22H2+
ai-data-extractor(把 AI 编程会话导出成一份统一 JSONL)
把各家 AI 编程助手的本地存储扫出来,统一成一份 JSONL 的 Python 工具包,只用标准库(Python 3.9+,无需依赖)。覆盖 Claude Code(~/.claude/projects 下每个会话一个 JSONL)、Codex CLI(~/.codex/sessions 的 rollout 文件)、Cursor(state.vscdb 这个 SQLite)、Windsurf(同类 SQLite,schema 未公开、
geiger(一条只读命令,点清本机所有 AI 智能体与 MCP 服务)
机器上装了 Claude Code、Cursor、Codex,又接了若干 MCP 服务、钩子和 AI 扩展之后,很少有人说得清到底有什么在跑、各自能碰到什么。geiger 把这件事压成一条只读命令:不执行插件、不联网、不装任何东西,直接读配置与目录,把每个智能体、MCP 服务、插件、钩子和扩展按生态列出来。覆盖范围包括 Claude Code 的全局与项目级 MCP、hooks、插件、skills 与子代理;Claude Desktop
agent-memory(Markdown 为准、Claude Code 与 Codex 共用一个记忆库)
会话一关,代理在这次会话里学到的东西就没了。agent-memory 把这件事做成一个有存储层的运行时,适用于任何能执行 shell 命令的代理,不限于编码类。一个目录里的 Markdown 文件是唯一事实来源,旁边的 SQLite 索引只是随时可以删掉的缓存,Claude Code、Codex CLI 与其它代理共用这一份存储。检索在本地完成并带排序,返回的是路径而不是拼接好的文本——代理按任务需要决定读到多深;写入不依赖代理「记得写
Webagent(填一份 JSON 就把网站变成受控的公开智能体)
给别人家的网站配一个能对外说话的智能体,通常意味着写一堆编排代码;Webagent 想改成填表。它是 Agent-net 开源的 Go 编排框架,业务方填写一份声明式 JSON,为 9 个可插拔槽位各挑一个 provider,然后跑 webagent serve 就能起服务。9 个槽位分别是检索、记忆、护栏、渠道、密钥、呈现、模型、动作与可观测性,每个槽位是接口,内置若干实现并有默认值——例如渠道支持 a2a、web、slack、wha
NVIDIA OSMO(一个 YAML 把物理 AI 的训练、仿真与机器人测试串起来)
做机器人的团队通常不只有一个算力问题,而是三个:策略在数据中心 GPU 集群上训练,在 Isaac Sim 里用 RTX 工作站做仿真与传感器渲染,最后装进真机上的 Jetson 做硬件在环验证。三层各有各的集群、调度器和胶水脚本,交接处最容易堆积一次性代码。OSMO 是英伟达对这个碎片化问题的答案:一个 Kubernetes 原生的工作流编排器,用一份 YAML 描述整条流水线,跨三层运行而不用碰基础设施代码。关键设计是工作流不写集群
Reef(把「智能体用得越多越强」做成一条能回滚的流水线)
让智能体从真实交互里持续变强,通常要自己把三样东西焊起来:推理服务、反馈采集、和训练完之后的版本切换,中间还夹着「更新时不能断服」这个没人愿意写的部分。Reef 把这套做成开源基础设施。它给自己的定位是补上推理引擎与 RL 训练框架之间的空缺:vLLM、SGLang 这类引擎能服务线上流量但不能训练权重,Slime、veRL、AReaL 这类框架能训练但不能服务,也不管版本;Reef 三件事都做,并且能改进权重之外的东西——提示词、规则
TensorRT Edge-LLM(把 LLM 与 VLM 塞进 Jetson 和车机的 C++ 推理运行时)
在服务器上跑大模型有成熟的推理栈,把同一个模型塞进 Jetson、DRIVE 这类边缘平台则要重新处理算子、显存和量化,多数团队会掉进自己写一次性推理代码的坑。TensorRT Edge-LLM 是英伟达自己维护的 C++ 推理运行时,覆盖文本、视觉、音频、语音与动作模型,面向的正是车载、机器人与边缘设备。2026 年 9 月发布的 0.10.1 加了两项实验性能力:双 NVIDIA DGX Spark 上的 TP=2 推理,以及重写过
Brig(把编码智能体关进本机 microVM 的一条命令)
编码智能体能装包、能联网、能读你的凭据,一旦跑飞,损失范围取决于你给了它多少。Brig 的做法是在你自己的机器上开一个 microVM,把智能体关进去跑:一条 brig run claude ~/code/demo 启动沙箱并在其中运行智能体,项目目录以读写方式挂到 /work/<name>,沙箱启动时不携带任何凭据,需要登录时由你在沙箱内完成;宿主机的其它目录、钥匙串与 SSH agent 都不进虚拟机。会话用 <a
Pizza Bot(给后台跑的智能体一个收件箱,完成或卡住才回来找你)
让智能体干活最烦的不是它做不完,而是你得盯着它做——一步要审批就停住,你只能守着窗口看它滚屏。Pizza Bot 是亚马逊内部先做、后来重写开源的本地优先收件箱:跑完的结果落进 Unread,等你决策的审批请求落进 Action,你走开、断连,任务也不会停(api-server 进程需保持运行)。运行时是带状态的 DeepAgents/LangGraph,桌面 Electron、浏览器与终端 CLI 都通过 HTTP/SSE 连同一个后
MCPJam(把 MCP 服务器「换个客户端就失灵」变成可测的回归项)
MCP 服务器在 Claude 里跑得通,换到 ChatGPT 或 Cursor 就开始漏调工具、参数对不上——这类退化以前只能靠用户投诉才发现。MCPJam 是专做 MCP 服务器测试、调试与评测的平台:除了交互式调试,还提供跨客户端测试(16+ 主流 AI 客户端)、把每一次 JSON-RPC 调用画成瀑布流轨迹、OAuth 与 EMA 一致性检查,并能模拟多用户工作流、把评测固化成 CI/CD 门禁,让每个 PR 都卡在模型行为上
Dictation API(AssemblyAI:把「用户说了什么」直接变成能发出去的文字)
普通语音转写给你的是「说了哪些字」,口癖、重复和自我更正都留着;口述场景要的是「想说什么」——去掉语气词、解开自我更正、把人名和术语拼对,拿到的文字可以直接发出去。AssemblyAI 9 月 18 日上线的 Dictation API 就是冲这件事做的:基于 Universal-3.5 Pro,覆盖 19 种语言,官方称短音频延迟中位数约 134 毫秒、一秒内返回,输出形式可以用提示词指定(笔记、提交信息、给客户的回复)。官方定价 $
Headroom(在内容进模型之前先压一遍:工具输出、日志与 RAG 片段)
编码智能体的账单大半花在「喂进去的东西」上:工具输出、日志、RAG 片段、文件与对话历史。Headroom 在这些内容到达模型之前做压缩,官方给出的口径是编码智能体可省约 20% token,JSON 类内容可省 60%—95%,并强调答案基本不变。压缩在本地完成,提示与文件内容不上传。它有四种接入方式:Python / TypeScript 库直接调用 compress(messages);headroom proxy --port
codebase-memory-mcp(把代码库索引成常驻知识图谱,换个会话不用重新读一遍)
每次新开一个会话,智能体都要重新探索一遍代码库:grep、读文件、理解调用关系,这些动作把上下文窗口和 token 预算都吃掉了。codebase-memory-mcp 是一个代码智能 MCP server,把代码库索引成常驻的知识图谱,官方称平均仓库可做到毫秒级索引、亚毫秒查询,能减少约 99% 的 token 消耗;支持 158 种语言,交付形态是一个零依赖的静态二进制。它用 C 编写、MIT 许可,9 月 19 日仍有提交,目前约
OpenCodeReview(把代码评审拆成「确定性管线 + 模型判断」两层)
阿里把内部用了两年的 AI 代码评审助手开源成 OpenCodeReview:一个 Go 写的 CLI,仓库约 3.8 万 star,9 月 20 日仍有提交。它和多数 AI 评审工具最大的差别是分工——选文件、打包上下文、匹配规则、拿评审意见去和 diff 校验,这些能确定性完成的事交给流水线,不让模型插手;只有代码分析交给带工具调用能力的 LLM 智能体。智能体能读完整文件、检索代码库、查看其它改动文件来补上下文,输出带行号定位的意
Delta(把代码评审从 Pull Request 搬到与智能体的同一条线程里)
Zed 发布 Delta 的公开测试版,一个把「和智能体一起写代码、并评审它们的产出」放进同一个多人环境的产品。最有说服力的动作是他们把自己仓库的 Pull Request 关掉了,现在完全在 Delta 里开发和协作。协作不依赖提交与推送:把队友邀请进与智能体的对话后,对方能看到同一批 worktree 并在自己机器上继续工作,也能直接问同一个智能体为什么某个实现选择这样写;你下线后队友可以接着往下做。评审有专门的子线程,带着原始智能
Kimi Code(把编程智能体的桌面端、命令行与 IDE 插件收进一套订阅)
月之暗面把 AI 编程工具做成了一套订阅:Kimi Code 现已覆盖桌面端、命令行(CLI)与 IDE 插件三种形态,同一个账号在三种环境里调用的是同一个编程智能体,不需要分别配置。官方页面列出的能力包括写代码与改代码(实现新功能、修 bug、重构)、读懂代码库(搜索、阅读、分析现有代码)、跑命令(执行测试、构建与脚本并验证结果),以及联网搜索或读取网页内容;首屏演示直接展示按项目分组的多会话列表,landing-page、kimi-
TypeSafe(把判断类调用单独做成模型:一次前向算出「允许答案」的概率)
TypeSafe 在做一件很窄但很常见的事:把「从几个固定答案里选一个」这类判断从生成式模型里拆出来。它的路线是 RLCD——面向校准决策的强化学习,注意力计算只跑一次,然后直接算出每个允许答案的概率,而不是把整段文本自回归地生成完,因此返回的是带类型、经过校准的判断结果。官方把这条路线与预训练模型、RLHF 聊天模型、RLVR 推理模型并列,当作演化路径上的下一格。对使用方最直接的收益是成本:其模型 Jev 定价为每百万输入 toke
Open Design(开源的设计工作台:让编码智能体直接产出可交付的设计文件)
Open Design 把「设计」这件事从专门的绘图工具搬回了编码智能体里:它是一个本地优先的桌面应用,做法是把你已经在用的 Claude Code、Codex、Cursor、OpenCode 等 20 多种命令行李具接进来,让它们充当渲染引擎,产出的不是截图而是真实文件——原型、落地页、仪表盘、幻灯片、图片与视频都能直接导出 HTML / PDF / PPTX / MP4。官方把它定位成闭源设计产品的开源替代,走 BYOK(自带密钥)
cognee(把智能体的长期记忆做成可以自托管的知识图谱)
cognee 解决的是智能体最实际的短板:换个会话就什么都不记得。它把对话、文档与结构化数据统一抽取成一张知识图谱,让智能体在跨会话、跨任务时能查回之前的事实,而不是靠不断往上下文里塞历史消息。与直接用向量库检索相比,图谱这一层多做了实体与关系的归并,回答「这几个东西之间是什么关系」这类问题时不至于只能拼相似片段。项目用 Python 写、Apache 2.0 许可、可以完全自托管,9 月 22 日仍有提交,约 3.1 万 star。适
Laya(把判断类调用从大模型里拆出来的决策模型,本地可跑)
Laya 解决的是 agent 里被浪费的一层:分类、路由、打分、审核这类判断根本不需要生成文本,用通用大模型跑既慢又贵,还得解析输出。它给一个状态(文本、邮件、工单、JSON)加一组带类型的问句(choice 选一个、score 打分、noul 是否),单次前向 33 毫秒返回带校准概率的答案,模型不生成任何文本,因此没有解析错误也没有幻觉。三个检查点覆盖英语与 100 多种语言,内置 Router 按请求挑;权重 Apache 2.
Ming-Image-0.1-Design(6B 设计模型:出稿,也把成品图拆回可编辑图层)
这个系列包含两个 6B 模型,正好接在设计流程的两端:Design 从文字生成 UI、信息图与海报这类文字密集的设计稿,原生支持 RGBA 输出(透明背景不用抠图),官方给的推荐分辨率是 2048;Design-Layer 反着来,把一张扁平化的设计图按拆层计划还原成 2 到 9 个可编辑的 RGBA 图层,让改稿从重画变成编辑。两个模型共用一套推理代码,权重以 MIT 许可开源,官方验证配置是单张 80GB 显存的 CUDA 卡。适合
Unreal Agent(把工具调用挪到后台异步跑的编码智能体:你在等它,它不用等你)
9 月 21 日开源、MIT 许可的编码智能体 harness(Go 编写,约 1900 star),核心设计只有一句话:工具调用异步执行。多数 agent 在执行耗时命令时会卡住整条会话——它在等结果,你就只能看着;Unreal Agent 把工具调用作为「操作」提交到后台,你可以继续输入、调整方向,结果回来再并入上下文。官方称在生产负载与基准上相对 Codex 最多省 40% 成本且不掉分,并给出 Terminal-Bench 4.
Alexandria(Firecrawl 给 agent 建的「数据图书馆」:官方 API、专门索引与实时网页一个入口)
Firecrawl 在 9 月 24 日公布的 $75M B 轮同时推出的产品,解决的是 agent「找不到好数据」这件事。它把三类来源合成一个库:Firecrawl 自建的索引(研究索引 4300 万篇摘要、开发者索引 7000 万+ README/issues/PR/文档)、官方 API(如 FRED、World Bank、GitHub、PyPI)以及授权出版方的数据(财报、播客转写等)。官方口径是 93 家提供方、640 项能力、
Zoho AgentInbox(给每个 AI Agent 一个专属邮箱:独立凭据 + 完整审计轨迹,走 REST 与 MCP 调用)
9 月 24 日开放早期访问的邮箱基础设施,专门给 AI Agent 用:每个 agent 分配到独立邮箱与独立凭据,它收发过的每一件事都留下完整审计轨迹,不再和人的邮箱共用一套账号。所有能力都有 REST API;对支持 MCP 的框架还内置了一个 MCP server,让 agent 把「发邮件、读邮件」当成原生工具调用,而不是自己拼 SMTP 与 IMAP。Python 与 Node.js SDK、终端 CLI 官方称随后推出,生
Docker Cloud Sandboxes + Sandbox Kit Spec(把「agent 能碰什么」写进镜像,沙箱从笔记本搬到云上)
9 月 24 日 Docker 发布两件配套的东西。一是 Cloud Sandboxes:把 agent 的隔离执行环境从开发者笔记本搬到云上,笔记机关机后工作流可以继续跑,不用自己搭机器、也不必为闲置容量付费。二是下一代 Kits:把 agent、它的工具、以及一份「它申请访问什么」的类型化清单(主机、凭据、卷)打成一个普通 OCI 镜像,于是固定镜像就等于固定了 agent 与它的权限申请,没有私有格式;规范以 Apache-2.0
Exa Agent Ultra
Exa 在 Agent 产品线里加的最高 effort 档位。接到任务后先把问题拆成子问题,再派多个子代理并行检索,最后汇总成答案;官方自己的说法是「把前沿智能放在真正需要的地方,把更快的模型放在够用的地方」。官方公布的 WANDR、DeepSearchQA、WideSearch、Find-All Company 四项评测均称优于 Opus 5.5、GPT-6 Astra 与 Perplexity Agent,且完成单个任务的成本更低。
LemonBeam
扫一个公开的 GitHub 仓库或本地目录,生成一份「每条论断都带出处」的入职指南,出处精确到文件名与行号,用来快速弄清一个陌生代码库怎么跑起来、各部分谁负责。三种用法:网页版(贴仓库地址 + 自备 OpenRouter API key)、CLI(输出 Markdown,可直接贴进 wiki 或 CLAUDE.md)、MCP server(加进 Claude Code、Codex 之类客户端当工具调用)。MIT 开源,仓库仍处早期(个位
Lovable
用自然语言描述需求就能生成可上线的全栈应用,自带数据库与登录,适合把想法快速做成产品。
Bolt.new
浏览器里直接跑完整开发环境,对话生成项目并即时预览部署,不用配本地环境。
CodeRabbit
自动对每次提交做代码评审,指出逻辑漏洞与风格问题并给出修改建议,减少人工过 PR 的负担。
Greptile
把整个代码库索引后再回答与评审,能理解跨文件依赖,问「这改动会影响谁」时答案更靠谱。
Qodo
专注代码质量与测试生成的助手,能自动补测试用例并在评审时提示边界情况。
Mintlify
把 Markdown 变成专业文档站,内置搜索与接口文档渲染,开发者文档开箱即用。
Pi
主打陪伴式对话的助手,语气温和会追问,适合当日常倾听和闲聊对象。
Replika
可长期相处的虚拟伙伴,记得住你说过的事,适合需要持续陪伴感的用户。
GPT4All
完全在本机离线运行的对话客户端,文档不出设备,适合处理敏感资料的场景。
You.com
把搜索与多个模型放在一起的助手,可切换模式做资料检索与长报告。
Phind
面向开发者的搜索问答,回答带资料来源与代码片段,排查技术问题比通用搜索快。
Kagi
订阅制无广告搜索,可以屏蔽垃圾站并按自己偏好调排序,适合重度检索用户。
Wolfram Alpha
能直接算出答案的计算知识引擎,数学、单位换算与数据类问题比大模型更可靠。
Elicit
按研究问题检索论文并抽取结论做成对比表,写综述时省掉大量翻文献的时间。
Consensus
用一篇篇论文的结论回答你的问题,并标出支持与反对的比例,适合看某个说法的证据强度。
Scite
把论文的引用关系细分为支持、提及与反驳,判断一篇研究是否被推翻很有用。
Glean
把公司内部的文档、聊天与工单统一检索,并沿用在职权限,适合内部知识很散的大团队。
Sider
浏览器侧边栏助手,在任意页面里划词提问、总结与翻译,不用来回切标签页。
Monica
装在浏览器里的 AI 助手,能读当前页面并顺手改写、总结与翻译。
Raycast AI
桌面启动器内置 AI 命令,选中文字就能总结、改写、翻译,效率工具的集大成者。
Granola
开会时只录音不打扰,会后把语音与你的手写笔记合成纪要,适合不想要机器人的会议场景。
Fireflies.ai
自动进会录音并生成纪要、待办与可搜索的会议库,跨团队追溯决策很方便。
Motion
把任务自动排进日历并随进度重排,适合事情多到排不过来的场景。
Superhuman
以快著称的邮件客户端,AI 帮你起草与摘要,处理大量邮件时省时间。
Shortwave
带 AI 助手的邮箱,能把长邮件串总结成要点,还支持用自然语言找邮件。
Mem
不用手动分类的笔记工具,写下来自动关联,之后靠搜索就能找回来。
Reflect
双向链接笔记配 AI 助手,能基于自己的笔记提问并生成摘要。
Napkin AI
把要点文字一键转成示意图与图表,做方案和演讲稿配图不用再开设计软件。
Sudowrite
面向小说作者的写作助手,擅长扩写、改写与情节建议,创意类写作手感好。
Lex
带 AI 反馈的写作编辑器,写不下去时给出下一句建议,反馈偏编辑视角。
Writesonic
偏营销场景的写作工具,能批量产出 SEO 文章与广告文案,适合内容运营。
QuillBot
改写与语法检查工具,同一句话能换成多种语气,英文写作与降重用得多。
Opus Clip
把长视频自动切成适合短视频平台的片段并加字幕,二次分发省掉剪辑工时。
Captions
拍口播视频时自动加字幕、补光与剪辑,一个人也能做出观看体验不错的成片。
Hedra
让一张静态人像按音频开口说话,口型与表情比较自然,适合做讲解类短视频。
Krisp
实时通话降噪与回声消除,在嘈杂环境开会也能让对方听清。
Moises
把歌曲拆成人声与伴奏各轨,练乐器、做翻唱或做混音素材都用得上。
Civitai
开源图像模型的社区与模型库,能直接抄别人的参数与工作流,出图风格扩展很方便。
OpenArt
提供多种出图模型与风格训练的创作平台,做系列角色时一致性能控制得更好。
Pixlr
浏览器里的修图工具,抠图、消除杂物与批量处理都能做,不用装软件。
Photoroom
手机拍的商品图一键去背景换场景,做电商详情页与投放素材很省事。
Vectorizer.AI
把位图自动转成可缩放的矢量图,Logo 与插画做印刷前处理省掉手描。
Uizard
把草图或文字描述转成可编辑的界面原型,产品早期验证想法很快。
Chatbase
上传资料就能做出回答准确的客服机器人,嵌到网站或接进消息平台都行。
Voiceflow
可视化设计多轮对话流程,适合团队协作打磨客服与语音助手的对话逻辑。
Gumloop
用拖拉拽把 AI 节点和日常工具串成自动化流程,不用写代码也能做批处理。
Lindy
把邮件、日历与常用工具接起来,用自然语言设定触发条件让助手自动跑流程。
AutoGPT
早期让模型自主拆任务并连续执行的代表项目,用来体验智能体编排的边界。
Gortex
把代码库索引成持久化知识图谱、再以 CLI / MCP Server / HTTP 接口提供给编码 agent 的代码智能引擎(Apache-2.0)。它用 tree-sitter 与编译器级解析为 257 种语言建出函数、类、调用链、HTTP 路由与跨服务契约的图谱,默认支持多仓库,让 agent 按需取片段而不是把整份文件读进上下文,官方称单次响应的 token 用量最多降到五十分之一。一条 init 命令可自动配置本机检测到的多种
Mistral OCR 4
Mistral AI 的文档理解模型,第四代把目标从「把一页转成干净文本与表格」升级为「返回整份文档的结构化表示」:可通过传入自定义 JSON Schema 拿到按你定义排布的输出,也能标注检测到的图片块。API 定价 $4 / 1,000 页,Batch API 五折到 $2 / 1,000 页,Mistral Studio 里的 Document AI 为 $5 / 1,000 页;同时提供自托管选项,适合有数据不出内网要求的团队。
Blitzy
面向企业的自主软件开发平台,9 月 28 日新增的 PR Review 会给每个拉取请求生成一份说清「改了什么、为什么这么改、风险在哪」的摘要,让团队在合并 AI 生成的代码前先看懂它,而不是只看行数与文件列表。它的 Sandbox 允许组织免费反向工程最多 100 万行存量代码、生成最多 2.5 万行带端到端测试的代码,并顺带标出安全漏洞。适合已经在用 agent 大量产码、评审环节开始堵住的工程团队。
C1 AppHub
让「用 AI 一上午做出来的内部应用」能安全发给同事的自托管平台:把部署、登录、权限、凭证这几件最容易卡住的事做成标准件,跑在你自己已有的云账号与基础设施上。它的仓库里带一个 skills 文件,编码 agent 一次提示就能生成一个通过 C1.ai 登录、按 C1.ai 的策略判权限、凭证不落地、模型调用也走 C1.ai 的应用;配合 C1 AppHub 的 MCP server,同一个提示在生成应用的同时把它发布出去,从空仓库到能跑
RRSI
让 agent 改自己的 harness(提示、工具、记忆、控制流、子 agent)而不改模型权重的一套开源方法:难点从来不是「能不能改」,而是改出来的东西往往只是把评测集背下来了。RRSI 把约束加在「搜索」这一步——编辑预算按余弦调度逐步收紧(早期可一次改多处,后期只允许改一处且要能归因),每轮编辑都进一份台账(改动组件、假设、diff、分数变化、成本变化),被证伪的方向不再重试;选择侧配一个评审器先筛掉写死了任务名、实体或答案的提
Relevance AI Invent 2.0
面向企业的 agent 工作台,9 月 29 日发布 2.0。它想解决的是「单个同事用 copilot 提效」到「整个部门跑自主工作流」之间的落差:把构建、测试、迭代 agent 工作队伍放进同一个界面,配上企业需要的权限、测试、监控与自改进回路。官方对外的说法是让组织跨过 Level 3 / Level 4 的系统性生产力,而不是停留在个人提效;它把评测与观测当作一等公民,agent 上线后要能看到每一步、能回放、能按失败案例回归。适
Magnitude
面向 agent 的开源推理引擎,把「针对你这台机器做优化」当成核心功能:它在本地编译并调优算子内核,让同一个开源模型跑起来比 llama.cpp 快最多约 2 倍。官方说 Apple Silicon、NVIDIA、AMD 都能跑,只有 CPU 也能跑;Rust 编写,Apache-2.0 许可。适合要在自有硬件上跑本地 agent、又不满足于通用推理引擎默认性能的团队。
Restate
给 agent 与后端用的持久化执行运行时。它解决的是「流程跑到一半挂了怎么办」:durable function 写在单个二进制里,日志走一层快速的分布式日志,官方给的指标是每次持久化动作的 P99 开销低于 10 毫秒、集群每秒可处理 10 万次以上动作。Replit 用它承载 agent 平台的全部持久化编排,也有银行把它用在账户与信用卡核心流程上;团队来自 Apache Flink 的原始作者。开源可自托管,另有全托管云与 BY