早报
资讯
工具
素材
学习
排行
社区
🔍
☽
店铺
登录
教程
实测
概念手册
学习资源
就业情报
远程工作
AI 工具测评
真实体验、不吹不黑。已深度评测
57
款 AI 工具,涵盖聊天对话、绘画设计、编程开发、音视频、办公效率与搜索研究
没有匹配的测评文章。
AI 工具测评
Qwen3.8-27B
评分 4.5/5。8 月 14 日开源的原生多模态 27B 模型,SWE-bench Pro 61.7 超过 Opus 4.6 Max,4bit 量化约 17GB 可在消费级显卡运行,是当前单卡可跑的最强开源模型之一。
LTX-2.5
评分 4.5/5。8 月 11 日发布的开源视频模型,原生支持 ComfyUI,10 秒左右可生成 720P 短视频。本地 12GB 显存可跑,是当前开源视频生成里对创作者最友好的一版。
DeepSeek-V4 Flash
评分 4.7/5。MoE 架构,2840 亿参数激活 130 亿,100 万 Token 上下文,支持思考/非思考模式切换。API 价格极低,是当前性价比最高的前沿大模型之一。
豆包(含 SeedRealtime)
评分 4.5/5。豆包 App 全量上线 SeedRealtime 全双工大模型后,成为国内首个支持同时听说交互的 AI 助手。免费、多模态、语音体验领先。
Kimi K3
评分 4.5/5。月之暗面最新旗舰模型,长文本处理能力行业领先,推理能力大幅提升。中国大模型「八周五连发」之一,在全球开发者中接受度持续走高。
Cursor AI
评分 4.8/5。基于 VS Code 的 AI 编程编辑器,支持代码补全、对话式编程、多文件编辑、Agent 模式。2026 年最热门的 AI 编程工具之一。
MiniMax H3(视频生成)
评分 4.6/5。MiniMax 最新视频模型 H3 在 Design Arena 多图生视频、图生视频、视频编辑三类全面登顶,超越 Seedance、Gemini 等闭源模型,登 Hugging Face 趋势榜第一。
ChatGPT
评分 4.6/5。上手零门槛、插件生态最完整的通用对话工具,几乎什么都能干但什么都不精。
Claude
评分 4.5/5。长文写作和代码质量一流,中文表达自然得不像翻译,但网络检索和实时性一般。
DeepSeek
评分 4.4/5。API 价格低到离谱、开源模型能自己部署,中文推理和代码能力可圈可点。
Gemini
评分 4.3/5。Google 生态的 AI 入口,多模态理解和超长上下文是绝活,但中文表现时好时坏。
Midjourney
评分 4.7/5。AI 绘画的审美天花板,成图质感和光影效果至今无人能敌,但操作门槛劝退了不少人。
Cursor
评分 4.6/5。目前最好用的 AI 编程编辑器,能理解整个代码库、跨文件修改,重构效率提升不止一个档次。
Claude Code
评分 4.5/5。在终端里自主执行开发任务的 AI 代理,能读懂项目、跑命令、改代码、提交 PR,但计费方式让人又爱又恨。
GitHub Copilot
评分 4.3/5。代码补全的先行者和标杆,企业落地最成熟,但「只补全不改写」的定位正在被 Cursor 们挑战。
即梦 AI
评分 4.2/5。字节的一站式 AI 创作平台,中文提示词友好、图生视频免费额度大方,对国内用户最友好。
Suno
评分 4.5/5。写一段歌词就能生成一首带人声的完整歌曲,词曲质量让人意外——零乐理也能出歌。
通义千问
评分 4.2/5。阿里自研大模型,中文能力均衡、开源版选择多,与阿里云生态绑定较深。
文心一言
评分 4/5。百度自研大模型,中文知识问答和本土化场景扎实,但创造性与顶尖推理还有距离。
Kimi
评分 4.3/5。长文档阅读是招牌能力,丢进去几十页 PDF 能帮你理出头绪,适合做文献综述和资料梳理。
Perplexity
评分 4.5/5。带引用来源的 AI 搜索引擎,回答直接、能追溯原网页,适合做事实核查和研究。
Notion AI
评分 4.1/5。内嵌在 Notion 里的 AI 写作助手,在你已有的文档和知识库上工作,省去了粘贴来粘贴去的麻烦。
Runway
评分 4.4/5。专业级 AI 视频生成和编辑平台,图生视频和运动控制适合影视创作者,但学习曲线和价格都不低。
豆包
评分 4.3/5。字节的全能型对话助手,中文口语化体验出色,内置绘图、写作等工具箱,免费额度给得很足。
智谱清言
评分 4.2/5。基于 GLM 系列模型,Agent 和工具调用能力在国产模型里算第一梯队,AutoGLM 值得关注。
腾讯元宝
评分 4.1/5。腾混元大模型加持,文档和表格处理是亮点,微信生态衔接好,但创造性一般。
Grok
评分 4.2/5。Musk 的 AI 助手,深度整合 X 平台实时信息,回答风格犀利幽默,但需要订阅。
文心一格
评分 4/5。百度的 AI 绘画工具,国风和中国传统文化风格的表现力突出,适合中文场景。
DALL·E 3
评分 4.4/5。与 ChatGPT 深度集成的图像生成模型,提示词遵循力极强,写实的文字渲染也相对靠谱。
Adobe Firefly
评分 4.3/5。Adobe 的生成式 AI,强调可商用版权安全,深度嵌入了 Photoshop 和创意云工作流。
Stable Diffusion
评分 4.5/5。AI 绘画的开源标杆,自由度最高,ControlNet 和 LoRA 让精细控制成为可能,但门槛不低。
Windsurf
评分 4.4/5。主打 Cascade 代理式编程的 AI 编辑器,跨文件规划和执行改动的体验接近 Cursor。
v0
评分 4.2/5。专注前端 UI 的 AI 工具,一句话生成 React 组件,搭界面快但复杂逻辑还需人工。
Ollama
评分 4.6/5。本地运行大模型的最简单方式,一行命令加载 Llama/Qwen 等开源模型,隐私友好。
ElevenLabs
评分 4.7/5。AI 语音合成的标杆,声音克隆和情感表达自然到让人分不清是真人还是 AI。
HeyGen
评分 4.3/5。数字人视频生成的代表作,上传文案就能生成多语种口播视频,适合跨境营销和内容生产。
Microsoft Copilot
评分 4.2/5。嵌入 Office 365 的 AI 助手,Word/Excel/PPT 里直接写、改、分析,企业部署成熟。
Gamma
评分 4.4/5。AI 一键生成演示文稿和网页,排版好看、模板现代,适合快速产出汇报和分享材料。
秘塔 AI 搜索
评分 4.3/5。无广告的中文 AI 搜索引擎,回答带引用来源、支持学术搜索,中文资料检索体验一流。
Ornith-1.5-397B
评分 4.2/5。8 月 19 日发布的 Ornith-1.5 开源系列旗舰:397B MoE 在部分测试中超过 Claude Opus 4.8,同系列 9B-Mobile 量化版可直接在手机上运行,训练采用「自我改进循环」机制。
豆包工作
评分 4.1/5。8 月 25 日发布的豆包生产力 Agent 产品:围绕目标自主拆解任务、调用工具推进复杂流程,与飞书深度打通后可基于企业上下文工作;电脑版已开放下载,能力覆盖文档、表格、PPT、网页甚至应用的生成与编辑。
Gemini Omni 1.1 Flash
评分 4.2/5。8 月 27 日发布的视频生成模型:可分析前 10 秒上下文续写场景(每次 +10 秒、累计最多 40 秒),支持指定首尾帧与引用最长 3 秒参考视频;新增 360p 草稿模式,速度约为 720p 的 1.6 倍、成本约 1/3,可升级 4K,API 按秒计费。
Claude Fable 5.1
评分 4.3/5。9 月 1 日发布的 Claude Fable 5.1 是 Anthropic 当前最强的编程与知识工作模型:1M 上下文、最大输出 128K,在 Terminal-Bench 4.0 与 Humanity's Last Exam 上刷新纪录;定价与 Fable 5 持平,缓存读取从 1 美元降至 0.25 美元/百万 token。受限版 Mythos 5.1 仅面向网络安全与生命科学合作伙伴。
OpenAI GPT-6 Astra
评分 4.2/5。9 月 3 日发布的 OpenAI 旗舰模型 GPT-6 Astra,官方称其在超过 10 万块 GPU 上完成训练,把长周期软件操作作为主要卖点;它也是 OpenAI 首个达到内部 Preparedness 框架“关键”(Critical)网络安全门槛的模型。API 定价每百万输入 token 10 美元、输出 50 美元,约为 GPT-5.6 Sol 的 2.5 倍,最前沿的网络攻防能力暂不全面开放。
MiniCPM5-2B(面壁智能 / OpenBMB)
评分 4.3/5。9 月 8 日开源的 2B 高密度端侧语言基座模型,走 Apache-2.0。官方口径与 AA 榜单显示:综合 23 分列 4B 以下开源模型第一,Agentic Index 20 分;代码、数学、长文本、工具调用等 34 项任务平均 53.9 分同级第一。原生 128K 上下文,支持工具调用、深度搜索与代码生成,官方同步开源训练配方与数据集。本次为文本生成模型,多模态视觉能力不在该版本内。
LingBot-World 2.0 轻量版(1.3B)
评分 4/5。9 月 10 日发布的 LingBot-World 2.0 轻量版把参数压到 1.3B,面向消费级单卡 GPU、可本地实时生成可交互世界。它和「生成一段视频」不是一回事:角色前进一步、视角转向一侧,画面都要接着生成,模型是在持续生成一个可交互的世界。官方仓库公开模型、代码与技术报告(arXiv 2607.07534),7 月的 14B 主模型已做过超过一小时的不间断生成测试,本次轻量版是让这套能力落到单卡上的取舍版本。
Gemini 3.8 Live / 3.8 Live Extended Thinking(把实时语音压到一小时约 1.38 美元)
评分 4.2/5。9 月 15 日发布的 Gemini 3.8 Live 与 3.8 Live Extended Thinking 是面向开发者的实时语音模型,通过 Gemini API 与 Google AI Studio 提供。前者能在说话的同时在后台跑工具与 API 调用、处理近实时视觉输入,并在对话中途自动切换 97 种语言;后者会边说边推理,用「让我查一下」这类口头提示承接多步任务。这次发布最值得记的不是能力而是价格:音频输入
Claude Code Projects(把并行智能体编排做成产品功能)
评分 4/5。9 月 17 日进入 beta 的 Claude Code Projects 重构,把原来的「文件夹式项目」改成「对话式项目」:你给目标与仓库,Claude 拆解任务、并行开线程、检查产出并汇总。每个线程是一个云端 Claude Code 会话,有自己的分支与仓库副本,能开 PR、跑测试;线程之间改到同一段代码时按普通 PR 的合并冲突解决。项目带共享记忆与素材库,新线程会读取既有决策。首批只面向使用云端会话、且网页与桌面
Claude Opus 5.5(缓存读降到五分之一,代价是四个破坏性变更)
评分 4.5/5。9 月 22 日发布的 Claude Opus 5.5 是 Claude 5.5 家族的第一个模型,官方给的定位很直接:多数任务达到 Fable 5.1 的水平,运行成本比 Opus 5 低 40%。降的不是一项,而是整套单价——输入从 $5 降到 $4、输出从 $25 降到 $20、缓存读从 $0.50 降到 $0.20、缓存写从 $6.25 降到 $5,缓存读只有基础输入价的 0.05 倍。跑分上它在智能体编码、电
Xiaomi MiMo-V2.6 系列(开源榜首 46 分,价格一点没涨)
评分 4.3/5。9 月 21 日发布并开源的 MiMo-V2.6 系列包含 Pro 与 Flash 两个原生全模态模型,权重为 MIT 许可。Pro 在 Artificial Analysis 智能指数拿到 46 分,官方称超过 Kimi K3 与 Qwen3.8 Max、是当前最强开源模型,同时也承认与 Claude Fable 5.1、GPT-6 Astra 仍有差距。训练侧的数字很具体:不到 6 天完成,Flash 与 Pro
NotebookLM
评分 4.4/5。把一个主题的资料——PDF、网页、视频字幕、你的笔记——全部丢进去,用问答的方式把它读薄。最实用的是两点:回答会标出出处段落,能一键跳回原文核对;以及把长材料转成两个人对谈的音频概览,通勤时听完一份报告。适合做研究、写材料前的资料准备。
Mistral Le Chat
评分 4.2/5。Mistral 的对话入口,最突出的感受是快——同样的问题,回复几乎是立刻开始往外吐字。它同时提供轻量与小尺寸的旗舰档位,还给开发者留了自部署的通路,对数据不能出境的团队比较友好。多语言表现均衡,写作与翻译这类日常任务是它的舒适区。
Sora
评分 4.3/5。文生视频里最早被大众记住的产品,长处在于长镜头下的物理一致性——人物、衣物、光影在一段连续运动里不容易崩,镜头语言也听得懂「推近、环绕、俯拍」这类指令。适合做概念短片与分镜预演,不适合指望它直接产出可交付的商业成片。
Recraft
评分 4.3/5。少数把「生成矢量图」做成核心能力的图像工具。出的是真正的 SVG 而不是位图描摹,可以直接丢进设计软件改节点、换配色、放大多倍不糊。品牌风格训练是另一条差异线:喂几张自家视觉稿,之后出图能稳定沿用同一套色与质感,做整套物料不容易跑偏。
Lovable
评分 4.2/5。用自然语言描述需求,直接产出一个能跑的全栈应用,自带数据库、登录与部署。它的定位不是给工程师省打字,而是让没有工程背景的人把想法做成可访问的产品。前端与数据的连线它基本替你接好了,剩下的是描述清楚需求本身。
可灵 Kling
评分 4.2/5。国产视频生成里较早进入实用阶段的产品,中文提示词的理解是它的天然优势——不用先把想法翻译成英文再祈祷模型听懂。图生视频的稳定性不错,给一张商品图或人像,能生成运动自然的短片段,做电商素材与短视频起画面很省事。
OpenAI GPT-6.1 Sol(把 Astra 九成能力压到五分之一价格,但只供给 Work 与 Codex)
评分 4.4/5。9 月 29 日 OpenAI 在 DevDay 上发布 GPT-6.1 Sol,定位说得很直接:在编程、电脑操作与专业工作三类场景接近 GPT-6 Astra,价格只要五分之一。单项数字可以对上——输入 $2、输出 $10 每百万 token,而 Astra 是 $10 / $50;缓存命中输入 $0.10,正好是输入价的 5%,缓存写 $2.50。上下文 105 万 token,知识截止 2026 年 4 月 30