它是什么
Exa 是一家做搜索的公司。它发布的 Agent Ultra 是自家 Agent 产品里 effort 最高的档位:接到一个研究任务后,先把任务拆成子问题,再分派多个 subagent 并行去不同方向检索,而不是让一个模型在一条上下文里按顺序翻资料。官方把这套分工描述为「把前沿智能放在真正需要的地方,把更快的模型放在够用的地方」。
官方公布的评测数字
以下全部是 Exa 自己公布的结果,对比对象是 Opus 5.5、GPT-6 Astra 与 Perplexity Agent 在各自最强设置下的表现。
- WANDR:分别高 12.6% / 213% / 103%,每任务成本约为 Opus 5.5 的一半。
- DeepSearchQA:分别高 4.7% / 21.0% / 10.1%,每任务成本比 GPT-6 Astra 低 46%。
- WideSearch:分别高 5.2% / 14.1% / 7.7%,是四者中每任务成本最低的。
- Find-All Company(把某家公司的信息找全):分别高 1579% / 2401% / 2069%,每实体成本最低。
评测口径要注意什么
Exa 自己交代了三点:评分逻辑与自己前作同源(vendored),差别在它自己的 contents tool、传输逻辑,以及换用了更便宜也更强的判分模型;别人公布过的成绩按公布值引用,没有的自己跑。这意味着这些百分比适合比较同一套口径下的相对差距和成本,不适合当作跨厂商的绝对分数。
什么时候值得用它
检索型任务分成两类:一类是一步到位的单点查询,用便宜模型就够;另一类是「把散在几千个来源里的事实凑齐」,这类任务上并行分派加按难度配模型的收益最大,因为耗时的部分本来就是并行的。验证方式也很直接:拿自己 20 条真实任务跑一遍,比「找到的关键事实条数 ÷ 花的钱」,而不是比单次回答的速度。
能省钱的地方通常不在模型,而在「谁去查、几个一起查」。