这是什么

蚂蚁集团百灵(Bailing)团队8月7日在Hugging Face和ModelScope开放Ling-3.0-flash权重。核心卖点是「大知识、小计算」:总参数124B,但每个Token只激活5.1B——相当于你有一个124B的大脑,但每次思考只动用4%的神经元。架构上采用原生混合线性MoE,KDA和MLA层以5:1交替排列,256K上下文窗口可扩展到1M。

124B总参数5.1B激活256K→1M上下文万级Agent精调
Ling-3.0-flash架构

为什么叫「执行节点」

蚂蚁把Agent工作流拆成两层:规划层交给超大型推理模型(做复杂决策和多步规划),执行层交给Ling-3.0-flash(快速、低成本地把规划变成具体动作)。模型在超过1万个交互式Agent环境中做了精调,定位就是「干活的」而不是「想事的」。

经济性数据

在Artificial Analysis Intelligence Index上,Ling-3.0-flash单任务成本约0.04美元,平均解码时间1.4分钟,输出速度353 tokens/s(高性能配置下蚂蚁声称可超1100 tokens/s)。FP4/INT4量化后可以在单台NVIDIA DGX Spark上端到端运行——这意味着数据不能出楼的企业也能本地部署。华为昇腾栈已提供0-day支持,分层缓存让长输入的首Token延迟降低60%-80%。

  • 5.1B激活参数意味着不做前沿多步推理,但作为执行层够用且极便宜。
  • 开源许可+单DGX部署=企业自建Agent流水线的经济选择。
  • 规划-执行分离架构正在成为Agent工程的主流范式。

市场位置

这是本周最低调但最实用的发布。蚂蚁不是在拼参数大小,而是在拼「每个Agent调用花多少钱」。在Agent工作流中,规划层调用一次大模型可能花几毛钱,但执行层可能要调用几十上百次——如果每次都用大模型,成本会爆炸。Ling-3.0-flash解决的正是这个「执行层经济性」问题。

不是每个调用都需要最强模型,Agent的执行层需要的是「够快够便宜」。