这是什么
蚂蚁集团百灵(Bailing)团队8月7日在Hugging Face和ModelScope开放Ling-3.0-flash权重。核心卖点是「大知识、小计算」:总参数124B,但每个Token只激活5.1B——相当于你有一个124B的大脑,但每次思考只动用4%的神经元。架构上采用原生混合线性MoE,KDA和MLA层以5:1交替排列,256K上下文窗口可扩展到1M。
为什么叫「执行节点」
蚂蚁把Agent工作流拆成两层:规划层交给超大型推理模型(做复杂决策和多步规划),执行层交给Ling-3.0-flash(快速、低成本地把规划变成具体动作)。模型在超过1万个交互式Agent环境中做了精调,定位就是「干活的」而不是「想事的」。
经济性数据
在Artificial Analysis Intelligence Index上,Ling-3.0-flash单任务成本约0.04美元,平均解码时间1.4分钟,输出速度353 tokens/s(高性能配置下蚂蚁声称可超1100 tokens/s)。FP4/INT4量化后可以在单台NVIDIA DGX Spark上端到端运行——这意味着数据不能出楼的企业也能本地部署。华为昇腾栈已提供0-day支持,分层缓存让长输入的首Token延迟降低60%-80%。
- 5.1B激活参数意味着不做前沿多步推理,但作为执行层够用且极便宜。
- 开源许可+单DGX部署=企业自建Agent流水线的经济选择。
- 规划-执行分离架构正在成为Agent工程的主流范式。
市场位置
这是本周最低调但最实用的发布。蚂蚁不是在拼参数大小,而是在拼「每个Agent调用花多少钱」。在Agent工作流中,规划层调用一次大模型可能花几毛钱,但执行层可能要调用几十上百次——如果每次都用大模型,成本会爆炸。Ling-3.0-flash解决的正是这个「执行层经济性」问题。
不是每个调用都需要最强模型,Agent的执行层需要的是「够快够便宜」。