蚂蚁百灵大模型近日宣布开源一款轻量级混合推理MoE模型——Ling-3.0-tiny,该模型以7.9亿总参数和1.3亿激活参数的精简设计,在保持高效推理能力的同时,显著降低了本地部署门槛。模型同步发布BF16、FP8和INT4三个精度版本,已在DGX Spark、MacBook、Mac mini等设备上完成验证,覆盖从专业级AI工作站到个人电脑的多样化场景。
在Artificial Analysis Intelligence Index评价体系中,Ling-3.0-tiny以25分的综合成绩紧追260亿参数的Gemma-4-26B-A4B(仅差1分),同时超越gpt-oss-120B(high)、Qwen3.5-9B等知名模型。其核心优势在于通过稀疏MoE架构实现参数效率与计算成本的平衡:每个Token仅激活8个路由专家和1个共享专家,在保持长上下文建模能力的同时,将峰值内存占用控制在8.34GiB(8K上下文长度)。
该模型采用3:1的KDA-MLA混合注意力架构,即每4层中包含3层月之暗面自研的KDA(Kimi增量注意力)和1层DeepSeek自研的MLA(多头潜在注意力)。这种设计使模型在代码生成、数理推理、指令遵循等任务中表现均衡,尤其在Agent能力方面表现突出——其Artificial Analysis Agentic Index得分达16,高于310亿参数的Gemma-4-31B模型。实测显示,Ling-3.0-tiny的输出速度超过160 tokens/s,生成500个Token的端到端用时约18秒(含思考过程)。
本地部署能力是Ling-3.0-tiny的另一大亮点。在FP8精度下,模型于DGX Spark上的推理吞吐量达100-105 tokens/s,两路并发时聚合吞吐提升至161 tokens/s;在M4 Pro MacBook上,首Token响应时间低于100毫秒,可流畅运行代码辅助、文档处理等任务。开发者在一台36GB内存的MacBook Pro上复现了Infinite Wiki(无限百科)的核心功能:用户点击词语即可生成上下文解释卡片,支持多层知识下钻,全程无需云端调用,数据完全留存本地。
针对不同硬件环境,Ling-3.0-tiny提供差异化部署方案:BF16版本适合对精度要求高的研究场景;FP8版本在效果、速度和资源占用间取得平衡;INT4版本则进一步压缩资源需求,适用于算力有限的边缘设备。例如,在Mac mini上,模型可作为常驻式本地智能节点,提供划词翻译、语法纠错等离线服务,响应延迟低至毫秒级。
技术团队透露,后续优化将聚焦于提升长尾知识覆盖的准确性、增强复杂工具调用的稳定性,并完善FP8/INT4版本的硬件适配与部署文档。目前,模型代码已通过Hugging Face和ModelScope平台开源,开发者可根据需求选择不同精度版本进行二次开发或直接部署。






















