蚂蚁集团开源百灵系列首个原生多模态模型 Ling-3.0-flash-VL
9月9日,蚂蚁集团宣布开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL。该模型基于 Ling-3.0-flash 的 MoE 架构扩展,总参数量为 124B,单次推理激活 5.5B 参数,原生支持图像、文本与视频输入,上下文窗口为 256K Token。

该模型引入视觉反馈闭环机制,将任务执行过程从一次性图像理解扩展为“观察、行动、验证、修正”的循环。在医疗报告解读、前端代码生成和 GUI 自动化等场景中,模型可根据视觉反馈持续调整结果。训练阶段采用原生多模态联合训练,视觉信息的加入对文本能力带来正向影响。在 Artificial Analysis Intelligence Index v4.1.1 评估中,该模型较纯文本版本 Ling-3.0-Flash 提升 4 分。
实际测试中,Ling-3.0-flash-VL 在图片转网页任务里可理解布局和组件关系并生成代码,还能通过渲染结果对比进行自我修正。在 Image-to-WebDev Arena 官方评测中,以 linthium 为代号的该模型得分高于 GPT-5.4。作为 GUI Agent 使用时,它可识别界面结构并完成跨工具操作;在医疗报告解读中,也支持跨文档数据整合与风险标识。
技术实现上,该模型搭配任意分辨率视觉编码器与 VideoRoPE,语言主干沿用 42 层混合架构,交替排列 KDA 与 Gated MLA,比例为 5:1。其 256K 上下文窗口可承载长文档和长视频分析,实时视频对话、多轮视觉交互及长时任务保持低延迟响应。目前,Ling-3.0-flash-VL 已在 Ling Studio 上线并提供免费体验,BF16 和 FP8 版本已在 Hugging Face 与 ModelScope 开源,FP4 和 INT4 版本计划于近期发布。









