快速了解本文
蚂蚁集团开源百灵首个原生多模态模型 Ling-3.0-flash-VL。
引入视觉反馈闭环,支持观察-行动-验证-修正的持续任务执行。
总参数量 124B,单次激活 5.5B,上下文窗口达 256K Token。
本摘要由 AI 辅助整理,请以正文内容为准。
数智朋克讯 蚂蚁集团发布并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL,引入视觉反馈闭环机制,使模型从一次性看图生成转向观察-行动-验证-修正的持续任务执行模式。
关键数据
Ling-3.0-flash-VL 基于 Ling-3.0-flash 的 MoE 架构拓展,总参数量 124B,单次推理激活 5.5B 参数,原生支持图像、文本与视频输入,上下文窗口达到 256K Token。模型引入任意分辨率视觉编码器与 VideoRoPE,语言主干沿用 42 层混合架构,交替排列 KDA 与 Gated MLA,比例为 5:1,在实时视频对话、多轮视觉交互及长时任务中可保持低延迟响应。
视觉反馈闭环机制
模型在执行任务时不再一次性生成结果,而是基于视觉反馈持续修正输出。
视觉反馈闭环机制是该模型的核心差异。模型在执行任务时不再一次性生成结果,而是基于视觉反馈持续修正输出。在图片转网页任务中,模型可通过渲染结果对比进行自我修正;在 Image-to-WebDev Arena 官方评测中,模型代号 linthium 的得分高于 GPT-5.4;作为 GUI Agent,模型可识别界面结构并完成跨工具操作;在医疗报告解读场景中,支持跨文档数据整合与风险标识。
在训练层面,模型通过原生多模态联合训练,视觉信息的引入对文本能力带来正向提升。在 Artificial Analysis Intelligence Index v4.1.1 评估中,模型较纯文本版本提升 4 分,表明多模态训练对文本能力有正向溢出,而非牺牲文本能力换取视觉能力。
Ling-3.0-flash-VL 已在 Ling Studio 上线并提供免费体验。BF16 和 FP8 版本已在 Hugging Face 及 ModelScope 平台开源,FP4 和 INT4 版本计划于近期发布。

