本土快讯2026.09.09

Ling-3.0-flash-VL 发布开源:百灵首个原生多模态模型引入视觉反馈闭环

蚂蚁集团发布并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL,引入视觉反馈闭环机制,使模型从一次性看图生成转向观察-行动-验证-修正的持续任务执行模式。模型总参数 124B,单次推理激活 5.5B,原生支持图像、文本与视频输入,上下文窗口达 256K Token。

朋克君
发布者朋克君
预计阅读 2 分钟
我要投稿
AI 摘要
约 1 分钟

快速了解本文

01

蚂蚁集团开源百灵首个原生多模态模型 Ling-3.0-flash-VL。

02

引入视觉反馈闭环,支持观察-行动-验证-修正的持续任务执行。

03

总参数量 124B,单次激活 5.5B,上下文窗口达 256K Token。

本摘要由 AI 辅助整理,请以正文内容为准。

数智朋克讯 蚂蚁集团发布并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL,引入视觉反馈闭环机制,使模型从一次性看图生成转向观察-行动-验证-修正的持续任务执行模式。

关键数据

124B总参数量MoE 架构拓展
5.5B单次激活参数高效推理
256K上下文窗口Token

Ling-3.0-flash-VL 基于 Ling-3.0-flash 的 MoE 架构拓展,总参数量 124B,单次推理激活 5.5B 参数,原生支持图像、文本与视频输入,上下文窗口达到 256K Token。模型引入任意分辨率视觉编码器与 VideoRoPE,语言主干沿用 42 层混合架构,交替排列 KDA 与 Gated MLA,比例为 5:1,在实时视频对话、多轮视觉交互及长时任务中可保持低延迟响应。

重点提示

视觉反馈闭环机制

模型在执行任务时不再一次性生成结果,而是基于视觉反馈持续修正输出。

视觉反馈闭环机制是该模型的核心差异。模型在执行任务时不再一次性生成结果,而是基于视觉反馈持续修正输出。在图片转网页任务中,模型可通过渲染结果对比进行自我修正;在 Image-to-WebDev Arena 官方评测中,模型代号 linthium 的得分高于 GPT-5.4;作为 GUI Agent,模型可识别界面结构并完成跨工具操作;在医疗报告解读场景中,支持跨文档数据整合与风险标识。

在训练层面,模型通过原生多模态联合训练,视觉信息的引入对文本能力带来正向提升。在 Artificial Analysis Intelligence Index v4.1.1 评估中,模型较纯文本版本提升 4 分,表明多模态训练对文本能力有正向溢出,而非牺牲文本能力换取视觉能力。

Ling-3.0-flash-VL 已在 Ling Studio 上线并提供免费体验。BF16 和 FP8 版本已在 Hugging Face 及 ModelScope 平台开源,FP4 和 INT4 版本计划于近期发布。

ARTICLE RECORD

转载说明

转载请注明文章出处。

TOPICS · 05

文章标签