快速了解本文
阿里千问上线 Qwen3.8-Omni-Flash 全模态模型
音视频能力对标 Gemini,音频能力整体超越
百万 Token 输入价格降至 0.8 元,降幅超九成
本摘要由 AI 辅助整理,请以正文内容为准。
数智朋克讯 9月18日,阿里千问正式上线新一代原生全模态模型 Qwen3.8-Omni-Flash。该模型支持同时处理文本、图像、音频和视频输入,并提供 1M(百万级)上下文窗口。在大幅提升全模态处理能力的同时,其百万 Token 图文音视频输入价格降至 0.8 元,展现出极致的性价比。
在性能方面,官方数据显示,Qwen3.8-Omni-Flash 在累计 30 项评测中平均得分较上一代 Qwen3.5-Omni-Plus 提升超过 26%,其音视频能力接近 Gemini 3.8 Flash,音频能力整体超越后者。模型支持长音视频理解,可处理最长一小时的音视频输入以生成会议纪要和待办事项,并结合扩展能力实现按需描述、Agentic 主动取证及会议任务推进等复杂工作流。此外,阿里同步推出实时版 Qwen3.8-Omni-Flash-Realtime,支持在音视频流输入时同步完成感知与响应,并具备融合空间声音与视觉信息的“听声辨位”能力。
成本的大幅下探是该模型的另一核心突破。阿里云百炼平台最新定价显示,Qwen3.8-Omni-Flash 每小时音频输入价格降幅超过 98%,每小时音视频输入价格降幅超过 93%。这种“能力进阶+成本骤降”的策略,将显著降低长音视频分析、实时多模态交互及复杂 Agent 工作流的开发门槛,加速全模态应用从验证阶段向规模化生产环境落地。具体调用计费详见阿里云百炼模型价格。

