本土快讯2026.09.18

阿里千问上线 Qwen3.8-Omni-Flash:音视频能力对标 Gemini,API 价格降幅超九成

阿里发布新一代原生全模态模型 Qwen3.8-Omni-Flash,支持 1M 上下文与长音视频理解,音视频能力对标 Gemini 3.8 Flash。其百万 Token 输入价格降至 0.8 元,大幅降低多模态应用开发门槛。

朋克君
发布者朋克君
预计阅读 2 分钟
我要投稿
AI 摘要
约 1 分钟

快速了解本文

01

阿里千问上线 Qwen3.8-Omni-Flash 全模态模型

02

音视频能力对标 Gemini,音频能力整体超越

03

百万 Token 输入价格降至 0.8 元,降幅超九成

本摘要由 AI 辅助整理,请以正文内容为准。

数智朋克讯 9月18日,阿里千问正式上线新一代原生全模态模型 Qwen3.8-Omni-Flash。该模型支持同时处理文本、图像、音频和视频输入,并提供 1M(百万级)上下文窗口。在大幅提升全模态处理能力的同时,其百万 Token 图文音视频输入价格降至 0.8 元,展现出极致的性价比。

在性能方面,官方数据显示,Qwen3.8-Omni-Flash 在累计 30 项评测中平均得分较上一代 Qwen3.5-Omni-Plus 提升超过 26%,其音视频能力接近 Gemini 3.8 Flash,音频能力整体超越后者。模型支持长音视频理解,可处理最长一小时的音视频输入以生成会议纪要和待办事项,并结合扩展能力实现按需描述、Agentic 主动取证及会议任务推进等复杂工作流。此外,阿里同步推出实时版 Qwen3.8-Omni-Flash-Realtime,支持在音视频流输入时同步完成感知与响应,并具备融合空间声音与视觉信息的“听声辨位”能力。

成本的大幅下探是该模型的另一核心突破。阿里云百炼平台最新定价显示,Qwen3.8-Omni-Flash 每小时音频输入价格降幅超过 98%,每小时音视频输入价格降幅超过 93%。这种“能力进阶+成本骤降”的策略,将显著降低长音视频分析、实时多模态交互及复杂 Agent 工作流的开发门槛,加速全模态应用从验证阶段向规模化生产环境落地。具体调用计费详见阿里云百炼模型价格

ARTICLE RECORD

转载说明

转载请注明文章出处。

TOPICS · 05

文章标签