DeepSeek-V3:突破性MoE语言模型,解锁AI新时代
DeepSeek-V3 是一个突破性的Mixture-of-Experts(MoE)语言模型,拥有6710亿参数,采用创新的多头潜在注意力(MLA)机制和负载平衡策略,在数学推理和编程任务中展现了超凡的性能。
SEARCH INTELLIGENCE
从最新动态到实用工具,找到你关心的内容。
PRODUCT DISCOVERY
DeepSeek-V3 是一个突破性的Mixture-of-Experts(MoE)语言模型,拥有6710亿参数,采用创新的多头潜在注意力(MLA)机制和负载平衡策略,在数学推理和编程任务中展现了超凡的性能。
INTELLIGENCE FEED
Reflection AI 正式发布 5010 亿参数的开放权重模型 Beam。该模型在高级推理测试中声称对标中国头部模型 GLM-5.2,且推理计算成本降低 3-4 倍,权重预计于本月晚些时候开放。
9月25日,美团上线 LongCat-2.5-Preview 模型。该模型采用 1.6 万亿参数 MoE 架构,原生支持 100 万 token 上下文,新增图片理解能力,并深度适配多款主流 AI 编程开发环境。
蚂蚁集团发布并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL,引入视觉反馈闭环机制,使模型从一次性看图生成转向观察-行动-验证-修正的持续任务执行模式。模型总参数 124B,单次推理激活 5.5B,原生支持图像、文本与视频输入,上下文窗口达 256K Token。
腾讯发布并开源混元 Hy4 preview 模型,总参数 770B、激活参数 49B,支持 1M 上下文长度,并在三维 Blaschke–Lebesgue 几何难题上取得科研突破。
阿里通义千问团队发布并开源 Qwen3.8-Flash 125B 参数 MoE 模型,训练成本降至前代的九分之一,原生支持 262K 上下文并可通过 YaRN 扩展至 1M,API 定价为每百万 Tokens 输入 1 元、输出 3 元。
阿里通义团队发布全新基础模型架构Qwen3-Next,同步开源基于该架构的Qwen3-Next-80B-A3B系列模型。新架构针对上下文长度扩展与参数扩展深度优化,通过混合注意力机制与极致稀疏MoE方案实现训练推理双重突破。
阿里巴巴开源的通义万相Wan2.2视频生成模型引入MoE架构,节省50%计算资源并新增电影美学控制系统。开源的三款模型支持高清视频生成,其中TI2V-5B可在消费级显卡快速处理高清视频。
数智朋克获悉月之暗面正式推出万亿参数Kimi K2模型并开源其MoE架构,该模型在多项基准测试中超越主流开源竞品。技术创新聚焦MuonClip优化器,API服务已上线并兼容主流格式,定价明确
猎户星空近日发布的Orion-MoE8×7B大模型,结合生成式混合专家架构,具备多语言处理能力,表现出色。与聚云科技合作推出的AI数据宝平台进一步助力大模型商业化,推动企业AI应用突破。