GPT-Live-1 接入 API:用单一语音模型替换 STT-LLM-TTS 级联栈
OpenAI 在 API 中上线 GPT-Live-1,将听与说合并到单一模型,原生处理打断、噪声与沉默,并把深度推理委派给后端文本模型。对频繁打断、电话噪声与长会话场景的语音代理,这意味着更低的工程复杂度与更自然的对话节奏,但开发者仍需自行权衡后端推理与工具调用的整体成本。
SEARCH INTELLIGENCE
从最新动态到实用工具,找到你关心的内容。
PRODUCT DISCOVERY
OpenAI 在 API 中上线 GPT-Live-1,将听与说合并到单一模型,原生处理打断、噪声与沉默,并把深度推理委派给后端文本模型。对频繁打断、电话噪声与长会话场景的语音代理,这意味着更低的工程复杂度与更自然的对话节奏,但开发者仍需自行权衡后端推理与工具调用的整体成本。
INTELLIGENCE FEED
OpenAI 发布 GPT-6 Astra Ultrafast 模型,基于 Blackwell GPU 运行,Token 生成速度提升 8 倍。该模型现已开放,旨在缩短代理工作流的调试循环,提升代码生成与工具调用的响应效率。
Google 发布前沿模型 Gemini 4 Argon,专注于编码、企业知识工作与网络安全防御。该模型输出 token 限制扩展至 1M,目前正通过 Fairwind Program 分阶段向受信任的网络防御者推出。
Reddit 宣布将于 2026 年底停用 RSS 订阅源,并于 2027 年 3 月关闭公共 API。此举旨在防范 AI 机器人抓取,保护其高利润的 AI 数据授权业务,将迫使依赖免费数据的第三方工具、研究人员和 AI 公司重构工作流或转向商业授权。
OpenAI 推出 GPT-6 Astra Ultrafast 服务,Codex 生成速度达 300 词元/秒,API 提速 6 倍。该服务输出定价最高 450 美元/百万词元,面向延迟敏感的企业级实时交互场景。
阿里发布新一代原生全模态模型 Qwen3.8-Omni-Flash,支持 1M 上下文与长音视频理解,音视频能力对标 Gemini 3.8 Flash。其百万 Token 输入价格降至 0.8 元,大幅降低多模态应用开发门槛。
Bain Capital Ventures 完成 16 亿美元第 11 期基金募集。该基金将专注早期 AI 初创企业,重点投资 AI 基础设施与安全等跨越 AGI 周期的底层赛道。
Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,首次将实时语音模型拆分为面向规模化对话与复杂推理两个版本,并同步开放 API 与 Workspace 入口。
DeepSeek 将快速、专家、识图三大模式合并为统一智能模式,用户无需手动切换,模型自动检测查询复杂度并激活相应能力。同时预告 V4.1 Flash 模型即将上线,在性能、费用、速度等指标上全面超越 V4 Pro。
网络芯片初创公司Celero Communications完成2.75亿美元融资,估值超30亿美元。公司成立仅约两年,产品聚焦AI数据中心集群的光纤互联。