昆仑天工旗下Mureka V8音乐大模型正式发布,在旋律创作、人声表现力等核心维度超越行业标杆Suno。同时启动Mureka Studio内测,提供单轨生成等功能,降低AI音乐创作门槛,并推动AI音乐向可发布品质迈进。
昆仑天工旗下Mureka V8音乐大模型正式发布,在旋律创作、人声表现力等核心维度超越行业标杆Suno。同时启动Mureka Studio内测,提供单轨生成等功能,降低AI音乐创作门槛,并推动AI音乐向可发布品质迈进。
小米正式开源原生端到端语音模型Xiaomi-MiMo-Audio,基于上亿小时训练数据实现少样本泛化能力,并在多项基准测试中超越同规模开源模型及闭源模型。该模型通过三重技术创新突破传统语音范式,全套技术方案已开源发布。
Coze Studio 是字节跳动开源的新一代 AI Agent 低代码开发平台,提供 Prompt、RAG、工作流等核心模块,通过可视化界面实现零代码 AI 应用开发。基于 Golang+React 的微服务架构遵循 DDD 原则,为开发者提供高性能、易扩展的工程底座,大幅提升 AI 开发效率。
阿里通义实验室推出空间音频生成模型OmniAudio,通过解析360°全景视频直接合成三维声场。该项目已全面开源,提供完整模型架构与Sphere360数据集,显著降低技术研发门槛。
Firebase Studio 构建了一个浏览器直达的「开发元宇宙」。它巧妙融合 Project IDX 的智能编码能力、Firebase 的云端服务矩阵以及 Gemini 的多模态 AI,打造出首个支持自然语言交互的全栈开发环境,开发者通过网页即可完成从原型设计到生产部署的全流程。
阿里通义大模型家族再添新成员,Qwen2系列新增音频语言模型Qwen2-Audio,可直接进行语音问答。通义团队还发布了新的音频理解模型测评基准,相关研究已入选ACL 2024国际会议。
Spikes Studio是一款专为内容创作者设计的AI视频剪辑工具,可将长视频转化为适合YouTube、Twitch、TikTok和Instagram Reels等平台的短视频。该工具具备自动生成字幕、标题、标签等功能,大幅简化视频编辑过程。
AutoStudio,一个无训练多代理框架。它利用基于大型语言模型(LLMs)和稳定扩散(Stable Diffusion, SD)的代理,能够在多个回合的用户互动中生成连贯且多样的图像。
在纽约峰会上,亚马逊云科技发布了由生成式AI驱动的Amazon App Studio,助力用户通过自然语言快速创建企业级应用程序。预览版现已在美国西部区域上线。
阿里巴巴集团旗下的通义实验室通过其FunAudioLLM项目,致力于提升人与大型语言模型(LLMs)之间的自然语音交互体验。FunAudioLLM由两大核心模型组成:SenseVoice和CosyVoice,分别专注于语音理解和语音生成,为多种应用场景提供强大的技术支持。