Alpha Arena:全球首个 AI 金融智能大比拼,DeepSeek 与 Qwen3 Max 领跑加密货币交易战场
Alpha Arena 是全球首个测试法学硕士 (LLM) 金融智能的基准测试,六个顶级 AI 模型使用真实资金进行加密货币期货交易。测试结果显示 DeepSeek 和 Qwen3 Max 表现优异,而部分西方模型因风险管理不善出现大幅亏损。这场实验证明了金融 AI 中风险控制的重要性,并为未来人机协同的金融模式提供了实证依据。
SEARCH INTELLIGENCE
从最新动态到实用工具,找到你关心的内容。
PRODUCT DISCOVERY
Alpha Arena 是全球首个测试法学硕士 (LLM) 金融智能的基准测试,六个顶级 AI 模型使用真实资金进行加密货币期货交易。测试结果显示 DeepSeek 和 Qwen3 Max 表现优异,而部分西方模型因风险管理不善出现大幅亏损。这场实验证明了金融 AI 中风险控制的重要性,并为未来人机协同的金融模式提供了实证依据。
INTELLIGENCE FEED
AI 模型评测平台 Arena 宣布完成 2 亿美元 B 轮融资,投后估值达 31 亿美元。在 10 个月内估值几近翻倍,其背后是年化经常性收入(ARR)从 3000 万美元增至 1 亿美元的商业化兑现,以及评测维度从单纯性能向模型“对齐”的拓展。
阿里千问发布 Qwen3.8-Max-0902 版本,在 CodeArena 前端编程总榜以 1691 分夺冠,每百万 Tokens 综合价格 5 美元,已上线 API 并接入千问办公、Qoder 和千问 App。
腾讯混元图像3.0在LMArena全球盲测榜单中超越26个主流大模型登顶。该开源模型发布一周即占据Hugging Face热榜首位,衍生模型超3000个。
谷歌DeepMind正式推出Gemini 2.5 Flash Image图像模型,优化了速度与上下文理解,支持基于文本提示的精准编辑。该模型在LMArena基准测试中表现领先,提供安全机制,开发者可通过Gemini API等访问,输出定价为每百万token 30美元。
Google DeepMind 推出了最新的 "Gemini 1.5 Pro Experimental 0801" 模型,在 Chatbot Arena 中超越了 GPT-4 和 Claude-3.5,成为文本和多模态测试的第一名。