资讯中心

Our Projects
您的位置: 首页 > 资讯中心 > 刚刚,小米刷新 AI 大模型斩杀线,罗福莉:技术难度超过 DeepSeek R1

刚刚,小米刷新 AI 大模型斩杀线,罗福莉:技术难度超过 DeepSeek R1

发布时间:2026-09-22 浏览量:4565

就在刚刚,小米正式发布并开源 MiMo-V2.6 系列模型。 此次发布包含两款原生全模态模型。MiMo-V2.6-Pro 面向复杂编程、Agent 和专业任务,MiMo-V2.6-Flash 更强调性能、效率与成本之间的平衡。 小米还同步推出 MiMo-V2.6-Pro-UltraSpeed,官方称其在保持模型质量的前提下,输出速度最高可达到 Pro 版本的 20 倍。 而除了版本更新, APPSO 之前也报道过,小米把一场持续近六天、合计花费约 347 万美元的强化学习训练公开到了网上。 从训练进度、成本变化到任务通过率,外界可以近乎实时地观察两个模型如何在 30 个 RL step 中逐渐提升能力。 小米将它视为探索 RSI,也就是递归自我改进路线的一次重要尝试。 MiMo V2.6 登场,国产开源模型迎来新标杆 官方公布的结果显示,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index v4.3 中获得 46.32 分,超过 Kimi K3 和 Qwen3.8 Max。 小米据此称其为当前该榜单得分最高的开源模型,同时表示 V2.6 沿用了 V2.5 的 API 价格,希望用相同成本提供更高的智能水平。 具体到各项基准测试成绩,Pro 在 DeepSWE v1.1 中获得 71.9 分,接近 DeepSeek V4.1 Flash 的 74.2、Claude Opus 5 与 GPT 6 Astra 的 74.0;在 Toolathlon-verified 中获得 76.9 分,高于 GPT 5.6 Sol 的 74.9; 在 Automation Bench v1.0.6 中获得 53.1 分,略低于 DeepSeek V4.1 Flash 的 54.8,高于 GPT 6 Astra 的 52.0;面向真实职业任务的 JobBench 得分为 62.0,仅次于 Claude Opus 5 的 65.7。 网页与可视化界面生成,也是此次更新的重点。 在小米自建的 MiMo Visual Coding 评测中,Pro 和 Flash 分别获得 72.3 分和 71.5 分,高于 DeepSeek V4.1 Flash 和 Claude Opus 5,但与 GPT 6 Astra 的 82.2 分仍有差距。 当然,整体来看,MiMo-V2.6 尚未在所有能力上追平闭源前沿模型。 Pro 在 Terminal Bench 4.0 中获得 34.9 分,与 GPT 6 Astra 的 59.6、Claude Fable 5.1 的 55.1 仍有明显差距,在多项网络安全评测中也整体落后于头部闭源模型。 不过,对开源模型而言,46.32 分的综合成绩与便宜大碗的 API 价格放在一起,可能比个别榜单上的名次更有现实意义。 六天烧掉 347 万美元,小米豪赌 RL MiMo-V2.6 背后的训练过程,可能比最终分数更能说明小米想做什么。 APPSO 也第一时间查阅了 MiMo-V2.6 的技术报告:MiMo-V2.6-Flash 和 Pro 分别完成 30 个强化学习 step,各自产生约 75 万条训练轨迹,成本分别约为 85 万美元和 262 万美元。 两个模型的平均任务通过率相对提升约 25% 和 12%,在没有参与训练的长程软件工程评测 DeepSWE v1.1 上,Flash 从 48.8 分提高到 65.68 分,Pro 从 58.4 分提高到 72.57 分。 多个项目在训练后半程仍保持增长。小米据此判断,大规模 RL 仍有较高的样本效率,而且收益能够扩展到训练分布之外,模型学到了一定的通用长程执行能力。 训练规模也远超常见的后训练实验。 每个 step 包含 1568 个 prompt,每个 prompt 同时生成 16 条候选轨迹,相当于一次处理约 2.5 万条长序列和 27 亿至 37 亿训练 token,最长上下文达到 100 万 token。 任务覆盖编程、通用 Agent、视觉和网络安全,并混合多个运行环境;评分系统则对同一问题下的多条轨迹进行比较,为长链路任务提供更细致的奖励信号,引导模型减少无效步骤和 token 消耗。 大规模 RL 也容易出现训练漂移和奖励投机。 模型可能寻找评分规则的漏洞,表面拿到高分,实际没有完成任务。小米在训练期间固定 MoE 路由器,并通过奖励设计、对抗评测、异常检测和多个验证器交叉核验提高稳定性,同时统一不同 Agent 框架产生的轨迹格式,让多类任务进入同一套训练系统。 罗福莉在发布后将 MiMo-V2.6 称为「扩展 RL 的艰难之路」。 她表示,按照算力投入衡量,它很可能是开源模型团队迄今规模最大的单次强化学习训练

about image

QQ

在线咨询真诚为您提供专业解答服务

热线

13594780006
7*24小时服务热线

微信

二维码 扫一扫微信交流