跳到正文

内容形态

评测基准 最新动态

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

3 条精选近 30 天 2 条共收录 13 条

更新

评测基准的精选

9月23日周三第 1–3 条
9月22日周二
  1. Latent Space76

    Xiaomi MiMo-V2.6-Pro 1T-A42B 发布,成为新的顶级开放权重模型

    Xiaomi 发布 MiMo-V2.6 系列原生全模态模型,MiMo-V2.6-Pro 以 1.02T 总参数 / 42B 激活参数成为新的顶级开放权重模型,另有 MiMo-V2.6-Flash 与最高 20x 输出提速的 MiMo-V2.6-Pro-UltraSpeed。

    推荐理由:文中给出 RL 训练的批量、上下文与 token 步长细节以及开源范围,便于判断开放 RL 环境的价值。

8月4日周二
  1. Microsoft Research71

    Microsoft Research 开源智能体训练框架 Orchard,小参数模型在 SWE-bench Verified 达 69.7%

    Microsoft Research 开源智能体训练框架 Orchard,核心是基于 Kubernetes 的可复用环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中直接训练智能体,并同步发布训练数据与评测方法。

    推荐理由:环境层与三套训练配方一并开源,读者可以据此判断小参数模型在真实 harness 中训练能达到什么水平。