美团发布LongCat-2.0,1.6万亿参数MoE模型在SWE-bench上超越GPT-5.5
6月30日,中国科技公司美团正式发布了LongCat-2.0,这是一个1.6万亿参数的混合专家(MoE)AI模型。该模型此前在OpenRouter上以匿名身份Owl Alpha运行了两个月,期间在多个平台上取得了排名前列的成绩。这是首个完全使用国产ASIC芯片端到端训练和部署的万亿参数模型,训练集群包含超过5万个国产加速器,预训练数据量超过35万亿个token。美团声称训练过程没有出现回滚或不可恢复的损失峰值,这一稳定性声明意义重大,因为未经证实的硬件堆栈上的大规模训练常常中途失败。LongCat-2.0采用了先进技术,包括稀疏注意力和N-gram嵌入,并集成了专注于工具使用、推理和对话的三个专业系统。该模型的定价极具竞争力:每百万输入token收费0.75美元,每百万输出token收费2.95美元,远低于GPT-5.5和Claude Sonnet 5的价格。在基准测试中,LongCat-2.0在SWE-bench Pro上得分59.5,高于GPT-5.5的58.6和Gemini 3.1 Pro的54.2,但低于Claude Opus 4.7和4.8;在FORTE上得分73.2,与Claude Opus 4.6持平,但低于GPT-5.5的77.8。该模型通过兼容OpenAI和Anthropic的API端点提供,并已集成到Hermes、Claude Code和OpenClaw等代理工具中。然而,自托管选项尚未开放,模型权重仍未发布。
关键事实
- 美团于6月30日发布LongCat-2.0,是一款1.6万亿参数的MoE模型,此前以Owl Alpha匿名测试。
- 首个完全使用国产ASIC芯片端到端训练的万亿参数模型,使用了超过5万个加速器。
- 取得多项排名:Hermes Agent第一,Claude Code第二,OpenClaw第三。
- 定价:每百万输入token 0.75美元,输出2.95美元,低于GPT-5.5和Claude Sonnet 5。
- 在SWE-bench Pro上得分59.5,高于GPT-5.5(58.6)和Gemini 3.1 Pro(54.2)。