LongCat是由中国互联网公司美团开发的大型语言模型系列,涵盖语言、多模态、图像生成、视频生成与语音交互等多类模型,其最新模型为LongCat-2.0(2026年6月)。
概述
LongCat是由美团旗下LongCat团队开发的基于转换器的生成式预训练模型(,GPT)系列,专注于智能体()任务场景下的实用性与推理效率。
LongCat系列模型大多以MIT许可证开源发布,可在GitHub及Hugging Face平台获取,同时通过官网longcat.ai向公众提供在线对话体验。
版本历史
衍生版本
LongCat-Flash-Chat
2025年9月1日,美团正式发布并开源LongCat-Flash-Chat。该模型采用混合专家模型(,MoE)架构,总参数量为560B,每个Token依据上下文需求仅激活18.6B至31.3B参数(平均约27B)。模型在H800上的推理速度达到100+ tokens/s,API输出成本为5元/百万Token,以MIT许可证开源。
在基准测试方面,LongCat-Flash-Chat在ArenaHard-V2中得分86.50,在MMLU中得分89.71,在CEval中得分90.44。在智能体工具使用测试τ2-Bench中的成绩超越参数规模更大的模型,并在VitaBench复杂场景评测中以24.30分排名第一。在指令遵循评测IFEval中得分89.65,排名第一;中文指令遵循基准COLLIE得分57.10,Meeseeks-zh得分43.03。
架构特性
LongCat-Flash引入「零计算专家()」机制,对于上下文中较简单的Token可跳过大部分计算,仅在需要时调用更多参数,从而实现算力按需分配。此外,该模型在层间铺设跨层通道,使MoE的通信与计算能够大程度上并行,极大提升训练与推理效率。训练过程采用超参迁移与模型层叠加方式,整体训练在30天内完成。
LongCat-Flash-Thinking 系列
LongCat-Flash-Thinking是在LongCat-Flash基础上强化推理能力的版本,主要面向需要多步规划与逻辑推理的复杂任务场景。
2026年1月15日,升级版LongCat-Flash-Thinking-2601正式发布并开源。该版本创新性地引入「重思考模式」,通过并行推理(同时探索多条推理路径)与深度总结(对多路径结果进行整合优化)两阶段设计,提升复杂任务中的表现。根据官方资料,LongCat-Flash-Thinking-2601在Agentic Search、Agentic Tool Use与TIR等核心评测基准上均达到开源模型SOTA水平。
LongCat-Flash-Omni
LongCat-Flash-Omni是LongCat-Flash系列的全模态版本,支持文本、图像、视频理解,以及语音感知与生成等多类任务,采用端到端架构设计。
LongCat-Video
LongCat-Video是美团LongCat团队发布的视频生成模型,参数量为13.6B,基于扩散Transformer(,DiT)架构构建,以MIT许可证开源。
该模型以统一框架同时支持文本生成视频(T2V)、图像生成视频(I2V)与视频续写三类任务,所有任务均在同一Transformer骨干内处理。在长视频生成方面,LongCat-Video采用粗到精()两阶段流程:首先以480p、15fps生成粗版视频,再通过基于LoRA的「精修专家」升至720p、30fps输出,该流程可在单张H800 GPU上数分钟内完成生成。此外,模型采用稀疏块注意力(,BSA)替代密集注意力,以降低长视频生成的计算开销。
LongCat-Image
LongCat-Image是美团LongCat团队发布的图像生成模型,参数量为6B,以MIT许可证开源,支持文本生图与图像编辑。
LongCat-Audio-Codec
LongCat-Audio-Codec是美团LongCat团队发布的专用语音编解码方案,提供一套Token生成器与Token还原器工具链,将原始音频信号映射为语义与声学并行的Token序列,并通过解码模块重构高质量音频,为语音大模型提供全链路音频处理支持。
LongCat-Flash-Prover
LongCat-Flash-Prover是面向数学形式化与定理证明的专用开源模型,支持自动形式化()、草图生成()与证明()三项原子能力,并基于Lean4形式语言对输出进行机器可验证。根据官方技术资料,该模型结合工具集成推理(,TIR),在MiniF2F-Test上仅用72次推理尝试即达到97.1%的通过率;在MathOlympiad-Bench上得分46.7%,在PutnamBench上得分41.5%。
LongCat-Next
2026年4月2日,美团LongCat团队发布并开源LongCat-Next,这是一个原生离散多模态模型,将图像、音频与文本统一映射为同源的离散Token,并通过单一自回归骨干以纯粹的下一个Token预测(,NTP)范式统一建模各类模态。
LongCat-Next以LongCat-Flash-Lite MoE(总参数68.5B,激活参数3B)为基座,在DiNA框架下训练,并采用dNaViT分词器进行任意分辨率视觉分词。理解与生成在同一Token空间内被统一为同一数学问题,以相同自回归目标训练。
LongCat-2.0-Preview
2026年4月24日,美团正式推出新一代基础大模型LongCat-2.0-Preview,面向公众开放邀请测试,测试期间每位用户每日可免费使用一千万Token的额度,LongCat-2.0-Preview采用混合专家架构,同时支持1M上下文。 在架构与训练策略上,该模型重点强化了对智能体场景的支持,显著提升在代码编写、多步骤任务分解与执行规划等实际生产环节中的表现。 其总参数量和激活参数量,与DeepSeek同日发布的新一代V4大模型基本一致。
参见
*大型语言模型列表
*DeepSeek
*通义千问
*美团
参考来源
评论 (0)