21CTO导读:JetBrains宣布发布Mellum2 模型,它在各种编码和语言处理任务中都能展现出出色的性能,同时具备低延迟和高吞吐量等优点。
软件开发与基础设施提供商JetBrains 周一宣布,它开源了一款名为 Mellum2 的模型(实际上也以Beta形式开源了数月,但并未大张旗鼓公布)。
这是一个有着 120 亿参数编码模型,旨在用于代理 AI 系统的基础设施层(路由、检索管道和子代理任务),以及私有本地部署,这是 Claude Code 及其同类产品无法实现的。
它是该公司 Mellum 的后续产品,Mellum 是一个4B 参数模型,JetBrains 于 2024 年底首次推出, 作为其自有 IDE 的专有代码补全工具,之后于 2025 年 4 月开源。但与前代产品不同的是,Mellum2 从一开始就是开源的。
值得我们开发者们注意的是,Mellum2 的功能范围也发生了显著变化。Mellum 的功能单一——代码补全——而 Mellum2 则旨在处理更广泛的任务,这些任务定义了工程团队部署 AI 的方式:模型间的协调、子代理工作负载的处理、检索管道中上下文的压缩,以及在基础设施团队自行控制的平台上运行推理。
Mellum2 的设计初衷是为了应对工程团队目前部署 AI 时所面临的更广泛的任务。
JetBrains 的一名研究工程师Nikita Pavlichenko和产品经理Anton Semenkin在一篇博客文章中将Mellum2 描述为“焦点模型”——快速且专业化,而不是在广度上与前沿大模型竞争。
他们这样写道:“前沿模型将不断突破极限,但实用的人工智能产品也需要核心模型:快速、专业的组件,能够高效地处理高频任务。这种专业化确保模型在软件工程环境中表现出色,同时保持精简和快速。”
此外,基础模型还附带两个训练后的变体:一个是直接回答的“指令”版本,另一个是先生成明确的推理轨迹再做出回应的“思考”版本,旨在处理更难的多步骤和智能任务。
Mellum2 采用混合专家 (MoE) 架构,总共有 120 亿个参数,但每个 token 仅激活 25 亿个参数。该设计将每个 token 路由到模型 64 位专家的子集,而不是整个网络,从而在不牺牲模型整体容量的情况下保持推理速度。
JetBrains在其技术报告中,使用代表真实生产代码补全工作负载的输入和输出规模。
在单个 H100 GPU 上对 Mellum2 与阿里巴巴的Qwen2.5-7B和Qwen3-8B进行了基准测试。
在单请求模式下,它几乎与 Qwen2.5-7B 完全匹配——每秒 192 个令牌,而 Qwen2.5-7B 为每秒 193 个令牌。在并发负载下(生产部署实际运行的情况),它比 Qwen2.5-7B 领先 21%,比 Qwen3-8B 领先 79%。
成本结构也遵循同样的逻辑。每个令牌仅激活 25 亿个参数,从推理的角度来看,该架构的行为更接近于 25 亿模型,而非传统的 120 亿密集模型——这对于每天需要通过该架构路由大量请求的团队来说至关重要,因为该架构是大型代理系统的一部分。
在功能级代码生成方面,通过结合 HumanEval+ 和 MBPP+ 的 EvalPlus 基准测试进行衡量,Mellum2 的思维变体得分为 78.4%,领先于比较表中的其他模型,包括得分为 71.8% 的 Qwen3.5-9B 和得分为 73.8% 的专门用于代码的 Seed-Coder-8B。
一旦评估范围超出软件工程任务,情况就变得更加复杂。JetBrains自身的研究结果表明,Qwen3.5-9B在更广泛的推理和知识评估中仍然具有优势,包括GPQA Diamond和MMLU-Redux。
JetBrains 在其技术报告中直接承认了这一点,并指出该模型的训练重点更窄是有代价的。
作者如此总结写道:“这种差距反映了我们在培训内容上的有意取舍,即更侧重于代码和开发人员文档,而不是广泛的百科全书式覆盖。”
Mellum2 最突出的优势或许在于它不需要什么。Anthropic 的Claude Code和OpenAI 的 Codex都在客户端本地运行,但推理过程分别通过 Anthropic 和 OpenAI 的 API 进行路由处理。
值得一提的是,Cursor 也在尝试开发自己的专有编码模型策略,最近推出了 Composer 2.5。这些功能仍然与 Cursor 的平台绑定,而该公司最近宣布与 SpaceX 的 xAI 建立合作关系,则将堆栈中的另一个关键层——基础设施和未来模型开发——置于客户控制之外。
Mellum2 采用 Apache 2.0 开源协议,为企业提供自行拥有和运营该层的选择。这种模式能否在企业级规模上获得认可,将取决于企业对自托管 AI 基础设施的需求。
JetBrains 认为,随着人工智能更深入地融入软件工程工作流程,部署灵活性、运维控制和所有权仍将是重要的考量因素。这不失为一个合理的判断,但其有效性仍需在规模化应用中得到验证。
Mellum2现已在 Hugging Face (https://huggingface.co/collections/JetBrains/mellum-2)上发布,其中包含根据 Apache 2.0 发布的基础、指导和思考检查点,以及详细介绍其背后的架构决策和训练流程的完整技术报告。
各位不妨研究一下,看用在自己的流程或某个场景上。
作者:场长
本篇文章为 @ 万能的大雄 创作并授权 21CTO 发布,未经许可,请勿转载。
内容授权事宜请您联系 webmaster@21cto.com或关注 21CTO 微信公众号。
该文观点仅代表作者本人,21CTO 平台仅提供信息存储空间服务。
请扫描二维码,使用微信支付哦。