17611538698
webmaster@21cto.com

专打 Claude Code 痛点!JetBrains 开源 12B 代码大模型 Mellum2:主推本地私有化与高并发速度

开源 0 14 1小时前
图片

21CTO导读:JetBrains宣布发布Mellum2 模型,它在各种编码和语言处理任务中都能展现出出色的性能,同时具备低延迟和高吞吐量等优点。

软件开发与基础设施提供商JetBrains 周一宣布,它开源了一款名为 Mellum2 的模型(实际上也以Beta形式开源了数月,但并未大张旗鼓公布)。

这是一个有着 120 亿参数编码模型,旨在用于代理 AI 系统的基础设施层(路由、检索管道和子代理任务),以及私有本地部署,这是 Claude Code 及其同类产品无法实现的。

它是该公司 Mellum 的后续产品,Mellum 是一个4B 参数模型,JetBrains 于 2024 年底首次推出, 作为其自有 IDE 的专有代码补全工具,之后于 2025 年 4 月开源。但与前代产品不同的是,Mellum2 从一开始就是开源的。

值得我们开发者们注意的是,Mellum2 的功能范围也发生了显著变化。Mellum 的功能单一——代码补全——而 Mellum2 则旨在处理更广泛的任务,这些任务定义了工程团队部署 AI 的方式:模型间的协调、子代理工作负载的处理、检索管道中上下文的压缩,以及在基础设施团队自行控制的平台上运行推理。

Mellum2 的设计初衷是为了应对工程团队目前部署 AI 时所面临的更广泛的任务。

JetBrains 的一名研究工程师Nikita Pavlichenko和产品经理Anton Semenkin在一篇博客文章中将Mellum2 描述为“焦点模型”——快速且专业化,而不是在广度上与前沿大模型竞争。

他们这样写道:“前沿模型将不断突破极限,但实用的人工智能产品也需要核心模型:快速、专业的组件,能够高效地处理高频任务。这种专业化确保模型在软件工程环境中表现出色,同时保持精简和快速。”

此外,基础模型还附带两个训练后的变体:一个是直接回答的“指令”版本,另一个是先生成明确的推理轨迹再做出回应的“思考”版本,旨在处理更难的多步骤和智能任务。

专为大规模速度而设计


Mellum2 采用混合专家 (MoE) 架构,总共有 120 亿个参数,但每个 token 仅激活 25 亿个参数。该设计将每个 token 路由到模型 64 位专家的子集,而不是整个网络,从而在不牺牲模型整体容量的情况下保持推理速度。

JetBrains在其技术报告中,使用代表真实生产代码补全工作负载的输入和输出规模。

在单个 H100 GPU 上对 Mellum2 与阿里巴巴的Qwen2.5-7BQwen3-8B进行了基准测试。

图片

在单请求模式下,它几乎与 Qwen2.5-7B 完全匹配——每秒 192 个令牌,而 Qwen2.5-7B 为每秒 193 个令牌。在并发负载下(生产部署实际运行的情况),它比 Qwen2.5-7B 领先 21%,比 Qwen3-8B 领先 79%。

成本结构也遵循同样的逻辑。每个令牌仅激活 25 亿个参数,从推理的角度来看,该架构的行为更接近于 25 亿模型,而非传统的 120 亿密集模型——这对于每天需要通过该架构路由大量请求的团队来说至关重要,因为该架构是大型代理系统的一部分。

在功能级代码生成方面,通过结合 HumanEval+ 和 MBPP+ 的 EvalPlus 基准测试进行衡量,Mellum2 的思维变体得分为 78.4%,领先于比较表中的其他模型,包括得分为 71.8% 的 Qwen3.5-9B 和得分为 73.8% 的专门用于代码的 Seed-Coder-8B。

一旦评估范围超出软件工程任务,情况就变得更加复杂。JetBrains自身的研究结果表明,Qwen3.5-9B在更广泛的推理和知识评估中仍然具有优势,包括GPQA Diamond和MMLU-Redux。

JetBrains 在其技术报告中直接承认了这一点,并指出该模型的训练重点更窄是有代价的。

作者如此总结写道:“这种差距反映了我们在培训内容上的有意取舍,即更侧重于代码和开发人员文档,而不是广泛的百科全书式覆盖。”

所依赖之参数


Mellum2 最突出的优势或许在于它不需要什么。Anthropic 的Claude CodeOpenAI 的 Codex都在客户端本地运行,但推理过程分别通过 Anthropic 和 OpenAI 的 API 进行路由处理。

值得一提的是,Cursor 也在尝试开发自己的专有编码模型策略,最近推出了 Composer 2.5。这些功能仍然与 Cursor 的平台绑定,而该公司最近宣布与 SpaceX 的 xAI 建立合作关系,则将堆栈中的另一个关键层——基础设施和未来模型开发——置于客户控制之外。

Mellum2 采用 Apache 2.0 开源协议,为企业提供自行拥有和运营该层的选择。这种模式能否在企业级规模上获得认可,将取决于企业对自托管 AI 基础设施的需求。

JetBrains 认为,随着人工智能更深入地融入软件工程工作流程,部署灵活性、运维控制和所有权仍将是重要的考量因素。这不失为一个合理的判断,但其有效性仍需在规模化应用中得到验证。

Mellum2现已在 Hugging Face (https://huggingface.co/collections/JetBrains/mellum-2)上发布,其中包含根据 Apache 2.0 发布的基础、指导和思考检查点,以及详细介绍其背后的架构决策和训练流程的完整技术报告。

各位不妨研究一下,看用在自己的流程或某个场景上。

作者:场长

评论

我要赞赏作者

请扫描二维码,使用微信支付哦。

分享到微信