21CTO导读:Meta 时隔一年多推出首个开源的拥有 300 亿参数的 LLM 库Muse Glimmer,标志着 Meta 重返公开组别。Muse Spark 的公开版本也将随后推出。
从今年春天开始,Meta 似乎放弃了其开源 AI 的根基。但在周一,它推出了一年多以来的第一个开放权重模型,又为企业以及笔记本电脑用户带来了更多希望。
Muse Glimmer于周一发布,它是一个拥有 300 亿个参数的大语言模型(LLM),是从社交网络规模更大、目前仍为专有的 Muse Spark 模型中提炼出来的。
这款产品来得及时,正值美利坚合众国的科技公司努力应对中国开放式重量级模型泛滥带来的危机,以及对本土创造的替代品的呼声之际,Glimmer 横空出世了。
Meta 曾凭借其开源权重模型开发而声名鹊起,该模型于 2023 年以 Llama 羊驼为起点。但自从Llama 4 失败后,该公司重组了其人工智能部门,批评人士质疑CEO马克·扎克伯格对开源人工智能的承诺。
此番Meta公司凭借Muse Glimmer重返开源权重领域。该公司表示,该模型非常适合本地AI推理工作负载,包括本地代理、代码助手以及需要强大的多模态工具使用和函数调用的应用。
基准测试:同级领先但非全面压制
早期支持已开始波及 Llama.cpp、Ollama 和 Unsloth 等流行的本地 AI 推理平台,预计优化后的实现将在未来几周内推出。
但是Muse Glimmer只拥有300亿个参数,对于重夺美国公开组人工智能领域的霸主地位来说,并没有什么实质性的突破。它的规模太小,无法与月之暗面的Kimi K3、阿里巴巴的Qwen 3.8-Max、DeepSeek V4 Flash,以及过去几个月来在人工智能新闻中占据主导地位的其他中国模型相媲美。
相反地,Muse Glimmer 的定位是面向中小企业或爱好者的模型,与阿里巴巴和谷歌规模相近的 LLM 展开竞争。这一点在 Meta 的基准测试数据中有所体现,该模型与阿里巴巴的 Qwen(36 亿至 270 亿美元)和谷歌的 Gemma 4(310 亿美元)进行了比较。
和往常一样,这些说法需要谨慎对待,但 Glimmer 在大多数情况下似乎确实胜过了谷歌的 Gemma,并且与阿里巴巴的千问模型(Qwen)同等规模的模型不相上下。
Muse Glimmer 的训练与评测目标非常地聚焦,官方列出的核心能力全部围绕Agent 工作流:
端到端任务完成:在DeepSearch QA、MCP-Atlas、SWE-Bench 等全流程基准上训练与验证,涵盖多轮需求解析、编程与除错
可靠工具调用:在长工作流中依照精确schema 稳定调用函数
多步推理与失败恢复:工具呼叫失败或回传异常时,模型会诊断错误并重试,而非直接中断
多模态输入:内建约18 亿参数的ViT-G/14 感知编码器,可交错理解文字、截图、图表与文件
可控推理强度:透过系统提示词设定low、medium、high、xhigh 四档,在品质与速度间取舍
架构面采用52 层密集Transformer,注意力以“三层区域搭配一层全域”的模式排列,滑动视窗2048,GQA 比例16:1,上下文长度131,072 tokens 起跳,支持超过100 种语言。其知识内容截止日为2026 年1 月4 日。
Glimmer 的参数数量相对较少,这表示与 DeepSeek V4 等更大型的前沿模型相比,它的硬件要求相当低。在其原生 BF16 精度下,该模型应该能够轻松加载到一块 Nvidia RTX Pro 6000 或 AMD MI350P 显卡中。
量化到 4 位精度后,模型权重从大约 60 GB 缩减到略低于 16 GB——小到足以装入 20 到 24 GB 的消费级显卡,例如 RTX 30/4090 或 RX 7900 XT/XTX。然而,对于拥有 16 GB 显卡的用户来说,由于工作内存不足,只能使用精度更低、容量更小的 3 位量化。
即使你能够让模型拟合,它的速度也不会像其他一些最近的模型那样快,例如 Qwen 3.6-35B-A3B 或 Gemma 4 26B-A4B,因为 Glimmer 使用全部 300 亿个参数来生成每个代币,而其他模型只使用 30 亿到 40 亿个参数。
Glimmer算法对内存带宽的依赖性很高。Meta表示,在RTX 5090这类拥有1.8 TB/s内存带宽的显卡上,用户可以预期达到75到233 tok/s的运算速度。更高的运算速度依赖于一种名为推测性解码的技术。
虽然该速度对于大多数代理工作负载来说已经足够快了,但大多数用户实际体验到的性能远达不到这个水平。Meta 估计,在搭载 M5 Max 处理器的 MacBook Pro 上,系统高达 614 GB/s 的带宽可以提供 26.2 到 57.8 tok/s 的可用速度,但值得注意的是,M5 Max 的内存带宽是目前典型 Windows 笔记本电脑的四倍。
换句话说,除非你拥有独立显卡且显存足以运行该模型,否则你最多只能达到 6 到 14 tok/s 的速度。有用户在 Unsloth Studio 中使用 DGX Spark 进行测试,速度约为 12.2 tok/s,不过目前似乎还没有实现对 DSpark 的支持。
如果你想亲自尝试一下该模型,其权重目前可在Hugging Face下载,也可通过 Ollama 和 LM Studio 等本地推理平台下载。
Meta重返无差别级赛场的步伐并不仅限于Glimmer。
周一,Meta的超级智能主管Alexandr Wang在 X上发文承诺,Muse Spark 1.2的无差别级版本也“即将”发布。
Muse Spark 1.2 是 Meta 最强大的模型,也是其首款能够与 OpenAI、Anthropic 和 Google 等竞争对手展开实质性竞争的模型。然而,即使是这一版本也并不能缩小与中国模型之间的差距。
根据人工智能分析的智能指数显示,Kimi K3 和 Qwen 3.8-Max 的性能均优于 Spark 。尽管如此,我们仍然不清楚 Spark 的实际规模有多大。如果 Meta 的下一代开放权重模型最终能够以更少的权重实现类似的性能,那么从每个Token的成本角度来看,它更具有竞争力。
结语:扎克伯格推动美国AI政策变革
扎克伯格表示,如果美国想要在开源人工智能领域保持领先地位,就需要“重新思考”其在多个领域的政策,包括数据蒸馏和训练中的数据使用,特别是大力推广开源软件。
他警告说人工智能领域的权力不应集中在少数几家公司手中,这是对 OpenAI 和 Anthropic 的隐晦批评。
“然而,令人惊讶的是,许多人工智能开发者的言论中充斥着如此悲观的论调。我不明白,为什么那些认为人工智能会取代大多数工作岗位并削弱人类存在意义的人,会急于构建这样一个未来,”扎克伯格说道。
“认为人工智能非常危险,以至于唯一安全的道路就是权力的极端集中,这种观点本身就存在问题。”
扎克伯格说:“我们不应该将超级智能集中起来,而应该广泛分发,让每个人都能驾驭它。这有可能开启个人赋能的新时代,让人们能够利用这种强大的新能力充分发挥自身潜力,追求兴趣爱好,并以前所未有的方式改善自身生活和世界。”
这位Meta 的首席执行官最后总结道:“每个人都将拥有一位能力卓越的私人经纪人(Agent),他了解你、你的目标以及你所关心的一切。”
作者:场长
本篇文章为 @ 场长 创作并授权 21CTO 发布,未经许可,请勿转载。
内容授权事宜请您联系 webmaster@21cto.com或关注 21CTO 微信公众号。
该文观点仅代表作者本人,21CTO 平台仅提供信息存储空间服务。
请扫描二维码,使用微信支付哦。