21CTO导读:本篇核心看点:阿里巴巴首次开源其顶级“Max”级别模型权重;DeepSeek V4-Flash 则以极高的性价比,重新定义了企业级部署的竞争门槛。中国大模型正从“价格”与“性能”两个维度,对西方专有模型发起了全面冲击。
中国科技公司正在加速改变全球 AI 市场的游戏规则。
周一,阿里巴巴发布了拥有 2.4 万亿参数 的千问大模型 Qwen 3.8-Max。这款能够媲美 OpenAI 与 Anthropic 顶尖水平的旗舰模型,打破了以往“顶级模型仅限 API 调用”的行业潜规则,首次向全球开放了底层模型权重下载。
几天前,DeepSeek 刚刚推出了 DeepSeek V4-Flash (0731)。第三方权威机构 Artificial Analysis 的基准测试显示:
性能极强:与 OpenAI 的入门级模型 GPT-5.6 Luna 相比,性能仅有 1 分之差;
成本极低:单次任务求解成本降低了 40%;
部署极轻:仅 2840 亿参数,体积足够轻量,可直接运行在配置适中的企业级服务器或高级工作站上。
从阿里巴巴、DeepSeek 到月之暗面(Moonshot.ai)与智谱 AI(Z.ai),中国开发者正在打破西方模型的垄断。相比之下,以 Anthropic 和 OpenAI 为代表的美国巨头,正频繁以“供应链安全”和“源头合规”为由,试图通过政治游说限制中国模型的发展。
Anthropic 首席执行官 Dario Amodei 公开声称,他并非反对“开源/开放权重”,而是反对“缺乏严格安全标准”的中国衍生模型。但在业内看来,这种诉求更像是一种商业保护主义——反对任何能对其专有模型构成威胁的强劲对手。
全球最大模型托管平台 Hugging Face 首席执行官 Clément Delangue 在接受 CNBC 采访时如此指出:
"中国目前在开放权重模型(Open-weight Models)领域已占据绝对主导地位。按照当前的演进速度,如果他们在今年年底或明年开始在整个前沿 AI 领域全面领跑,我一点也不会感到意外。"
在开源策略上,阿里巴巴的布局最贴近 OpenAI 和 Google 的体量,但做法却更为彻底。此前,Qwen 系列中小型模型已因授权宽松、易于微调而风靡全球,而最强版本的 Max 则一直保留在云端 API 中。
此次 Qwen 3.8-Max 开放权重下载,直接撕开了专有高墙。
阿里巴巴的官方测试数据给出了极其直观的信号:OpenAI 和 Anthropic 能做到的,Qwen 不仅能做到,而且更好、更便宜、更自由。
虽然在 Artificial Analysis 的独立测试中,Qwen 3.8-Max 的评分略低于阿里官方的激进宣传,但其表现仍稳定地与 Anthropic 强大的 Claude Sonnet 5 旗鼓相当。
| 模型 | 输入价格 (每百万 Token) | 输出价格 (每百万 Token) | 缓存读取成本 | 趋势/策略 |
| Qwen 3.8-Max | $2.00 | $6.00 | $0.17 - $0.25 | 支持权重下载 / 部署灵活 |
| Claude Sonnet 5 | $2.00 | $10.00 | $0.20 | 宣布将于9月1日起提价 50% |
| GPT-5.6 Luna | $0.20 (短上下文) | $1.20 (短上下文) | $0.02 | 超过 272k 上下文后费用翻倍 |
MoE(混合专家架构):总参数量虽达 2.4 万亿,但作为多模态 MoE 模型,单次 Token 生成仅激活约 950 亿参数,极大地优化了推理吞吐量;
超长上下文:采用 Transformer + Mamba 混合架构,提供高达 100 万 Token 的长文本处理能力;
部署需求:由于体积庞大,企业如需在生产环境中部署该模型,面向客户高并发场景约需 48–64 张 Nvidia B200 GPU;内部工作负载则需 8–16 张 B300 或 AMD MI355X;
轻量补充:阿里同时推出了 270 亿参数(27B) 的平民化版本,极大降低了中小企业的试错门槛。
如果说阿里巴巴是用“重型武器”正面对决,DeepSeek 则是通过极致的工程优化,将“用最少的权重榨取最高性能”发挥到了极致。
DeepSeek V4-Flash (2840亿参数) 在 FP4 精确度下仅占用约 142 GB 的显存,企业可以用极其低廉的硬件成本实现单机私有化部署。
令人吃惊的是,在 Artificial Analysis 的实际测试中,V4-Flash 的表现比参数量高达 1.6 万亿的上一代 DeepSeek V4 Pro 高出近 14%。
在智能体(Agent)和复杂推理场景中,单纯比较单 Token 价格并不能反映真实成本——如果一个模型因为推理能力差而消耗了双倍的 Token,其综合成本反而更高。
实际求解成本:在解决真实复杂任务时,DeepSeek V4-Flash 的平均单次任务求解成本仅为 3 美分,而 GPT-5.6 Luna 为 5 美分,相当于直接削减了 40% 的实际支出。这对于日均消耗数亿 Token 的自动化开发团队(Vibe Coding)而言,是难以拒绝的成本优势。
DeepSeek 高效的核心,在于将 DSpark 投机性解码(Speculative Decoding) 机制直接固化到了模型权重中。
通过预预测主模型的输出,成功时直接跳过冗余计算,失败时回退至基础模型,这种过程完全无损于模型精度。测试表明,在完全相同的硬件条件下,DSpark 能使单用户响应速度提升 57% 至 85%。
DeepSeek V4-Flash 的小巧体积,甚至让“个人在本地运行前沿大模型”成为了可能:
本地极客实测:在拥有 128 GB 统一内存的工作站(如 DGX Spark)上,通过 Llama.cpp 和 Unsloth 的 IQ3-XXS 3-bit 量化技术,成功将该模型装载入显存,并运行在了 128,000 Token 的上下文窗口中。
硬件普及的宿命:一台搭载 128GB 内存的高端工作站目前售价在 $4,000 美元左右(如 Ryzen AI Halo 或 DGX Spark)。这与 1981 年初代 IBM PC 通胀调整后的价格(折合今约 $13,700 美元)相比已大幅下降。
正如个人电脑的普及历史一样,随着硬件成本降低与算法压缩技术的突破,运行 DeepSeek 这类顶尖模型的门槛在未来几年内将迅速下沉至千家万户。
对于全球企业而言,面对专有模型高昂的订阅费、不透明的隐私策略以及随意的涨价行为,中国开源社区提供的顶级模型正成为唯一具备高可靠性、高性价比的替代方案。
在这场由 DeepSeek、阿里巴巴、月之暗面、MiniMax 和智谱 AI 引领的开源浪潮面前,西方专有模型的垄断高墙,正在被彻底瓦解。
作者:场长
本篇文章为 @ 场长 创作并授权 21CTO 发布,未经许可,请勿转载。
内容授权事宜请您联系 webmaster@21cto.com或关注 21CTO 微信公众号。
该文观点仅代表作者本人,21CTO 平台仅提供信息存储空间服务。
请扫描二维码,使用微信支付哦。