17611538698
webmaster@21cto.com

阿里巴巴发布Qwen3.8-Max,在人工智能基准测试中挑战GPT-5.6 Sol和Claude Fable 5

开源 0 15 1小时前
图片

21CTO导读:阿里巴巴千问大模型正式推出Qwen家族迄今最强大模型Qwen3.8-Max。

随着中美人工智能实验室之间的竞争日趋激烈,中国互联网巨头阿里巴巴今日发布了迄今为止规模最大、功能最强大的千问人工智能模型——Qwen3.8-Max。

Qwen3.8-Max现已上线QwenCloud平台,其模型权重将于下周在Hugging Face和ModelScope上开源。

图片

Qwen3.8-Max 是一个庞大的混合专家模型,总共拥有 2.4 万亿个参数。

然而,为了在降低推理成本和响应时间的同时保持强大的性能,每次请求仅激活 950 亿个参数。与 OpenAI 和 Anthropic 的前沿模型类似,Qwen3.8-Max 多模态模型可以处理文本、图像和视频,并支持高达 100 万个词元的上下文窗口。

编程能力方面,Qwen3.8-Max可从一个空文件夹出发,完成十数天的真实项目并交付,全程内置人工指挥。通过真实环境和算力的强化学习扩展,Qwen3.8-联合联合Max能够将法务团队约一周的审阅量压缩到一小时,也能仅凭一句话规划出复杂的动态工作流、交付集可盈利的端到端自动化策略。

阿里巴巴在其官方博客文章中提到,该模型可以连续自主地进行软件开发超过10天。在事实测评中,Qwen3.8-Max仅用了16天就完成了一个内部软件工程项目。因此,该公司将Qwen3.8-Max主要定位于需要AI代理长时间独立工作的编码和“协作”任务。

此次发布再次表明,中国人工智能实验室正在迅速缩小与美国竞争对手之间的差距。Moonshot AI 近期发布了拥有2.8 万亿参数的 Kimi K3 模型,这是一款开放权重的多模态模型,足以与 OpenAI 和 Anthropic 的前沿产品相媲美。DeepSeek 也于上周正式发布了 DeepSeek-V4-Flash,在编码和智能体能力方面实现了显著提升,而成本却远低于美国同类模型。

在衡量编码、智能和通用能力的基准测试中,Qwen3.8-Max在 7 项不同的评估中均优于Fable 5GPT-5.6 Sol。在多模态和视觉基准测试中,它在 36 项不同的测试中也领先于这两个模型。完整的基准测试列表如下所示。
全基准测评表格:
图片

多模态/视觉基准测试表格:

图片

Qwen3.8-Max模型权重将于下周开源,同时亦注册开源Qwen3.8-27B。

全球开发者都可通过千问 AI 平台获得 Qwen3.8 的 API 服务。中国国内每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中 1.5 元;海外每百万 Tokens 输入 2 美元、输出 6 美元,隐式缓存命中为 0.25 美元。

来自中国厂商的这种日益增长的压力可能会迫使 OpenAI 和 Anthropic降低价格,并为开发者提供更灵活的部署选项。

作者:场长

评论

我要赞赏作者

请扫描二维码,使用微信支付哦。

分享到微信