21CTO导读:Google Gemini 3.8发布了,有什么样的新特性敬请看本文。
面对业界对 AI 工具落地与实用效率的严苛要求,Google DeepMind 正在以几乎“四周三更”的高频率节奏,加速将大模型从“单纯对话”推向“高效干活”。
编程能力大幅进阶:内部代号“Skimaki”直追行业头部
Gemini 3.8 Flash 在延续 Flash 系列轻量、低延迟、高性价比优势的同时,大幅提升了软件工程能力。
总体包括如下两点。
内部表现越级:该模型此前在 Google 内部测试阶段的代号为“Skimaki”。在内部开发平台 Jetski 的对比测试中,部分工程师对该模型的偏好甚至超过了 Anthropic 的顶级模型 Opus,展现出极强的实操体验。
长程代码解题:在衡量复杂软件工程与长流程代码修复的 DeepSWE v1.1 等基准测试中,Gemini 3.8 Flash 凭借远低于旗舰大模型的成本,完成了对端到端代码问题的自主解决,进一步收窄了 Google 与竞品在 AI Coding 领域的差距。
强化自主 Agent 与动态推理:在成本与效率间寻找极值
除了纯代码生成,对自主 Agent(智能体)与复杂工作流的全面优化成为本次升级的另一大核心。
适应 Agent 的多步决策:智能体任务需要连续进行逻辑规划、外部工具调用以及结果反馈决策。Gemini 3.8 Flash 针对此类长周期任务进行了针对性强化,保证在频繁调用的场景下依旧拥有低成本和快速响应优势。
灵活调配推理投入:模型延续并优化了可调节“思考程度”(Thinking Level)的机制。面对简单任务,开发者可调低推理耗时以降低 Token 成本并提升速度;在处理跨学科推理、企业级复杂工作流时,则可加大推理深度,实现高准确率与综合成本的最佳平衡。
大模型竞争转向:从“比拼智商”到“实际干活”
Gemini 3.8 Flash 的快速迭代印证了大模型产业竞争的深刻转变——市场已不再局限于基础大模型的参数或聊天聪明程度,而是转向了工程落地、代码生产力和 Agent 自动化工作流执行能力。
凭借高频的更新节奏以及针对真实工作场景的持续优化,Google 正在 AI Coding 和智能体工具链市场上全面发力。
接下来可预见的是,Gemini 将与 Anthropic、OpenAI 在 AI Coding 和 Agent 领域展开更白热化的竞争。
作者:手扶拖拉斯基
本篇文章为 @ 场长 创作并授权 21CTO 发布,未经许可,请勿转载。
内容授权事宜请您联系 webmaster@21cto.com或关注 21CTO 微信公众号。
该文观点仅代表作者本人,21CTO 平台仅提供信息存储空间服务。
请扫描二维码,使用微信支付哦。