最新消息:关注人工智能 AI赋能新媒体运营

Gemini 3.6 Flash实测:速度提升但"智商"缩水,网友吐槽"省token不如省脑子"

科技资讯 admin 浏览

Google 发布三款 Gemini Flash 模型:效率提升,但旗舰缺席引争议

Google 近日一次性推出三款 Gemini 系列新模型,包括 3.6 Flash、3.5 Flash-Lite 以及专攻网络安全的 3.5 Flash Cyber。然而,这次发布并未完全打消外界对 Gemini 产品线的质疑声音。

3.6 Flash:主打效率与成本控制

作为 3.5 Flash 的小版本迭代,3.6 Flash 的核心卖点在于降低 token 消耗。据 Artificial Analysis Index 数据,其输出 token 比前代减少 17%,在 DeepSWE 等特定场景下最高可节省 65%。价格方面,输出费用从 3.5 Flash 的 9 美元降至 7.5 美元每百万 token,输入价格为 1.5 美元每百万 token。

具体性能指标方面,DeepSWE 代码测试从 37% 提升至 49%,MLE Bench 从 49.7% 提升至 63.9%,OSWorld-Verified 计算机操作测试从 78.4% 升至 83%。知识工作测试 GDPval-AA v2 从 1349 分提高到 1421 分。该模型的知识截止日期也从 2025 年 1 月更新至 2026 年 3 月。安全方面,Google 表示升级了 Frontier Safety 防护系统,重点防范化学、生物、放射性、核与网络攻击两类滥用风险。

3.5 Flash-Lite:速度优先的性价比选择

3.5 Flash-Lite 定位为高吞吐、低延迟任务模型,每秒可生成约 350 个 token。其价格进一步下探至输入 0.3 美元、输出 2.5 美元每百万 token。该模型支持可调推理档位,用户可根据任务复杂度灵活调整。

基准测试显示,Terminal-Bench 2.1 从 31% 提升至 54%,GDM-MRCR v2 长上下文测试从 60.1% 提升至 72.2%,GDPval-AA v2 从 642 分跃升至 1140 分。值得注意的是,这款定位较低的模型在部分任务上超过了 3 Flash,如 SWE-Bench Pro(54.2% 对 49.6%)和 OSWorld-Verified(74.0% 对 65.1%)。

3.5 Flash Cyber:安全专用模型

3.5 Flash Cyber 是 Google 首次针对网络安全场景推出的专用模型,基于 3.5 Flash 微调,配合 CodeMender 工具使用。多个 Flash Cyber agent 协同工作,最终生成漏洞检测报告。在 CyberGym 基准测试中,该模型达到行业第一梯队水平。

不过,该模型目前不对公众开放。Google 仅向可信合作伙伴限量提供内测权限,目的是在漏洞被恶意利用前协助防守方修复,同时防止模型本身被滥用。

旗舰缺席与外部质疑

本次发布未提及 Gemini 3.5 Pro。据彭博社等媒体报道,3.5 Pro 的代码生成能力未达内部预期,Google 曾于 6 月下旬更新训练数据试图补救,但效果不佳。有传闻称 Google 已推翻原有训练方案、从零开始重训。Google AI 宣传委员 Logan Kilpatrick 近期将公众注意力引向 Gemini 4,称其预训练已启动且"进展令人兴奋"。

第三方评测反馈喜忧参半。Artificial Analysis 指出,新模型单任务耗时减半、token 效率提升,Flash-Lite 智能指数上涨 11 分,但 3.6 Flash 的智能水平与 3.5 Flash 相比基本持平。部分网友认为其性价比不及竞品,实测中也出现解码问题、中文选词不当、多媒体生成质量差等问题。

此次三款 Flash 模型的发布,反映出 Google 在 AI 竞赛中兼顾效率优化与成本控制的策略,但旗舰产品跳票、实际体验争议等因素,也让外界对其长期技术路线保持关注。