首页 AI科技文章正文

Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期

AI科技 2026年07月22日 15:07 6 admin
Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期

昨夜谷歌DeepMind一场模型发布会,让不少开发者大失所望。大家翘首以盼的旗舰Gemini3.5Pro依旧不见踪影,取而代之的是三款轻量化模型:Gemini3.6Flash、3.5Flash-Lite与面向安全场景的3.5FlashCyber。

Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期

Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期

本以为3.6版本会带来能力跃升,可模型正式上线实测之后,负面评价席卷开发者社区,Gemini3.6Flash甚至被贴上“史上最差”的标签。一边是竞品持续迭代、赛道竞争白热化,一边是主力旗舰延期、新款轻量模型口碑崩盘,外界不禁发问:曾经手握技术优势的谷歌,在这场AGI长跑里,还能不能稳住位置?

Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期


Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期

一、实测大面积翻车,3.6Flash辜负市场期待

谷歌对外宣传,Gemini3.6Flash主打更高性价比,优化token消耗,适合规模化商用。但第一批上手测试的开发者,很快发现现实和宣传存在巨大落差,两大核心能力出现明显倒退。

首当其冲的是前端代码生成能力。界面开发一直是Flash系列的优势场景,不少程序员习惯用它快速产出页面代码。有开发者设计标准2-shot测试任务,考验模型UI界面生成水平,结果令人大跌眼镜。模型输出的代码组件嵌套混乱,交互逻辑断裂,代码无法直接运行,完全达不到工程使用标准。这名开发者留下一句感慨,迅速在全网传播:“这是我真正见过的最差结果。”在专业代码评测榜单CursorBench中,Gemini3.6Flash的成绩,甚至不如Cursor自研的Composer2.5,对比MetaMuseSpark1.1同样落于下风。

Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期


Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期

空间推理能力的下滑同样显眼。有爱好者录制完整测试视频,逐帧验证模型对物体位置、方向关系的理解。对比前代3.5Flash,3.6Flash判断失误频次明显增加。起初有人猜测,或许是没有开启高性能“highthinking”模式带来的限制,但多名网友开启高推理强度重新测试后,依旧没能改善问题。生成图像纹理偶尔尚可,但经常出现渲染bug,空间感知缺陷无法规避。

Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期


Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期

综合第三方平台ArtificialAnalysis测评数据,Gemini3.6Flash综合得分和上一代3.5Flash持平,没有实质性进步,排在MetaSpark、GLM系列、ClaudeSonnet、Grok一众模型之后。即便谷歌自家公开基准数据,也只能承认,新款模型仅在长上下文、视觉理解领域保持优势,代码能力已经被竞品超越。

Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期


更引发争议的还有知识截止日期。官方标注训练数据更新至2026年3月,大量用户实测后发现,模型对2025年下半年到2026年发生的事件认知严重缺失,有效知识库更接近2025年1月。不少人直言,这更像一个没有打磨完成、仓促推向市场的半成品。

Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期

二、高速不等于好用,另外两款新品亮点有限

本次同步登场的还有Gemini3.5Flash-Lite和3.5FlashCyber。

3.5Flash-Lite最大卖点是推理速度,每秒最高可以输出350个token,主打大批量文本处理、信息检索这类简单任务。但开发者吐槽了一个很现实的问题:速度再快,如果持续输出错误答案,本质只是更快消耗算力、浪费使用者的时间。横向对比竞品,它定价不占优势,能力又没有拉开差距,性价比很难打动企业用户。

而Gemini3.5FlashCyber定位十分清晰,是垂直网络安全模型,专门用来识别、修复程序漏洞。出于安全风险管控,谷歌采取有限开放策略,仅向可信机构试点投放。这款模型没有掀起大众讨论,属于谷歌面向政企安全赛道的布局,很难扭转普通开发者对于本次发布会的负面印象。

三款模型亮相,却没有一款能够撑起大众期待,整场发布的焦点,最终都绕不开同一个疑问:说好的Gemini3.5Pro去哪了?

三、旗舰持续跳票,转头启动规模空前的Gemini4预训练

面对全网追问,谷歌给出明确答复:Gemini3.5Pro还未准备就绪,上线时间继续延后。多家外媒消息显示,这款原本计划6月亮相的旗舰模型,因为内部测试代码能力达不到目标标准,被迫推迟发布。

就在3.5Pro难产的同时,谷歌抛出另一则重磅消息:正式启动Gemini4预训练项目。官方将其描述为谷歌有史以来规模最大、最有野心的训练计划,团队对外表示对项目进展感到振奋。

这条消息很难不让外界产生联想。有一种普遍猜测:3.5Pro研发遇到难以突破的瓶颈,谷歌调整资源重心,把算力与人力倾斜到更远期的Gemini4项目上。一边中端轻量模型匆忙上新刷版本号,一边主力旗舰不断延期,远期项目画下大饼,这样的节奏,让长期关注Gemini生态的开发者心生不满。

四、饱受诟病的版本游戏:重数字指标,轻真实体验

众多从业者的负面情绪,不止源于单款模型翻车,更是长期积攒下来,对谷歌“版本号策略”的反感。

Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期


AI行业竞争日趋激烈,各大科技巨头持续更新模型版本。但在不少开发者眼中,谷歌逐渐陷入指标导向的怪圈。为了财报展示、发布会宣传,不断推出带有更高数字后缀的新版本,追求更快的输出速度、更亮眼的纸面参数,却忽视大模型最核心的价值——真实场景可用性。

算力资源紧张已经是行业共识,有网友尖锐评论,如果打磨不完善的半成品仓促上线,本身就是一种算力浪费,不如把资源投入成熟产品迭代。Flash系列诞生之初,依靠均衡的能力和定价收获大量开发者,如今新版本“涨价、变弱”,不断消耗积累下来的口碑。

过去Gemini凭借超长上下文、多模态视觉能力一度建立差异化优势,如今国内外竞品持续追赶。Meta、Anthropic、OpenAI轮番更新模型,国内大模型也不断缩小差距。谷歌原本拥有充足技术储备,现在却出现中端模型原地踏步、旗舰断档的尴尬局面。

一场期待已久的发布会,最终演变成一场口碑危机。Gemini3.6Flash的翻车,不只是一款轻量化模型的失败,更折射出谷歌当前AI业务进退两难的处境。短期旗舰3.5Pro迟迟无法落地,中端产品线创新乏力,只能依靠迭代小版本维持曝光;长期赌上全部资源冲刺Gemini4,但巨大规模的预训练能否转化为实打实的性能优势,依旧充满未知。

Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期


Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期

Gemini3.6Flash被评史上最差,苦苦等待的 3.5Pro再度延期

大模型赛道拼的从来不是版本数字的大小,而是稳定可靠的实际能力。如果持续推出体验缩水的产品消耗信任,即便远期项目规划宏大,也很难留住开发者。在白热化的AGI竞赛中,谷歌想要守住第一梯队席位,显然需要调整节奏,拿出真正成熟、对得起期待的作品。

发表评论

长征号 Copyright © 2013-2024 长征号. All Rights Reserved.  sitemap