谷歌推出Gemini 4追赶AI对手 内部对其编程性能评价不一

谷歌推出Gemini 4追赶AI对手 内部对其编程性能评价不一

  Alphabet的谷歌已开始推出备受期待的旗舰人工智能模型Gemini 4 Argon,但公司内部对于该模型在编程等关键领域的实际表现存在质疑。

谷歌推出Gemini 4追赶AI对手 内部对其编程性能评价不一-第1张图片

  周三 ,谷歌向一小批可信赖的网络安全合作伙伴开放了该模型,并表示将在进行更多测试后扩大使用范围,首先对付费用户开放 。公司称 ,Gemini 4 在多项基准测试中取得了领先成绩,包括在一项衡量安全能力的测试中击败了OpenAI的Astra模型。

谷歌推出Gemini 4追赶AI对手 内部对其编程性能评价不一-第2张图片

  不过,一些内部人士表示 ,这些指标并不能反映全貌。据直接了解这项工作的知情人士称,尽管Gemini 4在衡量模型效能的基准测试中表现出色,但在员工实际使用时 ,效果则没有那么出色,某些编程任务尤其如此 。因讨论内部事务,这些人士要求匿名。

谷歌推出Gemini 4追赶AI对手 内部对其编程性能评价不一-第3张图片

  Alphabet股价在公司发布消息后的盘后交易中上涨约1.7%。但在常规交易时段尾盘 ,媒体报道了公司内部员工对该模型持怀疑态度后 ,Alphabet股价回吐了周三早先的部分涨幅 。

  谷歌近期一直致力于开发能够与OpenAI和Anthropic PBC相媲美的模型。知情人士透露,公司原计划在6月发布一个叫Gemini 3.5 Pro的新版本,但最终放弃了该项目。

  谷歌表示 ,说Gemini 4在编程等领域表现不佳并不准确,并让参考谷歌 DeepMind负责人Koray Kavukcuoglu上周的讲话,他当时对该模型的表现感到鼓舞 。

  “我对团队充满信心 ,”Kavukcuoglu在科技新闻网站The Information主办的一次会议上说。“在我看来,我们肯定始终会处于行业前沿。 ”

  谷歌内部看法不一 。一些员工认为,Anthropic的Fable和OpenAI的Astra模型进步速度比Gemini更快 。这些人认为 ,即使Gemini 4发挥到最佳水平,在某些方面仍然会落后于这些模型。而另一些员工的观点则是,即将推出的版本已经赶上了领先的人工智能实验室。

  一位熟悉模型开发的谷歌员工表示 ,公司内部“普遍认为”Gemini 4 处于技术前沿 。该员工称,公司已对模型进行了严格的测试,并否认模型在应对复杂的、现实世界的编码任务方面存在问题。

  谷歌迫切需要Gemini 4取得成功。从谷歌主要盈利引擎 —— 搜索功能中的人工智能答案 ,到地图、Gmail和Chrome浏览器 ,这个模型的不同版本支撑着几乎所有谷歌产品 。这些产品的用户数量都超过10亿,这正是谷歌的一些竞争对手所不具备的分发优势。

  但OpenAI和Anthropic正逐渐从销售AI模型转向打造自己的产品,包括编程智能体。如果谷歌无法提供尖端模型 ,其竞争对手可能会有更多时间说服消费者 、开发者和企业,让他们相信搜索和软件的未来应该运行在它们的平台上 。

  针对相关提问,谷歌回应称 ,尽管其上一款Pro模型是2月发布的,但此后公司的AI产品实现了增长,包括企业版Gemini、面向消费者的聊天机器人应用以及谷歌搜索中的AI模式 ,后两者的用户数量均已超过10亿。

  Gemini 3

  去年11月,谷歌发布了广受好评的Gemini 3,该模型被广泛视为谷歌追赶OpenAI和Anthropic的一个转折点。今年5月 ,谷歌在I/O开发者大会上宣布了Gemini 3.5 Pro,并承诺将于次月发布, 但未能如期推出 。熟悉情况的知情人士称 ,公司已经放弃了3.5 Pro。

  除了拖累谷歌的AI雄心之外 ,这一决定很可能也让该公司损失了大量时间和金钱。 行业研究分析师Mandeep Singh表示,构建这样一个模型所需的训练可能需要花费高达4亿美元 。而聘请高薪人工智能研究人员则可能进一步推高成本 。

  如今,谷歌在Gemini 4的开发上遇到了诸多挑战。熟悉该模型内部评估的人士透露 ,其编码能力表现不均衡。其中一人表示,Gemini并不擅长前端设计,而前端设计决定了应用程序和网站的外观和用户体验 。这对于谷歌来说可能是一个严重挫折 ,因为谷歌一直在努力在竞争激烈的AI编程工具市场中与对手抗衡。

  此外,另一位熟悉开发情况的知情人士说,这是一个非常庞大的模型。通常来说 ,大型模型的运行成本很高,这可能会对谷歌的利润率带来压力 。

  ‘Benchmaxxing’

  专家表示,谷歌可能正受到行业内过度关注基准测试的倾向的影响 —— 这种现象被称为“benchmaxxing” ,即工程师们专注于获得高分,而不是打造好的产品。人工智能实验室之所以会这样做,是因为客户通常会根据基准测试得分来评判模型。两位熟悉该模型的人士表示 ,Gemini 4似乎也受到了这种倾向的影响 。

  人工智能初创公司Surge AI的创始人Edwin Chen表示 ,依赖基准测试可能会促使实验室专注于打造擅长用某种特定语言编写代码的模型,而不是开发真正易用或设计良好的应用程序。

  他说:“打个比方,‘哦 ,我的孩子SAT考得真不错’ —— 但SAT成绩并不能转化为实际的表现。这是一个危害极大的问题 。 ”

  据一位熟悉情况的知情人士称,Gemini 4的确拥有一些优势,例如 ,该模型在理解文本以外的输入方面表现出色,例如从视频中提取元数据。此外,该模型在安全性、网络安全以及清晰自然的沟通能力方面也有优势。

  谷歌内部已有不满的情绪 。此前接受采访的研究人员将此归咎于试图将AI技术融入谷歌几乎所有产品的官僚做法 。他们表示 ,不断变化的要求和优先事项已经让专注于一套连贯的战略成为难事。

  与此同时,包括传奇工程师Jeff Dean 、诺贝尔奖得主John Jumper和参与发明支撑此次AI热潮关键技术的Noam Shazeer等一批明星AI研究人员离开了谷歌。8月,长期领导谷歌人工智能研究的Demis Hassabis ,转任董事长,并将DeepMind的日常运营交给了他的长期副手Kavukcuoglu 。

  谷歌周三表示,Gemini 4专为软件工程、金融、法律和网络安全等领域的复杂长任务而设计。公司称 ,Gemini 4可生成的回复长度超越其前代产品 ,一次最多可处理100万个词元,也就是大约75万个单词。

  谷歌正努力追赶,而竞争对手也在加速前进 。尽管此前发生一系列AI智能体侵入外部系统的事件后 ,曾有放慢部分前沿模型的开发速度的讨论。本月早些时候,Meta Platforms Inc. 发布了Muse人工智能体,称其可以完成网上购物和预约等日常任务。这款应用迅速登上下载排行榜前列 。

©版权声明
THE END