×
首页 › 首页 › IT数码› 产业 ›查看内容
发表文章
分享

DeepSeek V4.1 Flash 发力,中美顶尖模型 LiveBench 跑分差距缩至 3%

发布者: IT007编辑01| 2026-10-5 09:20| 查看: 105| 评论: 0|原作者: 箫雨|来自: 凤凰科技

摘要: 彭博分析师称,随着 DeepSeek 推出 V4.1 Flash,中国顶尖 AI 模型和美国领先模型的 LiveBench 跑分差距已缩小至 3%,中国 AI 性能进步明显,

北京时间 10 月 5 日,据彭博行业研究称,过去几个月,随着 DeepSeek 等中国 AI 实验室的模型不断进步,美国 AI 公司相对中国同行的性能领先优势急剧缩小,降至历史最低水平,这让美国的科技主导地位面临威胁。


DeepSeek

DeepSeek

彭博行业研究高级分析师罗伯特 · 利亚 (Robert Lea) 在周一的一份报告中写道,在 DeepSeek 9 月发布 V4.1 Flash 之后,中国顶尖模型在基准测试得分上仅落后美国竞争对手 3%。这一差距较 5 月份的约 9% 和今年早些时候的 15% 有所收窄。


他表示,这种性能的持续提升意味着中国竞争者将进一步扩大市场份额。


彭博指出,中国模型技术的崛起得益于其 AI 专业能力的不断深化,以及研究人员针对国产硬件优化模型的能力。这些进展也让人们开始质疑美国限制技术出口的做法是否有效。


利亚称,中国取得的进展“进一步让人质疑美国在 AI 领域的科技主导地位能否长期维持”。


DeepSeek 的 V4.1 Flash 上月在 LiveBench 全球排名中位列第六,成为自这家创业公司 2025 年凭借其推理模型 R1 取得突破以来排名最高的中国模型。LiveBench 根据 AI 模型对问题、谜题或任务的回答与分析进行评分,这一过程类似于衡量人类智商。


DeepSeek 最近一次在 LiveBench 上的得分为 81.1 分,低于 Anthropic 最高的 83.4 分。利亚表示,这意味着 DeepSeek 模型的表现已经“可以与 Anthropic、OpenAI 的领先 AI 系统相媲美”。不过,尽管双方的得分差距已经缩小至仅 3%,LiveBench 评选出的前 15 个模型中只有 3 个来自中国。


利亚提醒称,这类排名会不断变化,而且无论模型在排行榜上的排名如何,变现都可能很困难。

AI 解读

%差距意味着什么

  • %是LiveBench得分差距,从5月的9%和年初的15%收窄而来,衡量的是模型答题与分析的评分。
  • DeepSeek V4.1 Flash得分81.1,低于Anthropic最高的83.4,位列LiveBench全球第六。
  • 前15名里只有3个中国模型,说明头部整体仍是美国占多数,单点突破不等于全面追平。
  • 报告提醒排名会变,且排名高低和能否赚钱是两回事。


这个3%说的是基准测试分数,不是实际使用体验的差距。LiveBench用问题、谜题和任务来打分,类似测智商,分数接近说明在标准化题目上表现相当,但真实场景里的稳定性、工具调用、长文本处理这些维度,榜单未必能覆盖。


另一个容易被忽略的点是分布。前15名里中国只占3席,意味着领先的是一两个模型,而不是一整批。分数差距缩小和整体实力追平,是两件事。


对普通人来说,最直接的影响是可选模型变多,价格和能力的竞争会更激烈。但原文没有给出V4.1 Flash的定价、开放方式或具体上线时间,这些目前都还没有公布。


看榜单差距可以,但别把3%直接等同于体验追平。

以上内容由 AI 依据原文补充生成,不代表本站观点,仅供参考。

本文导航

最新评论(0)
扫码下载 IT007 App