|
北京时间 10 月 5 日,据彭博行业研究称,过去几个月,随着 DeepSeek 等中国 AI 实验室的模型不断进步,美国 AI 公司相对中国同行的性能领先优势急剧缩小,降至历史最低水平,这让美国的科技主导地位面临威胁。
彭博行业研究高级分析师罗伯特 · 利亚 (Robert Lea) 在周一的一份报告中写道,在 DeepSeek 9 月发布 V4.1 Flash 之后,中国顶尖模型在基准测试得分上仅落后美国竞争对手 3%。这一差距较 5 月份的约 9% 和今年早些时候的 15% 有所收窄。 他表示,这种性能的持续提升意味着中国竞争者将进一步扩大市场份额。 彭博指出,中国模型技术的崛起得益于其 AI 专业能力的不断深化,以及研究人员针对国产硬件优化模型的能力。这些进展也让人们开始质疑美国限制技术出口的做法是否有效。 利亚称,中国取得的进展“进一步让人质疑美国在 AI 领域的科技主导地位能否长期维持”。 DeepSeek 的 V4.1 Flash 上月在 LiveBench 全球排名中位列第六,成为自这家创业公司 2025 年凭借其推理模型 R1 取得突破以来排名最高的中国模型。LiveBench 根据 AI 模型对问题、谜题或任务的回答与分析进行评分,这一过程类似于衡量人类智商。 DeepSeek 最近一次在 LiveBench 上的得分为 81.1 分,低于 Anthropic 最高的 83.4 分。利亚表示,这意味着 DeepSeek 模型的表现已经“可以与 Anthropic、OpenAI 的领先 AI 系统相媲美”。不过,尽管双方的得分差距已经缩小至仅 3%,LiveBench 评选出的前 15 个模型中只有 3 个来自中国。 利亚提醒称,这类排名会不断变化,而且无论模型在排行榜上的排名如何,变现都可能很困难。 AI 解读 %差距意味着什么
这个3%说的是基准测试分数,不是实际使用体验的差距。LiveBench用问题、谜题和任务来打分,类似测智商,分数接近说明在标准化题目上表现相当,但真实场景里的稳定性、工具调用、长文本处理这些维度,榜单未必能覆盖。 另一个容易被忽略的点是分布。前15名里中国只占3席,意味着领先的是一两个模型,而不是一整批。分数差距缩小和整体实力追平,是两件事。 对普通人来说,最直接的影响是可选模型变多,价格和能力的竞争会更激烈。但原文没有给出V4.1 Flash的定价、开放方式或具体上线时间,这些目前都还没有公布。 看榜单差距可以,但别把3%直接等同于体验追平。 以上内容由 AI 依据原文补充生成,不代表本站观点,仅供参考。 |
