|
9 月 20 日消息,中电信人工智能科技有限公司于 9 月 17 日正式发布新一代星辰大模型 Xing4.0-29B-A4B。该模型聚焦复杂任务理解、任务规划、工具调用和自主执行等能力,支持长上下文处理,可应用于代码开发、数据分析、办公自动化及生活服务等场景。
华为中国官方昨晚宣布,Xing4.0-29B-A4B 总参数 29B,激活参数仅 4B,是国内首个基于昇腾 Atlas 900 A3 SuperPoD 液冷超节点与昇思 MindSpore 框架完成训练的百亿参数大模型,面向复杂工程任务进行了深度优化。 该模型采用新一代架构设计,进一步提升长程任务处理和多步骤执行能力,能够根据用户提出的目标自主规划任务路径、调用工具并完成复杂任务。 华为官方表示,模型的中高阶代码生成与智能体执行,是对长程上下文理解、复杂推理规划、工具调用协同的综合考验。华为团队与中电信团队紧密协同,从数据体系、模型架构、训练工程到强化学习,进行了系统性攻坚。
目前,昇腾已支持 40+ 个业界头部模型完成原生训练,也是国内唯一支持商用大规模预训练,并训练落地 SOTA 大模型的厂商。 付开源地址如下:
AI 解读 B只激活4B意味着什么
这次发布的重点其实不在模型本身的能力上限,而在训练路径。29B总参数、4B激活的稀疏结构,意味着它可以在相对可控的算力下完成训练和推理,而整个训练过程跑在昇腾超节点和昇思框架上。对行业来说,这更像是一次国产软硬件全栈训练大模型可行性的验证,模型只是载体。 对普通用户而言,短期内能直接感知的东西有限。权重虽然开源,但29B规模的模型本地部署仍有硬件门槛,实际使用大概率还是通过云端服务。原文没有提到价格、开放时间和商用条款,这些才是决定它能不能被用起来的关键,目前都还不确定。 值得留意的是长上下文和工具调用这两项。它们决定模型能不能处理多步骤的工程任务,而不是只做单轮问答。如果这两项在实际使用中站得住,受益的会是代码开发和数据分析这类场景。 先看它能不能在真实工程任务里跑通多步骤流程,参数和吞吐数字只是前提。 以上内容由 AI 依据原文补充生成,不代表本站观点,仅供参考。 |
© 2013-2016 Discuz Team. Powered by Discuz! X3.5