点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:浪潮信息发布“源2.0-M32”开源大模型
首页> 科技频道> 人工智能 > 正文

浪潮信息发布“源2.0-M32”开源大模型

来源:光明网2024-05-29 14:58

  5月28日,浪潮信息发布“源2.0-M32”开源大模型。“源2.0-M32”在基于“源2.0”系列大模型已有工作基础上,创新性地提出和采用了“基于注意力机制的门控网络”技术,构建包含32个专家(Expert)的混合专家模型(MoE),并大幅提升了模型算力效率,模型运行时激活参数为37亿,在业界主流基准评测中性能全面对标700亿参数的LLaMA3开源大模型。

  在算法层面,源2.0-M32提出并采用了一种新型的算法结构:基于注意力机制的门控网络(Attention Router),针对MoE模型核心的专家调度策略,这种新的算法结构关注专家模型之间的协同性度量,有效解决传统门控网络下,选择两个或多个专家参与计算时关联性缺失的问题,使得专家之间协同处理数据的水平大为提升。源2.0-M32采用源2.0-2B为基础模型设计,沿用并融合局部过滤增强的注意力机制(LFA, Localized Filtering-based Attention),通过先学习相邻词之间的关联性,然后再计算全局关联性的方法,能够更好地学习到自然语言的局部和全局的语言特征,对于自然语言的关联语义理解更准确,进而提升了模型精度。

  在数据层面,源2.0-M32基于2万亿的token进行训练、覆盖万亿量级的代码、中英文书籍、百科、论文及合成数据。大幅扩展代码数据占比至47.5%,从6类最流行的代码扩充至619类,并通过对代码中英文注释的翻译,将中文代码数据量增大至1800亿token。结合高效的数据清洗流程,满足大模型训练“丰富性、全面性、高质量”的数据集需求。基于这些数据的整合和扩展,源2.0-M32在代码生成、代码理解、代码推理、数学求解等方面有着出色的表现。

  在算力层面,源2.0-M32采用了流水并行的方法,综合运用流水线并行+数据并行的策略,显著降低了大模型对芯片间P2P带宽的需求,为硬件差异较大训练环境提供了一种高性能的训练方法。针对MOE模型的稀疏专家计算,采用合并矩阵乘法的方法,模算效率得到大幅提升。

  基于在算法、数据和算力方面全面创新,源2.0-M32的性能得以大幅提升,在多个业界主流的评测任务中,展示出了较为先进的能力表现,在MATH(数学竞赛)、ARC-C(科学推理)榜单上超越了拥有700亿参数的LLaMA3大模型。

  源2.0-M32大幅提升了模型算力效率,在实现与业界领先开源大模型性能相当的同时,显著降低了在模型训练、微调和推理所需的算力开销。在模型推理运行阶段,M32处理每token所需算力为7.4GFLOPs,而LLaMA3-70B所需算力为140GFLOPs。在模型微调训练阶段,对1万条平均长度为1024 token的样本进行全量微调,M32消耗算力约0.0026PD(PetaFLOPs/s-day),而LLaMA3消耗算力约为0.05PD。M32凭借特别优化设计的模型架构,在仅激活37亿参数的情况下,取得了和700亿参数LLaMA3相当的性能水平,而所消耗算力仅为LLaMA3的1/19,从而实现了更高的模算效率。

  浪潮信息人工智能首席科学家吴韶华表示:当前业界大模型在性能不断提升的同时,也面临着所消耗算力大幅攀升的问题,对企业落地应用大模型带来了极大的困难和挑战。源2.0-M32是浪潮信息在大模型领域持续耕耘的最新探索成果,通过在算法、数据、算力等方面的全面创新,M32不仅可以提供与业界领先开源大模型相当的性能,更可以大幅降低大模型所需算力消耗。大幅提升的模算效率将为企业开发应用生成式AI提供模型高性能、算力低门槛的高效路径。M32开源大模型配合企业大模型开发平台EPAI(Enterprise Platform of AI),将助力企业实现更快的技术迭代与高效的应用落地,为人工智能产业的发展提供坚实的底座和成长的土壤,加速产业智能化进程。

  据悉,源2.0-M32将持续采用全面开源策略,全系列模型参数和代码均可免费下载使用。(柯岩)

[ 责编:战钊 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 唱针落!战歌化作砍向侵略者的“大刀”

  • 走起!大橘带你打卡四季北京中轴线

独家策划

推荐阅读
国家能源局7月31日发布的信息显示,截至6月底,我国电动汽车充电设施(充电枪)总数已达到1610万个。
2025-08-01 10:17
今年是中国启动国家公园体制改革10周年,中国国家公园建设实现从试点探索、破冰突围到系统协调、全面推进的历史性转变,取得明显成效。
2025-08-01 10:16
31日,中国工程院信息与电子工程学部、中国信息与电子工程科技发展战略研究中心发布《新一代信息工程科技 人工智能新兴技术备选清单》297项,其中约三分之二是首次提出。
2025-08-01 10:11
由我国牵头制定的两项国际标准《高压开关设备和控制设备第313部分:直流断路器》和《高压开关设备和控制设备第315部分:直流转换开关》近日正式发布。
2025-08-01 10:11
复兴油田首期石油2010.06万吨、天然气123.52亿立方米探明地质储量顺利通过自然资源部评审,标志着我国四川盆地首个页岩层系油田诞生。
2025-08-01 10:10
六方金刚石的形成条件极为苛刻,人工合成最大难点在于高温高压下六方金刚石的形成能量高于普通金刚石,因此高温高压产物常以普通金刚石为主,而难以得到六方金刚石。
2025-07-31 10:27
当机器人不再只限于执行预设操作,而是能够具备自主思考和判断,具身智能或许将会很快在更多的社会生活场景中投入应用,为人类的未来社会开创更多可能性。
2025-07-31 10:23
当前,高校应以人民为中心办好让人民满意的教育,奋力构建以人工智能为支撑的人才自主培养新生态,为中国式现代化培养出更多高质量人才。
2025-07-31 10:20
“我们使用导航软件时,经常用到的信号灯倒计时读秒功能,正是基于北斗高精度定位‘透传’的实时位置服务数据实现的。“北斗+人形机器人”“北斗+农机”“北斗+打桩机”……北斗系统持续赋能千行百业,在多个领域实现深度应用与创新突破。
2025-07-31 10:15
7月30日15时49分,在海南商业航天发射场,长征八号甲运载火箭(以下简称“长八甲火箭”)托举卫星互联网低轨06组卫星直冲云霄,将其精准送入预定轨道,发射任务取得圆满成功。
2025-07-31 04:55
科技浪潮下,侨界青年索华也带来创业项目——基于燃气低碳催化的粉末喷涂线研发和产业化,顺应新能源与“双碳”目标趋势。
2025-07-30 09:41
中国国土南北跨越纬度近50度、东西跨经度60多度,带来气候多样性,适宜不同品种的蔬菜、水果生长。答:“十四五”以来,在消费升级与供应链创新的双重作用下,我国果蔬产业发生着诸多变化。
2025-07-30 09:40
面对激荡的国际竞争局势与高质量发展的迫切需求,唯有主动拥抱变革,让人工智能科技创新的“源头活水”充分浇灌产业创新的“广阔田野”,方能赢得战略主动、制胜未来。
2025-07-30 05:00
前不久,甘肃皋兰什川古梨园系统、浙江德清淡水珍珠复合养殖系统和福建福鼎白茶文化系统正式被联合国粮农组织认定为全球重要农业文化遗产。至此,我国的全球重要农业文化遗产数量增至25项,继续领跑全球。
2025-07-30 05:00
29日12时11分,双曲线一号遥十运载火箭在我国酒泉卫星发射中心发射升空,将搭载的恩施硒都山泉号卫星顺利送入预定轨道,飞行试验任务获得圆满成功。
2025-07-30 05:00
北京时间7月27日18时03分,我国在太原卫星发射中心使用长征六号改运载火箭,成功将卫星互联网低轨05组卫星发射升空,卫星顺利进入预定轨道,发射任务获得圆满成功。
2025-07-29 10:17
鸟类因误判透明或反光的玻璃而撞击建筑物,被称为“鸟撞”,是威胁鸟类种群的重要因素之一。
2025-07-29 04:40
日前从江西铜钹山国家级自然保护区获悉,该自然保护区与井冈山大学蜘蛛生物学研究团队开展蜘蛛资源本底调查中发现蜘蛛新物种——广丰合跳蛛。研究成果在国际期刊《生物钥匙》上发表。
2025-07-29 04:40
近日,该中心与重庆师范大学生命科学学院唐安军教授团队,在巫溪县白果林场发现近危物种长叶山兰,这是在阴条岭发现的又一新纪录种。
2025-07-29 04:40
随着大数据和人工智能技术的发展,数字化健康管理成为一种新的生活风尚,帮助人们提高健康管理的效率和质量。但当人们对健康数据的关注逐渐演变为时刻紧盯、过度解读时,这一数字化工具,反而可能催生不必要的焦虑,让人们在不知不觉中被数据所“绑架”。
2025-07-29 04:40
加载更多