点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:超级同传!AI实现101种语言即时翻译
首页> 科技频道> 综合新闻 > 正文

超级同传!AI实现101种语言即时翻译

来源:中国科学报2025-01-20 10:02

  中国科学报讯 科幻小说《银河系漫游指南》中的翻译动物“巴别鱼”,可能离现实更近了。美国互联网科技公司Meta的研究人员开发了一种机器学习系统,几乎可以立即将101种语言的语音翻译成36种目标语言中的任意一种。

  这种大规模多语言和多模态机器翻译(SEAMLESSM4T)系统还可以将语音转换成文本、文本转换成语音、文本转换成文本。相关研究成果1月15日发表于《自然》。

  Meta运营着脸书、WhatsApp和Instagram等社交媒体网站。该公司表示,在向全球学术研究人员成功发布LLaMA大语言模型后,将把SEAMLESSM4T开源用于非商业用途。

  过去几十年里,机器翻译取得了巨大进步,这在很大程度上归功于在大数据集上训练的神经网络。英语等主要语言的训练数据比比皆是,但其他语言的训练数据却少得可怜。这种不平等限制了机器可以翻译的语言范围。美国康奈尔大学的计算机科学家Allison Koenecke表示:“这影响了不经常出现在互联网上的那些语言。”

  Meta团队在之前语音对语音翻译工作的基础上,开启了一个名为“不让任何语言掉队”的项目,旨在为大约200种语言提供文本到文本的翻译。根据经验,Meta和其他机构的研究人员发现,即使在翻译那些训练数据有限的语言时,使翻译系统多语言化也能提高其性能,但原因尚不清楚。

  该团队从互联网和联合国档案等来源收集了数百万小时的音频文件,以及这些语音的人工翻译。他们还收集了其中一些演讲的文字记录。

  研究人员使用可靠的数据训练模型识别两份匹配的内容。这使研究人员能够将大约50万小时的语音与文本配对,并自动将一种语言的每个片段与其他语言的对应片段匹配。

  SEAMLESSM4T可以将语音转换成语音,而无须先将其转换为文本。语音合成器用于产生音频,它可以翻译101种语言中的任何一种语音,不过到目前为止,只有36种语言可输出。该系统还可以执行其他翻译任务,比如完成不同语言的文本到语音的翻译。

  论文作者之一、Meta的计算机科学家Marta Costa-juss表示,除了增加语言数量外,他们还通过整合文本和语音的不同组合提高系统性能。“这些是改善的关键。”她补充说,该系统的时间延迟通常为几秒钟,与专业人工翻译的表现相当。

  作者表示,他们对SEAMLESSM4T进行了微调,例如当翻译中出现与原文不符的攻击性语言时,可以限制这种情况发生。他们还对系统进行了控制,以防止它将一种语言中无性别的专有词汇(如英语中的“护士”)翻译成其他语言中有性别的对应词。

  Koenecke在评论中写道,为进一步限制自动翻译的潜在风险,“开发人员应该考虑如何在明确模型局限性的前提下输出翻译”,并考虑“在准确性有争议时完全放弃输出”。

  英国吉尔福德萨里大学的翻译研究员Sabine Braun说,在机器翻译被广泛采用前,应该进行更多审查,并就如何使用机器翻译进行教育培训,尤其是身处医疗或法律等关键工作岗位的人。 (李木子)

  相关论文信息:

  https://doi.org/10.1038/s41586-024-08359-z

  《中国科学报》 (2025-01-20 第2版 国际)

[ 责编:李欣哲 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 习近平会见越南总理范明政

  • 习近平会见越南国会主席陈青敏

独家策划

推荐阅读
借助一种名为SMART-EM(单分子原子分辨率时间分辨电子显微镜)的技术,首次在原子尺度上拍摄了催化反应过程。
2025-04-15 11:02
中国旅游研究院联合马蜂窝发布《中国赏花游报告2025》
2025-04-15 10:46
春天里,田野上,一粒粒良种破土而出、向阳生长,承载起端牢中国饭碗的希望。既为品种权人提供有力保护,又有效规范种业市场,一粒种子伤“芯”被抚平的故事,折射法治对种业发展的有力保障。
2025-04-15 11:00
中国是拥有杜鹃种类最多的国家之一,超过530种。2018年,《毕节市百里杜鹃风景名胜区条例》出台实施,形成对百里杜鹃资源保护“有地方性法规、有特设机构、有专岗人员”的立体化保护机制。
2025-04-15 10:58
从概念验证中心起步,一大批创新项目正培育成熟、投入市场,迈向更加广阔的未来。
2025-04-15 10:49
以耕地保护为例,为扭转黑土地退化趋势,我国自2020年启动实施了东北黑土地保护性耕作行动计划。
2025-04-14 09:58
北京市、中国科学院发布怀柔综合性国家科学中心科技设施开放运行报告,怀柔综合性国家科学中心已布局建设37个科技设施,其中16个已向全球开放,包括多个国家重大科技基础设施。
2025-04-14 09:57
近日,我国自主研制的最大直径盾构机“沧渊号”在江苏常熟下线,将用于世界最长高速公路水下盾构隧道——海太长江隧道工程施工。
2025-04-14 09:57
志林肚天牛体色以浅红褐色为主,下颚内缘为黑褐色,触角呈暗红褐色。
2025-04-14 09:30
如今,科技小院的科研成果已经推广至山西长子县、榆社县等地,形成了“垃圾分类先行、农用酵素开花、有机合作结果”的发展路径。
2025-04-14 09:28
经监测,截至2024年年底,青海湖裸鲤资源蕴藏量达12.75万吨,较2023年增加0.72万吨,增长5.98%,较2002年保护初期增长49倍;
2025-04-11 03:45
中央气象台预计,4月11日至12日,随着新一股较强冷空气东移南下,我国中东部地区将出现强风、降温、沙尘天气,华北将出现历史同期罕见持续性大风,内蒙古东部和东北地区东部将出现暴雪,南方将出现今年以来最强风雹天气。
2025-04-11 10:23
我国科学家利用嫦娥六号采回的月球背面样品,首次获得月球背面月幔的水含量小于2微克/克,为认识月幔水的时空演化提供了关键约束。
2025-04-11 03:45
自然资源部10日发布公告:经国务院批准,高纯石英矿成为我国第174号新矿种。据悉,这一矿种于2020年至2021年被发现,
2025-04-11 03:45
为实现长期心电智能监测,研究团队开发了一种无运动束缚的动态12导联心电系统(以下简称“MU-DCG系统”),实现了无感化佩戴、抗运动伪影以及低功耗原位实时信号处理的优势集成。
2025-04-11 03:45
一根细细的纱线,一头连着福建首个规模超万亿元的纺织鞋服产业;另一头牵动5位院士的心,带动多项高性能纺织面料技术取得突破,为国内一家锦纶龙头企业及上下游企业新增产值逾10亿元……
2025-04-10 10:13
人工智能快速发展,在赋能千行百业、助推经济社会发展的同时,利用AI进行违法犯罪、AI数据权属争议等新问题也随之出现。透过几个具有代表性的司法案例,看司法机关如何通过积极稳妥审理相关案件,运用法治方式厘清法律边界、做好规制监管、强化司法指引,护航人工智能向上向善。
2025-04-10 10:11
医生身处临床服务、保障人民健康第一线,能切实了解病患需要、诊疗现状、技术进展,也是最容易做创新、出成果的。
2025-04-10 10:07
近日,该所成功研发出全球首套面源污染智能监测系统,首次实现对流动水体中高风险抗生素、农药残留等新发污染物的实时、在线、动态监测。
2025-04-10 03:55
免疫细胞是免疫系统的重要部分。其中,小胶质细胞在中枢神经发育、免疫监视及退行性病变等过程中扮演重要角色,但自1919年被发现以来,小胶质细胞一直被认为仅存在于中枢神经系统内部。
2025-04-10 03:55
加载更多