Omnilingual ASR来了,几段示例学会冷门语言,语言保护的下一步该怎么走?
Meta发布Omnilingual ASR模型,可识别转录超1600种语言,并通过少量示例学习新语言。这不仅是语音识别技术的突破,更可能深刻改变全球语言保护和复兴的格局,为包括中国方言在内的濒危声音提供了前所未有的数字化工具。 世界上有超过7000种仍在使用的语言,但现代语音技术能“听懂”的,不过区区数百种。从非洲部落的土著,到亚马逊雨林的族群,再到乡镇里说着古老方言的老人,他们大多数人的母语,一直徘徊在数字时代洪亮的背景音之外。语音助手、自动字幕、实时翻译,这些人工智能(AI)带来的便利,似乎只为少数“主流”语言而生。 这种由技术差异造成的“数字鸿沟”,如今正迎来一位强大的破局者。Meta的人工智能研究团队发布了名为Omnilingual ASR的系统,一个能自动识别和转录超过1600种语言的AI模型,让几乎所有人类的声音都有了被机器“听懂”的可能。 “听懂”1600种语言的AI是怎样炼成的 Omnilingual ASR的发布,创造了语音识别(Automatic Speech Recognition, ASR)覆盖语言数量的新纪录。相比之下,此前由OpenAI开源的知名模型Whisper仅支持99种语言,而Omnilingual ASR几乎将这个数字提升了一个数量级。在它支持的语言中,有超过500种是从未被任何AI系统转录过的“全新”语言。 这项成就的背后,是庞大的数据和先进的模型架构。Omnilingual ASR的训练使用了超过430万小时的语音音频,数据来源极其广泛,涵盖了1239种语言。这是有史以来规模最大、多样性最高的语音训练语料库之一。 模型的核心技术之一,是基于自监督学习的wav2vec 2.0语音编码器。简单来说,这个编码器可以在没有文本标注的情况下,从海量的原始音频中学习声音的普遍规律和特征,形成一种跨语言的“听力”基础。在此之上,Meta的工程师们堆叠了参数量高达70亿的强大模型,并结合了两种解码策略:一种是传统的CTC解码,效率高、速度快;另一种则是融入了大型语言模型(Large Language Model, LLM)思路的文本解码器。 正是这种结合LLM的架构,赋予了Omnilingual ASR一项革命性的能力:“上下文学习”(in-context learning)。这意味着,即使某个语言最初不在模型的支持列表中,使用者也可以在实际
Explore this link on the map →