互联网资讯 · 2023年11月1日 0

不同语言的AI大模型带来的语言不平等:英语价格最低,其他语言价格较高

7 月 31 日消息,用户所使用的语言对于大型语言模型的费用有很大的影响,可能造成英语使用者和其它语言使用者之间的人工智能鸿沟。最近的一项研究显示,由于服务所采用的服务器成本衡量和计费的方式,英语输入和输出的费用要比其他语言低得多,其中简体中文的费用大约是英语的两倍,西班牙语是英语的 1.5 倍,而缅甸的掸语则是英语的 15 倍。

注意到,推特用户 Dylan Patel分享了一张照片,展示了牛津大学进行的一项研究,该研究发现,让一个处理一句缅甸语句子需要 198 个词元,而同样的句子用英语写只需要 17 个词元。词元代表了通过 API 访问所需的计算力成本,这意味着缅甸语句子使用这种服务的成本比英语句子高出 11 倍。

词元化模型意味着,除了英语之外的其他语言使用和训练模型要贵得多。这是因为像中文这样的语言有着不同、更复杂的结构,导致它们需要更高的词元化率。例如,根据的分词器,“你的爱意”在英语中只需要两个词元,但在简体中文中需要八个词元。尽管简体中文文本只有 4 个字符,而英文有 14 个字符。