$ 45 € 51.21 zł 11.66
+11° 基辅 (Kyiv) +13° 华沙 (Warsaw) +12° 华盛顿 (Washington)

台湾扩大自有AI训练数据库——《台北时报》

列夫·舍夫佐 24 九月 2026 01:37
台湾扩大自有AI训练数据库——《台北时报》

台湾正在开发自己的数据库,用于训练人工智能系统,使其能够更准确地理解该国的语言、文化和社会价值观。9月15日,台湾数位发展部邀请出版社、作家和电子书平台参与建设Taiwan’s Sovereign AI Training Corpus。该数据库目前包含约5000个数据集和超过22亿个文本词元,《台北时报》报道

数位发展部长林宜敬表示,语言模型对民主、制衡制度及其他概念的理解,是由其训练所使用的数据塑造的。她说,为了更准确地理解台湾,训练数据中必须纳入本地语言、文化和价值观。

主权AI的三项组成部分

文章指出,各国正日益重新审视对美国和中国科技公司的依赖。台湾的主权AI理念包括三个方向:知识主权,即系统能够正确理解台湾;数据主权,旨在使敏感信息处于本地控制之下;以及技术主权,旨在减少对外国模型供应商的依赖。

更多最新消息请关注 UA.News Telegram 频道 Telegram.

2023年,台湾启动了由政府支持的Trustworthy AI Dialogue Engine,即TAIDE。该项目旨在更好地处理繁体中文和台湾知识。当时,TAIDE负责人李育杰指出,多语言模型BLOOM的训练数据中有16%为简体中文,而繁体中文数据的占比仅为0.05%。

本地化提高准确性

TAIDE对参数可下载和修改的开放模型进行适配。早期版本使用了Meta的Llama,而当前的Gemma-3-TAIDE-12B基于Google的Gemma 3 12B。台湾的TMMLU+测试包含66个学科的2万多个问题,结果显示,TAIDE的2月模型正确回答率为58%,而原始Gemma为54%。在台湾地理问题中,结果为70%,而后者为61%。

与此同时,文章强调,本地训练并不能消除与最强大的外国模型之间的差距。该部的语料库还可用于RAG技术,在这种技术中,系统会在回答前从经过验证的文档数据库中检索信息。台北医学大学医学人工智能研究中心副主任张永春认为,由经过验证的台湾数据支持的更强推理模型,在复杂任务中可能优于较弱的本地适配模型。

关注我们在
下载我们的应用程序