Тайвань расширяет собственную базу данных для обучения ИИ — Taipei Times
Тайвань развивает собственную базу данных для обучения систем искусственного интеллекта, чтобы они точнее понимали язык, культуру и общественные ценности страны. 15 сентября Министерство цифровых дел Тайваня пригласило издателей, писателей и платформы электронных книг присоединиться к формированию Taiwan’s Sovereign AI Training Corpus. Сейчас база содержит около 5 тысяч наборов данных и более 2,2 млрд текстовых токенов, сообщает Taipei Times.
Министр цифровых дел Линь Ицзин заявила, что представление языковой модели о демократии, системе сдержек и противовесов и других понятиях формируется на основе данных, на которых ее обучали. По ее словам, для более точного понимания Тайваня в обучающие массивы должны войти местный язык, культура и ценности.
Три составляющие суверенного ИИ
В статье отмечается, что страны все чаще пересматривают зависимость от американских и китайских технологических компаний. Тайваньская концепция суверенного ИИ предусматривает три направления: суверенитет знаний, при котором система корректно понимает Тайвань; суверенитет данных, призванный сохранить чувствительную информацию под местным контролем; а также технологический суверенитет, направленный на уменьшение зависимости от зарубежных поставщиков моделей.
Больше актуальных новостей — в Telegram-канале UA.News Telegram.
В 2023 году Тайвань запустил поддерживаемый правительством Trustworthy AI Dialogue Engine, или TAIDE. Проект создавали для более эффективной работы с традиционным китайским языком и тайваньскими знаниями. Руководитель TAIDE Ли Юцзе тогда обращал внимание, что многоязычную модель BLOOM обучали на 16% данных на упрощенном китайском, тогда как доля данных на традиционном китайском составляла лишь 0,05%.
Локализация повышает точность
TAIDE адаптирует открытые модели, параметры которых можно скачивать и модифицировать. Ранние версии использовали Llama от Meta, а текущая Gemma-3-TAIDE-12B основана на Gemma 3 12B от Google. Тайваньский тест TMMLU+, содержащий более 20 тысяч вопросов по 66 предметам, показал, что февральская модель TAIDE дала 58% правильных ответов против 54% у оригинальной Gemma. В вопросах по географии Тайваня результат составил 70% против 61%.
В то же время материал подчеркивает, что локальное обучение не устраняет разрыв с наиболее мощными зарубежными моделями. Корпус министерства также можно использовать для технологии RAG, при которой система перед ответом ищет информацию в проверенной базе документов. Заместитель директора Центра исследований ИИ в медицине Тайбэйского медицинского университета Чжан Юнчунь считает, что более сильная модель рассуждений, подкрепленная проверенными тайваньскими данными, может превзойти более слабую локально адаптированную модель в сложных задачах.