Tajwan rozszerza własną bazę danych do szkolenia AI — Taipei Times
Tajwan rozwija własną bazę danych do szkolenia systemów sztucznej inteligencji, aby dokładniej rozumiały język, kulturę i wartości społeczne kraju. 15 września tajwańskie Ministerstwo Spraw Cyfrowych zaprosiło wydawców, pisarzy i platformy e-booków do udziału w tworzeniu Taiwan’s Sovereign AI Training Corpus. Baza zawiera obecnie około 5 tys. zbiorów danych i ponad 2,2 mld tokenów tekstu, informuje Taipei Times.
Minister spraw cyfrowych Lin Yi-ching oświadczyła, że rozumienie przez model językowy demokracji, systemu kontroli i równowagi oraz innych pojęć kształtuje się na podstawie danych, na których był szkolony. Według niej, aby dokładniej rozumieć Tajwan, do zbiorów treningowych muszą trafić lokalny język, kultura i wartości.
Trzy elementy suwerennej AI
Artykuł zauważa, że kraje coraz częściej ponownie analizują zależność od amerykańskich i chińskich firm technologicznych. Tajwańska koncepcja suwerennej AI obejmuje trzy kierunki: suwerenność wiedzy, w ramach której system prawidłowo rozumie Tajwan; suwerenność danych, mającą utrzymać wrażliwe informacje pod lokalną kontrolą; oraz suwerenność technologiczną, której celem jest zmniejszenie zależności od zagranicznych dostawców modeli.
Więcej aktualnych wiadomości na kanale UA.News w Telegramie Telegram.
W 2023 roku Tajwan uruchomił wspierany przez rząd Trustworthy AI Dialogue Engine, czyli TAIDE. Projekt stworzono, aby lepiej pracował z tradycyjnym językiem chińskim i tajwańską wiedzą. Szef TAIDE Lee Yu-chieh zwracał wówczas uwagę, że wielojęzyczny model BLOOM szkolono na danych, z których 16% było w uproszczonym chińskim, podczas gdy udział danych w tradycyjnym chińskim wynosił zaledwie 0,05%.
Lokalizacja zwiększa dokładność
TAIDE dostosowuje otwarte modele, których parametry można pobierać i modyfikować. Wczesne wersje wykorzystywały Llama firmy Meta, natomiast obecny Gemma-3-TAIDE-12B bazuje na Gemma 3 12B firmy Google. Tajwański test TMMLU+, zawierający ponad 20 tys. pytań z 66 przedmiotów, wykazał, że lutowy model TAIDE udzielił 58% poprawnych odpowiedzi wobec 54% w przypadku oryginalnego Gemma. W pytaniach dotyczących geografii Tajwanu wynik wyniósł 70% wobec 61%.
Jednocześnie materiał podkreśla, że lokalne szkolenie nie likwiduje różnicy wobec najpotężniejszych zagranicznych modeli. Korpus ministerstwa może być również wykorzystywany w technologii RAG, w której system przed udzieleniem odpowiedzi wyszukuje informacje w zweryfikowanej bazie dokumentów. Zastępca dyrektora Centrum Badań AI w Medycynie na Tajpejskim Uniwersytecie Medycznym Chang Yung-chun uważa, że silniejszy model rozumowania, wsparty zweryfikowanymi tajwańskimi danymi, może przewyższać słabszy model dostosowany lokalnie w złożonych zadaniach.
Czytaj nas na Telegram i Sends