Дослідники представили byteification для роботи мовних моделей із символами — Nature
Дослідники описали підхід byteification, який адаптує великі мовні моделі, що працюють із токенами, до обробки тексту на рівні байтів, повідомляє Nature. Це дає таким моделям змогу працювати з окремими символами у словах.
Чому моделі помиляються
Більшість великих мовних моделей кодують слова як токени — послідовності літер або частин слів. Такий підхід дає змогу досягати високих результатів у багатьох завданнях, але не надає прямого доступу до окремих символів, закодованих у двійкові послідовності — байти.
Більше актуальних новин читайте у Telegram-каналі UA.News.
Через це моделі можуть помилятися у підрахунку літер. Наприклад, у слові strawberry літера r трапляється тричі, хоча чимало великих мовних моделей відповідають, що двічі.
Робота на рівні байтів
Як зазначає Nature, Minixhofer та співавтори представили byteification як спосіб доопрацювати вже наявні токенізовані моделі для роботи на рівні байтів. Автори показали, що моделі після такого доопрацювання можуть демонструвати конкурентні результати, водночас зберігаючи здатність читати окремі символи.