$ 44.85 € 50.2 zł 11.46
+15° Киев +17° Варшава +20° Вашингтон

Исследователи представили byteification для работы языковых моделей с символами — Nature

Фёдор Крыштовский 07 Октября 2026 18:52
Исследователи представили byteification для работы языковых моделей с символами — Nature

Исследователи описали подход byteification, который адаптирует большие языковые модели, работающие с токенами, к обработке текста на уровне байтов, сообщает Nature. Это позволяет таким моделям работать с отдельными символами в словах.

Почему модели ошибаются

Большинство больших языковых моделей кодируют слова как токены — последовательности букв или частей слов. Такой подход позволяет достигать высоких результатов во многих задачах, но не предоставляет прямого доступа к отдельным символам, закодированным в двоичных последовательностях — байтах.

Больше актуальных новостей — в Telegram-канале UA.News Telegram.

Из-за этого модели могут ошибаться при подсчёте букв. Например, буква r встречается в слове strawberry трижды, хотя многие большие языковые модели отвечают, что дважды.

Работа на уровне байтов

Как отмечает Nature, Minixhofer и соавторы представили byteification как способ доработать уже существующие токенизированные модели для работы на уровне байтов. Авторы показали, что модели после такой доработки могут демонстрировать конкурентные результаты, одновременно сохраняя способность считывать отдельные символы.

Читай нас в
Загружай наше приложение