То-ке-ни-за-ци-я. Разделяй и властвуй
YandexGPT, BERT, LLaMA и все-все-все. Языковые модели получают тексты, обрабатывают их и «учатся» естественным языкам. Важнейшая техническая задача: поделить тексты на токены — новые слова, с которыми машина умеет хорошо работать. • Почему GPT-модели поймут слова 'рофлить' и 'брадобрей', даже если никогда не встречали их до вашего запроса? • Как токенизировать тексты на японском, в которых нет пробелов? • И как модели понимают, когда «синий бархат» — это про фильм Дэвида Линча, а когда просто про ткань синего цвета? Обо всех чудесах токенизации расскажет Марат Богаутдинов, студент 3 курса Фундаментальной и компьютерной лингвистики (ВШЭ)
Название:
То-ке-ни-за-ци-я. Разделяй и властвуй
Категория:
Разное