Андрей Карпаты | Создание Токенизатора ГПТ | GPT Tokenizer

13 подписчиков

12+
12+

8 часов назад

ПожаловатьсяНарушение авторских прав

13 подписчиков

12+
12+

8 часов назад

ПожаловатьсяНарушение авторских прав
12+
12+

8 часов назад

Токенизатор — необходимый и повсеместно используемый компонент больших языковых моделей (LLM), который выполняет преобразование между строками текста и токенами — отдельными фрагментами текста. Токенизация представляет собой полностью отдельный этап работы LLM. У токенизаторов есть собственные обучающие наборы данных и алгоритмы обучения, например Byte Pair Encoding (BPE, кодирование пар байтов). После обучения токенизатор выполняет две фундаментальные функции: encode() преобразует строки в токены, а decode() — токены обратно в строки. В этой лекции мы с нуля создадим токенизатор, используемый в серии моделей GPT от OpenAI. В процессе мы увидим, что многие странности и проблемы в поведении LLM на самом деле берут начало именно в токенизации. Мы подробно рассмотрим ряд таких проблем, разберёмся, почему в них виновата токенизация и почему в идеале кому-нибудь стоило бы придумать способ вообще избавиться от этого этапа. Ссылка на источник с оригиналом: https://www.youtube.com/watch?v=zduSFxRajkE&list=TLPQMjEwODIwMjaHOy47VoDEHA&index=21 Я делаю эти переводы в первую очередь потому, что сам хочу слушать на русском людей, которые прямо сейчас создают ИИ-индустрию и определяют её будущее. А раз перевожу для себя — почему бы не выкладывать и для вас. Без пересказов и чужих интерпретаций: просто первоисточник на русском. Если вам такое интересно — подписывайтесь на канал. #КосИбрагимов #нейросети #ии #андрейкарпаты #andrejkarpathy 00:00:00 — Введение: токенизация, статья о GPT-2 и проблемы, связанные с токенизацией 00:05:50 — Токенизация на примере веб-интерфейса tiktokenizer 00:14:56 — Строки в Python и кодовые точки Unicode 00:18:15 — Байтовые кодировки Unicode: ASCII, UTF-8, UTF-16 и UTF-32 00:22:47 — Немного пофантазируем: а что, если вообще избавиться от токенизации? 00:23:50 — Пошаговый разбор алгоритма Byte Pair Encoding (BPE) 00:27:02 — Начинаем реализацию токенизатора 00:28:35 — Подсчитываем последовательные пары и находим наиболее часто встречающуюся 00:30:36 — Объединяем наиболее частую пару 00:34:58 — Обучаем токенизатор: добавляем цикл while и рассчитываем коэффициент сжатия 00:39:20 — Схема «токенизатор → LLM»: почему токенизация — полностью отдельный этап 00:42:47 — Декодирование токенов обратно в строки 00:48:21 — Кодирование строк в токены 00:57:36 — Регулярные выражения для принудительного разделения текста по категориям 01:11:38 — Знакомство с библиотекой tiktoken и различия регулярных выражений GPT-2 и GPT-4 01:14:59 — Разбираем encoder.py GPT-2, опубликованный OpenAI 01:18:26 — Специальные токены, их обработка в tiktoken и различия между GPT-2 и GPT-4 01:25:28 — Время упражнения с minBPE: пишем собственный токенизатор GPT-4 01:28:42 — Знакомство с библиотекой SentencePiece, использовавшейся для обучения словаря Llama 2 01:43:27 — Как определить размер словаря? Возвращаемся к трансформеру из gpt.py 01:48:11 — Обучение новых токенов и пример сжатия промпта 01:49:58 — Мультимодальная токенизация изображений, видео и аудио с помощью векторного квантования 01:51:41 — Возвращаемся к странностям токенизации LLM и разбираемся в их причинах 02:10:20 — Итоговые рекомендации Ссылка на МОЙ канал - https://youtube.com/@kos.ibragimov?si=PKDQFQx57oMu0Gv7 Ссылка на ЭТО видео - https://youtu.be/bjIHaZjpbIg Подписывайтесь на канал и ставьте лайк — так YouTube поймёт, что такие видео стоит показывать чаще. А я пойму, что стоит делать их дальше.

Название:

Андрей Карпаты | Создание Токенизатора ГПТ | GPT Tokenizer

Категория:

Разное