Контекст и токены простыми словами: почему длинные чаты ведут себя иначе
Два слова, на которые натыкается каждый, кто углубляется в тему ИИ-чатов: «контекст» и «токены». Звучит технически, но идея за ними простая, и понимать её полезно — она объясняет половину странностей в поведении персонажа.
Токен — это кусочек текста
Модель не видит буквы и не видит слова. Она работает с токенами — кусочками, на которые текст режется по своим правилам. Токеном может быть целое короткое слово, часть длинного, знак препинания или пробел.
Практическая арифметика для русского языка: примерно два символа на токен. То есть слово «привет» — около трёх токенов, а обычное сообщение в пару предложений — сотня.
Важная деталь, которая многих удивляет: русский текст «дороже» английского. Одна и та же мысль по-английски занимает примерно вдвое меньше токенов. Так уж устроены словари, на которых обучались модели. Отсюда, кстати, и то, что зарубежные сервисы с лимитом «10 000 токенов» на русском кончаются вдвое быстрее.
Контекстное окно — это стол, а не память
Контекстное окно — максимальный объём текста, который модель может держать перед глазами за один запрос. Хорошая метафора — рабочий стол: на него влезает ограниченное количество бумаг. Что не влезло — лежит в шкафу, и модель этого не видит.
Ключевое: стол пересобирается заново на каждое сообщение. Модель ничего не помнит между запросами. Каждый раз сервис заново выкладывает на стол всё, что нужно: описание персонажа, свежие реплики, пересказ старого, факты о вас. Отправляет целиком. Получает ответ. Стол очищается.
Поэтому «память» ИИ — это на самом деле умение сервиса каждый раз правильно собрать стол. Об этом подробно — в статье почему ИИ забывает.
Что лежит на столе, кроме ваших сообщений
Неожиданный для многих факт: ваша переписка — не главный потребитель места.
В типичном запросе к персонажу примерно так: описание героя, его характер и манера речи занимают больше половины всего объёма. Дальше идут последние реплики, пересказ старого, факты о вас, служебные подсказки. Само ваше новое сообщение — доли процента.
Отсюда следствие, которое стоит запомнить: раздутое описание персонажа съедает память чата. Каждая лишняя тысяча знаков в карточке — это тысяча знаков, вытесненных из вашей переписки. Поэтому в описании ценится плотность, а не объём.
Почему середина забывается сильнее краёв
Эффект, который экспериментально подтверждён на всех больших моделях: информацию в начале и в конце запроса модель использует надёжно, а лежащую в середине — заметно хуже.
Это объясняет странность, с которой сталкиваются в очень длинных чатах: персонаж помнит и то, что было в самом начале знакомства, и то, что было пять минут назад, а середину истории — как в тумане.
Вывод практический: больше контекста не всегда лучше. Чат, куда механически свалили тысячу сообщений, помнит хуже, чем аккуратно собранные триста. Сервис, который «отправляет всю переписку», не молодец, а ленивый.
При чём тут деньги
Стоимость запроса к модели считается по токенам — отдельно за то, что отправили, отдельно за то, что получили. Поэтому объём и цена связаны напрямую.
Отсюда две вещи, которые видит пользователь:
- Лимиты в бесплатных тарифах. Они существуют не из жадности: каждое сообщение реально стоит денег.
- Разная цена у разных моделей. Умная модель может стоить в десятки раз дороже быстрой при том же объёме текста.
Как это выглядит в деньгах со стороны сервиса и почему подписки устроены именно так — разбирали в статье сколько стоит ИИ-компаньон.
Что с этим делать пользователю
- Держите описание персонажа плотным. Факты и привычки вместо прилагательных. Это и характер улучшает, и место экономит.
- Не ведите пять сюжетов в одном чате. Разные линии — разные чаты, каждому свой стол.
- Важное проговаривайте явно. В пересказ попадёт то, что было названо словами.
- Не гонитесь за «максимальным контекстом». Качество сборки важнее размера.
В Noxie объём дословной памяти растёт вместе с уровнем подписки, а всё, что вышло за его пределы, не пропадает — уходит в пересказ и в поиск по смыслу. Попробовать →
Читайте также
- Почему ИИ забывает, о чём вы говорили, и как это исправить
- Сколько стоит ИИ-компаньон и почему бесплатных не бывает
- SillyTavern на русском: кому он нужен, а кому проще онлайн-сервис
- ИИ повторяется и отвечает одинаково: 7 причин и что делать