Контекст и токены простыми словами: почему длинные чаты ведут себя иначе

Два слова, на которые натыкается каждый, кто углубляется в тему ИИ-чатов: «контекст» и «токены». Звучит технически, но идея за ними простая, и понимать её полезно — она объясняет половину странностей в поведении персонажа.

Токен — это кусочек текста

Модель не видит буквы и не видит слова. Она работает с токенами — кусочками, на которые текст режется по своим правилам. Токеном может быть целое короткое слово, часть длинного, знак препинания или пробел.

Практическая арифметика для русского языка: примерно два символа на токен. То есть слово «привет» — около трёх токенов, а обычное сообщение в пару предложений — сотня.

Важная деталь, которая многих удивляет: русский текст «дороже» английского. Одна и та же мысль по-английски занимает примерно вдвое меньше токенов. Так уж устроены словари, на которых обучались модели. Отсюда, кстати, и то, что зарубежные сервисы с лимитом «10 000 токенов» на русском кончаются вдвое быстрее.

Контекстное окно — это стол, а не память

Контекстное окно — максимальный объём текста, который модель может держать перед глазами за один запрос. Хорошая метафора — рабочий стол: на него влезает ограниченное количество бумаг. Что не влезло — лежит в шкафу, и модель этого не видит.

Ключевое: стол пересобирается заново на каждое сообщение. Модель ничего не помнит между запросами. Каждый раз сервис заново выкладывает на стол всё, что нужно: описание персонажа, свежие реплики, пересказ старого, факты о вас. Отправляет целиком. Получает ответ. Стол очищается.

Поэтому «память» ИИ — это на самом деле умение сервиса каждый раз правильно собрать стол. Об этом подробно — в статье почему ИИ забывает.

Что лежит на столе, кроме ваших сообщений

Неожиданный для многих факт: ваша переписка — не главный потребитель места.

В типичном запросе к персонажу примерно так: описание героя, его характер и манера речи занимают больше половины всего объёма. Дальше идут последние реплики, пересказ старого, факты о вас, служебные подсказки. Само ваше новое сообщение — доли процента.

Отсюда следствие, которое стоит запомнить: раздутое описание персонажа съедает память чата. Каждая лишняя тысяча знаков в карточке — это тысяча знаков, вытесненных из вашей переписки. Поэтому в описании ценится плотность, а не объём.

Почему середина забывается сильнее краёв

Эффект, который экспериментально подтверждён на всех больших моделях: информацию в начале и в конце запроса модель использует надёжно, а лежащую в середине — заметно хуже.

Это объясняет странность, с которой сталкиваются в очень длинных чатах: персонаж помнит и то, что было в самом начале знакомства, и то, что было пять минут назад, а середину истории — как в тумане.

Вывод практический: больше контекста не всегда лучше. Чат, куда механически свалили тысячу сообщений, помнит хуже, чем аккуратно собранные триста. Сервис, который «отправляет всю переписку», не молодец, а ленивый.

При чём тут деньги

Стоимость запроса к модели считается по токенам — отдельно за то, что отправили, отдельно за то, что получили. Поэтому объём и цена связаны напрямую.

Отсюда две вещи, которые видит пользователь:

Как это выглядит в деньгах со стороны сервиса и почему подписки устроены именно так — разбирали в статье сколько стоит ИИ-компаньон.

Что с этим делать пользователю

В Noxie объём дословной памяти растёт вместе с уровнем подписки, а всё, что вышло за его пределы, не пропадает — уходит в пересказ и в поиск по смыслу. Попробовать →

Читайте также


Все статьи Noxie · На главную