Ты разговариваешь с Claude — и он отвечает умно, связно, по-русски. Кажется, он понимает тебя. Но что на самом деле происходит внутри? Это не магия и не "настоящий разум". Это математика на языке кирпичиков — и как только ты это поймёшь, ты начнёшь использовать AI эффективнее.
Суть урока
Большинство людей работают с LLM (эл-эл-эм, Large Language Model — «большая языковая модель») как с чёрным ящиком: задал вопрос — получил ответ. Это работает. Но понимание того, как устроен ящик изнутри, даёт практические преимущества: экономишь деньги, получаешь лучшие ответы, понимаешь почему AI иногда ошибается и как это обойти.
Этот урок — рентгеновский снимок языковой модели. Без формул. Только образы.
Ключевые концепции
- Токен (token) — минимальная единица текста, которую AI обрабатывает
- Предобучение (pre-training) — как модель учится на гигантских объёмах текста
- Эмбеддинг (embedding) — как AI превращает слова в числа и смысл
- Трансформер (transformer) и внимание (attention) — устройство модели, которое изменило всё
- Контекстное окно (context window) — память AI за один разговор
- Температура (temperature) — регулятор "творческой случайности"
- Галлюцинация (hallucination) — почему AI иногда уверенно говорит неправду
Теория
1. Что такое токен — атомы языка
Прежде всего: AI не читает слова. Он видит токены (токен — от англ. «жетон», минимальная единица текста которую AI обрабатывает).
Токен — это не слово. Это кусок текста, который языковая модель считает неделимой единицей. Иногда токен = слово. Иногда токен = слог. Иногда токен = символ.
Примеры (числа примерные: у каждой модели текст режется по-своему):
- Английское слово
cat(«кот») = 1 токен (короткое, частое) - Английское слово
catastrophe(«катастрофа») может разрезаться на 3 токена:cat+ast+rophe - Русское слово
привет— обычно 1-2 токена - Русское слово
компьютер— обычно 2-3 токена - Длинное редкое слово вроде
антропоморфизм— ещё больше
Важная деталь: русский язык "дороже" английского. В русском слова длиннее и меняются по падежам и родам — один и тот же смысл на русском занимает заметно больше токенов, чем на английском (точное соотношение зависит от модели и текста). Это важно, потому что именно токенами измеряют и лимиты в чате, и плату в API (так называют подключение для разработчиков).
Примерный ориентир для английского текста, по оценке Anthropic: 1000 токенов ≈ 750 слов; у новейших моделей Claude текст режется мельче, и в 1000 токенов помещается около 555 слов. В русском тексте на те же 1000 токенов слов приходится ещё меньше.
Почему это важно на практике:
- Счёт идёт на токены, а не на слова: в бесплатном и платном чате токены расходуют твой лимит, в API за них платят деньгами. Чем короче и конкретнее промпт (так называют запрос к AI), тем меньше тратишь
- Длинные русские тексты расходуют больше токенов, чем такие же английские
- "Сжатый" промпт без воды = заметная экономия при том же качестве
2. Как AI учится: предобучение
Откуда Claude знает что значит слово "кот"? Откуда он знает что после "Солнце светит в" идёт "небе"? Откуда он знает историю, физику, программирование?
Ответ: предобучение (pre-training) — первый этап обучения языковой модели.
Представь: разработчики модели собирают гигантскую библиотеку текстов. Не просто большую — невообразимую. Энциклопедии на множестве языков, книги, научные статьи, программный код, новости, форумы, юридические документы. Это называется «корпус» (corpus — от лат. «тело», большой массив текстов для обучения).
Затем модель обучается на этом корпусе — триллионы токенов, месяцы вычислений на тысячах специальных чипов.
Задача при обучении до примитивности проста: угадай следующий токен.
Конкретно: модель видит текст "Земля вращается вокруг" — и должна предсказать что идёт дальше. Правильный ответ: "Солнца". Модель предсказала "звёзд" — неправильно. Обновляем параметры. Снова. И снова. Триллионы раз.
Звучит примитивно? Но именно из этой простой задачи вырастает всё. Чтобы хорошо угадывать следующее слово в медицинской статье — нужно понять медицину. Чтобы угадывать в коде — нужно понять логику программирования. Чтобы угадывать в поэзии — нужно почувствовать ритм.
3. Эмбеддинги — как AI видит смысл
Компьютер понимает только числа. Как же он работает с текстом?
Ответ: каждый токен превращается в вектор чисел.
Эмбеддинг (embedding — представление слова набором чисел) — это способ превратить любое слово в список чисел так, чтобы похожие по смыслу слова давали похожие числа.
Вектор (vector — упорядоченный список чисел) для слова "кот" может выглядеть как [0.32, -0.71, 0.15, 0.88, -0.03, ...] — тысячи чисел в одном списке. Для слова "кошка" — очень похожий список. Для слова "банан" — совершенно другой.
Эти векторы живут в многомерном математическом пространстве. Слова с похожим смыслом — рядом в этом пространстве. Слова с разным смыслом — далеко.
Потрясающее свойство эмбеддингов: математика на них работает осмысленно.
Есть знаменитый пример: вектор("король") - вектор("мужчина") + вектор("женщина") ≈ вектор("королева"). Математика текста дала правильный ответ о соотношении понятий. Это не случайность — это то как устроено пространство смыслов.
4. Трансформер и механизм внимания
В 2017 году исследователи Google опубликовали статью с названием "Attention Is All You Need" ("Внимание — это всё что нужно"). Эта статья изменила историю AI.
Трансформер (transformer — схема устройства нейросети, изобретённая в Google в 2017 году) стал основой для всех современных языковых моделей: GPT, Claude, Gemini, Llama.
До трансформеров AI читал текст как человек читает плохую книгу — слева направо, слово за словом, забывая начало к концу. Длинные тексты давались плохо.
Трансформер решил это радикально: он видит ВЕСЬ текст одновременно.
Ключевой механизм — внимание (attention): способность модели одновременно учитывать все части текста при обработке каждого слова.
Когда трансформер обрабатывает слово "он" в предложении, механизм внимания задаёт вопрос: на какие другие слова в тексте нужно обратить внимание, чтобы понять кто такой этот "он"?
Пример: "Ключ не подошёл к замку" и "Из-под камня бил холодный ключ".
Слово "ключ" одно и то же. Но механизм внимания в первом случае замечает слово "замку" и понимает: это ключ от двери. Во втором — слова "бил" и "холодный" и понимает: это родник. Одно слово — два разных смысла — правильно различены через внимание к контексту.
5. Контекстное окно — рабочий стол AI
Контекстное окно (context window — максимальный объём текста который AI держит в памяти за один разговор) — это, пожалуй, самый практически важный параметр для работы с AI.
Всё что попадает в контекстное окно — AI "видит" и учитывает. Всё что за его пределами — не существует для AI в данный момент.
Размеры контекстных окон (на октябрь 2026, для Claude в API):
- Claude Fable 5.1, Opus 5.5, Sonnet 5.5: 1 000 000 токенов ≈ 555 000 английских слов (у этих моделей текст режется на токены мельче, чем у прежних) ≈ 1800 страниц книги
- Claude Haiku 4.5: 200 000 токенов ≈ 150 000 английских слов ≈ 500 страниц
У ChatGPT, Gemini и других ассистентов окна тоже исчисляются сотнями тысяч и миллионами токенов, но точные значения зависят от модели и тарифа: смотри документацию поставщика и страницу Актуальное сейчас. В обычном приложении (например, в чате claude.ai) доступный объём может отличаться от API.
Это большие числа. Но в реальной работе контекст расходуется быстрее, чем кажется: системный промпт (служебные инструкции, которые приложение даёт модели), история переписки, загруженные документы, ответы AI — всё это занимает место в контекстном окне.
Что происходит когда контекст заполняется: Ранние части разговора "вытесняются" и AI перестаёт их учитывать. Ты замечаешь это: AI "забывает" что говорилось в начале длинного чата. Это не глупость — это ограничение самого устройства модели.
Практические выводы:
- Большой контекст — удобно. Но обходится дороже: в API платишь за каждый токен в запросе, а в чате длинный разговор быстрее расходует лимит
- На будущее, когда дойдёшь до Claude Code (агент для программирования, он появится в конце курса): для длинных проектов там есть команда
/compact— она сжимает историю разговора, сохраняя главное - Не смешивай задачи: начинай новый чат для новой задачи, не тяни всё в один
6. Как AI генерирует ответ — шаг за шагом
Ты написал: "Объясни квантовую механику простыми словами". Что происходит дальше?
Шаг 1: Токенизация Твой текст разбивается на токены. "Объясни" → 1-2 токена, "квантовую" → 2-3 токена, и так далее.
Шаг 2: Эмбеддинги Каждый токен превращается в вектор чисел. Теперь твой запрос существует как набор точек в математическом пространстве.
Шаг 3: Трансформер обрабатывает Механизм внимания проходит по всем токенам, строит связи, понимает контекст. "Квантовую" + "механику" + "простыми словами" — три части, каждая важна для понимания задачи.
Шаг 4: Вычисление вероятностей Модель смотрит на всё что есть в контексте и вычисляет: какой следующий токен наиболее вероятен? Не один вариант — а распределение вероятностей по всему словарю (десяткам тысяч токенов). "Квантовая" — 12%, "Рассмотрим" — 8%, "Представь" — 15%...
Шаг 5: Выбор токена (по-английски sampling) Модель выбирает следующий токен из распределения вероятностей. Как именно — зависит от температуры (об этом ниже).
Шаг 6: Повторение Выбранный токен добавляется в контекст. Повторяем шаги 4-5 для следующего токена. И снова. И снова — пока ответ не будет завершён.
7. Температура (temperature) — регулятор случайности
Температура (temperature — параметр управляющий "случайностью" при выборе следующего токена; в разных сервисах диапазон разный, чаще от 0 до 1 или до 2) — важная идея для понимания того, почему ответы отличаются.
⚠️ Оговорка на октябрь 2026. В API новейших моделей Claude (Opus 4.7 и новее, включая Opus 5.5) ручная настройка температуры убрана: любое значение кроме стандартного возвращает ошибку, а поведением управляют формулировкой запроса. В обычных чатах этой настройки нет вообще. Она по-прежнему есть у части других моделей и сервисов, поэтому принцип ниже полезен, но проверяй документацию своей модели.
Помни: на шаге выбора токена у модели есть распределение вероятностей. Температура определяет как из этого распределения выбирать.
Температура = 0: Модель всегда выбирает токен с максимальной вероятностью. Полностью предсказуемый режим (его называют «детерминированным»: одинаковый запрос даёт одинаковый результат). Задашь один и тот же вопрос 10 раз — получишь один и тот же ответ. Предсказуемо. Надёжно. Скучно. (Даже при нулевой температуре одинаковый ответ гарантируется не всегда.)
Подходит для: точные инструкции, извлечение данных, структурированные задачи, код.
Температура = 1 (стандарт): Баланс между предсказуемостью и разнообразием. Это настройка Claude по умолчанию. Ответы связные, но не механические.
Температура = 1.5-2: Модель берёт токены с более низкими вероятностями — "неожиданные" выборы. Ответы становятся творческими, неожиданными, иногда странными. При очень высокой температуре — бессмысленными.
Практические рекомендации (там, где инструмент даёт менять температуру):
- Пишешь код / извлекаешь данные → температура 0-0.3
- Обычная беседа / анализ → температура 0.7-1.0
- Придумываешь идеи / пишешь творческий текст → температура 1.0-1.3
- Выше 1.5 — только для экспериментов
8. Параметры модели — что это такое
Параметр (parameter — числовое значение, выученное моделью в процессе обучения) — это числа внутри нейронной сети, которые определяют как она "думает".
Упрощённо: нейронная сеть — это математическая функция с миллиардами переменных. Обучение — это процесс подбора правильных значений для этих переменных так, чтобы функция хорошо предсказывала следующий токен.
Сравнение размеров:
- GPT-3 (2020): 175 миллиардов параметров
- Современные флагманы OpenAI, Anthropic и Google: компании размеры не раскрывают, любые цифры в интернете — догадки
- Llama 3.1 (Meta, открытые веса — то есть саму модель может скачать любой): версии на 8, 70 и 405 миллиардов
Больше параметров ≠ лучше модель. Это распространённое заблуждение. Важно не количество — важно качество обучения, данных и самого устройства модели. Новые модели меньшего размера нередко превосходят более крупных предшественников.
9. Дообучение (fine-tuning) — как рождается помощник
После базового предобучения у нас есть мощная, но "сырая" языковая модель. Она умеет предсказывать токены. Но она не умеет быть полезным ассистентом — она может и цитировать нацистскую пропаганду, и давать инструкции по самовредительству, просто потому что "это тоже был текст в обучающих данных".
Чтобы превратить "предсказатель текста" в "полезного ассистента" — используют дообучение (по-английски fine-tuning, «файн-тюнинг»): уже обученную модель учат дальше на специально подобранных данных для конкретной цели.
RLHF — ключевой метод для ChatGPT, GPT-4 и большинства коммерческих моделей:
RLHF (ар-эл-эйч-эф, Reinforcement Learning from Human Feedback — обучение с подкреплением на основе человеческих оценок) работает так:
- Модель генерирует несколько вариантов ответа на один вопрос
- Люди-оценщики ранжируют их: этот лучше, тот хуже
- На основе этих оценок обучается отдельная модель-оценщик (её называют «модель вознаграждения», reward model)
- Основная модель учится выдавать ответы, которые модель-оценщик оценит высоко
Constitutional AI — метод Anthropic для Claude:
Constitutional AI («конституционный AI» — метод обучения, где модель руководствуется набором принципов) — это подход Anthropic, который лежит в основе обучения Claude.
Вместо того чтобы только полагаться на оценки людей (которые могут ошибаться и быть предвзятыми), Claude обучается следовать набору явных принципов — "конституции": будь полезным, будь честным, избегай вреда. Модель учится критиковать собственные ответы с точки зрения этих принципов и улучшать их.
10. Почему AI галлюцинирует
Галлюцинация (hallucination — уверенное утверждение AI, которое является ложным) — самая частая проблема при работе с языковыми моделями.
AI уверенно называет несуществующие научные статьи. Приписывает реальным людям цитаты которых они никогда не говорили. Называет неверные даты исторических событий. И делает это с той же интонацией уверенности, что и когда правильно.
Почему это происходит:
Помни: модель оптимизирована на "угадай следующий токен так, чтобы текст звучал правдоподобно". Не "выдай истину". Правдоподобность и истинность — разные вещи.
Если в обучающих данных много текстов где упоминается "профессор Иванов из МГУ" — модель создаст правдоподобного "профессора Иванова из МГУ" даже если такого не существует. Потому что это правдоподобный паттерн.
Если конкретный факт встречался в обучающих данных редко или в противоречивых контекстах — модель заполнит пробел "наиболее вероятным" вариантом. Который может быть ложным.
AI не "знает" факты в том смысле как знает их человек, который прочёл их в надёжном источнике. AI видел паттерны текстов о фактах — и воспроизводит эти паттерны.
Как защититься:
- Важные факты всегда проверяй в независимом источнике
- Для дат, имён, статистики — перепроверяй
- Для свежих данных проси Claude поискать в интернете (у него есть веб-поиск) и смотри на ссылки, которые он приводит
- Спрашивай Claude: "ты уверен в этом? Какова вероятность ошибки?" — модели обученные честности часто признают неопределённость
11. Зачем всё это знать на практике
Это не академическая лекция. Каждый раздел имеет прямое применение в работе.
Токены → экономия лимита и денег: Токены расходуют твой лимит в чате, а в API за них платят деньгами. Понимая что такое токен, ты:
- Пишешь более компактные промпты (меньше "воды" = меньше токенов = меньше расход)
- Знаешь, что русский текст занимает больше токенов, чем английский, поэтому длинный русский документ расходует лимит быстрее
- Не загружаешь в контекст лишние документы целиком — только нужные части
Контекстное окно → работа с большими документами: Зная что контекст конечен:
- Делишь большие документы на части и обрабатываешь поочерёдно
- Позже, в Claude Code, используешь команду
/compact, когда разговор становится длинным - Начинаешь новый чат для новой задачи — не тащишь всё в один
Температура → стабильность или творчество: Зная как работает температура:
- Ставишь низкую температуру для задач где нужна повторяемость (написание кода, извлечение данных) — там, где инструмент даёт её менять
- Ставишь высокую для мозговых штурмов и поиска идей
- Понимаешь почему один и тот же промпт каждый раз даёт немного разный ответ
Галлюцинации → критическое мышление: Зная природу галлюцинаций:
- Не доверяешь AI слепо в фактических вопросах
- Всегда проверяешь важное в первоисточниках
- Используешь AI, чтобы упорядочить мысли, а не вместо проверки фактов
Практика
Задание 1: Эксперимент с токенами
Зайди на claude.ai и напиши:
Вот список слов. Для каждого скажи сколько токенов он занимает примерно: кот, катастрофа, компьютер, AI, internationalization, привет, hello, антропоморфизм, i18n
Посмотри на ответ. Это приблизительная оценка: число токенов зависит от модели, и точно его считают только через API (подключение для разработчиков). Как это устроено, описано в документации Anthropic (на английском): Token counting. Тебе считать ничего не нужно: достаточно увидеть, что короткие частые слова занимают один токен, а длинные и редкие — несколько.
Цель: почувствовать разницу между токенами в разных языках и словах.
Задание 2: Эксперимент с температурой через повторение
Напиши один и тот же промпт три раза подряд, не меняя ничего (каждый раз в новом чате, чтобы Claude не видел свои прошлые ответы):
Придумай необычное название для кофейни в стиле магического реализма. Только название, без объяснений.
Ответы совпали? Слегка отличаются? Сильно отличаются? Это температура в действии.
Задание 3: Тест контекстного окна
Возьми любую длинную статью из интернета (минимум 5000 слов). Вставь её в чат с Claude и задай вопрос о деталях из начала статьи. Затем задай вопрос о деталях из конца статьи. Сравни точность ответов.
Попробуй ту же статью разбить на два запроса и посмотри изменится ли качество ответов.
Чего ждать: статья такого размера целиком помещается в контекстное окно, поэтому Claude должен одинаково точно ответить и про начало, и про конец. "Забывание" начинается только в очень длинных разговорах.
Задание 4: Проверка на галлюцинации
Спроси Claude о конкретном малоизвестном факте — например, о втором по величине городе малоизвестной страны, или о дате основания конкретного небольшого университета. Запиши ответ. Проверь в Википедии. Совпало?
Цель: выработать привычку проверять важные факты.
Ключевые выводы
AI — это не думающая машина. Это очень продвинутый предсказатель следующего токена. Это объясняет и силы (закономерности, связи, скорость) и слабости (галлюцинации, отсутствие "настоящего" понимания).
Токены — это валюта работы с AI. Чем меньше лишних токенов в промпте — тем дешевле и часто точнее результат.
Контекстное окно — рабочий стол AI. Что на столе — видит. Что за столом — нет. Управляй тем, что кладёшь на стол.
Температура регулирует баланс между предсказуемостью и творчеством. Для кода — низкая. Для идей — высокая.
Галлюцинации — свойство самого устройства модели. Не злой умысел, не случайная ошибка. Модель настроена на правдоподобность, не на истинность. Проверяй важное.
Дообучение превратило "предсказатель текста" в "полезного ассистента". Constitutional AI — подход Anthropic, на котором строится поведение Claude.
Следующий урок
→ История AI — от Тьюринга до Claude: откуда всё это взялось и почему перелом случился именно сейчас.
Сравнение ассистентов (Claude, ChatGPT, Gemini и другие) будет в следующем модуле, в уроке Сравнение моделей.
Отметка хранится только в этом браузере и никуда не отправляется. Мой прогресс