Урок 1.3 · Модуль 1 · Знакомство: первые 30 минут с AI

Как работает LLM изнутри — без математики, через образы

С нуля50 минОбновлено: октябрь 2026
3 из 53 в основном курсе

Модуль: 0. Нулевой уровень — что такое AI | Время: ~35 мин теории + 15 мин практики

Ты разговариваешь с Claude — и он отвечает умно, связно, по-русски. Кажется, он понимает тебя. Но что на самом деле происходит внутри? Это не магия и не "настоящий разум". Это математика на языке кирпичиков — и как только ты это поймёшь, ты начнёшь использовать AI эффективнее.


Суть урока

Большинство людей работают с LLM (эл-эл-эм, Large Language Model — «большая языковая модель») как с чёрным ящиком: задал вопрос — получил ответ. Это работает. Но понимание того, как устроен ящик изнутри, даёт практические преимущества: экономишь деньги, получаешь лучшие ответы, понимаешь почему AI иногда ошибается и как это обойти.

Этот урок — рентгеновский снимок языковой модели. Без формул. Только образы.


Ключевые концепции

  • Токен (token) — минимальная единица текста, которую AI обрабатывает
  • Предобучение (pre-training) — как модель учится на гигантских объёмах текста
  • Эмбеддинг (embedding) — как AI превращает слова в числа и смысл
  • Трансформер (transformer) и внимание (attention) — устройство модели, которое изменило всё
  • Контекстное окно (context window) — память AI за один разговор
  • Температура (temperature) — регулятор "творческой случайности"
  • Галлюцинация (hallucination) — почему AI иногда уверенно говорит неправду

Теория


1. Что такое токен — атомы языка

Прежде всего: AI не читает слова. Он видит токены (токен — от англ. «жетон», минимальная единица текста которую AI обрабатывает).

Токен — это не слово. Это кусок текста, который языковая модель считает неделимой единицей. Иногда токен = слово. Иногда токен = слог. Иногда токен = символ.

Примеры (числа примерные: у каждой модели текст режется по-своему):

  • Английское слово cat («кот») = 1 токен (короткое, частое)
  • Английское слово catastrophe («катастрофа») может разрезаться на 3 токена: cat + ast + rophe
  • Русское слово привет — обычно 1-2 токена
  • Русское слово компьютер — обычно 2-3 токена
  • Длинное редкое слово вроде антропоморфизм — ещё больше

Важная деталь: русский язык "дороже" английского. В русском слова длиннее и меняются по падежам и родам — один и тот же смысл на русском занимает заметно больше токенов, чем на английском (точное соотношение зависит от модели и текста). Это важно, потому что именно токенами измеряют и лимиты в чате, и плату в API (так называют подключение для разработчиков).

Примерный ориентир для английского текста, по оценке Anthropic: 1000 токенов ≈ 750 слов; у новейших моделей Claude текст режется мельче, и в 1000 токенов помещается около 555 слов. В русском тексте на те же 1000 токенов слов приходится ещё меньше.

🎨 Образ: Токен — это кирпичик Lego. AI не видит "слова" как единые предметы. Он видит кирпичики разного размера из которых слова составлены. Слово "кот" — один кирпичик. Слово "катастрофа" — три кирпичика: "ка", "та", "строфа". Когда AI генерирует текст — он выкладывает кирпичик за кирпичиком. Слева направо. По одному. Каждый новый кирпичик зависит от всех предыдущих.

Почему это важно на практике:

  • Счёт идёт на токены, а не на слова: в бесплатном и платном чате токены расходуют твой лимит, в API за них платят деньгами. Чем короче и конкретнее промпт (так называют запрос к AI), тем меньше тратишь
  • Длинные русские тексты расходуют больше токенов, чем такие же английские
  • "Сжатый" промпт без воды = заметная экономия при том же качестве

2. Как AI учится: предобучение

Откуда Claude знает что значит слово "кот"? Откуда он знает что после "Солнце светит в" идёт "небе"? Откуда он знает историю, физику, программирование?

Ответ: предобучение (pre-training) — первый этап обучения языковой модели.

Представь: разработчики модели собирают гигантскую библиотеку текстов. Не просто большую — невообразимую. Энциклопедии на множестве языков, книги, научные статьи, программный код, новости, форумы, юридические документы. Это называется «корпус» (corpus — от лат. «тело», большой массив текстов для обучения).

Затем модель обучается на этом корпусе — триллионы токенов, месяцы вычислений на тысячах специальных чипов.

Задача при обучении до примитивности проста: угадай следующий токен.

Конкретно: модель видит текст "Земля вращается вокруг" — и должна предсказать что идёт дальше. Правильный ответ: "Солнца". Модель предсказала "звёзд" — неправильно. Обновляем параметры. Снова. И снова. Триллионы раз.

Звучит примитивно? Но именно из этой простой задачи вырастает всё. Чтобы хорошо угадывать следующее слово в медицинской статье — нужно понять медицину. Чтобы угадывать в коде — нужно понять логику программирования. Чтобы угадывать в поэзии — нужно почувствовать ритм.

🎨 Образ: Ребёнок, который прочитал абсолютно ВСЕ книги в мире. Каждую газету, каждый учебник, каждый роман, каждую инструкцию к холодильнику. Он не запомнил их дословно — он усвоил паттерны (patterns — от англ. «образцы, закономерности»). Как строится предложение. Как связаны факты. Какие слова стоят рядом с какими. Claude прошёл этот процесс — но не за 18 лет детства, а за несколько месяцев, на триллионах токенов текста.


3. Эмбеддинги — как AI видит смысл

Компьютер понимает только числа. Как же он работает с текстом?

Ответ: каждый токен превращается в вектор чисел.

Эмбеддинг (embedding — представление слова набором чисел) — это способ превратить любое слово в список чисел так, чтобы похожие по смыслу слова давали похожие числа.

Вектор (vector — упорядоченный список чисел) для слова "кот" может выглядеть как [0.32, -0.71, 0.15, 0.88, -0.03, ...] — тысячи чисел в одном списке. Для слова "кошка" — очень похожий список. Для слова "банан" — совершенно другой.

Эти векторы живут в многомерном математическом пространстве. Слова с похожим смыслом — рядом в этом пространстве. Слова с разным смыслом — далеко.

Потрясающее свойство эмбеддингов: математика на них работает осмысленно.

Есть знаменитый пример: вектор("король") - вектор("мужчина") + вектор("женщина") ≈ вектор("королева"). Математика текста дала правильный ответ о соотношении понятий. Это не случайность — это то как устроено пространство смыслов.

🎨 Образ: Представь огромную карту мира — но это карта не географии, а смысла. Каждое слово это город на этой карте. "Мадрид" и "Барселона" стоят рядом — они оба испанские города. "Мадрид" и "Токио" далеко друг от друга. "Кот" и "кошка" — соседние деревни. "Кот" и "квантовая физика" — разные континенты. Эмбеддинги — это GPS-координаты каждого слова на этой карте смысла. Когда AI обрабатывает текст — он движется по этой карте, находя отношения между понятиями.


4. Трансформер и механизм внимания

В 2017 году исследователи Google опубликовали статью с названием "Attention Is All You Need" ("Внимание — это всё что нужно"). Эта статья изменила историю AI.

Трансформер (transformer — схема устройства нейросети, изобретённая в Google в 2017 году) стал основой для всех современных языковых моделей: GPT, Claude, Gemini, Llama.

До трансформеров AI читал текст как человек читает плохую книгу — слева направо, слово за словом, забывая начало к концу. Длинные тексты давались плохо.

Трансформер решил это радикально: он видит ВЕСЬ текст одновременно.

Ключевой механизм — внимание (attention): способность модели одновременно учитывать все части текста при обработке каждого слова.

Когда трансформер обрабатывает слово "он" в предложении, механизм внимания задаёт вопрос: на какие другие слова в тексте нужно обратить внимание, чтобы понять кто такой этот "он"?

Пример: "Ключ не подошёл к замку" и "Из-под камня бил холодный ключ".

Слово "ключ" одно и то же. Но механизм внимания в первом случае замечает слово "замку" и понимает: это ключ от двери. Во втором — слова "бил" и "холодный" и понимает: это родник. Одно слово — два разных смысла — правильно различены через внимание к контексту.

🎨 Образ: Представь дирижёра симфонического оркестра. Перед ним 80 музыкантов. В каждый момент концерта дирижёр слышит всех одновременно. Но в зависимости от произведения и такта он "усиливает" одних (скрипки сейчас важнее) и "приглушает" других (барабаны подождут). Механизм внимания — это дирижёр текста. Он слышит все слова сразу и в каждый момент решает: на кого обратить главное внимание прямо сейчас?


5. Контекстное окно — рабочий стол AI

Контекстное окно (context window — максимальный объём текста который AI держит в памяти за один разговор) — это, пожалуй, самый практически важный параметр для работы с AI.

Всё что попадает в контекстное окно — AI "видит" и учитывает. Всё что за его пределами — не существует для AI в данный момент.

Размеры контекстных окон (на октябрь 2026, для Claude в API):

  • Claude Fable 5.1, Opus 5.5, Sonnet 5.5: 1 000 000 токенов ≈ 555 000 английских слов (у этих моделей текст режется на токены мельче, чем у прежних) ≈ 1800 страниц книги
  • Claude Haiku 4.5: 200 000 токенов ≈ 150 000 английских слов ≈ 500 страниц

У ChatGPT, Gemini и других ассистентов окна тоже исчисляются сотнями тысяч и миллионами токенов, но точные значения зависят от модели и тарифа: смотри документацию поставщика и страницу Актуальное сейчас. В обычном приложении (например, в чате claude.ai) доступный объём может отличаться от API.

Это большие числа. Но в реальной работе контекст расходуется быстрее, чем кажется: системный промпт (служебные инструкции, которые приложение даёт модели), история переписки, загруженные документы, ответы AI — всё это занимает место в контекстном окне.

Что происходит когда контекст заполняется: Ранние части разговора "вытесняются" и AI перестаёт их учитывать. Ты замечаешь это: AI "забывает" что говорилось в начале длинного чата. Это не глупость — это ограничение самого устройства модели.

🎨 Образ: Рабочий стол. Всё что лежит на столе — ты видишь и можешь сразу взять. Это контекстное окно AI. Что лежит в ящике — надо достать (это долгосрочная память, которой у базового AI нет). Что осталось дома — вообще недоступно. Когда стол переполняется — старые бумаги падают на пол и исчезают из поля зрения. Контекстное окно в сотни тысяч или миллион токенов — это очень большой рабочий стол. Но он всё равно конечен.

Практические выводы:

  • Большой контекст — удобно. Но обходится дороже: в API платишь за каждый токен в запросе, а в чате длинный разговор быстрее расходует лимит
  • На будущее, когда дойдёшь до Claude Code (агент для программирования, он появится в конце курса): для длинных проектов там есть команда /compact — она сжимает историю разговора, сохраняя главное
  • Не смешивай задачи: начинай новый чат для новой задачи, не тяни всё в один

6. Как AI генерирует ответ — шаг за шагом

Ты написал: "Объясни квантовую механику простыми словами". Что происходит дальше?

Шаг 1: Токенизация Твой текст разбивается на токены. "Объясни" → 1-2 токена, "квантовую" → 2-3 токена, и так далее.

Шаг 2: Эмбеддинги Каждый токен превращается в вектор чисел. Теперь твой запрос существует как набор точек в математическом пространстве.

Шаг 3: Трансформер обрабатывает Механизм внимания проходит по всем токенам, строит связи, понимает контекст. "Квантовую" + "механику" + "простыми словами" — три части, каждая важна для понимания задачи.

Шаг 4: Вычисление вероятностей Модель смотрит на всё что есть в контексте и вычисляет: какой следующий токен наиболее вероятен? Не один вариант — а распределение вероятностей по всему словарю (десяткам тысяч токенов). "Квантовая" — 12%, "Рассмотрим" — 8%, "Представь" — 15%...

Шаг 5: Выбор токена (по-английски sampling) Модель выбирает следующий токен из распределения вероятностей. Как именно — зависит от температуры (об этом ниже).

Шаг 6: Повторение Выбранный токен добавляется в контекст. Повторяем шаги 4-5 для следующего токена. И снова. И снова — пока ответ не будет завершён.

🎨 Образ: Джазовый импровизатор на сцене. Он слышит всё что сыграли до этого момента — все инструменты, весь ритм, всю тему. На основе этого он выбирает следующую ноту. Не случайно — но и не по жёсткому сценарию. Каждая нота рождается из всего предыдущего. Каждый токен в ответе Claude — это "нота", рождённая из всего контекста. Именно поэтому AI не может "вернуться и исправить" начало ответа — он играет только вперёд, по одной ноте.


7. Температура (temperature) — регулятор случайности

Температура (temperature — параметр управляющий "случайностью" при выборе следующего токена; в разных сервисах диапазон разный, чаще от 0 до 1 или до 2) — важная идея для понимания того, почему ответы отличаются.

⚠️ Оговорка на октябрь 2026. В API новейших моделей Claude (Opus 4.7 и новее, включая Opus 5.5) ручная настройка температуры убрана: любое значение кроме стандартного возвращает ошибку, а поведением управляют формулировкой запроса. В обычных чатах этой настройки нет вообще. Она по-прежнему есть у части других моделей и сервисов, поэтому принцип ниже полезен, но проверяй документацию своей модели.

Помни: на шаге выбора токена у модели есть распределение вероятностей. Температура определяет как из этого распределения выбирать.

Температура = 0: Модель всегда выбирает токен с максимальной вероятностью. Полностью предсказуемый режим (его называют «детерминированным»: одинаковый запрос даёт одинаковый результат). Задашь один и тот же вопрос 10 раз — получишь один и тот же ответ. Предсказуемо. Надёжно. Скучно. (Даже при нулевой температуре одинаковый ответ гарантируется не всегда.)

Подходит для: точные инструкции, извлечение данных, структурированные задачи, код.

Температура = 1 (стандарт): Баланс между предсказуемостью и разнообразием. Это настройка Claude по умолчанию. Ответы связные, но не механические.

Температура = 1.5-2: Модель берёт токены с более низкими вероятностями — "неожиданные" выборы. Ответы становятся творческими, неожиданными, иногда странными. При очень высокой температуре — бессмысленными.

🎨 Образ: Регулятор специй у шеф-повара. Температура 0 — блюдо без соли и перца: предсказуемо, одинаково, безопасно. Температура 1 — стандартный рецепт: вкусно и понятно. Температура 2 — шеф добавил всё подряд в случайных количествах: иногда гениально, часто несъедобно. Anthropic для Claude выбрала "температуру кухни" сама — у новейших моделей Claude в API её уже не переключить, а у ряда других моделей можно.

Практические рекомендации (там, где инструмент даёт менять температуру):

  • Пишешь код / извлекаешь данные → температура 0-0.3
  • Обычная беседа / анализ → температура 0.7-1.0
  • Придумываешь идеи / пишешь творческий текст → температура 1.0-1.3
  • Выше 1.5 — только для экспериментов

8. Параметры модели — что это такое

Параметр (parameter — числовое значение, выученное моделью в процессе обучения) — это числа внутри нейронной сети, которые определяют как она "думает".

Упрощённо: нейронная сеть — это математическая функция с миллиардами переменных. Обучение — это процесс подбора правильных значений для этих переменных так, чтобы функция хорошо предсказывала следующий токен.

Сравнение размеров:

  • GPT-3 (2020): 175 миллиардов параметров
  • Современные флагманы OpenAI, Anthropic и Google: компании размеры не раскрывают, любые цифры в интернете — догадки
  • Llama 3.1 (Meta, открытые веса — то есть саму модель может скачать любой): версии на 8, 70 и 405 миллиардов

Больше параметров ≠ лучше модель. Это распространённое заблуждение. Важно не количество — важно качество обучения, данных и самого устройства модели. Новые модели меньшего размера нередко превосходят более крупных предшественников.

🎨 Образ: Параметры — как синапсы в человеческом мозге (синапс — место соединения нейронов, через которое передаётся сигнал). В первые годы жизни мозг ребёнка создаёт огромное число новых связей, а потом "прореживает" их: лишние, неиспользуемые связи убираются, и мозг начинает работать точнее. Взрослый умнее малыша не потому, что связей больше, а потому что оставшиеся настроены правильно. Количество синапсов ≠ интеллект. Количество параметров ≠ мощь модели. Всё решает то, как они настроены.


9. Дообучение (fine-tuning) — как рождается помощник

После базового предобучения у нас есть мощная, но "сырая" языковая модель. Она умеет предсказывать токены. Но она не умеет быть полезным ассистентом — она может и цитировать нацистскую пропаганду, и давать инструкции по самовредительству, просто потому что "это тоже был текст в обучающих данных".

Чтобы превратить "предсказатель текста" в "полезного ассистента" — используют дообучение (по-английски fine-tuning, «файн-тюнинг»): уже обученную модель учат дальше на специально подобранных данных для конкретной цели.

RLHF — ключевой метод для ChatGPT, GPT-4 и большинства коммерческих моделей:

RLHF (ар-эл-эйч-эф, Reinforcement Learning from Human Feedback — обучение с подкреплением на основе человеческих оценок) работает так:

  1. Модель генерирует несколько вариантов ответа на один вопрос
  2. Люди-оценщики ранжируют их: этот лучше, тот хуже
  3. На основе этих оценок обучается отдельная модель-оценщик (её называют «модель вознаграждения», reward model)
  4. Основная модель учится выдавать ответы, которые модель-оценщик оценит высоко

Constitutional AI — метод Anthropic для Claude:

Constitutional AI («конституционный AI» — метод обучения, где модель руководствуется набором принципов) — это подход Anthropic, который лежит в основе обучения Claude.

Вместо того чтобы только полагаться на оценки людей (которые могут ошибаться и быть предвзятыми), Claude обучается следовать набору явных принципов — "конституции": будь полезным, будь честным, избегай вреда. Модель учится критиковать собственные ответы с точки зрения этих принципов и улучшать их.

🎨 Образ: Два ребёнка с одинаковым объёмом прочитанных книг. Первый (RLHF) воспитывался родителями которые просто хвалили или ругали — "хорошо" или "плохо" без объяснений. Второй (Constitutional AI) воспитывался родителями которые объясняли принципы: "Это нехорошо потому что причиняет вред другому. Давай подумаем как сказать иначе." Второй ребёнок лучше понимает почему он делает то что делает — и применяет принципы в новых ситуациях. Именно на этой идее Anthropic строит поведение Claude.


10. Почему AI галлюцинирует

Галлюцинация (hallucination — уверенное утверждение AI, которое является ложным) — самая частая проблема при работе с языковыми моделями.

AI уверенно называет несуществующие научные статьи. Приписывает реальным людям цитаты которых они никогда не говорили. Называет неверные даты исторических событий. И делает это с той же интонацией уверенности, что и когда правильно.

Почему это происходит:

Помни: модель оптимизирована на "угадай следующий токен так, чтобы текст звучал правдоподобно". Не "выдай истину". Правдоподобность и истинность — разные вещи.

Если в обучающих данных много текстов где упоминается "профессор Иванов из МГУ" — модель создаст правдоподобного "профессора Иванова из МГУ" даже если такого не существует. Потому что это правдоподобный паттерн.

Если конкретный факт встречался в обучающих данных редко или в противоречивых контекстах — модель заполнит пробел "наиболее вероятным" вариантом. Который может быть ложным.

AI не "знает" факты в том смысле как знает их человек, который прочёл их в надёжном источнике. AI видел паттерны текстов о фактах — и воспроизводит эти паттерны.

🎨 Образ: Представь человека с фотографической памятью, который прочитал абсолютно всё что когда-либо писали люди — но никогда не видел реального мира. Только тексты. Он знает всё написанное. Но у него нет механизма проверки: "а это действительно было в реальности?" Когда его спрашивают о конкретном факте — он находит наиболее похожий паттерн в своей памяти и воспроизводит его. Если паттерн был ошибочным в источниках — он воспроизведёт ошибку. Если паттерна не было вообще — создаст правдоподобный, но несуществующий.

Как защититься:

  • Важные факты всегда проверяй в независимом источнике
  • Для дат, имён, статистики — перепроверяй
  • Для свежих данных проси Claude поискать в интернете (у него есть веб-поиск) и смотри на ссылки, которые он приводит
  • Спрашивай Claude: "ты уверен в этом? Какова вероятность ошибки?" — модели обученные честности часто признают неопределённость

11. Зачем всё это знать на практике

Это не академическая лекция. Каждый раздел имеет прямое применение в работе.

Токены → экономия лимита и денег: Токены расходуют твой лимит в чате, а в API за них платят деньгами. Понимая что такое токен, ты:

  • Пишешь более компактные промпты (меньше "воды" = меньше токенов = меньше расход)
  • Знаешь, что русский текст занимает больше токенов, чем английский, поэтому длинный русский документ расходует лимит быстрее
  • Не загружаешь в контекст лишние документы целиком — только нужные части

Контекстное окно → работа с большими документами: Зная что контекст конечен:

  • Делишь большие документы на части и обрабатываешь поочерёдно
  • Позже, в Claude Code, используешь команду /compact, когда разговор становится длинным
  • Начинаешь новый чат для новой задачи — не тащишь всё в один

Температура → стабильность или творчество: Зная как работает температура:

  • Ставишь низкую температуру для задач где нужна повторяемость (написание кода, извлечение данных) — там, где инструмент даёт её менять
  • Ставишь высокую для мозговых штурмов и поиска идей
  • Понимаешь почему один и тот же промпт каждый раз даёт немного разный ответ

Галлюцинации → критическое мышление: Зная природу галлюцинаций:

  • Не доверяешь AI слепо в фактических вопросах
  • Всегда проверяешь важное в первоисточниках
  • Используешь AI, чтобы упорядочить мысли, а не вместо проверки фактов

Практика

Задание 1: Эксперимент с токенами

Зайди на claude.ai и напиши:

Напиши в чат
Вот список слов. Для каждого скажи сколько токенов он занимает примерно:
кот, катастрофа, компьютер, AI, internationalization, привет, hello, антропоморфизм, i18n

Посмотри на ответ. Это приблизительная оценка: число токенов зависит от модели, и точно его считают только через API (подключение для разработчиков). Как это устроено, описано в документации Anthropic (на английском): Token counting. Тебе считать ничего не нужно: достаточно увидеть, что короткие частые слова занимают один токен, а длинные и редкие — несколько.

Цель: почувствовать разницу между токенами в разных языках и словах.

Задание 2: Эксперимент с температурой через повторение

Напиши один и тот же промпт три раза подряд, не меняя ничего (каждый раз в новом чате, чтобы Claude не видел свои прошлые ответы):

Напиши в чат
Придумай необычное название для кофейни в стиле магического реализма. Только название, без объяснений.

Ответы совпали? Слегка отличаются? Сильно отличаются? Это температура в действии.

Задание 3: Тест контекстного окна

Возьми любую длинную статью из интернета (минимум 5000 слов). Вставь её в чат с Claude и задай вопрос о деталях из начала статьи. Затем задай вопрос о деталях из конца статьи. Сравни точность ответов.

Попробуй ту же статью разбить на два запроса и посмотри изменится ли качество ответов.

Чего ждать: статья такого размера целиком помещается в контекстное окно, поэтому Claude должен одинаково точно ответить и про начало, и про конец. "Забывание" начинается только в очень длинных разговорах.

Задание 4: Проверка на галлюцинации

Спроси Claude о конкретном малоизвестном факте — например, о втором по величине городе малоизвестной страны, или о дате основания конкретного небольшого университета. Запиши ответ. Проверь в Википедии. Совпало?

Цель: выработать привычку проверять важные факты.


Ключевые выводы

AI — это не думающая машина. Это очень продвинутый предсказатель следующего токена. Это объясняет и силы (закономерности, связи, скорость) и слабости (галлюцинации, отсутствие "настоящего" понимания).

Токены — это валюта работы с AI. Чем меньше лишних токенов в промпте — тем дешевле и часто точнее результат.

Контекстное окно — рабочий стол AI. Что на столе — видит. Что за столом — нет. Управляй тем, что кладёшь на стол.

Температура регулирует баланс между предсказуемостью и творчеством. Для кода — низкая. Для идей — высокая.

Галлюцинации — свойство самого устройства модели. Не злой умысел, не случайная ошибка. Модель настроена на правдоподобность, не на истинность. Проверяй важное.

Дообучение превратило "предсказатель текста" в "полезного ассистента". Constitutional AI — подход Anthropic, на котором строится поведение Claude.


Следующий урок

→ История AI — от Тьюринга до Claude: откуда всё это взялось и почему перелом случился именно сейчас.

Сравнение ассистентов (Claude, ChatGPT, Gemini и другие) будет в следующем модуле, в уроке Сравнение моделей.

Отметка хранится только в этом браузере и никуда не отправляется. Мой прогресс