Практический разбор · Claude & большие языковые модели

Как
работает ИИ

От устройства модели до повседневной работы с агентом — без магии и без занудства.

6 разделов · ~25 минут → стрелка вправо, чтобы начать
Маршрут

О чём поговорим

01Что такое ИИИз чего состоит модель, как она думает, что такое агенты
02Рефлексивное обучениеСамый недооценённый приём: спросить у ИИ про ИИ
03Решение проблем«Новой модели не видно» и где смотреть лимиты
04MCP и контекстПамять, скилы, субагенты, интерфейс IDE
05EffortУровни «усилия» модели и когда какой брать
06CompactСжатие истории: когда спасает, когда вредит
01

Что такое ИИ

Когда мы говорим «ИИ» здесь — мы про большие языковые модели. Не база данных, не поисковик. Статистическая модель, которая выучила закономерности языка и знаний и предсказывает продолжение.

01 · Суть

Машина предсказания

  • Главная задача — предсказать следующий «кусочек» текста по тому, что уже есть.
  • Обучена на огромных объёмах текста: книги, код, статьи, диалоги.
  • Не хранит факты как ячейки в таблице — она хранит закономерности.
  • Один и тот же запрос может дать разные ответы — это вероятностная машина, а не калькулятор.

Простая аналогия

Представь человека, который прочитал почти весь интернет и научился очень хорошо угадывать, какое слово идёт дальше. Спросишь — он не «вспоминает строчку из учебника», а на лету собирает наиболее вероятный осмысленный ответ. Отсюда и сила, и ошибки («галлюцинации»).

01.1 · Анатомия

Из чего состоит модель

Веса

Миллиарды чисел-параметров. Это и есть «знания» модели, настроенные при обучении. Больше весов ≈ умнее и дороже.

Архитектура

Трансформер с механизмом внимания — он решает, на какие части текста смотреть, чтобы понять смысл.

Токенизатор

Режет текст на токены (части слов). Модель считает не буквы и не слова, а токены — в них же измеряется цена и контекст.

Контекстное окно

Сколько текста модель «видит» за раз. У свежих Claude — до 1 млн токенов. Что не влезло — модель не видит.

Обучение

Сначала предобучение на сырых данных, потом дообучение и выравнивание (RLHF) — чтобы была полезной и безопасной.

Способности

Зрение, рассуждение, работа с инструментами — надстройки поверх базовой модели предсказания текста.

01.2 · Глубже в механику

Токены и квантование

  • Токен — кусочек текста: слово, часть слова или символ. Один токен ≈ 3–4 символа: «привет» ≈ 1–2 токена, редкое длинное слово — 3–4.
  • Токенизатор режет текст по словарю частых кусков (BPE): частое слово — один токен, редкое собирается из частей.
  • Незнакомого слова в словаре нет — оно режется чуть ли не по буквам, 1 к 1: тот же смысл, а токенов (и денег) уходит больше.
  • Модель видит номера токенов, а не буквы — поэтому «посчитай буквы в слове» для неё неожиданно трудная задача.
  • В токенах меряется всё: контекст, лимиты и цена.
# как режется фраза «Эльф-повар берёт лук» → Эльф | - | повар | _берёт | _лук # незнакомое слово — почти по буквам «привеееееет» → прив | е | е | е | е | е | е | т ← каждая «е» = токен, дороже

Квантование

Веса модели — миллиарды чисел, обычно по 16 бит каждое. Квантование — округление этих чисел до 8 или 4 бит.

Зачем: модель занимает в 2–4 раза меньше памяти, влезает в дешёвое железо и отвечает быстрее.

Цена: теряется точность. Лёгкое квантование почти незаметно, сильное — ощутимо «туплит» модель. Поэтому «та же самая» модель у стороннего провайдера или локально может отвечать хуже оригинала.

01.3 · Различия

Чем модели отличаются друг от друга

размерЧисло параметровБольше — умнее на сложных задачах, но медленнее и дороже.
скоростьСкорость против качестваЛёгкая модель отвечает мгновенно; тяжёлая думает дольше, но глубже.
окноКонтекстное окноСколько влезает за раз — от 200K до 1M токенов.
ценаСтоимость токеновСчитается отдельно за вход и за выход, за миллион токенов.
профильСпециализацияКто-то заточен под скорость, кто-то под рассуждения и агентную работу.
версияПоколениеНовые версии умнее при той же цене — поэтому стоит обновляться.
01.4 · Линейка Claude

Opus · Sonnet · Haiku · Fable

МодельРольКонтекстЦена вход / выход за 1M
Fable 5 топСамая мощная, для предельных задач — доступ восстановлен1M$10 / $50
Opus 5 рабочая лошадкаНовый флагман Opus — скачок над 4.8 при той же цене1M$5 / $25
Sonnet 5 балансПочти уровень Opus в коде за треть цены1M$3 / $15
Haiku 4.5 быстрыйСамый быстрый и дешёвый, для простого200K$1 / $5

Как выбирать: простая рутина → Haiku, повседневная работа → Sonnet 5, сложный код и агенты → Opus 5, предельные задачи → Fable 5. Брать самую дорогую «на всякий случай» — пустая трата. Прошлое поколение (Opus 4.8, Sonnet 4.6) никуда не делось и осталось доступным.

01.5 · Как принимается решение

«Эльф-повар всегда берёт с собой лук, чтобы…»

«Лук» — это и овощ, и оружие. Модель не знает «правильного» ответа. Она взвешивает вероятности всех продолжений по контексту. Слово «повар» перетягивает весы к луку-овощу. Был бы «эльф-лучник» — весы качнулись бы к оружию и охоте.

лук = овощ 🧅…накормить собратьев вкусным луковым супом
88%
лук = оружие 🏹…хорошо поохотиться
12%
● Эмерджентный юмор — реальный ответ Opus 4.8 на эту же фразу
«…чтобы враг прослезился ещё до боя. 🧅🏹Ну или, если по-эльфийски жёстко: берёт лук — а какой именно (репчатый или со стрелами), решает уже по обстановке. 😏»
Топовая модель не выбирает один смысл — она склеивает оба: физику овоща (от лука плачут) и военный контекст, и запечатывает ребусом из двух эмодзи 🧅🏹.
01.6 · Человек против ИИ

Человек — тоже вычислитель

«Человек ду‑у‑умает, а ИИ всего лишь считает» — это самоуспокоение. Убери пафос — и концептуальной разницы не остаётся.

  • «Думать» = вычислять. Интуиция и озарение — это параллельное вычисление на миллиардах синапсов, а не магия.
  • Решение = минимизация функции потерь. Мозг гасит стресс и дискомфорт ровно так же, как модель — ошибку предсказания.
  • Мы тоже рабы контекста. Тело, психика, культура, воспитание — это захардкоженные веса и входные данные, а не «свободная воля».
  • Боль и страх — не сакральное. Это классификатор-прерывание на границе среды и вычислений — аналог guardrails у модели.
ЧеловекИИ
Весанейронные связи, опытпараметры обучения
Контекствосприятие в моментеконтекстное окно
Цельгомеостаз, дофаминфункция потерь / задача
Носительбиохимия, ~120 м/скремний, скорость света
● Мысль из живого диалога — про реакцию на блок
«ИИ работает один в один: классификатор заблокировал shell — не вопрос, пойду через python-скрипт. И человек: больно — не вопрос, решу задачу иначе.»
Упёрся в стену — не падаешь, а пересчитываешь контекст и идёшь в обход. Это и есть адаптивный интеллект — и у модели, и у нас. Разница — лишь субстрат и скорость, а не «живой / неживой».
01.7 · Оценка и защита

Слои-классификаторы

В проде модель никогда не работает «голой». Вокруг неё — слои, которые оценивают вход и выход. Каждый решает свою задачу минимизации функции потерь.

  • Функция потерь — число «насколько ошиблись». Обучение — это подкрутка весов так, чтобы это число падало.
  • У базовой модели loss — ошибка предсказания следующего токена. У классификатора своя: «опасно / безопасно», «хорошо / плохо», «соответствует рубрике / нет».
  • Reward-модель в RLHF — тоже классификатор: она ставила оценки ответам, пока модель дообучали быть полезной.
  • Под капотом у всех — трансформер из статьи «Attention Is All You Need» (2017). Одна архитектура, разные функции потерь: и генератор, и судья, и reward-модель.
входВходной фильтрБлокирует опасный запрос до того, как его увидит модель.
выходВыходной фильтрПроверяет и режет ответ модели перед выдачей.
правилаGuardrails по правиламРегэкспы, стоп-списки, лимиты — тупо, дёшево, надёжно.
судьяМодель-судья (LLM-as-judge)Другая модель оценивает ответ: качество, безопасность, соответствие рубрике.

Живой пример: защитный фильтр Fable 5 — отдельный классификатор перед моделью: смотрит на запрос и решает, пускать его или нет.

01.8 · От чат-бота к исполнителю

Как ИИ работает с агентами

Агент = модель + инструменты + цикл. Она не просто пишет ответ — она действует: читает файлы, ищет, запускает команды, смотрит результат и решает следующий шаг.

  • Инструменты (tools) — руки модели: файлы, поиск, терминал, API.
  • Субагенты — делегирование подзадач с урезанным контекстом: быстрее за счёт параллельности, но почти всегда дороже.
  • Результат — вместо «вот текст» получаешь «задача сделана».
# цикл агента думает → что нужно сделать? вызывает инструмент → читает файл ← получает результат думает → теперь правлю код вызывает инструмент → запускает тест ← тест зелёный думает → готово ✦
02

Рефлексивное обучение

«Уважаемый ИИ, расскажи, что такое ИИ.» Да, так тоже можно — и это один из самых сильных приёмов в работе.

02 · Учись через сам инструмент

Спроси у ИИ про ИИ

  • Не понял ответ? «Объясни проще / почему ты так решил?»
  • Не знаешь, что умеет? «Что ты можешь? Какие у тебя инструменты?»
  • Плохо сформулировал? «Как мне переформулировать запрос, чтобы получить лучший результат?»
  • Застрял? «Предложи варианты, как это решить.»

Почему это работает

Модель отлично знает саму себя и хорошие практики работы с ней. Вместо того чтобы гуглить «как написать промпт» — спроси у неё прямо. Это метаобучение: ты осваиваешь инструмент через сам инструмент, и с каждым разом запросы становятся точнее.

03

Решение проблем

Две самые частые бытовые ситуации: «вышла новая модель, а я её не вижу» и «куда упёрлись мои лимиты».

03 · Бытовые ситуации

Когда что-то не так

Новой модели не видно

  • Обнови приложение / клиент до последней версии
  • Перезапусти — иногда список моделей кэшируется
  • Проверь подписку и доступ к модели
  • Релиз бывает постепенным — доходит не до всех сразу

Где смотреть лимиты

Использование и остаток по плану:

claude.ai/settings/usage

Видно расход, лимиты плана и сколько осталось. Упёрся — дождись сброса окна или подними план.

04

MCP и контекст

Как правильно хранить контекст, чем он отличается от архива сообщений, и что такое скилы и субагенты.

04 · Память и расширения

MCP, контекст, скилы, субагенты

MCP

Model Context Protocol — стандарт, которым к модели подключают внешние данные и инструменты: базы, файлы, API, твою историю. Один раз настроил сервер — и у модели появился доступ.

Контекст ≠ архив

Контекст — то, что модель видит прямо сейчас (как оперативка, ограничен). Архив сообщений — сохранённая история, которую можно достать обратно в контекст по запросу (как диск, безграничен).

Скилы

Переиспользуемые наборы инструкций и экспертизы. Модель подгружает их только когда они нужны — не надо запихивать всё в каждый запрос.

Субагенты

Отдельные агенты с почти пустым общим контекстом под подзадачу. Дают скорость за счёт параллельности, но это тонкий инструмент: чаще дороже и в ущерб качеству — оправданы лишь для независимых задач.

04.1 · Интерфейс IDE

Режимы правок в PhpStorm / VSCode

normalОбычный режимКаждое изменение спрашивает подтверждение — ты контролируешь шаги.
autoАвто-применениеАгент сам применяет правки без вопросов — быстро, но довериться надо.
planPlan modeСначала составляет план, файлы не трогает. Одобряешь план — тогда исполняет.

Как переключать

В Claude Code режимы переключаются клавишей Shift + Tab — она циклически прогоняет: обычный → авто → план. В IDE-плагине то же самое доступно из панели агента.

Правило: незнакомый или важный код — начинай с plan mode; рутину — можно в авто.

04.2 · Управление

Модели, команды и подключение MCP

модельСменить модельКоманда /model или настройки — выбираешь Opus / Sonnet / Haiku под задачу.
командыСлэш-команды/help /clear /compact — и сам агент умеет запускать команды в терминале.
mcpПодключить MCPДобавляешь сервер в конфиг — указываешь команду запуска или URL. После этого его инструменты доступны модели.
# сменить модель /model opus # полезные команды /clear очистить контекст /compact сжать историю # MCP-сервер в конфиге "mcpServers": { "my-server": { "command": "..." } }
05

Что такое effort

Effort — уровень «усилия» модели. Сколько она думает и сколько токенов готова на это потратить.

05.1 · Уровни усилия

От быстрого к предельному

low
Быстро и дёшево. Простые задачи, минимум размышлений.
medium
Баланс качества и расхода. Средние задачи.
high
Для всего, где важен интеллект. Часто по умолчанию.
xhigh
Лучший для кода и агентов. По умолчанию в Claude Code.
max
Когда правильность важнее стоимости. Предельная глубина.
Ultracode
xhigh + workflows: оркестрация множества агентов. Самый масштабный режим.

Выше effort → глубже размышления, но дороже и дольше. high — золотая середина; max и Ultracode — для по-настоящему тяжёлых задач.

06

Что такое compact

Compact — сжатие истории разговора, когда контекст переполняется. Модель суммирует прошлое, чтобы освободить место и продолжить.

06 · Когда сжимать

Compact: спасает или вредит

Нужен, когда

  • Длинный разговор подходит к лимиту контекста
  • Хочешь продолжить ту же задачу, не теряя нить
  • Срабатывает авто — или зови вручную /compact

Не нужен, когда

  • Разговор короткий — сжимать нечего
  • Важны точные детали ранней части (сжатие их теряет)
  • Сменилась тема — лучше начать новый чат через /clear

Главное помнить: после compact мелкие детали теряются — не полагайся на сжатую часть как на точный источник.

Итог

Модель — это инструмент.
А инструменты осваивают руками.

Выбирай модель под задачу, управляй контекстом и effort, не бойся спрашивать у ИИ про ИИ. Остальное приходит с практикой.

Вопросы → давайте обсудим
Навигация: · пробел · колесо мыши · F полный экран
1 / 22