Практический разбор · Claude & большие языковые модели
Как
работает ИИ
От устройства модели до повседневной работы с агентом — без магии и без занудства.
Маршрут
О чём поговорим
01Что такое ИИИз чего состоит модель, как она думает, что такое агенты
02Рефлексивное обучениеСамый недооценённый приём: спросить у ИИ про ИИ
03Решение проблем«Новой модели не видно» и где смотреть лимиты
04MCP и контекстПамять, скилы, субагенты, интерфейс IDE
05EffortУровни «усилия» модели и когда какой брать
06CompactСжатие истории: когда спасает, когда вредит
01
Что такое ИИ
Когда мы говорим «ИИ» здесь — мы про большие языковые модели. Не база данных, не поисковик. Статистическая модель, которая выучила закономерности языка и знаний и предсказывает продолжение.
01 · Суть
Машина предсказания
- Главная задача — предсказать следующий «кусочек» текста по тому, что уже есть.
- Обучена на огромных объёмах текста: книги, код, статьи, диалоги.
- Не хранит факты как ячейки в таблице — она хранит закономерности.
- Один и тот же запрос может дать разные ответы — это вероятностная машина, а не калькулятор.
◎Простая аналогия
Представь человека, который прочитал почти весь интернет и научился очень хорошо угадывать, какое слово идёт дальше. Спросишь — он не «вспоминает строчку из учебника», а на лету собирает наиболее вероятный осмысленный ответ. Отсюда и сила, и ошибки («галлюцинации»).
01.1 · Анатомия
Из чего состоит модель
⚖Веса
Миллиарды чисел-параметров. Это и есть «знания» модели, настроенные при обучении. Больше весов ≈ умнее и дороже.
⊞Архитектура
Трансформер с механизмом внимания — он решает, на какие части текста смотреть, чтобы понять смысл.
⌗Токенизатор
Режет текст на токены (части слов). Модель считает не буквы и не слова, а токены — в них же измеряется цена и контекст.
◳Контекстное окно
Сколько текста модель «видит» за раз. У свежих Claude — до 1 млн токенов. Что не влезло — модель не видит.
⟳Обучение
Сначала предобучение на сырых данных, потом дообучение и выравнивание (RLHF) — чтобы была полезной и безопасной.
✦Способности
Зрение, рассуждение, работа с инструментами — надстройки поверх базовой модели предсказания текста.
01.2 · Глубже в механику
Токены и квантование
- Токен — кусочек текста: слово, часть слова или символ. Один токен ≈ 3–4 символа: «привет» ≈ 1–2 токена, редкое длинное слово — 3–4.
- Токенизатор режет текст по словарю частых кусков (BPE): частое слово — один токен, редкое собирается из частей.
- Незнакомого слова в словаре нет — оно режется чуть ли не по буквам, 1 к 1: тот же смысл, а токенов (и денег) уходит больше.
- Модель видит номера токенов, а не буквы — поэтому «посчитай буквы в слове» для неё неожиданно трудная задача.
- В токенах меряется всё: контекст, лимиты и цена.
# как режется фраза
«Эльф-повар берёт лук» →
Эльф | - | повар | _берёт | _лук
# незнакомое слово — почти по буквам
«привеееееет» →
прив | е | е | е | е | е | е | т ← каждая «е» = токен, дороже
▽Квантование
Веса модели — миллиарды чисел, обычно по 16 бит каждое. Квантование — округление этих чисел до 8 или 4 бит.
Зачем: модель занимает в 2–4 раза меньше памяти, влезает в дешёвое железо и отвечает быстрее.
Цена: теряется точность. Лёгкое квантование почти незаметно, сильное — ощутимо «туплит» модель. Поэтому «та же самая» модель у стороннего провайдера или локально может отвечать хуже оригинала.
01.3 · Различия
Чем модели отличаются друг от друга
размерЧисло параметровБольше — умнее на сложных задачах, но медленнее и дороже.
скоростьСкорость против качестваЛёгкая модель отвечает мгновенно; тяжёлая думает дольше, но глубже.
окноКонтекстное окноСколько влезает за раз — от 200K до 1M токенов.
ценаСтоимость токеновСчитается отдельно за вход и за выход, за миллион токенов.
профильСпециализацияКто-то заточен под скорость, кто-то под рассуждения и агентную работу.
версияПоколениеНовые версии умнее при той же цене — поэтому стоит обновляться.
01.4 · Линейка Claude
Opus · Sonnet · Haiku · Fable
| Модель | Роль | Контекст | Цена вход / выход за 1M |
| Fable 5 топ | Самая мощная, для предельных задач — доступ восстановлен | 1M | $10 / $50 |
| Opus 5 рабочая лошадка | Новый флагман Opus — скачок над 4.8 при той же цене | 1M | $5 / $25 |
| Sonnet 5 баланс | Почти уровень Opus в коде за треть цены | 1M | $3 / $15 |
| Haiku 4.5 быстрый | Самый быстрый и дешёвый, для простого | 200K | $1 / $5 |
Как выбирать: простая рутина → Haiku, повседневная работа → Sonnet 5, сложный код и агенты → Opus 5, предельные задачи → Fable 5. Брать самую дорогую «на всякий случай» — пустая трата. Прошлое поколение (Opus 4.8, Sonnet 4.6) никуда не делось и осталось доступным.
01.5 · Как принимается решение
«Эльф-повар всегда берёт с собой лук, чтобы…»
«Лук» — это и овощ, и оружие. Модель не знает «правильного» ответа. Она взвешивает вероятности всех продолжений по контексту. Слово «повар» перетягивает весы к луку-овощу. Был бы «эльф-лучник» — весы качнулись бы к оружию и охоте.
лук = овощ 🧅…накормить собратьев вкусным луковым супом
88%
лук = оружие 🏹…хорошо поохотиться
12%
● Эмерджентный юмор — реальный ответ Opus 4.8 на эту же фразу
«…чтобы враг прослезился ещё до боя. 🧅🏹Ну или, если по-эльфийски жёстко: берёт лук — а какой именно (репчатый или со стрелами), решает уже по обстановке. 😏»
01.6 · Человек против ИИ
Человек — тоже вычислитель
«Человек ду‑у‑умает, а ИИ всего лишь считает» — это самоуспокоение. Убери пафос — и концептуальной разницы не остаётся.
- «Думать» = вычислять. Интуиция и озарение — это параллельное вычисление на миллиардах синапсов, а не магия.
- Решение = минимизация функции потерь. Мозг гасит стресс и дискомфорт ровно так же, как модель — ошибку предсказания.
- Мы тоже рабы контекста. Тело, психика, культура, воспитание — это захардкоженные веса и входные данные, а не «свободная воля».
- Боль и страх — не сакральное. Это классификатор-прерывание на границе среды и вычислений — аналог guardrails у модели.
| Человек | ИИ |
| Веса | нейронные связи, опыт | параметры обучения |
| Контекст | восприятие в моменте | контекстное окно |
| Цель | гомеостаз, дофамин | функция потерь / задача |
| Носитель | биохимия, ~120 м/с | кремний, скорость света |
● Мысль из живого диалога — про реакцию на блок
«ИИ работает один в один: классификатор заблокировал shell — не вопрос, пойду через python-скрипт. И человек: больно — не вопрос, решу задачу иначе.»
01.7 · Оценка и защита
Слои-классификаторы
В проде модель никогда не работает «голой». Вокруг неё — слои, которые оценивают вход и выход. Каждый решает свою задачу минимизации функции потерь.
- Функция потерь — число «насколько ошиблись». Обучение — это подкрутка весов так, чтобы это число падало.
- У базовой модели loss — ошибка предсказания следующего токена. У классификатора своя: «опасно / безопасно», «хорошо / плохо», «соответствует рубрике / нет».
- Reward-модель в RLHF — тоже классификатор: она ставила оценки ответам, пока модель дообучали быть полезной.
- Под капотом у всех — трансформер из статьи «Attention Is All You Need» (2017). Одна архитектура, разные функции потерь: и генератор, и судья, и reward-модель.
входВходной фильтрБлокирует опасный запрос до того, как его увидит модель.
выходВыходной фильтрПроверяет и режет ответ модели перед выдачей.
правилаGuardrails по правиламРегэкспы, стоп-списки, лимиты — тупо, дёшево, надёжно.
судьяМодель-судья (LLM-as-judge)Другая модель оценивает ответ: качество, безопасность, соответствие рубрике.
Живой пример: защитный фильтр Fable 5 — отдельный классификатор перед моделью: смотрит на запрос и решает, пускать его или нет.
01.8 · От чат-бота к исполнителю
Как ИИ работает с агентами
Агент = модель + инструменты + цикл. Она не просто пишет ответ — она действует: читает файлы, ищет, запускает команды, смотрит результат и решает следующий шаг.
- Инструменты (tools) — руки модели: файлы, поиск, терминал, API.
- Субагенты — делегирование подзадач с урезанным контекстом: быстрее за счёт параллельности, но почти всегда дороже.
- Результат — вместо «вот текст» получаешь «задача сделана».
# цикл агента
думает → что нужно сделать?
вызывает инструмент → читает файл
← получает результат
думает → теперь правлю код
вызывает инструмент → запускает тест
← тест зелёный
думает → готово ✦
02
Рефлексивное обучение
«Уважаемый ИИ, расскажи, что такое ИИ.» Да, так тоже можно — и это один из самых сильных приёмов в работе.
02 · Учись через сам инструмент
Спроси у ИИ про ИИ
- Не понял ответ? «Объясни проще / почему ты так решил?»
- Не знаешь, что умеет? «Что ты можешь? Какие у тебя инструменты?»
- Плохо сформулировал? «Как мне переформулировать запрос, чтобы получить лучший результат?»
- Застрял? «Предложи варианты, как это решить.»
↺Почему это работает
Модель отлично знает саму себя и хорошие практики работы с ней. Вместо того чтобы гуглить «как написать промпт» — спроси у неё прямо. Это метаобучение: ты осваиваешь инструмент через сам инструмент, и с каждым разом запросы становятся точнее.
03
Решение проблем
Две самые частые бытовые ситуации: «вышла новая модель, а я её не вижу» и «куда упёрлись мои лимиты».
03 · Бытовые ситуации
Когда что-то не так
⟲Новой модели не видно
- Обнови приложение / клиент до последней версии
- Перезапусти — иногда список моделей кэшируется
- Проверь подписку и доступ к модели
- Релиз бывает постепенным — доходит не до всех сразу
▤Где смотреть лимиты
Использование и остаток по плану:
claude.ai/settings/usage
Видно расход, лимиты плана и сколько осталось. Упёрся — дождись сброса окна или подними план.
04
MCP и контекст
Как правильно хранить контекст, чем он отличается от архива сообщений, и что такое скилы и субагенты.
04 · Память и расширения
MCP, контекст, скилы, субагенты
⇄MCP
Model Context Protocol — стандарт, которым к модели подключают внешние данные и инструменты: базы, файлы, API, твою историю. Один раз настроил сервер — и у модели появился доступ.
◳Контекст ≠ архив
Контекст — то, что модель видит прямо сейчас (как оперативка, ограничен). Архив сообщений — сохранённая история, которую можно достать обратно в контекст по запросу (как диск, безграничен).
✦Скилы
Переиспользуемые наборы инструкций и экспертизы. Модель подгружает их только когда они нужны — не надо запихивать всё в каждый запрос.
⋔Субагенты
Отдельные агенты с почти пустым общим контекстом под подзадачу. Дают скорость за счёт параллельности, но это тонкий инструмент: чаще дороже и в ущерб качеству — оправданы лишь для независимых задач.
04.1 · Интерфейс IDE
Режимы правок в PhpStorm / VSCode
normalОбычный режимКаждое изменение спрашивает подтверждение — ты контролируешь шаги.
autoАвто-применениеАгент сам применяет правки без вопросов — быстро, но довериться надо.
planPlan modeСначала составляет план, файлы не трогает. Одобряешь план — тогда исполняет.
⇧Как переключать
В Claude Code режимы переключаются клавишей Shift + Tab — она циклически прогоняет: обычный → авто → план. В IDE-плагине то же самое доступно из панели агента.
Правило: незнакомый или важный код — начинай с plan mode; рутину — можно в авто.
04.2 · Управление
Модели, команды и подключение MCP
модельСменить модельКоманда /model или настройки — выбираешь Opus / Sonnet / Haiku под задачу.
командыСлэш-команды/help /clear /compact — и сам агент умеет запускать команды в терминале.
mcpПодключить MCPДобавляешь сервер в конфиг — указываешь команду запуска или URL. После этого его инструменты доступны модели.
# сменить модель
/model opus
# полезные команды
/clear очистить контекст
/compact сжать историю
# MCP-сервер в конфиге
"mcpServers": {
"my-server": { "command": "..." }
}
05
Что такое effort
Effort — уровень «усилия» модели. Сколько она думает и сколько токенов готова на это потратить.
05.1 · Уровни усилия
От быстрого к предельному
| low |
| Быстро и дёшево. Простые задачи, минимум размышлений. |
| medium |
| Баланс качества и расхода. Средние задачи. |
| high |
| Для всего, где важен интеллект. Часто по умолчанию. |
| xhigh |
| Лучший для кода и агентов. По умолчанию в Claude Code. |
| max |
| Когда правильность важнее стоимости. Предельная глубина. |
| Ultracode |
| xhigh + workflows: оркестрация множества агентов. Самый масштабный режим. |
Выше effort → глубже размышления, но дороже и дольше. high — золотая середина; max и Ultracode — для по-настоящему тяжёлых задач.
06
Что такое compact
Compact — сжатие истории разговора, когда контекст переполняется. Модель суммирует прошлое, чтобы освободить место и продолжить.
06 · Когда сжимать
Compact: спасает или вредит
✓Нужен, когда
- Длинный разговор подходит к лимиту контекста
- Хочешь продолжить ту же задачу, не теряя нить
- Срабатывает авто — или зови вручную /compact
✕Не нужен, когда
- Разговор короткий — сжимать нечего
- Важны точные детали ранней части (сжатие их теряет)
- Сменилась тема — лучше начать новый чат через /clear
Главное помнить: после compact мелкие детали теряются — не полагайся на сжатую часть как на точный источник.
Итог
Модель — это инструмент.
А инструменты осваивают руками.
Выбирай модель под задачу, управляй контекстом и effort, не бойся спрашивать у ИИ про ИИ. Остальное приходит с практикой.
Вопросы → давайте обсудим