Вадим Жартун
Главное про AI
Посвящается моей любимой жене, моей Надежде.
- - -
Предисловие
Это не научный труд, не художественное произведение и не одна идея, растянутая на сотню страниц. Я написал эту книгу для тех, кто уже попробовал работать с AI и теперь хочет понять, что это такое и что делать дальше, чтобы эффективно использовать AI в бизнесе: для собственников, менеджеров, юристов, дизайнеров, финансистов, инженеров — не специалистов в IT или машинном обучении. Для тех, кто видит для себя в AI перспективу или угрозу.
Внедрение AI в компании, подразделении или на своём рабочем месте поднимает массу практических вопросов: можно ли ожидать от AI полезных результатов в конкретной области, какие инструменты и модели лучше выбрать, какой экономический эффект это даст, как внедрять AI-решения, какие подводные камни вас ожидают на этом пути, чего стоит ожидать от AI в ближайшем будущем, и так далее. Каждая из 17 глав книги — содержательный ответ на наиболее острые из этих вопросов.
Не стану врать, что тема AI проста и всё можно объяснить за пять минут на пальцах. Это не так, поэтому книга получилась довольно объёмной. Чек-листы, списки и таблицы помогут вам быстро сориентироваться в теме и принять взвешенные решения, основываясь не на радужных обещаниях маркетологов, страшилках вечных скептиков или эмоциональных высказываниях популярных блогеров, а на фактах.
В конце каждой главы есть короткое резюме с ключевыми мыслями, чтобы можно было быстро погрузиться в контекст в случае необходимости, а специфические термины и аббревиатуры, которые вы не обязаны знать, я постарался расшифровать не только в глоссарии, но и прямо в тексте.
Разумеется, эта книга про AI была написана с помощью AI. В основу её текстов легли материалы моих семинаров на стыке искусственного интеллекта и менеджмента, а также публикации в открытых источниках. На AI легла работа по переводу текстов, верификации данных, корректуре и множеству других технических задач. Для такой динамично развивающейся области знаний это просто необходимо, иначе книга рискует устареть ещё до момента публикации. Такова реальность, и мы не можем её игнорировать.
Спасибо, что открыли эту книгу. Давайте начнём.
Глава 1. Как устроены LLM
Летом 2017 года восемь инженеров Google Brain в Маунтин-Вью спорили, можно ли отказаться от рекуррентности в архитектуре нейросети и оставить только механизм внимания — научить машину смотреть на предложение целиком, а не читать слово за словом. Для тех, кто привык к рекуррентным сетям, затея звучала ересью. Базовую модель они обучили за двенадцать часов, большую — за три с половиной дня, тоже на восьми видеокартах; результаты англо-французского теста пришли за пять минут до дедлайна. Двенадцатого июня 2017 года на arXiv появилась статья «Attention Is All You Need» («Внимание — это всё, что вам нужно»), и через восемь лет у неё было больше ста семидесяти тысяч цитирований — это входит в топ-10 самых цитируемых научных работ двадцать первого века. Эта дата — точка отсчёта для всей современной индустрии AI (Artificial Intelligence, искусственный интеллект).
Я начинаю с этой истории, потому что она отвечает на вопрос, с которым вы пришли в книгу: «что я использую каждый день, когда ввожу запрос в чат?». Короткий ответ: статистическую машину, обученную на терабайтах текста предсказывать следующее слово по предыдущим. Длинный ответ — почему эта машина вообще смогла появиться. Три вещи сошлись в одной точке: большие корпуса текстов, видеокарты, способные их перемалывать, и архитектура, которая хорошо подходит для этих видеокарт. Дальше сработала обычная инженерная логика: что работает, то повторяем в большем масштабе.
АНАТОМИЯ ТРАНСФОРМЕРА: АРХИТЕКТУРА, ИЗМЕНИВШАЯ ВСЁ
Когда вы слышите в новостях «новая модель от вендора X», важно знать: в основе большинства моделей, с которыми вы работаете, лежит одна и та же архитектура — трансформер. Это архитектура нейросети, появившаяся в 2017 году (историю её создания я рассказал в начале главы). Трансформер лежит в основе современных LLM (Large Language Models, большие языковые модели) — и именно о них эта глава. Слова «трансформер» и «LLM» — не синонимы: LLM — это конкретная обученная модель, а трансформер — архитектура, по которой её собрали. Одну и ту же архитектуру можно обучить на разных данных и получить разные модели, поэтому на самом деле по этому чертежу собраны и Qwen, и DeepSeek, и GigaChat, и YandexGPT.
ТРАНСФОРМЕР БЕЗ ФОРМУЛ: СУТЬ НА ПАЛЬЦАХ
Никакой мистики. Трансформер смотрит на всё предложение целиком и для каждого слова решает, с какими другими словами его связать. До него текстовые нейросети — рекуррентные сети (RNN, recurrent neural networks) — читали предложения слово за словом, как вы читаете эту строку: чтобы понять десятое слово, нужно было сначала «переварить» девятое, а до него — восьмое, и так до первого. RNN по природе последовательны, и на видеокарте с тысячами ядер реально работало меньше десяти процентов — остальные ждали, пока одна цепочка токенов ползёт от первого к последнему. Трансформер убрал цепочку: каждое слово за один проход связывается со всеми остальными, и эту операцию можно делать параллельно на тысячах ядер. Та же загрузка видеокарты, что раньше не превышала десяти процентов, выросла до девяноста, и с 2017 года размер моделей стал расти на порядки — инженерная логика «что работает, то повторяем в большем масштабе» перестала упираться в железо. Суть трансформера простая: нейросеть, которая хорошо параллелизуется. Не «более умная» — лучше приспособленная к железу.
МЕХАНИЗМ SELF‑ATTENTION
Почему трансформер «победил» RNN, что именно изменила архитектура внутреннего внимания (self-attention) и какие ограничения железа она сняла? Именно этот механизм реализует возможность каждому слову смотреть на все остальные в предложении. Работает он в три шага.
Сначала для каждого слова модель строит три вектора — запрос (Query), ключ (Key) и значение (Value). Это не три разных вычисления, а три проекции одного и того же слова — три угла зрения на одну сущность.
Затем она сравнивает запрос слова с ключами остальных и получает набор «весов внимания» — численную оценку того, насколько каждое слово важно для текущего. Веса нормализуются так, чтобы в сумме давать единицу, и по ним берётся взвешенная сумма значений остальных слов.
На выходе — новое представление слова, «обогащённое» контекстом.
Простой