» » » » Главное про AI - Вадим Жартун

Главное про AI - Вадим Жартун

1 ... 3 4 5 6 7 ... 101 ВПЕРЕД
Перейти на страницу:
трёх факторов, каждый из которых сам по себе недостаточен. Убери любой из трёх — и большие языковые модели либо не появляются, либо приходят на десять лет позже. Это и есть ответ на вопрос «почему именно сейчас»: впервые в истории у одного поколения инженеров оказались все три инструмента в одной связке.

Эти три фактора подтверждаются тремя вехами:

Данные. В 2009 году Фей-Фей Ли (Fei-Fei Li) из Стэнфорда с командой разметили четырнадцать миллионов изображений через Amazon Mechanical Turk — этот датасет, ImageNet, стал первым датасетом такого масштаба. Через десять лет тот же рецепт перенесли на текст: Common Crawl (некоммерческий проект, который с 2008 года архивирует веб-страницы) выкачивает весь интернет, GPT-3 берёт оттуда восемьдесят два процента своих токенов.

Железо. В 2012 году аспирант Алекс Крыжевский (Alex Krizhevsky) из Торонто обучил нейросеть AlexNet на двух игровых видеокартах NVIDIA GTX 580, написанных на CUDA (язык, который NVIDIA выпустила в 2007 году, чтобы видеокарты перестали быть «только для игр»), и AlexNet выиграл конкурс ImageNet с отрывом в десять с лишним процентных пунктов. Стало ясно: видеокарты — не побочный продукт игровой индустрии, а отдельный инженерный слой.

Алгоритм. Трансформер 2017 года дал параллелизацию, и за пять лет размер моделей вырос на три порядка.

В январе 2020 года OpenAI публикует статью о масштабировании моделей (Kaplan и соавторы, «Scaling Laws for Neural Language Models» — «Законы масштабирования для нейросетевых языковых моделей»), которая задала стратегию обучения на годы вперёд. Тезис простой: чем больше модель и чем больше данных, тем предсказуемо лучше она работает, причём зависимость степенная. В марте 2022 года DeepMind показывает, что OpenAI ошибся в одном: их рецепт недооценивал данные. Модели, обученные «маленькими, но долго», били модели, обученные «большими, но быстро». Так появилось эмпирическое правило из работы DeepMind под названием Chinchilla (это именно правило обучения, а не модель — название отсылает к шиншилле из детской повести): на каждый параметр модели нужно примерно двадцать токенов данных. То, что раньше делали интуитивно, стало инженерной дисциплиной.

Хинтон не изобрёл нейросети в 2010-х — он работает с ними с 1980-х, и большая часть его карьеры пришлась на период, когда эту область называли безнадёжной. Авторы «Attention Is All You Need» — восемь человек из Google Brain, а не один гений с армией ассистентов. LLaMA — десятки инженеров Meta и результат трёх лет подготовительной работы. Современная большая модель — это индустриальный продукт, где без инфраструктуры не будет прорыва. «История AI как история одиноких гениев» — пиар-история, которая хорошо продаётся, но плохо отражает реальность.

Миф «модель знает всё, потому что обучена на всём интернете» — неверен. Она обучена на срезе с пропусками и с датой отсечки. У неё нет представления о «сейчас», есть только статистика по корпусу, который заканчивается в определённый месяц, — отсюда уверенно поданный старый прецедент как свежий. То, что вы используете, делала команда из сотни человек с бюджетом в десятки миллионов долларов, а не один талантливый исследователь.

Какие сегодняшние «фундаментальные» ограничения AI через два-три года перестанут существовать и что, наоборот, подорожает? Узкое место в индустрии сдвигалось три раза, и каждое десятилетие приносило свой ответ:

2017 — алгоритм. Трансформер дал параллелизацию.

2020 — данные и формула. Chinchilla превратила «побольше данных» в инженерный план.

2024–2025 — применение модели и качество данных. Узкое место сместилось снова.

Сейчас это не «как обучить» (железо есть) и не «на чём обучать» (текстов на английском хватает), а «как обработать миллион токенов контекста без квадратичного взрыва» и «как заставить модель думать дольше, не делая её работу слишком медленной». Индустрия отвечает тремя путями.

Разреженное внимание. Модель смотрит не на все токены, а на отобранные. Так работают DeepSeek и Gemini Flash.

Смесь экспертов (MoE — Mixture of Experts). Модель состоит из нескольких специализированных подмоделей, и для каждого токена выбирается свой эксперт.

Дополнительные вычисления на этапе ответа в режиме рассуждения. Так работают o1, Claude thinking и Qwen3-Max-Thinking.

Из этого следует: через два-три года текущие «фундаментальные» ограничения — длина надёжного контекста, качество рассуждений и цена топовых моделей — тоже перестанут быть узким местом. Это не «AI станет умнее», а «инженеры найдут способ тратить вычисления умнее». А подорожает то, что и всегда: электричество, видеокарты, инженерные кадры и качественные данные на русском.

ПАРАМЕТРЫ И МАСШТАБ: КОГДА РАЗМЕР ВАЖЕН, А КОГДА НЕТ

Когда в команде говорят «давайте возьмём модель побольше, чтобы точно работало», полезно иметь в голове список из трёх строк:

1: 7 млрд параметров — «карманный помощник». Поправит письмо, сделает выжимку из протокола, переведёт короткий кусок, вытащит из длинного документа нужный пункт.

2: 70 млрд — «серьёзный собеседник». Пишет код с пониманием структуры, разбирает юридические документы на десятой странице без потери нити, выдерживает сложную многошаговую инструкцию.

3: 405 млрд — «старший эксперт, которого вызывают по особому поводу». Глубокий анализ, синтез противоречивых источников, длинные рассуждения с цепочкой выводов.

По моей оценке, около восьмидесяти процентов офисных задач закрывает 7-миллиардная модель, ещё пятнадцать — 70-миллиардная, и только оставшиеся пять действительно требуют 405-миллиардной. «Самая большая» для большинства команд не нужна.

Meta, выпуская Llama 3.1 в трёх размерах, фактически предлагает один и тот же рецепт, испечённый в трёх противнях: один для ноутбука, один для серверной стойки, один для дата-центра. Цифра параметров отвечает на вопрос «сколько железа нужно», а не «насколько модель умна». По данным Meta, 405B обучена на более чем пятнадцати триллионах токенов на кластере из шестнадцати тысяч H100 — Meta подчёркивает, что 405B — первая модель Llama, обученная в таком масштабе. За числом стоит бюджет, а бюджет — не магия, а деньги, электричество и инженерные решения.

Microsoft в релизе Phi-4 (декабрь 2024) поставила курс на «больше — не всегда лучше»: модель с четырнадцатью миллиардами параметров позиционируется как рассуждающая, конкурирующая с куда большими моделями. В декабре 2025 Microsoft подвела итог: Phi-4-reasoning «соперничает с куда большими моделями на сложных задачах на рассуждение». В той же точке сходятся независимые исследования: стэнфордская работа о «мираже» эмерджентности (иллюзии резких скачков в способностях модели при увеличении размера; авторы — Schaeffer, Miranda, Koyejo) показала, что «резкие скачки» в способностях больших моделей могут быть артефактом того, как их измеряют. При смене метрики или при увеличении числа примеров скачки исчезают, и зависимость становится гладкой. «Больше параметров» — в первую очередь маркетинговый аргумент. Для большинства бизнес-задач хватает

1 ... 3 4 5 6 7 ... 101 ВПЕРЕД
Перейти на страницу:
Комментариев (0)