» » » » Главное про AI - Вадим Жартун

Главное про AI - Вадим Жартун

1 ... 17 18 19 20 21 ... 101 ВПЕРЕД
Перейти на страницу:
перевода — отдельный навык, и все перечисленные бенчмарки англоцентричны и text-only.

6: Разобрать входящий PDF и вытащить сущности — MMLU как прокси на понимание текста и свой оценочный набор, потому что нужна комбинация OCR (распознавания текста с картинки) и рассуждения, и ни один из четырёх не покрывает это напрямую.

Эти шесть пунктов показывают суть: для большинства офисных задач ни один публичный бенчмарк не даёт прямого ответа. Свой набор закрывает разрыв. Только он.

ДОВЕРИЕ К БЕНЧМАРКУ: УСЛОВИЯ И ОГОВОРКИ

Бенчмарк предсказывает ваш результат, если одновременно выполнены четыре условия:

1: Задачи в бенчмарке похожи на ваш случай по структуре — формат, длина контекста, тип ответа — и метрика считает то, что вам важно. Не «доля правильных ответов в тестах с выбором ответа» (MCQ, multiple choice question), а «процент задач, где результат пригоден для отправки клиенту».

2: Тестовый набор чист от контаминации.

3: Бенчмарк ещё не насыщен (разница между лидерами статистически значима, а не «91% против 92%») и регулярно обновляется. Иначе модели учат его наизусть.

4: Метрика измеряет то, что связано с вашей задачей, а не постороннюю способность.

Хотя бы одно условие не выполнено — бенчмарк показывает красивую цифру без всякого отношения к вашему офису.

Четыре признака «мёртвого» бенчмарка.

1: Топ-5 моделей выдают результаты в диапазоне 1–2 процентных пункта — разница не различима за пределами шума.

2: Бенчмарк не обновлялся 2+ года — за это время его вопросы попали в обучающие данные всех крупных моделей.

3: Метрика измеряет то, что не связано с реальной задачей (например, тест с выбором ответа по праву для ассистента, который должен переписываться с клиентом).

4: Публичные результаты расходятся с числами, которые вендор заявляет сам, на 5+ пунктов в одну или другую сторону.

Если вы видите хотя бы два признака из четырёх, бенчмарку доверять нельзя. Ориентиром становится свой оценочный набор.

Что показывает Chatbot Arena, а что — нет. Chatbot Arena (от LMSYS, Lab for Machine Learning and Systems at UC Berkeley — лаборатория Беркли) — самый цитируемый лидерборд по «человеческому рейтингу», где пользователи в слепом сравнении голосуют за ответ А или Б, а рейтинг считается через систему Эло по сумме миллионов диалогов.

Показывает Arena общую «человеческую» привлекательность ответа — тон, структуру, полноту. Не показывает точность в задачах с единственным правильным ответом (арифметика, код, юридические ссылки), устойчивость к граничным случаям (edge case, нестандартным входным данным, на которых модели часто ломаются), устойчивость к попыткам взлома через запрос (jailbreak) и стабильность на длинном контексте.

В 2025 году опубликована работа, показывающая, что рейтинг можно сместить целенаправленным голосованием. Это последний аргумент в пользу собственного оценочного набора: чужие цифры можно исказить, свои — сложнее.

Классы задач, которые не покрывает ни один популярный бенчмарк.

1: Работа с таблицами и числами из вашей корпоративной базы (нужен RAG — поиск ответов модели по вашей базе документов — и свой оценочный набор).

2: Генерация длинных связных документов на 10+ страниц (бенчмарки смотрят на короткие ответы).

3: Следование вашему внутреннему тону голоса бренда и шаблонам (бенчмарки не знают ваш стиль).

4: Соблюдение ваших нормативных ограничений — юридических, отраслевых, внутренних.

5: Многошаговые agent-сценарии, где модель должна планировать, вызывать инструменты и откатываться.

Прежде чем доверять бенчмарку, проверьте семь вещей.

1: Дата сбора датасета и дата обучения модели — пересекаются ли (если да, контаминация почти гарантирована).

2: Тип оценки: multiple choice, генерация, человеческий Эло, LLM-as-a-Judge — разные шкалы нельзя сравнивать напрямую.

3: Размер выборки: 164 задачи (HumanEval) — это статистически хрупко, 8 500 (GSM8K) — плотнее.

4: Метод подсчёта: pass@1, pass@k, accuracy, F1, Brier — не путать.

5: Self-reported против независимого замера: разница в 5+ пунктов — красный флаг.

6: Способ подачи запроса: ввод без примеров, с примерами в самом запросе, с просьбой рассуждать по шагам, с системным запросом или без — меняет результат радикально.

7: Стоимость прогона: на дорогих моделях один прогон может стоить сотни долларов.

Модель, которая отлично сдала MMLU, HumanEval и GSM8K, доказала только одно: она умеет решать задачи этого типа «в вакууме» — короткие, с чётким форматом и эталонным ответом. Это ничего не говорит о том, как она поведёт себя в реальном офисе — с грязными данными, неполным контекстом, прерванным разговором, нечёткой постановкой задачи. Если нанять по результатам единого госэкзамена, можно получить отличника, который не умеет вести переговоры. Высокий балл на бенчмарке — пропуск в следующий тур отбора. Не гарантия работы.

Насыщенный бенчмарк — линейка с делением только до 90 сантиметров. Когда 99% моделей набирают больше 90% на GSM8K, разница между «отличной» и «средней» моделью становится невидимой, как рост человека выше 190 см на линейке, где последнее деление — 90. Линейка не врёт, но она больше не различает. MMLU, HumanEval и GSM8K к 2026 году превратились в инструмент «отсева слабых моделей», а не ранжирования сильных. Для сравнения топ-моделей нужны более длинные линейки — SWE-bench Verified, GPQA Diamond, Humanity’s Last Exam.

СЛЕПЫЕ ЗОНЫ БЕНЧМАРКОВ И ЦЕННОСТЬ СОБСТВЕННЫХ МЕТРИК

Бенчмарки измеряют то, что легко автоматизировать: наличие правильного ответа, скорость работы, объём памяти. Не измеряют то, что в офисной работе критично: тон, стиль, уместность, этические границы, устойчивость к необычному запросу.

Эмили Бендер (Emily M. Bender) с соавторами в работе 2021 года «On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?» поставила вопрос жёстко: риски LLM смягчаются, если заранее заложить бюджет на курирование и документацию и не создавать датасеты больше, чем можно качественно поддерживать. Бенчмарки измеряют, насколько хорошо модель имитирует «правильные ответы» в выборке, на которой она обучалась. Это не то же самое, что понимание. Stochastic parrots — термин из этой работы, ставший символом критического взгляда на метрики LLM.

Четыре области, которые остаются за пределами стандартных метрик.

1: Креативность. Способность сгенерировать неожиданный, но релевантный ответ не измеряется ни одним публичным бенчмарком. Модель может набрать 95% на MMLU и выдавать пресные тексты — при обучении её оптимизировали на правдоподобие, а не на оригинальность.

2: Этика. Стремление отказаться от этически сомнительного (по мнению создателей модели) запроса — неизмеримая метрика. Универсального теста на «хорошее поведение» нет. Есть только наборы сценариев, которые вендор сам выбирает.

3: Актуальность знаний. Бенчмарк фиксирует знания на момент сбора датасета. Если модель обучена на данных до 2023 года, она не ответит на вопрос

1 ... 17 18 19 20 21 ... 101 ВПЕРЕД
Перейти на страницу:
Комментариев (0)