» » » » Главное про AI - Вадим Жартун

Главное про AI - Вадим Жартун

1 ... 97 98 99 100 101 ВПЕРЕД
Перейти на страницу:
главу 4.

prefill — приём промптинга, при котором модель получает начало ответа в своём же ответе (например, { для JSON), что заставляет её продолжить в нужном формате. См. главу 6.

prompt injection — тип атаки на LLM-системы, при которой злоумышленник через входные данные (prompt) обходит системные инструкции модели; один из ключевых рисков продакшн-систем. См. главы 6, 16.

Q4, Q8, FP16, INT8, INT4 — уровни квантования модели; меньшая цифра — большее сжатие и ниже качество. См. главу 5.

QLoRA — Quantized Low-Rank Adaptation; метод дообучения с 4-битным квантованием весов, сокращает требования к VRAM для модели 8B с 69 ГБ до 16 ГБ. См. главу 2.

RAG (Retrieval-Augmented Generation) — техника, при которой модель получает фрагменты из внешней базы знаний перед генерацией ответа; снижает галлюцинации, но не устраняет их полностью. См. главу 2.

RLHF (Reinforcement Learning from Human Feedback) — метод тонкой настройки модели на основе человеческих оценок ответов. См. главу 2.

RNN (Recurrent Neural Network) — рекуррентная нейронная сеть; архитектура-предшественник трансформера, упомянутая в главе 1 для исторической перспективы. См. главу 1.

ROI (Return on Investment) — возврат на инвестиции; ключевая метрика экономики внедрения AI. См. главу 8.

self-attention — механизм внутреннего внимания в трансформере: каждое слово «смотрит» на все остальные и решает, насколько они для него важны; дал параллелизацию на видеокартах, без которой современных LLM не существовало бы. См. главу 1.

SentencePiece — вариант BPE-токенизации, работающий без предварительной разбивки на слова; часто используется в многоязычных моделях, включая кириллические. См. главу 1.

SLAVA — бенчмарк для оценки мультимодальных моделей (текст + изображения) на русском языке; семейство моделей SLAVA от SberDevices. См. главу 4.

SLM — Small Language Model; компактная языковая модель (обычно до 10B параметров); альтернатива большим LLM для on-prem развертывания. См. главу 14.

STT — Speech-to-Text; технология распознавания речи из аудио в текст; основной API-блок для голосовых AI-агентов. См. главу 10.

Test-time compute — дополнительные вычисления, которые модель тратит уже после обучения, на этапе ответа; основа режима рассуждения (o1, Claude thinking, Qwen3-Max-Thinking). См. главу 1.

U-образная кривая внимания трансформера — эффект, при котором модель лучше помнит начало и конец длинного контекста и хуже — середину; в книге упоминается в главе 2 как причина маркера «длинный ответ — выше шанс галлюцинации в середине»; в глоссарии также есть запись «Потерянная середина (lost in the middle)» из главы 1. См. главы 1, 2.

vLLM — высокопроизводительный сервер инференса для LLM с поддержкой PagedAttention; оптимален для production-нагрузок на своих серверах. См. главу 5.

VRAM (Video Random Access Memory) — видеопамять; память графического процессора, на котором идёт обучение и инференс модели; полное дообучение модели 7B требует 100–120 ГБ VRAM и ключевое ограничение для запуска локальных моделей. См. главы 2 и 5.

WordPiece — вариант BPE-токенизации, используемый в моделях Google (BERT и др.); отличается от BPE критерием выбора пар для склейки. См. главу 1.

1 ... 97 98 99 100 101 ВПЕРЕД
Перейти на страницу:
Комментариев (0)