Короткий ответ: для запуска языковой модели объемом 7–8 млрд параметров в квантованном виде обычно хватает 8 ГБ памяти, для модели на 13–14 млрд — 12–16 ГБ, для 30–34 млрд — 24–32 ГБ, а для моделей на 70 млрд параметров нужно 48 ГБ и больше. Точная цифра зависит от трех вещей: количества параметров, степени квантизации (сжатия весов) и размера контекста, который вы планируете использовать. Ниже разберем, как из этих трех факторов получить конкретное число для вашей задачи, а не ориентироваться на чужие «минимальные требования».
- Из чего складывается потребление памяти
- Базовая формула для весов модели
- Квантизация: экономия памяти и ее цена
- Контекст: вторая статья расхода, о которой забывают
- Видеопамять, оперативная память и гибридный режим
- Полностью на GPU
- Полностью на CPU
- Гибридный режим (offload)
- Готовые ориентиры под разные конфигурации
- Пошаговый порядок расчета под вашу задачу
- Типичные ошибки при оценке требований
- Как проверить до скачивания
- Что делать, если памяти не хватает
- Практический итог
Из чего складывается потребление памяти
Когда вы запускаете языковую модель локально, в память загружается не только «сама модель». Итоговое потребление складывается из нескольких частей, и понимать их состав важно, потому что каждая масштабируется по-своему.
- Веса модели — основная и самая предсказуемая часть. Это все параметры сети, записанные числами. Их объем зависит от числа параметров и разрядности представления.
- Контекст (KV-кэш) — память под промежуточные состояния обработки текста. Растет с длиной диалога и количеством обрабатываемых токенов. Чем длиннее контекст вы задаете, тем больше памяти уходит сверх весов.
- Вычислительные буферы — временные данные при обработке каждого запроса. Обычно это несколько сотен мегабайт, но при больших пакетах или длинных входах буферы заметно растут.
- Служебные данные фреймворка — сама среда исполнения (llama.cpp, Ollama, LM Studio, vLLM и другие) тоже занимает память, обычно от нескольких сотен мегабайт до пары гигабайт.
На практике веса составляют 80–95% потребления, поэтому расчет обычно начинают с них, а затем добавляют запас на контекст и служебные нужды.
Базовая формула для весов модели
Объем весов считается просто:
Память под веса (ГБ) ≈ число параметров (млрд) × байт на параметр
Байт на параметр зависит от формата хранения:
| Формат | Байт на параметр | Пример: модель 7 млрд | Пример: модель 70 млрд |
|---|---|---|---|
| FP16 / BF16 (полная точность) | 2 | 14 ГБ | 140 ГБ |
| 8-битное квантование (Q8) | ≈1 | 7 ГБ | 70 ГБ |
| 6-битное квантование (Q6) | ≈0,75 | ≈5,3 ГБ | ≈53 ГБ |
| 5-битное квантование (Q5) | ≈0,6 | ≈4,4 ГБ | ≈44 ГБ |
| 4-битное квантование (Q4) | ≈0,5 | ≈3,5–4 ГБ | ≈38–40 ГБ |
Обратите внимание: у 4-битных квантованных моделей фактический размер файла обычно немного больше, чем «параметры × 0,5 байта», потому что часть слоев (например, слои нормализации и выходной слой) хранится с более высокой точностью. Поэтому для Q4-модели на 7 млрд параметров реальный файл чаще весит 4–4,5 ГБ, а не ровно 3,5 ГБ. При расчете лучше брать размер конкретного файла модели — он всегда указан в карточке модели на репозитории или в каталоге.
Самый надежный способ: найдите нужную модель, посмотрите размер файла в гигабайтах и умножьте примерно на 1,1–1,2 — получите оценку потребления памяти под веса с учетом служебных накладных расходов.
Квантизация: экономия памяти и ее цена
Квантизация — это представление весов меньшим числом бит. Исходные модели обучаются в 16-битном формате, но для локального запуска их почти всегда сжимают до 4–8 бит. Компромисс очевиден:
- Q8 — потеря качества практически незаметна в большинстве задач. Хороший выбор, если память позволяет.
- Q6 / Q5 — качество близко к оригиналу, экономия памяти ощутимая. Часто это разумный баланс.
- Q4 — самый распространенный вариант для домашнего железа. Качество немного снижается: модель может чаще ошибаться в сложных рассуждениях, коде и на редких фактах, но для чатов, пересказа и базовых задач остается вполне рабочей.
- Q3 и ниже — заметная деградация. Имеет смысл только когда альтернатива — не запустить модель вообще, и лучше предпочесть меньшую модель в Q4, чем большую в Q3.
Важный принцип, который часто нарушают: лучше запустить модель меньшего размера в более высокой точности, чем большую модель в агрессивном квантовании. Модель на 7–8 млрд параметров в Q5 обычно отвечает качественнее, чем модель на 14 млрд в Q3, при сопоставимом потреблении памяти.
Контекст: вторая статья расхода, о которой забывают
Контекст — это объем текста, который модель «держит в голове»: системный промпт, история диалога, загруженные документы. Память под контекст (KV-кэш) растет линейно с его длиной и зависит от архитектуры модели.
Для типичной модели среднего размера ориентир такой: контекст в 8 тысяч токенов может занимать порядка 0,5–1 ГБ, контекст в 32 тысячи — несколько гигабайт. Точные цифры сильно различаются между моделями: архитектуры с группированным вниманием (GQA) расходуют заметно меньше, чем старые архитектуры с полным вниманием. У некоторых моделей есть механизмы вроде сжатого или скользящего окна внимания, которые дополнительно снижают расход.
Практический вывод: если вы планируете работать с длинными документами или большими историями диалога, закладывайте на контекст минимум 1–3 ГБ сверх весов, а при контексте 64–128 тысяч токенов — существенно больше. Многие программы позволяют ограничить длину контекста в настройках — это самый простой способ уложить модель в доступную память.
Видеопамять, оперативная память и гибридный режим
Где именно должна находиться модель — зависит от того, чем вы собираетесь ее считать.
Полностью на GPU
Самый быстрый вариант: вся модель помещается в видеопамять (VRAM) видеокарты. Скорость генерации при этом высокая — десятки токенов в секунду даже на потребительских картах. Требования те же, что в формуле выше, но применяются к объему VRAM: модель 7 млрд в Q4 поместится в 6–8 ГБ видеопамяти, модель 13–14 млрд в Q4 потребует около 10–12 ГБ.
Полностью на CPU
Если модель помещается в обычную оперативную память, ее можно запускать на процессоре. Работает это медленнее — обычно единицы токенов в секунду на бытовых системах, что для диалога еще терпимо, а для длинных ответов уже утомительно. Скорость сильно зависит от пропускной способности памяти: двухканальный режим и быстрая оперативная память дают ощутимый прирост.
Гибридный режим (offload)
Большинство инструментов позволяют разложить модель между видеокартой и оперативной памятью: часть слоев на GPU, остальное на CPU. Это позволяет запустить модель, которая не влезает в VRAM целиком. Скорость при этом падает пропорционально тому, сколько слоев осталось на процессоре: если на GPU помещается 80% слоев, скорость будет заметно ниже полной, но все же приемлемой; если 30% — работа будет медленной.
Отсюда практическое правило: смотрите не только на суммарный объем памяти, но и на то, сколько из него приходится на видеокарту. Система с 8 ГБ VRAM и 32 ГБ ОЗУ запустит модель на 14 млрд параметров, но комфортная скорость будет у модели, которая почти целиком помещается в видеопамять.
Готовые ориентиры под разные конфигурации
Сведем типичные сценарии. Цифры даны для квантованных моделей в формате GGUF (наиболее распространенный формат для локального запуска) с умеренным контекстом и включают запас на служебные нужды.
| Модель (параметры) | Q4, ориентир по памяти | Что нужно для работы целиком на GPU | Что нужно для комфортного гибрида |
|---|---|---|---|
| 3–4 млрд | 2,5–3,5 ГБ | 4 ГБ VRAM | 8 ГБ ОЗУ |
| 7–8 млрд | 4,5–5,5 ГБ | 6–8 ГБ VRAM | 16 ГБ ОЗУ |
| 13–14 млрд | 8–9 ГБ | 12 ГБ VRAM | 16 ГБ ОЗУ + любая карта |
| 30–34 млрд | 18–20 ГБ | 24 ГБ VRAM | 32 ГБ ОЗУ + карта на 8–12 ГБ |
| 70 млрд | 40–45 ГБ | 48 ГБ VRAM (или несколько карт) | 64 ГБ ОЗУ, скорость низкая |
Эти ориентиры относятся к «обычным» плотным моделям. Модели с разреженной архитектурой (Mixture of Experts) нарушают эту логику: у них общее число параметров велико, но при каждом шаге активна только часть, поэтому некоторые из них запускаются на железе, которое по «паспортному» размеру им не соответствует. Для таких моделей ориентируйтесь на фактический размер файла и рекомендации автора модели.
Пошаговый порядок расчета под вашу задачу
- Определите задачу. Чат и короткие ответы — хватит модели на 7–8 млрд. Работа с кодом и сложные рассуждения — лучше 13–34 млрд. Обработка длинных документов — смотрите также на поддерживаемую длину контекста.
- Выберите модель и конкретный файл. Посмотрите точный размер файла в гигабайтах — это база расчета.
- Умножьте размер файла на 1,1–1,2. Получите потребление под веса с накладными расходами.
- Добавьте память под контекст. Для чата — 1–2 ГБ, для длинных документов — 2–5 ГБ и больше, в зависимости от модели и длины контекста.
- Сравните результат с VRAM вашей видеокарты. Помещается — запускайте на GPU целиком. Не помещается — оцените, сколько процентов слоев влезет, и решите, устроит ли вас скорость гибридного режима.
- Проверьте оперативную память. Для гибридного и CPU-режимов суммарное потребление не должно упираться в ОЗУ: оставьте системе минимум 4–8 ГБ свободной памяти, иначе начнется выгрузка на диск и все замедлится катастрофически.
Условный пример: вы хотите модель на 14 млрд параметров, нашли Q4-версию с файлом 8,5 ГБ, планируете чат с контекстом 8 тысяч токенов. Расчет: 8,5 × 1,15 ≈ 9,8 ГБ под веса плюс ~1 ГБ на контекст и служебные нужды — итого около 11 ГБ. Карта на 12 ГБ справится целиком, карта на 8 ГБ потребует выноса части слоев в ОЗУ, для чего желательно иметь 16 ГБ оперативной памяти.
Типичные ошибки при оценке требований
- Ориентация на «параметры» вместо размера файла. Формулировка «модель на 7 млрд» ничего не говорит о потреблении памяти, пока не известна разрядность. Разница между FP16 и Q4 — четырехкратная.
- Игнорирование контекста. Модель запускается, отвечает на первое сообщение, а при длинном диалоге или загрузке документа система начинает тормозить или падать — потому что KV-кэш вырос и переполнил память.
- Занятая видеопамять. Если видеокарта одновременно используется монитором, браузером с аппаратным ускорением или игрой, свободной VRAM меньше паспортной. Проверяйте фактическую свободную память, а не номинальную.
- Одноканальная память при работе на CPU. Скорость инференса на процессоре упирается в пропускную способность ОЗУ. Две планки в двухканальном режиме дают ощутимый прирост по сравнению с одной планкой того же объема.
- Погоня за размером модели в ущерб качеству. Как уже отмечено, большая модель в глубоком квантовании часто проигрывает меньшей в умеренном.
- Забытый запас. Расчет «впритык» почти всегда заканчивается подкачкой на диск и резким падением скорости. Закладывайте 15–25% запаса.
Как проверить до скачивания
Прежде чем загружать файл на десятки гигабайт, стоит сделать три проверки.
- Посмотрите обсуждения и карточку модели. Авторы квантованных версий обычно указывают рекомендуемый объем памяти для каждой версии, а в обсуждениях пользователи с похожим железом делятся фактическими результатами.
- Проверьте свободную память на своей системе. Для VRAM — в диспетчере задач или утилите мониторинга при типичной нагрузке; для ОЗУ — сколько памяти реально свободно при запущенных программах.
- Начните с меньшей версии. Если сомневаетесь между двумя размерами, скачайте сначала меньший файл: если скорость и качество устроят — вопрос закрыт, если нет — обновитесь. Скачать лишние 20 ГБ дешевле, чем столкнуться с негодной производительностью.
Что делать, если памяти не хватает
Есть несколько направлений, и они не исключают друг друга:
- Снизить квантование на ступень — например, с Q5 до Q4. Экономит 15–20% памяти при небольшой потере качества.
- Уменьшить длину контекста в настройках программы. Часто контекст выставлен по максимуму, а реально используется 4–8 тысяч токенов.
- Взять модель меньшего размера — часто более свежая модель на 7–8 млрд обходит старую на 13 млрд и точно легче в обслуживании.
- Добавить оперативную память — самое дешевое железное улучшение для локальных моделей, особенно если вы работаете в гибридном режиме.
- Рассмотреть MoE-модели — при равном качестве они могут требовать меньше активной памяти, хотя файлы у них бывают крупными.
Практический итог
Главный принцип расчета: размер файла модели × 1,1–1,2 плюс 1–5 ГБ на контекст — и сравнение этого числа сначала с видеопамятью, потом с оперативной памятью. Если модель помещается в VRAM — вы получите комфортную скорость. Если нет — гибридный режим на запасе ОЗУ, но со сниженной производительностью.
Следующий шаг: определите основную задачу (чат, код, работа с документами), выберите 2–3 модели подходящего класса, найдите их Q4- и Q5-версии, посмотрите фактические размеры файлов и прогоните расчет по шагам выше. Для большинства домашних сценариев отправная точка — модель на 7–8 млрд параметров в Q4/Q5 и 16 ГБ оперативной памяти: это сочетание дает разумный баланс качества, скорости и требований к железу.
