Сервер для ИИ: сколько VRAM нужно моделям 7B, 13B и 70B

Сервер для ИИ: требования к железу и сколько нужно VRAM

Марина
Марина
📅 6 сентября 2026 ⏱ 16 мин чтения 👁 16 просмотров
Сервер для ИИ: требования к железу и сколько нужно VRAM

Сервер для ИИ — это не одна конфигурация, а две разные машины под две разные задачи. Если вы просто запускаете готовую модель и задаёте ей вопросы, вам хватит машины с видеокартой на 8–24 ГБ видеопамяти, а иногда и обычного процессорного сервера за 200–600 ₽ в месяц. Если вы собираетесь обучать или дообучать модель, требования вырастают в 4–10 раз, и это уже совсем другой бюджет. Подобрать конкретный тариф можно в разделе серверов для ИИ, но сначала стоит понять, какие цифры вообще нужно искать в характеристиках.

Этот материал — для тех, кто впервые арендует машину под нейросеть: разработчика небольшого сервиса, владельца бизнеса, который хочет держать модель у себя, или студента, который экспериментирует с локальными LLM. Разберём, чем видеопамять отличается от оперативной, сколько гигабайт требуют модели на 7, 13 и 70 миллиардов параметров, когда GPU не нужен вовсе и во что реально обходится вход по ценам каталога на сентябрь 2026 года.

Что скрывается за формулировкой «сервер для ИИ»

В прайсах хостеров словосочетание «сервер для ИИ» означает три совершенно разные вещи. Первая — обычный виртуальный сервер без видеокарты, на котором крутится ваш код: бот, API-обёртка, обработка очередей, вызовы чужих моделей по сети. Такая машина стоит столько же, сколько любой VPS, и никакого специального железа не требует.

Вторая — сервер с выделенной видеокартой (GPU), на котором модель работает локально. Здесь платят именно за карту, и цена определяется её объёмом видеопамяти. Третья — арендованный на часы кластер под обучение.

Большинство новичков приходят за вторым вариантом, а по факту им нужен первый. Если вы дёргаете модель по API у внешнего сервиса, вычисления происходят не у вас, и мощная карта в аренде — выброшенные деньги. Проверить это просто: посмотрите, есть ли в вашем коде загрузка весов модели в память. Если весов нет, а есть только HTTP-запросы, берите обычный недорогой VPS — стартовые тарифы с 1 ГБ памяти начинаются от 59 ₽ в месяц.

VRAM и оперативная память — почему это не одно и то же

Это главная путаница у тех, кто выбирает сервер впервые. В характеристиках тарифа вы видите строку «Память — 2 ГБ» или «Память — 16 ГБ», и логично предполагаете, что именно туда загрузится нейросеть. Но это оперативная память (RAM) — она подключена к центральному процессору и обслуживает операционную систему, ваш код и обычные приложения.

Видеокарта же имеет собственную память, распаянную прямо на плате, — видеопамять (VRAM). Она физически отдельная и в разы быстрее: пропускная способность у современных серверных карт измеряется сотнями гигабайт в секунду против десятков у обычной DDR. Именно скорость доступа к памяти определяет, насколько быстро модель выдаёт текст.

Когда пишут «модели 13B нужно 10 ГБ», речь всегда о видеопамяти, а не об оперативной. Расширить VRAM нельзя: сколько распаяно на карте, столько и есть. Докупить оперативную память до 64 ГБ у большинства хостеров можно за пару кликов, а превратить карту на 16 ГБ в карту на 24 ГБ — нет, только сменить тариф.

Отсюда простое правило: если модель не помещается в видеопамять целиком, она либо не запустится, либо начнёт «выгружать» часть слоёв в обычную RAM. Второй вариант работает, но скорость падает в 5–20 раз — примерно так же, как сайт на диске вместо кеша.

Разница между видеопамятью и оперативной памятью
Модель загружается именно в VRAM видеокарты

Сколько видеопамяти требуют модели 7B, 13B и 70B

Размер модели измеряют в миллиардах параметров: 7B — семь миллиардов, 70B — семьдесят. Каждый параметр занимает в памяти определённое количество байт, и это количество зависит от точности хранения — квантизации. При 16 битах на параметр уходит 2 байта, при 8 битах — 1 байт, при 4 битах — половина байта.

Квантизация в 4 бита — сегодня рабочий стандарт для запуска моделей на скромном железе. Качество ответов проседает незначительно, а требования к памяти падают вчетверо по сравнению с исходным форматом. Ориентиры для 4-битной квантизации: 7B — примерно 6 ГБ, 13B — около 10 ГБ, 70B — порядка 40 ГБ видеопамяти.

Модель 4 бита 8 бит 16 бит Какая карта нужна
7B ≈ 6 ГБ ≈ 8 ГБ ≈ 14 ГБ от 8 ГБ VRAM
13B ≈ 10 ГБ ≈ 14 ГБ ≈ 26 ГБ от 12 ГБ VRAM
34B ≈ 20 ГБ ≈ 36 ГБ ≈ 68 ГБ от 24 ГБ VRAM
70B ≈ 40 ГБ ≈ 72 ГБ ≈ 140 ГБ от 48 ГБ VRAM

К цифрам из таблицы добавьте 15–20% запаса на служебные структуры и на кеш контекста: чем длиннее диалог, тем больше памяти уходит под него. Модель 13B в 4 битах формально требует 10 ГБ, но на карте ровно с 10 ГБ она упрётся в потолок при длинном промпте. Берите с запасом хотя бы в 2 ГБ.

Требования моделей к видеопамяти
Сколько VRAM нужно моделям 7B, 13B и 70B

Сценарий первый: инференс, то есть запуск готовой модели

Инференс — это работа обученной модели: вы подаёте текст, она отвечает. Никакого пересчёта весов не происходит, поэтому нагрузка сводится к чтению модели из памяти и умножению матриц. Это самый частый и самый дешёвый сценарий.

Для инференса решающий параметр один — объём видеопамяти. Скорость карты влияет на то, сколько токенов в секунду вы получите, но если модель не влезла в память, никакая скорость не поможет. На картах уровня 16 ГБ комфортно живут модели до 13B, на 24 ГБ — до 34B в 4-битной квантизации.

Второй по важности параметр — сколько одновременных запросов вы обслуживаете: каждой сессии нужен свой контекст в памяти. Для личных экспериментов достаточно одной карты, для сервиса на 20–50 параллельных сессий потребуется карта с бо́льшим объёмом либо очередь запросов.

Готовые конфигурации под этот сценарий собраны в разделе VPS с видеокартой. Если вы уже определились с конкретной моделью, посмотрите подборку серверов под аренду для LLM — там разложено по объёмам памяти.

Когда для нейросети хватает обычного процессорного сервера

GPU нужен не всегда. Модели до 7B в 4-битной квантизации реально работают на центральном процессоре, если в системе есть минимум 16 ГБ оперативной памяти. Библиотеки вроде llama.cpp умеют считать на CPU и на серверах, и на ноутбуках.

Расплата — скорость. Там, где карта выдаёт 30–60 токенов в секунду, процессор на 4–8 ядрах даст 3–8 токенов. Ответ в 300 слов будет собираться минуту вместо пяти секунд. Для чат-бота с живым пользователем это неприемлемо, а для ночной фоновой обработки документов — вполне.

Процессорный вариант оправдан в четырёх случаях: пакетная обработка без спешки, редкие обращения (несколько запросов в час), небольшие модели-классификаторы на 1–3B и эмбеддинги для поиска. В последнем случае модели крошечные, и разница между CPU и GPU почти незаметна.

Что брать: 8–16 ГБ RAM, 4–8 виртуальных ядер и диск NVMe — веса модели на 7B занимают на диске 4–5 ГБ, и грузить их с медленного HDD мучительно. Подойдут тарифы для серверов под Python, поскольку почти вся экосистема ИИ на нём и написана.

Сценарий второй: обучение и дообучение

Обучение отличается от инференса принципиально. При запуске модели в памяти лежат только веса. При обучении туда же добавляются градиенты, состояния оптимизатора и промежуточные активации — всё это по объёму сопоставимо с самими весами или превышает их.

Практический ориентир: полное дообучение модели требует в 4–6 раз больше видеопамяти, чем её инференс в том же формате. Модель 7B, которая для ответов просит 6 ГБ, при полном дообучении съест 60–80 ГБ. Это уже не одна карта, а связка из нескольких.

Спасает подход LoRA — дообучение не всей модели, а небольших дополнительных матриц поверх замороженных весов. Обучаемых параметров становится в 100–1000 раз меньше, а требования падают до посильных: 7B через LoRA на 4-битных весах помещается в 16–24 ГБ видеопамяти, 13B — в 24–32 ГБ.

Задача с моделью 7B VRAM ориентировочно Время Аренда
Инференс, 4 бита 6–8 ГБ постоянно помесячно
Инференс, 16 бит 14–16 ГБ постоянно помесячно
LoRA-дообучение 16–24 ГБ 2–12 часов почасово
Полное дообучение 60–80 ГБ 1–5 суток почасово
Обучение с нуля от 320 ГБ недели кластер

Обратите внимание на колонку «Аренда». Обучение — процесс конечный: вы запускаете его на несколько часов и выключаете машину. Держать такой сервер помесячно бессмысленно, разумнее почасовая оплата. Инференс, наоборот, работает круглосуточно, и там выгоднее месячный тариф.

Сколько это стоит по ценам каталога

Разброс огромен, потому что под «сервером для ИИ» скрываются и машина за две сотни рублей, и стойка за сотни тысяч. Ниже — стартовые тарифы провайдеров, которые представлены в GPU-разделе каталога. Это точка входа: базовые конфигурации без видеокарты, от которых считается апгрейд.

Провайдер Стартовый тариф Базовая конфигурация Тарифов Рейтинг
Selectel от 200 ₽/мес 1 ядро, 1 ГБ, 10 ГБ NVMe 69 4.5
Beget от 330 ₽/мес 1 ядро, 1 ГБ, 10 ГБ NVMe 7 4.5
IQHost от 350 ₽/мес 1 ядро, 2 ГБ, 15 ГБ SSD 17 4.0
Timeweb Cloud от 477 ₽/мес 1 ядро, 1 ГБ, 15 ГБ NVMe 4 4.5
RuVDS от 139 ₽/мес 1 ядро, 0.5 ГБ, 10 ГБ HDD 440 4.3

Данные проверены 02.09.2026.

Стартовая цена в 200 ₽ у Selectel не означает, что за эти деньги вы получите видеокарту. Это цена самой младшей виртуальной машины; GPU-конфигурации в линейке того же провайдера стоят кратно дороже и считаются обычно по часам. Смысл таблицы в другом: она показывает, у кого вообще есть GPU-направление и насколько широка линейка — 69 тарифов у Selectel против 4 у Timeweb Cloud означает разную гибкость при подборе.

Отдельно посмотрите подборку хостингов для ИИ с разбором по провайдерам и сравнение тарифов в разделе серверов для LLM: там конфигурации отсортированы уже по объёму памяти, а не по цене входа.

Что упирается кроме видеокарты: диск, память и сеть

Даже правильно подобранная карта не спасёт, если остальная машина не тянет. Веса моделей занимают на диске много места: 7B в 4 битах — около 4 ГБ, 70B — порядка 40 ГБ. Если вы держите три-четыре модели и переключаетесь между ними, закладывайте 100–200 ГБ дискового пространства.

Оперативной памяти нужно не меньше объёма видеопамяти карты, а лучше в полтора раза больше. При загрузке модель сначала читается в RAM, а уже оттуда переливается в VRAM. На машине с 24 ГБ видеопамяти и 8 ГБ оперативной загрузка крупной модели просто упадёт с ошибкой нехватки памяти.

Скорость диска важна в момент старта: с NVMe модель на 13B поднимается за 20–40 секунд, с обычного HDD — за 5–10 минут. Сеть критична, только когда вы качаете веса: канал в 100 Мбит/с скачает 40 ГБ примерно за час, канал в 1 Гбит/с — за шесть минут.

Как подобрать конфигурацию за шесть шагов

Порядок действий одинаков для любой задачи: сначала определяемся с моделью, потом с памятью и только в конце смотрим на цену. Обратный порядок — «возьму подешевле, там разберусь» — почти всегда заканчивается доплатой за смену тарифа.

Пройдите по шагам с калькулятором и списком тарифов перед глазами.

  1. Назовите модель и её размер. Определитесь, что именно вы запускаете: 7B, 13B или 70B. Без этого дальше считать нечего.
  2. Выберите квантизацию. Для большинства прикладных задач берите 4 бита: 7B уместится в 6 ГБ, 13B — в 10 ГБ, 70B — в 40 ГБ.
  3. Добавьте 20% запаса. Умножьте цифру из шага 2 на 1.2 — получите минимальный объём VRAM с учётом контекста.
  4. Задайте оперативную память. Ставьте RAM не меньше полученного объёма видеопамяти, минимум 16 ГБ.
  5. Посчитайте диск. По 5 ГБ на каждую модель 7B, по 40 ГБ на каждую 70B, плюс 20 ГБ на систему и библиотеки.
  6. Выберите схему оплаты. Круглосуточный инференс — помесячно, разовое обучение — почасово.

После заказа машину нужно настроить: обновить систему, поставить драйверы карты и окружение. Базовые шаги описаны в инструкции по настройке VPS с нуля, а окружение с библиотеками удобнее ставить не вручную, а через Docker — готовые образы с драйверами экономят часы возни с зависимостями.

Частые ошибки при аренде сервера под нейросеть

Почти все неудачные заказы повторяют один из нескольких сценариев. Перечислю те, что встречаются чаще прочих, — каждый стоит либо денег, либо переустановки сервера.

  • Путают RAM и VRAM. Берут тариф с 32 ГБ оперативной памяти, ждут, что туда влезет модель 34B, и получают отказ при запуске.
  • Арендуют GPU под вызовы чужого API. Если модель считается не у вас, карта простаивает, а счёт капает.
  • Берут карту впритык. Модель на 10 ГБ на карте ровно с 10 ГБ падает при длинном контексте.
  • Держат обучающий сервер помесячно. Обучение занимает часы, а платят за 30 дней простоя.
  • Экономят на диске. Тариф с 15 ГБ не вместит даже две модели по 7B вместе с системой.

Шестая по счёту, но не по цене ошибка — игнорировать резервные копии окружения. Собранная конфигурация с драйверами и библиотеками — это несколько часов работы. Снимок диска перед экспериментами возвращает систему за пару минут вместо повторной настройки с нуля.

Частые вопросы

Можно ли запустить нейросеть на обычном VPS без видеокарты? Да, если модель небольшая. При 16 ГБ оперативной памяти на процессоре реально работают модели до 7B в 4-битной квантизации. Скорость будет в разы ниже — ориентировочно 3–8 токенов в секунду против 30–60 на карте, — поэтому вариант подходит для фоновых задач, а не для живого чата.

Сколько видеопамяти нужно для модели 13B? При 4-битной квантизации — около 10 ГБ, при 8-битной — примерно 14 ГБ, в исходной 16-битной точности — порядка 26 ГБ. С учётом контекста и служебных структур берите карту минимум на 12 ГБ, а лучше на 16 ГБ.

Чем VRAM отличается от оперативной памяти? VRAM распаяна на самой видеокарте и работает в связке с её вычислительными блоками, а RAM подключена к центральному процессору. Модель считается на карте, поэтому её веса должны поместиться именно в VRAM. Увеличить видеопамять на существующей карте невозможно — только сменить тариф на конфигурацию с более объёмной картой.

Что дешевле — арендовать GPU-сервер или считать на своём компьютере? Для разовых экспериментов дешевле локальная машина, если у вас уже есть подходящая карта. Для сервиса, который отвечает круглосуточно, выигрывает аренда: домашнюю машину пришлось бы держать включённой, с белым IP-адресом и бесперебойным питанием.

Хватит ли 8 ГБ видеопамяти для работы с ИИ? Для модели 7B в 4-битной квантизации — да, с запасом на короткий контекст. Для 13B уже нет: понадобится либо выгрузка части слоёв в оперативную память с падением скорости, либо более агрессивная квантизация с потерей качества ответов. Если бюджет позволяет, 12 ГБ — заметно более комфортный минимум.

Нужен ли GPU для дообучения на своих данных? Для метода LoRA — да, но требования умеренные: модель 7B дообучается на 16–24 ГБ видеопамяти за 2–12 часов в зависимости от объёма датасета. Полное дообучение той же модели потребует 60–80 ГБ и связки из нескольких карт, и почти всегда в этом нет практического смысла.

Как понять, что сервер не справляется? Три признака: ответы генерируются медленнее 5 токенов в секунду, процесс падает с сообщением о нехватке памяти, либо загрузка модели занимает больше 3 минут. Первое лечится картой помощнее, второе — бо́льшим объёмом VRAM или квантизацией, третье — переездом на NVMe-диск.

Можно ли арендовать GPU-сервер на несколько часов? Да, почасовая тарификация есть у части провайдеров и предназначена ровно для таких задач. Схема стандартная: разворачиваете окружение, запускаете обучение, сохраняете результат в объектное хранилище и удаляете машину. Платите только за фактическое время работы.

Итог

Требования к серверу для ИИ определяются одним числом — объёмом видеопамяти, который нужен вашей модели. При 4-битной квантизации это примерно 6 ГБ для 7B, 10 ГБ для 13B и 40 ГБ для 70B, плюс 20% запаса на контекст. Для обучения умножайте эти цифры на 4–6 и переходите на почасовую аренду вместо месячной.

Если модель небольшая, а скорость некритична, процессорный сервер с 16 ГБ оперативной памяти справится и обойдётся в 200–600 ₽ в месяц. Готовые конфигурации с фильтрами по памяти и цене собраны в разделе VPS для ИИ — начните с определения размера модели, а тариф подберётся под неё.

Поделиться:
Марина
Редактор · FREEHOSTING
Главный редактор FREEHOSTING. С 2020 года тестирует VDS, VPS и хостинг-провайдеров — арендует серверы, нагружает их реальными проектами и пишет честные обзоры по итогам. Помогает читателям выбирать хостинг под свои задачи: от Telegram-бота до production-сайта.