Сервер для ИИ — это не одна конфигурация, а две разные машины под две разные задачи. Если вы просто запускаете готовую модель и задаёте ей вопросы, вам хватит машины с видеокартой на 8–24 ГБ видеопамяти, а иногда и обычного процессорного сервера за 200–600 ₽ в месяц. Если вы собираетесь обучать или дообучать модель, требования вырастают в 4–10 раз, и это уже совсем другой бюджет. Подобрать конкретный тариф можно в разделе серверов для ИИ, но сначала стоит понять, какие цифры вообще нужно искать в характеристиках.
Этот материал — для тех, кто впервые арендует машину под нейросеть: разработчика небольшого сервиса, владельца бизнеса, который хочет держать модель у себя, или студента, который экспериментирует с локальными LLM. Разберём, чем видеопамять отличается от оперативной, сколько гигабайт требуют модели на 7, 13 и 70 миллиардов параметров, когда GPU не нужен вовсе и во что реально обходится вход по ценам каталога на сентябрь 2026 года.
Что скрывается за формулировкой «сервер для ИИ»
В прайсах хостеров словосочетание «сервер для ИИ» означает три совершенно разные вещи. Первая — обычный виртуальный сервер без видеокарты, на котором крутится ваш код: бот, API-обёртка, обработка очередей, вызовы чужих моделей по сети. Такая машина стоит столько же, сколько любой VPS, и никакого специального железа не требует.
Вторая — сервер с выделенной видеокартой (GPU), на котором модель работает локально. Здесь платят именно за карту, и цена определяется её объёмом видеопамяти. Третья — арендованный на часы кластер под обучение.
Большинство новичков приходят за вторым вариантом, а по факту им нужен первый. Если вы дёргаете модель по API у внешнего сервиса, вычисления происходят не у вас, и мощная карта в аренде — выброшенные деньги. Проверить это просто: посмотрите, есть ли в вашем коде загрузка весов модели в память. Если весов нет, а есть только HTTP-запросы, берите обычный недорогой VPS — стартовые тарифы с 1 ГБ памяти начинаются от 59 ₽ в месяц.
VRAM и оперативная память — почему это не одно и то же
Это главная путаница у тех, кто выбирает сервер впервые. В характеристиках тарифа вы видите строку «Память — 2 ГБ» или «Память — 16 ГБ», и логично предполагаете, что именно туда загрузится нейросеть. Но это оперативная память (RAM) — она подключена к центральному процессору и обслуживает операционную систему, ваш код и обычные приложения.
Видеокарта же имеет собственную память, распаянную прямо на плате, — видеопамять (VRAM). Она физически отдельная и в разы быстрее: пропускная способность у современных серверных карт измеряется сотнями гигабайт в секунду против десятков у обычной DDR. Именно скорость доступа к памяти определяет, насколько быстро модель выдаёт текст.
Когда пишут «модели 13B нужно 10 ГБ», речь всегда о видеопамяти, а не об оперативной. Расширить VRAM нельзя: сколько распаяно на карте, столько и есть. Докупить оперативную память до 64 ГБ у большинства хостеров можно за пару кликов, а превратить карту на 16 ГБ в карту на 24 ГБ — нет, только сменить тариф.
Отсюда простое правило: если модель не помещается в видеопамять целиком, она либо не запустится, либо начнёт «выгружать» часть слоёв в обычную RAM. Второй вариант работает, но скорость падает в 5–20 раз — примерно так же, как сайт на диске вместо кеша.

Сколько видеопамяти требуют модели 7B, 13B и 70B
Размер модели измеряют в миллиардах параметров: 7B — семь миллиардов, 70B — семьдесят. Каждый параметр занимает в памяти определённое количество байт, и это количество зависит от точности хранения — квантизации. При 16 битах на параметр уходит 2 байта, при 8 битах — 1 байт, при 4 битах — половина байта.
Квантизация в 4 бита — сегодня рабочий стандарт для запуска моделей на скромном железе. Качество ответов проседает незначительно, а требования к памяти падают вчетверо по сравнению с исходным форматом. Ориентиры для 4-битной квантизации: 7B — примерно 6 ГБ, 13B — около 10 ГБ, 70B — порядка 40 ГБ видеопамяти.
| Модель | 4 бита | 8 бит | 16 бит | Какая карта нужна |
|---|---|---|---|---|
| 7B | ≈ 6 ГБ | ≈ 8 ГБ | ≈ 14 ГБ | от 8 ГБ VRAM |
| 13B | ≈ 10 ГБ | ≈ 14 ГБ | ≈ 26 ГБ | от 12 ГБ VRAM |
| 34B | ≈ 20 ГБ | ≈ 36 ГБ | ≈ 68 ГБ | от 24 ГБ VRAM |
| 70B | ≈ 40 ГБ | ≈ 72 ГБ | ≈ 140 ГБ | от 48 ГБ VRAM |
К цифрам из таблицы добавьте 15–20% запаса на служебные структуры и на кеш контекста: чем длиннее диалог, тем больше памяти уходит под него. Модель 13B в 4 битах формально требует 10 ГБ, но на карте ровно с 10 ГБ она упрётся в потолок при длинном промпте. Берите с запасом хотя бы в 2 ГБ.

Сценарий первый: инференс, то есть запуск готовой модели
Инференс — это работа обученной модели: вы подаёте текст, она отвечает. Никакого пересчёта весов не происходит, поэтому нагрузка сводится к чтению модели из памяти и умножению матриц. Это самый частый и самый дешёвый сценарий.
Для инференса решающий параметр один — объём видеопамяти. Скорость карты влияет на то, сколько токенов в секунду вы получите, но если модель не влезла в память, никакая скорость не поможет. На картах уровня 16 ГБ комфортно живут модели до 13B, на 24 ГБ — до 34B в 4-битной квантизации.
Второй по важности параметр — сколько одновременных запросов вы обслуживаете: каждой сессии нужен свой контекст в памяти. Для личных экспериментов достаточно одной карты, для сервиса на 20–50 параллельных сессий потребуется карта с бо́льшим объёмом либо очередь запросов.
Готовые конфигурации под этот сценарий собраны в разделе VPS с видеокартой. Если вы уже определились с конкретной моделью, посмотрите подборку серверов под аренду для LLM — там разложено по объёмам памяти.
Когда для нейросети хватает обычного процессорного сервера
GPU нужен не всегда. Модели до 7B в 4-битной квантизации реально работают на центральном процессоре, если в системе есть минимум 16 ГБ оперативной памяти. Библиотеки вроде llama.cpp умеют считать на CPU и на серверах, и на ноутбуках.
Расплата — скорость. Там, где карта выдаёт 30–60 токенов в секунду, процессор на 4–8 ядрах даст 3–8 токенов. Ответ в 300 слов будет собираться минуту вместо пяти секунд. Для чат-бота с живым пользователем это неприемлемо, а для ночной фоновой обработки документов — вполне.
Процессорный вариант оправдан в четырёх случаях: пакетная обработка без спешки, редкие обращения (несколько запросов в час), небольшие модели-классификаторы на 1–3B и эмбеддинги для поиска. В последнем случае модели крошечные, и разница между CPU и GPU почти незаметна.
Что брать: 8–16 ГБ RAM, 4–8 виртуальных ядер и диск NVMe — веса модели на 7B занимают на диске 4–5 ГБ, и грузить их с медленного HDD мучительно. Подойдут тарифы для серверов под Python, поскольку почти вся экосистема ИИ на нём и написана.
Сценарий второй: обучение и дообучение
Обучение отличается от инференса принципиально. При запуске модели в памяти лежат только веса. При обучении туда же добавляются градиенты, состояния оптимизатора и промежуточные активации — всё это по объёму сопоставимо с самими весами или превышает их.
Практический ориентир: полное дообучение модели требует в 4–6 раз больше видеопамяти, чем её инференс в том же формате. Модель 7B, которая для ответов просит 6 ГБ, при полном дообучении съест 60–80 ГБ. Это уже не одна карта, а связка из нескольких.
Спасает подход LoRA — дообучение не всей модели, а небольших дополнительных матриц поверх замороженных весов. Обучаемых параметров становится в 100–1000 раз меньше, а требования падают до посильных: 7B через LoRA на 4-битных весах помещается в 16–24 ГБ видеопамяти, 13B — в 24–32 ГБ.
| Задача с моделью 7B | VRAM ориентировочно | Время | Аренда |
|---|---|---|---|
| Инференс, 4 бита | 6–8 ГБ | постоянно | помесячно |
| Инференс, 16 бит | 14–16 ГБ | постоянно | помесячно |
| LoRA-дообучение | 16–24 ГБ | 2–12 часов | почасово |
| Полное дообучение | 60–80 ГБ | 1–5 суток | почасово |
| Обучение с нуля | от 320 ГБ | недели | кластер |
Обратите внимание на колонку «Аренда». Обучение — процесс конечный: вы запускаете его на несколько часов и выключаете машину. Держать такой сервер помесячно бессмысленно, разумнее почасовая оплата. Инференс, наоборот, работает круглосуточно, и там выгоднее месячный тариф.
Сколько это стоит по ценам каталога
Разброс огромен, потому что под «сервером для ИИ» скрываются и машина за две сотни рублей, и стойка за сотни тысяч. Ниже — стартовые тарифы провайдеров, которые представлены в GPU-разделе каталога. Это точка входа: базовые конфигурации без видеокарты, от которых считается апгрейд.
| Провайдер | Стартовый тариф | Базовая конфигурация | Тарифов | Рейтинг |
|---|---|---|---|---|
| Selectel | от 200 ₽/мес | 1 ядро, 1 ГБ, 10 ГБ NVMe | 69 | 4.5 |
| Beget | от 330 ₽/мес | 1 ядро, 1 ГБ, 10 ГБ NVMe | 7 | 4.5 |
| IQHost | от 350 ₽/мес | 1 ядро, 2 ГБ, 15 ГБ SSD | 17 | 4.0 |
| Timeweb Cloud | от 477 ₽/мес | 1 ядро, 1 ГБ, 15 ГБ NVMe | 4 | 4.5 |
| RuVDS | от 139 ₽/мес | 1 ядро, 0.5 ГБ, 10 ГБ HDD | 440 | 4.3 |
Данные проверены 02.09.2026.
Стартовая цена в 200 ₽ у Selectel не означает, что за эти деньги вы получите видеокарту. Это цена самой младшей виртуальной машины; GPU-конфигурации в линейке того же провайдера стоят кратно дороже и считаются обычно по часам. Смысл таблицы в другом: она показывает, у кого вообще есть GPU-направление и насколько широка линейка — 69 тарифов у Selectel против 4 у Timeweb Cloud означает разную гибкость при подборе.
Отдельно посмотрите подборку хостингов для ИИ с разбором по провайдерам и сравнение тарифов в разделе серверов для LLM: там конфигурации отсортированы уже по объёму памяти, а не по цене входа.
Что упирается кроме видеокарты: диск, память и сеть
Даже правильно подобранная карта не спасёт, если остальная машина не тянет. Веса моделей занимают на диске много места: 7B в 4 битах — около 4 ГБ, 70B — порядка 40 ГБ. Если вы держите три-четыре модели и переключаетесь между ними, закладывайте 100–200 ГБ дискового пространства.
Оперативной памяти нужно не меньше объёма видеопамяти карты, а лучше в полтора раза больше. При загрузке модель сначала читается в RAM, а уже оттуда переливается в VRAM. На машине с 24 ГБ видеопамяти и 8 ГБ оперативной загрузка крупной модели просто упадёт с ошибкой нехватки памяти.
Скорость диска важна в момент старта: с NVMe модель на 13B поднимается за 20–40 секунд, с обычного HDD — за 5–10 минут. Сеть критична, только когда вы качаете веса: канал в 100 Мбит/с скачает 40 ГБ примерно за час, канал в 1 Гбит/с — за шесть минут.
Как подобрать конфигурацию за шесть шагов
Порядок действий одинаков для любой задачи: сначала определяемся с моделью, потом с памятью и только в конце смотрим на цену. Обратный порядок — «возьму подешевле, там разберусь» — почти всегда заканчивается доплатой за смену тарифа.
Пройдите по шагам с калькулятором и списком тарифов перед глазами.
- Назовите модель и её размер. Определитесь, что именно вы запускаете: 7B, 13B или 70B. Без этого дальше считать нечего.
- Выберите квантизацию. Для большинства прикладных задач берите 4 бита: 7B уместится в 6 ГБ, 13B — в 10 ГБ, 70B — в 40 ГБ.
- Добавьте 20% запаса. Умножьте цифру из шага 2 на 1.2 — получите минимальный объём VRAM с учётом контекста.
- Задайте оперативную память. Ставьте RAM не меньше полученного объёма видеопамяти, минимум 16 ГБ.
- Посчитайте диск. По 5 ГБ на каждую модель 7B, по 40 ГБ на каждую 70B, плюс 20 ГБ на систему и библиотеки.
- Выберите схему оплаты. Круглосуточный инференс — помесячно, разовое обучение — почасово.
После заказа машину нужно настроить: обновить систему, поставить драйверы карты и окружение. Базовые шаги описаны в инструкции по настройке VPS с нуля, а окружение с библиотеками удобнее ставить не вручную, а через Docker — готовые образы с драйверами экономят часы возни с зависимостями.
Частые ошибки при аренде сервера под нейросеть
Почти все неудачные заказы повторяют один из нескольких сценариев. Перечислю те, что встречаются чаще прочих, — каждый стоит либо денег, либо переустановки сервера.
- Путают RAM и VRAM. Берут тариф с 32 ГБ оперативной памяти, ждут, что туда влезет модель 34B, и получают отказ при запуске.
- Арендуют GPU под вызовы чужого API. Если модель считается не у вас, карта простаивает, а счёт капает.
- Берут карту впритык. Модель на 10 ГБ на карте ровно с 10 ГБ падает при длинном контексте.
- Держат обучающий сервер помесячно. Обучение занимает часы, а платят за 30 дней простоя.
- Экономят на диске. Тариф с 15 ГБ не вместит даже две модели по 7B вместе с системой.
Шестая по счёту, но не по цене ошибка — игнорировать резервные копии окружения. Собранная конфигурация с драйверами и библиотеками — это несколько часов работы. Снимок диска перед экспериментами возвращает систему за пару минут вместо повторной настройки с нуля.
Частые вопросы
Можно ли запустить нейросеть на обычном VPS без видеокарты? Да, если модель небольшая. При 16 ГБ оперативной памяти на процессоре реально работают модели до 7B в 4-битной квантизации. Скорость будет в разы ниже — ориентировочно 3–8 токенов в секунду против 30–60 на карте, — поэтому вариант подходит для фоновых задач, а не для живого чата.
Сколько видеопамяти нужно для модели 13B? При 4-битной квантизации — около 10 ГБ, при 8-битной — примерно 14 ГБ, в исходной 16-битной точности — порядка 26 ГБ. С учётом контекста и служебных структур берите карту минимум на 12 ГБ, а лучше на 16 ГБ.
Чем VRAM отличается от оперативной памяти? VRAM распаяна на самой видеокарте и работает в связке с её вычислительными блоками, а RAM подключена к центральному процессору. Модель считается на карте, поэтому её веса должны поместиться именно в VRAM. Увеличить видеопамять на существующей карте невозможно — только сменить тариф на конфигурацию с более объёмной картой.
Что дешевле — арендовать GPU-сервер или считать на своём компьютере? Для разовых экспериментов дешевле локальная машина, если у вас уже есть подходящая карта. Для сервиса, который отвечает круглосуточно, выигрывает аренда: домашнюю машину пришлось бы держать включённой, с белым IP-адресом и бесперебойным питанием.
Хватит ли 8 ГБ видеопамяти для работы с ИИ? Для модели 7B в 4-битной квантизации — да, с запасом на короткий контекст. Для 13B уже нет: понадобится либо выгрузка части слоёв в оперативную память с падением скорости, либо более агрессивная квантизация с потерей качества ответов. Если бюджет позволяет, 12 ГБ — заметно более комфортный минимум.
Нужен ли GPU для дообучения на своих данных? Для метода LoRA — да, но требования умеренные: модель 7B дообучается на 16–24 ГБ видеопамяти за 2–12 часов в зависимости от объёма датасета. Полное дообучение той же модели потребует 60–80 ГБ и связки из нескольких карт, и почти всегда в этом нет практического смысла.
Как понять, что сервер не справляется? Три признака: ответы генерируются медленнее 5 токенов в секунду, процесс падает с сообщением о нехватке памяти, либо загрузка модели занимает больше 3 минут. Первое лечится картой помощнее, второе — бо́льшим объёмом VRAM или квантизацией, третье — переездом на NVMe-диск.
Можно ли арендовать GPU-сервер на несколько часов? Да, почасовая тарификация есть у части провайдеров и предназначена ровно для таких задач. Схема стандартная: разворачиваете окружение, запускаете обучение, сохраняете результат в объектное хранилище и удаляете машину. Платите только за фактическое время работы.
Итог
Требования к серверу для ИИ определяются одним числом — объёмом видеопамяти, который нужен вашей модели. При 4-битной квантизации это примерно 6 ГБ для 7B, 10 ГБ для 13B и 40 ГБ для 70B, плюс 20% запаса на контекст. Для обучения умножайте эти цифры на 4–6 и переходите на почасовую аренду вместо месячной.
Если модель небольшая, а скорость некритична, процессорный сервер с 16 ГБ оперативной памяти справится и обойдётся в 200–600 ₽ в месяц. Готовые конфигурации с фильтрами по памяти и цене собраны в разделе VPS для ИИ — начните с определения размера модели, а тариф подберётся под неё.