На главную

Локальные нейросети без розовых очков: как не слить бюджет на RTX 4090 и посчитать реальную экономику AI для бизнеса

Сегодня каждый второй прогрессивный директор по маркетингу или владелец бизнеса мечтает об одном: «А давайте развернем свою языковую модель (LLM) локально!». Мо...

18 сентября 2026 г.
Локальные нейросети без розовых очков: как не слить бюджет на RTX 4090 и посчитать реальную экономику AI для бизнеса

Иллюзия независимости: почему бизнес бежит на «свои сервера»

Сегодня каждый второй прогрессивный директор по маркетингу или владелец бизнеса мечтает об одном: «А давайте развернем свою языковую модель (LLM) локально!». Мотивы кажутся железобетонными. Во-первых, безопасность: никому не хочется отправлять конфиденциальную базу клиентов, финансовые отчеты или уникальные маркетинговые стратегии на сервера OpenAI или Anthropic. Во-вторых, мнимая экономия: один раз купил мощную видеокарту — и пользуйся бесплатно, забудь про ежемесячные счета за API.

Я, как человек прагматичный и слегка циничный, люблю в такие моменты доставать калькулятор. Идея «бесплатного локального AI» разбивается о суровую реальность кремния и законов физики в первые же минуты после запуска. Мощная видеокарта в сервере — это еще не гарантия того, что ваша локальная модель будет отвечать быстрее, чем сонный стажер в понедельник утром. Давайте снимем розовые очки и разберем, как устроена экономика и техническая изнанка локального инференса, чтобы вы не закопали пару сотен тысяч рублей в бесполезное железо.

Главный капкан железа: почему терафлопсы не решают

Когда обыватель выбирает видеокарту для нейросетей, он смотрит на терафлопсы (TFLOPS) — показатель вычислительной мощности процессора. Маркетологи NVIDIA радостно потирают руки, продавая геймерские флагманы под соусом «идеально для AI». Но в реальности генерация текста (инференс LLM) работает совершенно иначе, чем рендеринг 3D-графики или обучение моделей.

Процесс генерации каждого нового слова (токена) в LLM — это последовательный процесс. Чтобы выдать одну букву, видеокарте нужно прогнать через свои вычислительные блоки все веса модели от начала до конца. И здесь мы упираемся не в скорость вычислений чипа, а в скорость, с которой память может передать эти данные в процессор.

Пропускная способность памяти (Memory Bandwidth) — истинный царь инференса

Если у вас модель на 70 миллиардов параметров (70B), сжатая до 4 бит (она весит около 35-40 ГБ), то для генерации одного-единственного токена видеокарта должна считать из своей памяти все эти 40 ГБ.

  • Если пропускная способность памяти вашей карты составляет 1000 ГБ/сек (как у RTX 4090), то теоретический предел скорости для одного пользователя — около 25-28 токенов в секунду.
  • Если вы поставите карту попроще, например, RTX 4070 Ti Super с шиной поуже и пропускной способностью около 670 ГБ/сек, скорость упадет пропорционально, даже если сам чип будет простаивать.

Вывод прост: для локальной LLM объем видеопамяти (VRAM) и ее пропускная способность критически важнее, чем «игровая» мощность чипа. Если модель не влезает в VRAM полностью и начинает использовать оперативную память компьютера (RAM) через шину PCIe, скорость генерации падает до уровня «одно слово в три секунды». Использовать это в бизнесе становится физически невозможно.

Скрытый жрач ресурсов: KV-кэш и контекстное окно

Допустим, вы посчитали размер модели, купили условную RTX 3090 на 24 ГБ, скачали модель Llama-3-8B (которая в 4-битном квантовании весит всего около 5 ГБ) и думаете, что у вас осталось еще 19 ГБ свободной памяти. Но тут в игру вступает понятие KV-кэша (Key-Value Cache).

Чтобы модель помнила, о чем шла речь в начале диалога, ей нужно хранить в памяти промежуточные состояния для всех предыдущих токенов. Чем длиннее ваш диалог (контекстное окно), тем больше памяти сжирает этот кэш.

Если вы загружаете в модель длинный документ на 16 000 токенов (например, транскрипт созвона или договор), KV-кэш может легко сожрать дополнительные 10-15 ГБ видеопамяти сверх веса самой модели. Если память закончится — система либо вылетит с ошибкой Out of Memory, либо перейдет на медленную системную память, превратив ваш суперкомпьютер в калькулятор.

Экономика в цифрах: API против собственного «железа»

Давайте займемся чистой бизнес-математикой. Представим, что вашей компании нужно автоматизировать обработку входящих лидов или генерацию SEO-текстов. Объем — около 1 000 000 токенов в день (это примерно 750 страниц текста).

Считаем TCO (Total Cost of Ownership) локального стенда

Для комфортной работы хорошей открытой модели (например, Mixtral 8x7B или Llama-3-70B) нам потребуется сервер с двумя б/у картами RTX 3090 (суммарно 48 ГБ VRAM) или одной новой RTX 6000 Ada (но это космос по деньгам). Остановимся на народном варианте: две RTX 3090.

  • Капитальные затраты (CAPEX): Две карты RTX 3090 (б/у, так как новые не найти) — около 180 000 руб. Платформа (материнская плата с поддержкой двух карт на хорошей скорости, мощный блок питания на 1.5 кВт, процессор, 128 ГБ RAM) — еще 120 000 руб. Итого сборка обойдется примерно в 300 000 рублей.
  • Операционные затраты (OPEX): Электричество (сервер под нагрузкой потребляет около 1 кВт/ч). При работе 10 часов в день это около 300 кВт в месяц (примерно 2 000 рублей). Но главное — администрирование. Локальный сервер нужно настроить, обновлять софт, следить, чтобы он не зависал. Если у вас нет своего системного администратора со знанием Linux и Docker, придется нанимать аутсорс — это минимум 20 000 - 30 000 рублей в месяц.
  • Амортизация: Железо устаревает за 2-3 года. Через три года ваши карты будут стоить вдвое дешевле, а новые модели потребуют еще больше памяти.

Итого, запуск своего стенда в первый год обойдется вам примерно в 550 000 рублей (с учетом минимальной поддержки).

Считаем затраты на API

Если использовать коммерческие API (например, Claude 3.5 Sonnet или GPT-4o mini):

  • GPT-4o mini стоит смешные $0.15 за 1 млн входных токенов и $0.60 за выходные. Даже при плотном потоке в 1 млн токенов в день, ваши затраты составят около $15-$20 в месяц. Это около 2 000 рублей.
  • Если нужна тяжелая и умная модель уровня Claude 3.5 Sonnet, 1 млн токенов обойдется примерно в $3 (входные) и $15 (выходные). В среднем — около $8 в день, или $240 в месяц (около 22 000 рублей).

Прагматичный вывод: Чтобы локальный сервер на собственном железе стал экономически выгоднее, чем использование дешевых API вроде GPT-4o mini, вам нужно генерировать гигантские объемы трафика 24/7. В 90% случаев для малого и среднего бизнеса покупка своего железа — это чистый убыток и дань моде, а не экономия.

Софтверный костыль: квантование и движки инференса

Если вы все же решились на локальный запуск (например, из-за жестких требований безопасности), не пытайтесь запускать модели в исходном качестве (FP16). Ваше спасение — квантование (quantization).

Это процесс сжатия весов модели с потерей точности, но с колоссальным выигрышем в объеме. Модель в формате INT4 (4-битное сжатие) весит в 4 раза меньше оригинальной, а качество ответов падает всего на 2-5%.

Также критически важно выбрать правильный движок инференса. Забудьте про стандартные библиотеки Python. Для продакшена используют:

  • vLLM: Отличный движок для серверов, который использует технологию PagedAttention. Он оптимизирует работу с KV-кэшем и позволяет обслуживать десятки пользователей одновременно без лавинообразного роста потребления памяти.
  • llama.cpp / Ollama: Идеально для быстрого старта и работы на CPU + GPU. Позволяет запускать модели даже на обычных компьютерах, хотя и с потерей скорости.
  • ExLlamaV2: Лучший выбор, если вы работаете строго на картах NVIDIA и используете формат EXL2. Дает максимальную скорость генерации.

Чек-лист прагматика: покупать или арендовать?

Прежде чем подписывать счет на покупку очередной видеокарты, задайте себе три вопроса:

1. Действительно ли наши данные секретны? Если вы не банк, не медицинская клиника и не оборонное предприятие, скорее всего, стандартного соглашения о конфиденциальности (NDA) с облачными провайдерами (например, через Azure OpenAI или европейские хостинги) вам будет более чем достаточно.

2. Какова наша утилизация железа? Если ваш сервер будет работать на 10% мощности, решая задачи раз в час, вы просто сжигаете деньги. В таком случае гораздо выгоднее арендовать GPU в облаке (RunPod, Vast.ai, Cloud.ru) с поминутной оплатой. Запустили, обработали массив данных за 2 часа, заплатили $2 и выключили.

3. Кто это будет поддерживать? Локальная LLM — это не программа «установил и забыл». Модели обновляются каждую неделю, библиотеки конфликтуют, драйвера NVIDIA «слетают» после обновлений системы. Если у вас нет инженера, готового тратить на это время, ваше железо быстро превратится в дорогой пылесборник.

Резюме от Ленивого Маркетолога: Не ищите сложных путей там, где работают простые. Начните с API. Если объемы вырастут настолько, что счета начнут пугать вашего бухгалтера — переходите на аренду облачных GPU. И только если вы упретесь в жесткие требования регуляторов или начнете обрабатывать терабайты персональных данных в секунду — только тогда открывайте конфигуратор серверов. И считайте не терафлопсы, а гигабайты в секунду.


Больше практики, реальных цифр и разборов без воды:

⚡ Telegram-канал: t.me/lenivymarketolog — оперативные инсайты, тренды и аналитика без воды

💼 Группа ВКонтакте: vk.ru/lenivymarketolog — кейсы, статьи и практические руководства

🌐 Профиль в MAX: max.ru/id781624934797_biz — экспертный бизнес-блог и статьи

М
Автор: Черниенко
Маркетолог, специалист по перфоманс-трафику и росту продуктов.