ITOQ
LLM на своём железе: как мы запустили Llama 3.3 на двух RTX
Все статьи
AI / LLM 1 мин чтения

LLM на своём железе: как мы запустили Llama 3.3 на двух RTX

Полный путь от выбора модели до продакшена: бенчмарки, нюансы инфраструктуры, реальная экономика приватного AI-стека.

LLM на своём железе: как мы запустили Llama 3.3 на двух RTX

Зачем локальная LLM в 2025

Облачные API удобны, но у них есть три проблемы для среднего и крупного бизнеса: стоимость на масштабе, передача данных третьим сторонам и зависимость от провайдера. В прошлом квартале мы развернули клиенту приватный стек на базе Llama 3.3 70B на двух RTX и получили предсказуемый latency и нулевую утечку чувствительных данных.

Конфигурация

  • 2× NVIDIA RTX (24 GB VRAM каждая)
  • vLLM как сервер инференса с батчингом
  • AWQ-квантование 4-bit для влезания в память
  • nginx + auth-прокси с rate-limit
  • Prometheus + Grafana для метрик

Бенчмарки

Метрика Значение
Latency p50 42 ms
Tokens/s 187
Контекст 32 768 токенов
Загрузка GPU 78%

Что важно учесть

  • Тепловой режим: при сутки-в-сутки работе нужна нормальная вентиляция и мониторинг
  • Батчинг запросов — vLLM прибавляет 3–4× к throughput против naive serving
  • Backpressure: при пиках лучше очередь, чем 502 от прокси
  • Обновления: модели выходят каждые 1–2 месяца, готовьте процесс ротации

Экономика

При 1.5M запросов в месяц и средней длине ответа 600 токенов локальный стек окупается за 4–5 месяцев против OpenAI API. После этого — экономия в разы.

Когда не нужно

Если у вас нерегулярные запросы и нет требований к приватности — оставайтесь на API. Локальный стек оправдан там, где есть стабильный поток или конфиденциальность.

#LLM#Llama#NVIDIA#Инфраструктура#Приватность
CTA

Похожая задача в вашем бизнесе?

Расскажите коротко — предложим путь от аудита до запуска. Можно без формальностей.

Читать дальше