
Зачем локальная LLM в 2025
Облачные API удобны, но у них есть три проблемы для среднего и крупного бизнеса: стоимость на масштабе, передача данных третьим сторонам и зависимость от провайдера. В прошлом квартале мы развернули клиенту приватный стек на базе Llama 3.3 70B на двух RTX и получили предсказуемый latency и нулевую утечку чувствительных данных.
Конфигурация
- 2× NVIDIA RTX (24 GB VRAM каждая)
- vLLM как сервер инференса с батчингом
- AWQ-квантование 4-bit для влезания в память
- nginx + auth-прокси с rate-limit
- Prometheus + Grafana для метрик
Бенчмарки
| Метрика | Значение |
|---|---|
| Latency p50 | 42 ms |
| Tokens/s | 187 |
| Контекст | 32 768 токенов |
| Загрузка GPU | 78% |
Что важно учесть
- Тепловой режим: при сутки-в-сутки работе нужна нормальная вентиляция и мониторинг
- Батчинг запросов — vLLM прибавляет 3–4× к throughput против naive serving
- Backpressure: при пиках лучше очередь, чем 502 от прокси
- Обновления: модели выходят каждые 1–2 месяца, готовьте процесс ротации
Экономика
При 1.5M запросов в месяц и средней длине ответа 600 токенов локальный стек окупается за 4–5 месяцев против OpenAI API. После этого — экономия в разы.
Когда не нужно
Если у вас нерегулярные запросы и нет требований к приватности — оставайтесь на API. Локальный стек оправдан там, где есть стабильный поток или конфиденциальность.
Похожая задача в вашем бизнесе?
Расскажите коротко — предложим путь от аудита до запуска. Можно без формальностей.


