Сколько стоит инференс LLM: считаем на реальном примере Мы протестировали инференс Qwen3-32B на A100 (80 ГБ) и двух A5000 (48 ГБ суммарно) в сценарии с умеренной длиной запроса и ответа, Q4-квантизацией и некритичными требованиями к скорости генерации, а затем посчитали стоимость обработки 1 млн токенов. По ссылке — полный разбор с параметрами теста, методикой расчета и чек-листом оптимизации затрат на AI-инфраструктуру.
Not enough history yet to show a trend.