Сколько на самом деле стоит неудачный запрос к нейросети

Тема не про хайп, а про деньги. Мы считаем себестоимость ИИ-функций в своём сервисе и наткнулись на цифру, которая переворачивает привычную арифметику.
Обычно стоимость ИИ считают так: цена за тысячу токенов умножить на объём. Красивая линейная модель, по которой строят финансовые планы и обещают инвесторам маржинальность.
В реальности картина другая.
Разобрали один типичный сценарий, генерацию плана документа. Вот что вышло по факту:
Попытка, которая не дала результата: три обращения к модели плюс три веб-поиска. Модель ответила, деньги списались, но формат ответа оказался непригодным.
Повторная попытка, строго по формату, без поиска: одно обращение, результат получен.
Так вот, неудачная попытка обошлась почти в четыре раза дороже успешной. Не потому что она сложнее, а потому что модель по дороге сходила в интернет, собрала контекст, потратила входные токены и только потом выдала нечитаемый результат.
Отсюда три вывода, применимых к любой оценке ИИ в бизнесе.
Первое. Считать нужно стоимость результата, а не стоимость запроса. Между ними разница в разы, и она не видна в прайсе поставщика модели.
Второе. Самая дорогая часть обычно не генерация, а контекст. Поиск, подгруженные документы, история переписки. Входные токены дешевле выходных за единицу, но их на порядок больше.
Третье, самое неприятное для прогнозов. Доля неудачных попыток нестабильна. Она зависит от формулировок пользователя, от версии модели, от того, как поставщик сегодня настроил свой сервис. То есть ваша себестоимость плавает по причинам, на которые вы не влияете.
Практический смысл для тех, кто оценивает такие компании или внедряет ИИ у себя: спрашивайте не «сколько стоит один запрос», а «какая доля запросов доходит до результата с первого раза». Второй показатель говорит о юнит-экономике гораздо больше первого.
У нас после этого разбора появилась отдельная метрика на долю повторов. Экономия там измеряется не процентами, а разами.