Одну и ту же модель держат несколько площадок. По умолчанию мы выбираем сами и объясняем выбор в ответе; блок provider нужен там, где решение должно быть вашим.
Фактическая площадка приходит в поле provider ответа и пишется в лог активности. Никакой скрытой маршрутизации нет: по каждому запросу видно, кто его обслужил и по какой цене.
| Поле | Тип | Что делает |
|---|---|---|
| order | массив строк | Пробовать площадки строго в этом порядке. Отключает балансировку. |
| only | массив строк | Разрешить только перечисленные. Остальные не рассматриваются даже как резерв. |
| ignore | массив строк | Исключить перечисленные. |
| allow_fallbacks | булево, по умолчанию true | Разрешить уход на другую площадку, если выбранная недоступна. |
| require_parameters | булево, по умолчанию false | Брать только те площадки, которые поддерживают все параметры запроса. |
| data_collection | allow | deny | deny исключает площадки, которые оставляют себе промпты для обучения. |
| sort | строка или объект | price, throughput или latency. Отключает балансировку. |
| max_price | объект | Потолок цены за миллион токенов, в рублях. Площадки дороже отбрасываются. |
| quantizations | массив строк | Фильтр по разрядности весов: fp16, fp8, int8, int4. |
{
"model": "deepseek/deepseek-v3",
"messages": [{"role": "user", "content": "…"}],
"provider": {
"order": ["deepseek", "together"],
"allow_fallbacks": false
}
}С allow_fallbacks: false запрос уйдёт только площадкам из списка; если ни одна не ответила — 502. Это правильный режим для задач, где ответ другой площадки хуже, чем отсутствие ответа: воспроизводимые эксперименты, сравнение качества, отладка.
| Значение sort | Что оптимизируется | Чем платите |
|---|---|---|
| price | минимальная цена запроса | Медленные площадки. Для фоновых задач это не важно |
| throughput | токенов в секунду | Цена. Разница между самой быстрой и самой дешёвой бывает двукратной |
| latency | время до первого токена | Цена. Имеет смысл там, где пользователь смотрит в экран |
sort или order запросы перестают распределяться между близкими площадками и идут в одну — ту, что первая по вашему критерию. Это ровно то, о чём вы попросили, но устойчивость к её падению держится теперь только на резерве.{
"model": "meta/llama-4-70b",
"messages": [{"role": "user", "content": "…"}],
"provider": {
"data_collection": "deny",
"max_price": {"prompt": 40, "completion": 120},
"quantizations": ["fp16", "fp8"]
}
}max_price задаётся в рублях за миллион токенов и сравнивается с итоговой ценой, той самой, что спишется с баланса. Если после всех фильтров не осталось ни одной площадки, запрос возвращает 404 с перечнем отвергнутых и причиной по каждой — гадать не придётся.
Про data_collection стоит понимать одно: это фильтр по заявленной политике площадки, а не техническая гарантия. Что именно мы про это знаем и чего не знаем — в разделе «Данные и логи».
Одна и та же модель у разных площадок может крутиться в разной точности. int4 дешевле и быстрее, но заметно хуже на длинном контексте и на коде. Если вы сравниваете качество моделей между собой, фиксируйте разрядность — иначе сравниваете вы не модели, а хостинги.
Вкладка «Провайдеры» в карточке модели показывает список с ценой, разрядностью, средней задержкой и аптаймом за последние сутки. Сводка по всем площадкам — на странице «Провайдеры».