Вставьте промпт — увидите токены и стоимость на GPT, Claude, Gemini, Qwen, DeepSeek, а затем сравните две модели
| Модель | Токены | Вход | Выход | Один запрос | Запросов: {n} | Контекст | Влезает? |
|---|
Большие языковые модели тарифицируются по токенам — небольшим фрагментам текста, примерно три четверти английского слова. Провайдеры отдельно берут плату за токены, которые вы отправляете (вход), и токены, которые модель пишет в ответ (выход), причём выход обычно в несколько раз дороже, поэтому короткий вопрос с длинным ответом может стоить дороже длинного документа с кратким резюме.
Цена — лишь одна из осей при выборе модели. Контекстное окно определяет, сколько текста модель учитывает одновременно — от ста тысяч токенов до миллиона и более; скорость решает, будет ли чат казаться мгновенным; а мультимодальные модели умеют ещё и читать изображения, слушать аудио и смотреть видео. Дешёвые быстрые модели подходят для классификации, извлечения данных и массового чата, а флагманские и рассуждающие стоят своих денег на сложном программировании, анализе и планировании.
Сравнение моделей класса GPT, Claude, Gemini, Qwen, DeepSeek, Grok и Llama бок о бок делает компромиссы видимыми до того, как проект вырастет: умножьте стоимость запроса на месячный объём — и десятикратная разница в цене превращается в реальную строку бюджета. Модели с открытыми весами добавляют ещё один вариант: их можно запускать на собственном оборудовании или у нескольких конкурирующих хостеров.