Масштабное обновление каталога VseLLM: Gemini 3.7 Flash, провайдер MiniMax и пересмотр тарифов

Масштабное обновление каталога нейросетей VseLLM. Интеграция Gemini 3.7 Flash и провайдера MiniMax, глобальное снижение цен на GPT, DeepSeek и Kimi.

Масштабное обновление каталога VseLLM: Gemini 3.7 Flash, провайдер MiniMax и пересмотр тарифов

Обновление каталога VseLLM: Gemini 3.7 Flash, провайдер MiniMax и глобальный пересмотр тарифов

Информируем о масштабных обновлениях в каталоге моделей. Мы добавили новых провайдеров, интегрировали актуальные версии нейросетей и провели ревизию стоимости. Все цены ниже указаны за 1 млн токенов (в рублях, по фиксированному курсу 85 ₽ за 1$).

Новые модели и промо-периоды

Добавлена высокоскоростная модель google/gemini-3.7-flash.

⚠️ Внимание: Для google/gemini-3.6-flash и google/gemini-3.7-flash стартовые цены действуют до 31 декабря 2026 года включительно (Input: 82.875 ₽ | Output: 414.375 ₽ | Cache Read: 8.287 ₽). С 1 января 2027 года стоимость вернется к стандартной (Input: 165.75 ₽ | Output: 828.75 ₽ | Cache Read: 16.575 ₽).

Также в каталог добавлены:

  • anthropic/claude-fable-5.1
  • z-ai/glm-5.3 и z-ai/glm-5.3-flash (действует стартовая скидка 50% до 9 сентября 2026)
  • Линейка Qwen: qwen/qwen3.8-flash, qwen/qwen3.8-27b, qwen/qwen3.8-2.4t-a95b

Новый провайдер: MiniMax

В каталог официально добавлен провайдер MiniMax. Теперь для вызова доступны модели: minimax/minimax-m3, minimax/minimax-m2.7 и minimax/minimax-m2.7-highspeed.

Снижение стоимости моделей

  • google/gemini-3.6-flash: Input 165.75 ₽82.875 ₽ | Output 828.75 ₽414.375 ₽ | Cache Read 16.575 ₽8.287 ₽
  • openai/gpt-5.6-terra: Input 276.25 ₽221 ₽ | Output 1657.5 ₽1326 ₽ | LC Input 552.5 ₽442 ₽ | LC Output 2486.25 ₽1989 ₽
  • openai/gpt-5.6-luna: Input 110.5 ₽22.1 ₽ | Output 663 ₽132.6 ₽ | LC Input 221 ₽44.2 ₽ | LC Output 994.5 ₽198.9 ₽
  • deepseek/deepseek-v4-pro: Input 252.45 ₽192.27 ₽ | Output 504.9 ₽384.54 ₽ | Cache Read 21.11 ₽16.575 ₽
  • deepseek/deepseek-r1-distill-llama-70b: Input 107.1 ₽88.4 ₽ | Output 122.4 ₽88.4 ₽
  • moonshotai/kimi-k2.7-code: Input 104.975 ₽98.77 ₽ | Output 442 ₽410.29 ₽
  • moonshotai/kimi-k2.6: Input 136.85 ₽104.97 ₽ | Output 567.8 ₽442 ₽
  • xiaomi/mimo-v2.5: Input 21.25 ₽15.47 ₽ | Output 42.5 ₽30.94 ₽
  • xiaomi/mimo-v2.5-pro: Input 66.3 ₽48.06 ₽ | Output 133.45 ₽96.13 ₽
  • qwen/qwen3.7-plus: Input 35.36 ₽30.49 ₽ | Output 141.44 ₽121.66 ₽

Повышение цен

  • deepseek/deepseek-chat-v3-0324: Input 38.25 ₽55.25 ₽ | Output 153 ₽165.75 ₽
  • meta-llama/llama-3.3-70b-instruct: Input 16.49 ₽24.31 ₽ | Output 48.96 ₽55.25 ₽
  • openai/gpt-oss-20b: Input 4.59 ₽11.05 ₽ | Output 21.42 ₽55.25 ₽

Тарификация длинного контекста (Qwen)

Ранее для моделей Qwen не поддерживалась тарификация в зависимости от размера входного контекста — все запросы рассчитывались по единой ставке. Теперь мы внедрили ценовые пороги (в рублях).

  • qwen3.7-plus (256K–1M): Input 91.27 ₽ | Output 364.76 ₽
  • qwen3-coder-next: (32K–128K) Input 33.04 ₽ / Output 131.73 ₽; (128K–256K) Input 54.92 ₽ / Output 219.40 ₽
  • qwen3-max-2026-01-23 / qwen3-max-thinking: (32K–128K) Input 87.82 ₽ / Output 350.98 ₽; (128K–256K) Input 153.61 ₽ / Output 614.14 ₽
  • qwen3.6-max-preview (128K–256K): Input 315.63 ₽ | Output 1893.68 ₽
  • qwen3-vl-flash: (32K–128K) Input 6.57 ₽ / Output 65.79 ₽; (128K–256K) Input 13.15 ₽ / Output 131.42 ₽
  • qwen3-vl-plus: (32K–128K) Input 33.04 ₽ / Output 329.10 ₽; (128K–256K) Input 65.94 ₽ / Output 658.05 ₽
  • qwen3.5-397b-a17b (128K–256K): Input 65.79 ₽ | Output 394.74 ₽
  • qwen3.5-flash: (128K–256K) Input 17.59 ₽ / Output 175.49 ₽; (256K–1M) Input 26.31 ₽ / Output 263.16 ₽
  • qwen3.5-plus: (128K–256K) Input 43.91 ₽ / Output 263.16 ₽; (256K–1M) Input 87.66 ₽ / Output 526.32 ₽
  • qwen3.6-flash (256K–1M): Input 100.98 ₽ | Output 606.03 ₽
  • qwen3.6-plus (256K–1M): Input 168.45 ₽ | Output 1010.10 ₽