Обновление каталога VseLLM: Gemini 3.7 Flash, провайдер MiniMax и глобальный пересмотр тарифов
Информируем о масштабных обновлениях в каталоге моделей. Мы добавили новых провайдеров, интегрировали актуальные версии нейросетей и провели ревизию стоимости. Все цены ниже указаны за 1 млн токенов (в рублях, по фиксированному курсу 85 ₽ за 1$).
Новые модели и промо-периоды
Добавлена высокоскоростная модель google/gemini-3.7-flash.
google/gemini-3.6-flash и google/gemini-3.7-flash стартовые цены действуют до 31 декабря 2026 года включительно (Input: 82.875 ₽ | Output: 414.375 ₽ | Cache Read: 8.287 ₽). С 1 января 2027 года стоимость вернется к стандартной (Input: 165.75 ₽ | Output: 828.75 ₽ | Cache Read: 16.575 ₽).
Также в каталог добавлены:
- anthropic/claude-fable-5.1
- z-ai/glm-5.3 и z-ai/glm-5.3-flash (действует стартовая скидка 50% до 9 сентября 2026)
- Линейка Qwen: qwen/qwen3.8-flash, qwen/qwen3.8-27b, qwen/qwen3.8-2.4t-a95b
Новый провайдер: MiniMax
В каталог официально добавлен провайдер MiniMax. Теперь для вызова доступны модели: minimax/minimax-m3, minimax/minimax-m2.7 и minimax/minimax-m2.7-highspeed.
Снижение стоимости моделей
- google/gemini-3.6-flash: Input 165.75 ₽ → 82.875 ₽ | Output 828.75 ₽ → 414.375 ₽ | Cache Read 16.575 ₽ → 8.287 ₽
- openai/gpt-5.6-terra: Input 276.25 ₽ → 221 ₽ | Output 1657.5 ₽ → 1326 ₽ | LC Input 552.5 ₽ → 442 ₽ | LC Output 2486.25 ₽ → 1989 ₽
- openai/gpt-5.6-luna: Input 110.5 ₽ → 22.1 ₽ | Output 663 ₽ → 132.6 ₽ | LC Input 221 ₽ → 44.2 ₽ | LC Output 994.5 ₽ → 198.9 ₽
- deepseek/deepseek-v4-pro: Input 252.45 ₽ → 192.27 ₽ | Output 504.9 ₽ → 384.54 ₽ | Cache Read 21.11 ₽ → 16.575 ₽
- deepseek/deepseek-r1-distill-llama-70b: Input 107.1 ₽ → 88.4 ₽ | Output 122.4 ₽ → 88.4 ₽
- moonshotai/kimi-k2.7-code: Input 104.975 ₽ → 98.77 ₽ | Output 442 ₽ → 410.29 ₽
- moonshotai/kimi-k2.6: Input 136.85 ₽ → 104.97 ₽ | Output 567.8 ₽ → 442 ₽
- xiaomi/mimo-v2.5: Input 21.25 ₽ → 15.47 ₽ | Output 42.5 ₽ → 30.94 ₽
- xiaomi/mimo-v2.5-pro: Input 66.3 ₽ → 48.06 ₽ | Output 133.45 ₽ → 96.13 ₽
- qwen/qwen3.7-plus: Input 35.36 ₽ → 30.49 ₽ | Output 141.44 ₽ → 121.66 ₽
Повышение цен
- deepseek/deepseek-chat-v3-0324: Input 38.25 ₽ → 55.25 ₽ | Output 153 ₽ → 165.75 ₽
- meta-llama/llama-3.3-70b-instruct: Input 16.49 ₽ → 24.31 ₽ | Output 48.96 ₽ → 55.25 ₽
- openai/gpt-oss-20b: Input 4.59 ₽ → 11.05 ₽ | Output 21.42 ₽ → 55.25 ₽
Тарификация длинного контекста (Qwen)
Ранее для моделей Qwen не поддерживалась тарификация в зависимости от размера входного контекста — все запросы рассчитывались по единой ставке. Теперь мы внедрили ценовые пороги (в рублях).
- qwen3.7-plus (256K–1M): Input 91.27 ₽ | Output 364.76 ₽
- qwen3-coder-next: (32K–128K) Input 33.04 ₽ / Output 131.73 ₽; (128K–256K) Input 54.92 ₽ / Output 219.40 ₽
- qwen3-max-2026-01-23 / qwen3-max-thinking: (32K–128K) Input 87.82 ₽ / Output 350.98 ₽; (128K–256K) Input 153.61 ₽ / Output 614.14 ₽
- qwen3.6-max-preview (128K–256K): Input 315.63 ₽ | Output 1893.68 ₽
- qwen3-vl-flash: (32K–128K) Input 6.57 ₽ / Output 65.79 ₽; (128K–256K) Input 13.15 ₽ / Output 131.42 ₽
- qwen3-vl-plus: (32K–128K) Input 33.04 ₽ / Output 329.10 ₽; (128K–256K) Input 65.94 ₽ / Output 658.05 ₽
- qwen3.5-397b-a17b (128K–256K): Input 65.79 ₽ | Output 394.74 ₽
- qwen3.5-flash: (128K–256K) Input 17.59 ₽ / Output 175.49 ₽; (256K–1M) Input 26.31 ₽ / Output 263.16 ₽
- qwen3.5-plus: (128K–256K) Input 43.91 ₽ / Output 263.16 ₽; (256K–1M) Input 87.66 ₽ / Output 526.32 ₽
- qwen3.6-flash (256K–1M): Input 100.98 ₽ | Output 606.03 ₽
- qwen3.6-plus (256K–1M): Input 168.45 ₽ | Output 1010.10 ₽