Двадцать шестого августа 2026 года Timeweb Cloud сообщил, что его сервис AI Gateway дорос почти до 70 моделей, доступных через единый API. По данным компании, за август число пользователей сервиса выросло на 40 процентов.
Что произошло
AI Gateway это шлюз, который отдаёт разные ИИ-модели через один совместимый с OpenAI интерфейс. Разработчику не нужно заводить отдельный ключ и договор на каждую модель: он указывает один базовый адрес и ключ, а дальше обращается к любой из подключённых моделей. Совместимость с OpenAI API означает, что сервис можно подставить в готовые инструменты, например в ИИ-ассистенты для кода Cline, Codex и OpenCode, без переписывания кода.
Тарификация идёт по токенам, по факту использования: вы платите за реально отправленные и полученные токены, а не за постоянно выделенный GPU-сервер. Продуктовый лид Timeweb Cloud Илья Копыт описал логику так: «AI Gateway становится единой точкой входа, централизуя маршрутизацию запросов, управление лимитами и политики безопасности». По его словам, на этот сервис уже приходится половина выручки ИИ-направления компании.
Что доступно через шлюз
Через единый API компания открыла несколько групп возможностей:
- генерация текста и кода
- генерация изображений (GPT Image 2, Gemini 3 Pro Image Preview)
- синтез и распознавание речи (GPT-4o mini TTS, GPT-4o mini Transcribe, GPT-4o Transcribe)
- инференс открытых моделей, которые можно запускать и на своём сервере (Qwen 3 235B Instruct, Kimi K2.6, GLM 5.2)
Набор закрывает типовые задачи бизнеса: автоматизацию поддержки, генерацию контента, голосовые интерфейсы, расшифровку звонков, быстрый запуск проектов в e-commerce и смежных нишах.
Что это значит, если вы выбираете сервер
Главное, что стоит понимать: шлюз к моделям не заменяет сервер, а дополняет его. Ваше приложение, бот или бэкенд всё равно где-то работают, и этим местом обычно остаётся VPS. Реалистичная схема выглядит так: лёгкий сервер под саму программу плюс обращения к шлюзу за инференсом. Если вы собираете бота или бэкенд с вызовами моделей, отталкивайтесь от нагрузки самого приложения: посчитать конфигурацию можно в подборе под ИИ или под Telegram-бота.
Альтернатива шлюзу это собственный GPU-сервер, на котором вы сами поднимаете открытую модель, ту же Qwen или GLM. Здесь стоимость фиксированная и не зависит от числа запросов, зато вы полностью контролируете данные и задержку. Ориентир простой: при переменной или небольшой нагрузке тарификация по токенам обычно выходит выгоднее простаивающего ускорителя, а при стабильно высоком потоке запросов собственный GPU-сервер становится предсказуемее по расходам. Точку перехода считайте на своих числах: объём токенов в месяц против аренды GPU-сервера, способного тянуть выбранную модель.
Отдельно про юрисдикцию данных. Часть моделей в шлюзе зарубежные, и запрос к ним уходит за пределы российского контура. Если вы обрабатываете персональные данные и обязаны держать их в России по 152-ФЗ, для таких сценариев ближе вариант с открытой моделью на сервере в РФ, где данные не покидают вашу инфраструктуру. Для остальных задач, где чувствительных данных нет, удобство единого API часто перевешивает.
Раскрытие
С Timeweb Cloud у нас партнёрские отношения: если вы оформите услугу по нашей ссылке, мы получим вознаграждение, а цена для вас не изменится. На позицию провайдера в подборе это не влияет, формула подбора опубликована целиком.
Материал не заказан и не оплачен провайдером. Данные о запуске взяты из публикации CNews от 26 августа 2026 года и из заявлений компании.