Мой блог
6 бесплатных AI API-шлюзов: доступные модели, лимиты и реальные тесты RPM
Я протестировал шесть публичных API-шлюзов для работы с нейросетями с помощью реальных практических запросов. Главная задача исследования — выяснить, какие бесплатные сервисы действительно дают доступ к современным языковым моделям, сколько токенов или бонусных средств они зачисляют при регистрации и какой лимит запросов в минуту (RPM) показывают на практике.
VyceAI
Сайт: vyceai.com
Формат API: OpenAI-compatible
Базовый URL: https://vyceai.com
Эндпоинты: GET /v1/models (список моделей), POST /v1/chat/completions (отправка запросов)





После создания аккаунта на мой внутренний баланс автоматически начислилось $40. Чтобы открыть доступ к вызову нейросетей через API, сервису требуется обязательная привязка профиля в Discord.
В бесплатной витрине на момент проверки было представлено четыре текстовые модели со следующими расценками и ограничениями:

- gpt-5.6-new: $2 за 1 млн входных / $2 за 1 млн выходных токенов. Лимиты: 50 млн токенов в сутки и 60 запросов в минуту (RPM).
- gpt-5.6-luna: $0.20 за 1 млн входных / $1.20 за 1 млн выходных токенов. Лимит: 60 RPM.
- claude-sonnet-4-6: $3 за 1 млн входных / $15 за 1 млн выходных токенов. Лимит: 60 RPM.
- deepseek-v4-flash: $0.09 за 1 млн входных / $0.18 за 1 млн выходных токенов. Лимит: 60 RPM.
Experiential Labs
Сайт: platform.experientiallabs.ai
Формат API: OpenAI-compatible
Базовый URL: https://api.experientiallabs.ai/v1
Эндпоинты: POST /v1/chat/completions, GET /v1/models
Каталог платформы выглядит масштабным, но плашка FREE в интерфейсе не всегда означает полный бесплатный доступ. В частности, для запуска некоторых нейросетей Experiential Labs просит внести $1 для верификации учетной записи. В итоговый список я включил исключительно те модели, которые мне удалось успешно вызвать без внесения оплаты:

qwen3.8-27bdeepseek-v4-flashgpt-5.6-lunaminimax-m2.7-freeminimax-m3-freeopenrouter-free
Проверка реальных лимитов Experiential Labs
Точный параметр RPM в справочной документации Experiential Labs отсутствует, поэтому я протестировал модель gpt-5.6-luna серией последовательных коротких вызовов.
В первом прогоне сервис успешно обработал 20 из 20 запросов без единой ошибки HTTP 429. На втором этапе было отправлено еще 30 запросов: 29 завершились успешно, 1 зафиксирован с ошибкой сервера, и 0 ответов со статусом 429. Весь процесс занял 74,02 секунды, что соответствует фактической скорости около 24 запросов в минуту.
Практический вывод: модель gpt-5.6-luna стабильно выдерживает нагрузку в районе 24 RPM без срабатывания блокировок rate limit.

Dahl Inference
Сайт: inference.dahl.global
Формат API: OpenAI-compatible
Базовый URL: https://inference.dahl.global/v1
Эндпоинты: POST /v1/chat/completions, GET /v1/models, GET /tokens/current (проверка остатка)
При регистрации сервис зачисляет 100 млн стартовых токенов. Однако они хранятся на общем балансе аккаунта, поэтому перед началом работы их необходимо вручную привязать к конкретному API-ключу через кнопку Allocate.
Через запрос к /v1/models система отдала две доступные модели:

MiniMaxAI/MiniMax-M2.7deepseek-ai/DeepSeek-V4-Flash-0731
Платформа использует точный учет расхода токенов: списание со счета происходит один к одному с фактически обработанным объемом. Например, в тесте MiniMax суммарный размер запроса и ответа составил 63 токена (43 input + 20 output), и с баланса списалось ровно 63 токена. Для DeepSeek один вызов потратил 11 токенов (9 input + 2 output), что также отобразилось в точном списании 11 токенов.
Скорость работы оказалась неоднородной: модель MiniMax M2.7 отдавала ответы примерно за 0,56 секунды. А вот DeepSeek V4 Flash показал задержки — первый запрос отвалился по таймауту HTTP 524, а повторный обрабатывался в течение 37 секунд.
Проверка реальных лимитов Dahl Inference
Так как отдельный параметр RPM в заголовках ответов не передается, я проверил пропускную способность под нагрузкой на модели MiniMax M2.7. Результат тестов: 60 успешных ответов из 60 за 60,86 секунды при списании 2700 токенов. Площадка без проблем выдерживает темп как минимум в 60 RPM.
APInex
Сайт: apinex.bond
Формат API: OpenAI-compatible
Базовый URL: https://api.apinex.bond/v1
Эндпоинты: POST /v1/chat/completions
Даже при стартовом балансе $0.00 шлюз предоставляет бесплатный доступ к пяти моделям из специальной категории:

free/qwen-3.8-maxfree/gpt-5.6-lunafree/glm-5.3-flashfree/deepseek-v4-flash-0731free/deepseek-v4-pro-0813
Проверка реальных лимитов APInex
Сервис транслирует ограничения прямо в стандартных HTTP-заголовках ответа: x-ratelimit-limit: 30, x-ratelimit-remaining и x-ratelimit-reset. Серия из пяти последовательных обращений к разным моделям продемонстрировала уменьшение остатка (29 → 28 → 27 → 26 → 25) с одинаковым таймером сброса. Это означает, что лимит в 30 запросов в минуту действует на весь аккаунт целиком, а не выделяется отдельно под каждую нейросеть.
ModelRouter
Сайт: modelrouter.io
Формат API: OpenAI-compatible
Базовый URL: https://api.modelrouter.io/v1
Эндпоинты: POST /v1/chat/completions, GET /v1/models
Бесплатный тарифный план гарантирует 150 000 внутренних токенов в сутки, которые возобновляются ежедневно в полночь по UTC. Подписка бессрочная. Важно учитывать, что расходы зависят от коэффициента конкретной модели, поэтому 150 000 внутренних токенов не равны реальному количеству входных и выходных токенов.

Через запрос к /v1/models шлюз вернул 59 доступных наименований. Я проверил работу некоторых из них:
- claude-opus-5: работает штатно
- claude-sonnet-5: работает штатно
- kimi-k3: работает штатно
- glm-5.2: работает штатно
- gemini-3.1-pro-preview: возвращает статус HTTP 200, но отдаёт пустой
content - gemini-3.6-flash-thinking: статус HTTP 200 с пустым
content - gpt-5.6-sol: выдает ошибку сервера HTTP 500
- gpt-5.5: выдает ошибку сервера HTTP 500
Жесткий лимит частоты вызовов на бесплатном тарифе составляет 10 запросов в минуту (10 RPM).
TokenForge
Сайт: tokenforge.ai.studio
Формат API: OpenAI-compatible
Базовый URL: https://tokenforge.ai.studio/v1
Эндпоинты: POST /v1/chat/completions, GET /v1/models
При старте платформой начисляется приветственный баланс $50, к которому можно ежедневно добавлять по $20 через функцию Check in. После выполнения первого чек-ина мой общий счет составил $70.
Список /v1/models содержит лишь одну модель: claude-opus-5.
Проверка реальных лимитов TokenForge
Аппаратного ограничения по RPM во время тестов обнаружено не было — при отправке пачки из 60 запросов шлюз не вернул ни одной ошибки HTTP 429. Однако сам сервис пока работает нестабильно: из 60 вызовов успехом завершились лишь 17. То есть явного лимита запросов в минуту нет, но процент ошибок самой модели высокий.
Главные выводы по выбору AI API-шлюзов
Если оценивать шлюзы по совокупности характеристик и результатам тестов, получается следующая картина:
- Dahl Inference — наиболее щедрый сервис по бесплатному объему токенов (100 млн) с быстрой работой MiniMax на скорости 60 RPM.
- APInex — самый понятный и предсказуемый варіант с прозрачным набором бесплатным моделей и отслеживаемым лимитом 30 RPM на аккаунт.
- VyceAI — предлагает солидный стартовый депозит $40 и лимит 60 RPM, но требует обязательно привязывать профиль Discord.
- ModelRouter — интересен бессрочным ежедневным пополнением на 150 000 токенов, но ограничен 10 RPM и имеет проблемы с корректностью отдачи ответов у семейств Gemini и GPT.
- TokenForge — дает приличные бонусы ($50 сразу плюс $20 ежедневно), однако практическое использование затруднено слабой стабильностью нейросети (лишь 17 успешных ответов из 60).
Помните, что провайдеры могут со временем менять условия бесплатных тарифов и перечень доступных нейросетей, поэтому все данные актуальны на момент проведения моих нагрузочных проверок.
Источник: habr.com
