Как устроен бесплатный LLM API
LLM означает large language model, большую языковую модель. Приложение отправляет ей запрос через API и получает ответ. Генерацию называют inference.
Разработчик модели и поставщик API могут различаться. Mistral предоставляет свои модели, Groq и Cloudflare запускают чужие, OpenRouter объединяет поставщиков. Сравнивайте условия конкретного сервиса, а не только название нейросети.
- Бесплатный уровень, free tier: доступ без оплаты в рамках установленных ограничений.
- Пробные кредиты, trial credits: ограниченный бюджет на знакомство с платформой.
- Локальная модель: нет платы поставщику за генерацию, но остаются расходы на оборудование и обслуживание.
Free LLM API: сравнение сервисов и стоимости старта
Условия проверены на 26.09.2026 по документации, без собственных замеров скорости. Бесплатную квоту и временный бюджет сравнивайте отдельно.
| Сервис | Что можно попробовать | Что проверить перед запуском |
|---|---|---|
| OpenRouter | Разные бесплатные модели, суффикс :free | 20 запросов в минуту; 50 в сутки, до 1 000 при пополнении счёта от 10 долларов |
| Groq | Free Plan, модель openai/gpt-oss-20b | 30 запросов в минуту; 1 000 в сутки; 8 000 токенов в минуту |
| Cloudflare Workers AI | 10 000 Neurons в сутки без оплаты | Некоторым моделям нужен Workers Paid или предоплаченные кредиты AI Gateway |
| Mistral | Free mode с включённым месячным объёмом | Объём общий для Studio, API и Vibe Code; проверяется в аккаунте |
| Google Gemini API | Для России исключён из выбора | Россия отсутствует в официальном списке поддерживаемых регионов |
| Yandex Cloud | Стартовый грант для подходящего нового аккаунта | Право на грант, срок действия и способ оплаты |
| Cerebras | Free Trial: 5 долларов на 30 дней | Нужен подтверждённый способ оплаты; постоянного бесплатного тарифа нет |
OpenRouter: один API для сравнения нейросетей
OpenRouter объединяет модели разных поставщиков одним API. Для бесплатного вызова выбирайте идентификатор с суффиксом :free, например meta-llama/llama-3.3-70b-instruct:free. Каталог меняется, поэтому перед запуском сверяйте доступность модели.
На сентябрь 2026 года доступны 20 запросов в минуту и 50 в сутки. Покупка кредитов на сумму от 10 долларов повышает дневной предел до 1 000. Это платное условие расширения квоты, а не обязательный шаг бесплатного старта.
Совместимый формат OpenAI API не гарантирует поддержку изображений, инструментов и структурированного ответа. Проверяйте возможности выбранной модели.
Groq: бесплатный API и ограничения частоты
На сентябрь 2026 года Groq Free Plan включает модели gpt-oss и Qwen. Для openai/gpt-oss-20b действует 30 запросов в минуту и 1 000 в сутки. Дополнительно ограничен объём токенов: 8 000 в минуту и 200 000 в сутки.
Пределы относятся к указанной модели. Длинный документ может исчерпать минутную квоту при свободном дневном остатке.
Cloudflare Workers AI: бесплатная квота вычислений
Cloudflare измеряет расход в Neurons, условных единицах вычислений. На сентябрь 2026 года бесплатно выделяют 10 000 Neurons в сутки. Это не число сообщений: расход зависит от выбранной нейросети и объёма обработки.
В каталоге есть Llama, Qwen, DeepSeek, gpt-oss, Mistral Small 3.1 и GLM-4.7-Flash. Некоторым моделям нужен Workers Paid или предоплаченные кредиты AI Gateway. Расход Neurons зависит от модели и объёма входа и выхода.
Лимит обновляется в 00:00 UTC. На плане Workers Free сверх лимита новые запросы прекращаются до сброса счётчика. На платном Workers Paid бесплатная квота остаётся той же, а расход сверх неё оплачивается отдельно.
Mistral: Free mode и общий месячный объём
На сентябрь 2026 года новым аккаунтам Mistral доступен Free mode. Включённый месячный объём общий для Studio, API и Vibe Code. Всеобщей платы с первого запроса нет.
Остаток смотрите в Subscription. Единую сумму бесплатных API-кредитов не обещаем. Старые таблицы с миллиардом токенов не заменяют условия аккаунта.
При включённом pay-as-you-go расход сверх месячного объёма оплачивается за токены. Без него доступ может остановиться до следующего расчётного периода.
Gemini и GitHub Models: почему старый список не гарантирует доступ
Gemini API официально недоступен в России; рассмотрите YandexGPT или GigaChat. Для проекта в поддерживаемой стране проверяйте условия выбранной модели отдельно.
GitHub Models закрыт с 30 июля 2026 года. Его каталог, площадка для тестов и inference API больше недоступны. Поэтому старые подборки с бесплатными лимитами GitHub Models нельзя использовать как инструкцию подключения.
Перед регистрацией проверьте регион, подтверждение личности и способ оплаты. Доступ к чату в браузере не подтверждает доступ через API.
Пробные кредиты и стартовый грант Yandex Cloud
Грант Yandex Cloud покрывает начальные расходы, но не является постоянным бесплатным тарифом. На сентябрь 2026 года личному аккаунту резидента РФ доступно от 4 000 рублей на 60 дней.
Для личного аккаунта привяжите карту при создании первого платёжного аккаунта. Ранее нельзя покупать услуги облака или активировать пробный период. Грант однократный, в том числе для бизнеса того же владельца.
Личный грант не покрывает GPU-кластеры, Postbox, платную поддержку и платные продукты Маркетплейса. Для бизнес-аккаунтов РФ действуют отдельные условия: 4 000 рублей при оплате картой или 10 000 рублей при банковском переводе.
Банковский перевод допускает оплату любых сервисов облака. При тесте YandexGPT учитывайте расходы гранта на другие сервисы.
Cerebras: бесплатный доступ и срок действия лимитов
На сентябрь 2026 года Cerebras предоставляет Free Trial: 5 долларов после добавления подтверждённого способа оплаты. Кредиты действуют 30 дней. Без способа оплаты API и площадка для тестов остаются недоступными.
Для gpt-oss-120b доступны 5 запросов в минуту, 30 000 некэшированных и 90 000 общих токенов в минуту. Часовой и суточный пределы: по 1 млн токенов.
После исчерпания или окончания срока кредитов доступ останавливается до покупки новых. Возобновляемого бесплатного тарифа нет. Точные ограничения организации смотрите в Limits.
Как подключить бесплатный API к приложению
Пример Python использует стандартную библиотеку. Задайте OPENROUTER_API_KEY в окружении процесса. Без переменной программа остановится до запроса. Timeout 60 задаёт выбранное нами ожидание в секундах.
В Chat Completions поле model задаёт модель, messages содержит историю сообщений. Поле role указывает автора реплики, content содержит текст. Ответ находится в choices[0].message.content.
Сохраните пример как example.py в UTF-8 и выполните python example.py. Сначала проверьте доступность модели в каталоге. Пример отправляет один запрос; приложению также нужна обработка отказов.
- Выберите доступный в вашей стране сервис и модель.
- Создайте ключ в разделе API Keys; раздел models нужен для выбора модели.
- Храните ключ в окружении сервера, исключите его из кода страницы и репозитория.
- Отправьте запрос по HTTPS и проверьте ответ, квоту и расход.
- Добавьте очередь, ограниченные повторы и уведомление об исчерпании квоты.
import json
import os
from urllib.request import Request, urlopen
body = {
"model": "meta-llama/llama-3.3-70b-instruct:free",
"messages": [{"role": "user", "content": "Объясните простыми словами: что такое API"}],
}
request = Request(
"https://openrouter.ai/api/v1/chat/completions",
data=json.dumps(body).encode("utf-8"),
headers={
"Authorization": "Bearer " + os.environ["OPENROUTER_API_KEY"],
"Content-Type": "application/json",
},
)
with urlopen(request, timeout=60) as response:
result = json.load(response)
print(result["choices"][0]["message"]["content"])
Лимиты, задержка и ошибки API
Токен может быть частью слова, словом или знаком. Контекстное окно ограничивает объём истории и ответа. Проверяйте его отдельно от RPM и TPM.
При превышении квоты Groq возвращает HTTP code 429. Заголовок retry-after указывает задержку до повтора. Ограничьте число попыток; при суточном лимите частые повторы бессмысленны. Сначала выясните, какое ограничение сработало.
Остальные ошибки разбирайте по телу ответа и документации поставщика. Неверный ключ повторами не исправить. При сетевом сбое сохраните задачу.
| Термин | Что означает | Как использовать при выборе |
|---|---|---|
| RPM, requests per minute | Количество запросов в минуту | Оцените нагрузку в часы пика |
| RPD, requests per day | Количество запросов в сутки | Сравните с ожидаемым дневным объёмом |
| TPM, tokens per minute | Объём текста за минуту | Учтите длинные документы и историю диалога |
| Time to first token | Ожидание начала ответа | Измерьте комфортную задержку для посетителя |
| Usage | Сведения о потреблении | Сопоставьте расход с длиной задания |
| Multimodal | Работа с несколькими видами данных | Проверьте нужный формат: текст, изображение или звук |
Как проверить посредника и работоспособность модели
Каталог не доказывает доступность модели вашему аккаунту. У посредника выясните поставщика генерации и получателя данных. Уточните, закреплена ли модель за маршрутом или выбирается автоматически.
В политике данных проверьте хранение запросов и обучение. Строка «Used to improve our products» означает использование данных для улучшения продуктов. Читайте пояснения к Yes и No; тестируйте на вымышленных обращениях.
- Запишите дату, сервис, точный model ID, доступную квоту и баланс перед тестом.
- Отправьте одинаковые задания: короткий вопрос, длинный документ и запрос на JSON с заданными полями.
- Сохраните код HTTP, задержку, расход из usage и изменение баланса. Ключ и тексты клиентов в журнал не записывайте.
- Повторите задания в пределах разрешённых лимитов. Отдельно отметьте ошибки, обрывы ответа и случаи смены модели.
- Проверьте восстановление после отказа и правило обновления квоты. Успешный единичный ответ не доказывает суточный лимит или стабильность сервиса.
Какой free API выбрать под вашу задачу
Оцените качество, задержку и разрешённое коммерческое использование. Перед изменением сведений в CRM проверяйте результат: бесплатность не гарантирует точность.
Платный бюджет считайте по входным и выходным токенам на задачу и ожидаемому числу задач. Добавьте повторы, сервер и хранение.
- Сравнение моделей: OpenRouter, если подходит регион и хватает дневной квоты.
- Чат с короткими ответами: Groq как кандидат для замеров задержки на ваших заданиях.
- Приложение в Cloudflare: Workers AI с учётом расхода Neurons и доступа к выбранной модели.
- Знакомство с моделями Mistral: Free mode после проверки включённого объёма в аккаунте.
- Разовый тест Cerebras: Free Trial, если подходит способ оплаты и ограниченный срок кредитов.
- Российский проект: YandexGPT с проверкой права на грант; закрытые документы можно обрабатывать локально при подходящей лицензии модели.
От прототипа к ИИ-агенту на сайте
Для внедрения посмотрите услугу «разработка ИИ-агентов»: /uslugi/ii-agenty/. Подготовьте примеры обращений, желаемый результат и список систем.
seosite1 делает сайты с 2009 года и работает удалённо по всей России. Каждое решение и цифру проверяет человек. Итоговую цену и сроки называем после брифа.
Источники
- OpenRouter: бесплатные модели, лимиты и пример запроса
- Groq: квоты бесплатного уровня и ошибки
- Cloudflare Workers AI: стоимость и бесплатный объём
- Mistral: Free mode, месячный объём и оплата сверх него
- GitHub: прекращение работы GitHub Models
- Google: поддерживаемые регионы
- Yandex Cloud: условия стартового гранта
- Cerebras: лимиты Free Trial