Как устроен бесплатный LLM API

LLM означает large language model, большую языковую модель. Приложение отправляет ей запрос через API и получает ответ. Генерацию называют inference.

Разработчик модели и поставщик API могут различаться. Mistral предоставляет свои модели, Groq и Cloudflare запускают чужие, OpenRouter объединяет поставщиков. Сравнивайте условия конкретного сервиса, а не только название нейросети.

  • Бесплатный уровень, free tier: доступ без оплаты в рамках установленных ограничений.
  • Пробные кредиты, trial credits: ограниченный бюджет на знакомство с платформой.
  • Локальная модель: нет платы поставщику за генерацию, но остаются расходы на оборудование и обслуживание.

Free LLM API: сравнение сервисов и стоимости старта

Условия проверены на 26.09.2026 по документации, без собственных замеров скорости. Бесплатную квоту и временный бюджет сравнивайте отдельно.

Free LLM API: сравнение сервисов и стоимости старта
СервисЧто можно попробоватьЧто проверить перед запуском
OpenRouterРазные бесплатные модели, суффикс :free20 запросов в минуту; 50 в сутки, до 1 000 при пополнении счёта от 10 долларов
GroqFree Plan, модель openai/gpt-oss-20b30 запросов в минуту; 1 000 в сутки; 8 000 токенов в минуту
Cloudflare Workers AI10 000 Neurons в сутки без оплатыНекоторым моделям нужен Workers Paid или предоплаченные кредиты AI Gateway
MistralFree mode с включённым месячным объёмомОбъём общий для Studio, API и Vibe Code; проверяется в аккаунте
Google Gemini APIДля России исключён из выбораРоссия отсутствует в официальном списке поддерживаемых регионов
Yandex CloudСтартовый грант для подходящего нового аккаунтаПраво на грант, срок действия и способ оплаты
CerebrasFree Trial: 5 долларов на 30 днейНужен подтверждённый способ оплаты; постоянного бесплатного тарифа нет

OpenRouter: один API для сравнения нейросетей

OpenRouter объединяет модели разных поставщиков одним API. Для бесплатного вызова выбирайте идентификатор с суффиксом :free, например meta-llama/llama-3.3-70b-instruct:free. Каталог меняется, поэтому перед запуском сверяйте доступность модели.

На сентябрь 2026 года доступны 20 запросов в минуту и 50 в сутки. Покупка кредитов на сумму от 10 долларов повышает дневной предел до 1 000. Это платное условие расширения квоты, а не обязательный шаг бесплатного старта.

Совместимый формат OpenAI API не гарантирует поддержку изображений, инструментов и структурированного ответа. Проверяйте возможности выбранной модели.

Groq: бесплатный API и ограничения частоты

На сентябрь 2026 года Groq Free Plan включает модели gpt-oss и Qwen. Для openai/gpt-oss-20b действует 30 запросов в минуту и 1 000 в сутки. Дополнительно ограничен объём токенов: 8 000 в минуту и 200 000 в сутки.

Пределы относятся к указанной модели. Длинный документ может исчерпать минутную квоту при свободном дневном остатке.

Cloudflare Workers AI: бесплатная квота вычислений

Cloudflare измеряет расход в Neurons, условных единицах вычислений. На сентябрь 2026 года бесплатно выделяют 10 000 Neurons в сутки. Это не число сообщений: расход зависит от выбранной нейросети и объёма обработки.

В каталоге есть Llama, Qwen, DeepSeek, gpt-oss, Mistral Small 3.1 и GLM-4.7-Flash. Некоторым моделям нужен Workers Paid или предоплаченные кредиты AI Gateway. Расход Neurons зависит от модели и объёма входа и выхода.

Лимит обновляется в 00:00 UTC. На плане Workers Free сверх лимита новые запросы прекращаются до сброса счётчика. На платном Workers Paid бесплатная квота остаётся той же, а расход сверх неё оплачивается отдельно.

Mistral: Free mode и общий месячный объём

На сентябрь 2026 года новым аккаунтам Mistral доступен Free mode. Включённый месячный объём общий для Studio, API и Vibe Code. Всеобщей платы с первого запроса нет.

Остаток смотрите в Subscription. Единую сумму бесплатных API-кредитов не обещаем. Старые таблицы с миллиардом токенов не заменяют условия аккаунта.

При включённом pay-as-you-go расход сверх месячного объёма оплачивается за токены. Без него доступ может остановиться до следующего расчётного периода.

Gemini и GitHub Models: почему старый список не гарантирует доступ

Gemini API официально недоступен в России; рассмотрите YandexGPT или GigaChat. Для проекта в поддерживаемой стране проверяйте условия выбранной модели отдельно.

GitHub Models закрыт с 30 июля 2026 года. Его каталог, площадка для тестов и inference API больше недоступны. Поэтому старые подборки с бесплатными лимитами GitHub Models нельзя использовать как инструкцию подключения.

Перед регистрацией проверьте регион, подтверждение личности и способ оплаты. Доступ к чату в браузере не подтверждает доступ через API.

Пробные кредиты и стартовый грант Yandex Cloud

Грант Yandex Cloud покрывает начальные расходы, но не является постоянным бесплатным тарифом. На сентябрь 2026 года личному аккаунту резидента РФ доступно от 4 000 рублей на 60 дней.

Для личного аккаунта привяжите карту при создании первого платёжного аккаунта. Ранее нельзя покупать услуги облака или активировать пробный период. Грант однократный, в том числе для бизнеса того же владельца.

Личный грант не покрывает GPU-кластеры, Postbox, платную поддержку и платные продукты Маркетплейса. Для бизнес-аккаунтов РФ действуют отдельные условия: 4 000 рублей при оплате картой или 10 000 рублей при банковском переводе.

Банковский перевод допускает оплату любых сервисов облака. При тесте YandexGPT учитывайте расходы гранта на другие сервисы.

Cerebras: бесплатный доступ и срок действия лимитов

На сентябрь 2026 года Cerebras предоставляет Free Trial: 5 долларов после добавления подтверждённого способа оплаты. Кредиты действуют 30 дней. Без способа оплаты API и площадка для тестов остаются недоступными.

Для gpt-oss-120b доступны 5 запросов в минуту, 30 000 некэшированных и 90 000 общих токенов в минуту. Часовой и суточный пределы: по 1 млн токенов.

После исчерпания или окончания срока кредитов доступ останавливается до покупки новых. Возобновляемого бесплатного тарифа нет. Точные ограничения организации смотрите в Limits.

Как подключить бесплатный API к приложению

Пример Python использует стандартную библиотеку. Задайте OPENROUTER_API_KEY в окружении процесса. Без переменной программа остановится до запроса. Timeout 60 задаёт выбранное нами ожидание в секундах.

В Chat Completions поле model задаёт модель, messages содержит историю сообщений. Поле role указывает автора реплики, content содержит текст. Ответ находится в choices[0].message.content.

Сохраните пример как example.py в UTF-8 и выполните python example.py. Сначала проверьте доступность модели в каталоге. Пример отправляет один запрос; приложению также нужна обработка отказов.

  1. Выберите доступный в вашей стране сервис и модель.
  2. Создайте ключ в разделе API Keys; раздел models нужен для выбора модели.
  3. Храните ключ в окружении сервера, исключите его из кода страницы и репозитория.
  4. Отправьте запрос по HTTPS и проверьте ответ, квоту и расход.
  5. Добавьте очередь, ограниченные повторы и уведомление об исчерпании квоты.
import json
import os
from urllib.request import Request, urlopen

body = {
    "model": "meta-llama/llama-3.3-70b-instruct:free",
    "messages": [{"role": "user", "content": "Объясните простыми словами: что такое API"}],
}
request = Request(
    "https://openrouter.ai/api/v1/chat/completions",
    data=json.dumps(body).encode("utf-8"),
    headers={
        "Authorization": "Bearer " + os.environ["OPENROUTER_API_KEY"],
        "Content-Type": "application/json",
    },
)
with urlopen(request, timeout=60) as response:
    result = json.load(response)
print(result["choices"][0]["message"]["content"])

Лимиты, задержка и ошибки API

Токен может быть частью слова, словом или знаком. Контекстное окно ограничивает объём истории и ответа. Проверяйте его отдельно от RPM и TPM.

При превышении квоты Groq возвращает HTTP code 429. Заголовок retry-after указывает задержку до повтора. Ограничьте число попыток; при суточном лимите частые повторы бессмысленны. Сначала выясните, какое ограничение сработало.

Остальные ошибки разбирайте по телу ответа и документации поставщика. Неверный ключ повторами не исправить. При сетевом сбое сохраните задачу.

Лимиты, задержка и ошибки API
ТерминЧто означаетКак использовать при выборе
RPM, requests per minuteКоличество запросов в минутуОцените нагрузку в часы пика
RPD, requests per dayКоличество запросов в суткиСравните с ожидаемым дневным объёмом
TPM, tokens per minuteОбъём текста за минутуУчтите длинные документы и историю диалога
Time to first tokenОжидание начала ответаИзмерьте комфортную задержку для посетителя
UsageСведения о потребленииСопоставьте расход с длиной задания
MultimodalРабота с несколькими видами данныхПроверьте нужный формат: текст, изображение или звук

Как проверить посредника и работоспособность модели

Каталог не доказывает доступность модели вашему аккаунту. У посредника выясните поставщика генерации и получателя данных. Уточните, закреплена ли модель за маршрутом или выбирается автоматически.

В политике данных проверьте хранение запросов и обучение. Строка «Used to improve our products» означает использование данных для улучшения продуктов. Читайте пояснения к Yes и No; тестируйте на вымышленных обращениях.

  • Запишите дату, сервис, точный model ID, доступную квоту и баланс перед тестом.
  • Отправьте одинаковые задания: короткий вопрос, длинный документ и запрос на JSON с заданными полями.
  • Сохраните код HTTP, задержку, расход из usage и изменение баланса. Ключ и тексты клиентов в журнал не записывайте.
  • Повторите задания в пределах разрешённых лимитов. Отдельно отметьте ошибки, обрывы ответа и случаи смены модели.
  • Проверьте восстановление после отказа и правило обновления квоты. Успешный единичный ответ не доказывает суточный лимит или стабильность сервиса.

Какой free API выбрать под вашу задачу

Оцените качество, задержку и разрешённое коммерческое использование. Перед изменением сведений в CRM проверяйте результат: бесплатность не гарантирует точность.

Платный бюджет считайте по входным и выходным токенам на задачу и ожидаемому числу задач. Добавьте повторы, сервер и хранение.

  • Сравнение моделей: OpenRouter, если подходит регион и хватает дневной квоты.
  • Чат с короткими ответами: Groq как кандидат для замеров задержки на ваших заданиях.
  • Приложение в Cloudflare: Workers AI с учётом расхода Neurons и доступа к выбранной модели.
  • Знакомство с моделями Mistral: Free mode после проверки включённого объёма в аккаунте.
  • Разовый тест Cerebras: Free Trial, если подходит способ оплаты и ограниченный срок кредитов.
  • Российский проект: YandexGPT с проверкой права на грант; закрытые документы можно обрабатывать локально при подходящей лицензии модели.

От прототипа к ИИ-агенту на сайте

Для внедрения посмотрите услугу «разработка ИИ-агентов»: /uslugi/ii-agenty/. Подготовьте примеры обращений, желаемый результат и список систем.

seosite1 делает сайты с 2009 года и работает удалённо по всей России. Каждое решение и цифру проверяет человек. Итоговую цену и сроки называем после брифа.

Источники

  1. OpenRouter: бесплатные модели, лимиты и пример запроса
  2. Groq: квоты бесплатного уровня и ошибки
  3. Cloudflare Workers AI: стоимость и бесплатный объём
  4. Mistral: Free mode, месячный объём и оплата сверх него
  5. GitHub: прекращение работы GitHub Models
  6. Google: поддерживаемые регионы
  7. Yandex Cloud: условия стартового гранта
  8. Cerebras: лимиты Free Trial