Какой LLM leaderboard выбрать

Единого рейтинга качества нет: площадки измеряют разные свойства. Хороший собеседник не обязательно лучше пишет код или дешевле обрабатывает документы.

Какой LLM leaderboard выбрать
ПлощадкаЧто показываетКак использовать
Arena, arena.aiПредпочтения людей в парных сравненияхВыберите категорию и проверьте неопределённость оценки
Artificial AnalysisIntelligence Index, стоимость задания, скорость и контекстОтберите кандидатов для приложения
LLM StatsОбщий Score и отдельные оценки Reasoning, Coding, AgentСопоставьте общий результат с нужной категорией
VellumТесты и раздел Compare modelsВыберите испытание под рабочую задачу
OpenRouter RankingsОбъём токенов через платформу; Benchmarks вынесены отдельноОцените использование моделей, а не точность ответов

Какие модели лидируют на сентябрь 2026 года

Срез проверен 26.09.2026. Ниже лидеры Artificial Analysis по отдельным критериям.

В таблицах встречаются GPT от OpenAI, Claude от Anthropic, Gemini от Google и DeepSeek. Сохраняйте полное название и режим участника.

Какие модели лидируют на сентябрь 2026 года
КритерийЛидер в источникеПоказатель
Intelligence IndexClaude Opus 5.5 (max with fallback)58 баллов
Output SpeedCeleris-11628,3 токена в секунду
LatencyGemini 2.5 Flash-Lite (Non-reasoning) и North Mini CodeНаименьшая задержка
Cost per TaskGPT-6 Luna (low)0,0045 доллара за задание индекса
Открытые веса, Intelligence IndexMiMo-V2.6-Pro46 баллов
Context WindowLlama 4 Scout и Grok 4.20 0309Указаны среди лидеров по объёму контекста

Как читать баллы и фильтровать таблицу

На Artificial Analysis задайте Weights, Price, Reasoning и Status. Затем откройте Model для деталей или Providers для сравнения поставщиков.

DeepSeek V4 Pro и V4.1 Flash идут отдельными строками. Пропуск оценки не означает нулевое качество.

LLM Stats объединяет сопоставимые результаты тестов с учётом неопределённости. Недостающие измерения не считает поражениями; данные разработчика отделяет от проверенных площадкой.

Как читать баллы и фильтровать таблицу
ОбозначениеКак читать
Model / ScoreТочная конфигурация и балл по методике площадки
Rank Spread / Votes в ArenaДиапазон возможной позиции и число голосов
Context / 1MОбъём контекста; 1M означает миллион токенов
Input / Output PriceРаздельные ставки за вход и выход; проверьте единицу расчёта

Цена, скорость и размер контекста

При оплате API за токены учитывайте входной текст и ответ отдельно. Добавьте повторные запросы, инструменты и проверку специалистом.

Стоимость принятого результата считайте так: все затраты на обработку разделите на число заданий, прошедших проверку.

Output Speed показывает скорость генерации. Time to First Token, или TTFT, измеряет ожидание первого токена. Отдельно замерьте полное время ответа.

Не путайте токены и символы в секунду: tok/s и c/s обозначают разные единицы. Сравнивайте одинаковые режимы у конкретного поставщика.

Context Window обозначает общий предел входных и выходных токенов. У длины ответа обычно есть отдельное ограничение.

LLM Arena: мнение людей и русский язык

На arena.ai пользователь сравнивает анонимные ответы. Названия раскрываются после выбора; рейтинг рассчитывается по модели Брэдли-Терри.

В официальный зачёт входят голоса до раскрытия названий. В Side by Side вы выбираете участников сами; голоса не меняют публичный рейтинг.

В Text Arena за 25 сентября 2026 года первым указан claude-opus-5.5-high: 1509 баллов, погрешность ±12, 2307 голосов.

Его Rank Spread составляет от 1 до 10. При такой неопределённости нельзя объявлять его безусловно лучшим.

По запросу LLM Arena встречается и llmarena.ru, отдельная площадка тестирования на русском языке. Её результаты нельзя объединять с arena.ai.

Для проверки русского языка попросите объяснить условия возврата по вашему документу. Проверьте, не добавлены ли выдуманные обещания.

Какие бенчмарки нужны для вашей задачи

Бенчмарк, или benchmark, это набор заданий для оценки навыков. Общий балл скрывает различия между ними.

В Vellum раздел Best in Reasoning показывает результаты рассуждений, Best for Work Automations посвящён рабочей автоматизации.

Какие бенчмарки нужны для вашей задачи
Тест в VellumЧто проверяется
Humanity's Last ExamСложные вопросы из разных областей знаний
GPQA DiamondНаучные вопросы по физике, химии и биологии
SWE-benchИсправление реальных задач из репозиториев GitHub
AutoBenchРабочие процессы с инструментами и несколькими шагами
OSWorldВыполнение действий через интерфейс компьютера
BrowseCompПоиск информации в интернете
Terminal-BenchРабота с командами и инструментами терминала

Открытые модели и собственный сервер

Open weights означает доступность весов. Для коммерческого использования проверьте лицензию выбранного выпуска.

Для обозначения open source одних весов недостаточно: уточните доступность кода, данных и условия использования.

Для своего сервера оцените память, одновременные запросы и обслуживание. Сравнивайте с API по одинаковому объёму принятой работы.

Ошибки при сравнении нейросетей

  1. Смешивать измерения площадки с заявлениями разработчика. Ищите исходный отчёт, настройки и отметку независимой проверки.
  2. Опираться на знакомые тестовые задания. Добавьте собственные примеры, чтобы проверить перенос навыка на новую задачу.
  3. Принимать красивый ответ за правильный. Перепроверьте утверждения по исходному документу.
  4. Оценивать только успехи. Включите неоднозначные вопросы, ошибки во входных данных и отсутствие нужной информации.
  5. Путать популярность с качеством. OpenRouter считает токены; длина ответов тоже влияет на позицию.
  6. Забывать про подключение. До оплаты проверьте доступность сервиса в вашей стране и правила обработки данных.

Как провести своё сравнение

  1. Опишите критерии приёмки: верные поля документа, работающий код или ответ покупателю.
  2. Соберите обычные и сложные задания. Удалите конфиденциальные сведения из примеров для публичных площадок.
  3. Задайте одинаковые инструкции, данные, доступные инструменты и лимиты.
  4. Запишите версию, режим, поставщика, расходы, время и ошибки. Повторите задания, чтобы увидеть разброс оценок.
  5. Попросите специалиста оценить ответы без названий участников. Отдельно отметьте фактические ошибки и нарушения формата.
  6. Выберите решение по стоимости принятого результата. После обновлений повторяйте контрольные задания.

Внедрение ИИ в бизнес

Услуга «Внедрение ИИ в бизнес»: /uslugi/vnedrenie-ii/. Для брифа подготовьте описание процесса и примеры заданий.

В seosite1 проект ведёт руководитель с опытом с 2009 года. ИИ-агенты работают под его контролем, решения и цифры проверяет человек.

Цена после брифа. Работаем удалённо по всей России.

Источники

  1. Arena: методика и режимы сравнения
  2. Arena: текстовый рейтинг за 25 сентября 2026 года
  3. Artificial Analysis: лидеры и показатели, проверено 26.09.2026
  4. LLM Stats: методика сводной оценки
  5. Vellum: сравнение моделей и словарь тестов
  6. OpenRouter: методика рейтингов использования
  7. LLM Arena: тестирование на русском языке
  8. SWE-bench: варианты тестов и результаты