Какой LLM leaderboard выбрать
Единого рейтинга качества нет: площадки измеряют разные свойства. Хороший собеседник не обязательно лучше пишет код или дешевле обрабатывает документы.
| Площадка | Что показывает | Как использовать |
|---|---|---|
| Arena, arena.ai | Предпочтения людей в парных сравнениях | Выберите категорию и проверьте неопределённость оценки |
| Artificial Analysis | Intelligence Index, стоимость задания, скорость и контекст | Отберите кандидатов для приложения |
| LLM Stats | Общий Score и отдельные оценки Reasoning, Coding, Agent | Сопоставьте общий результат с нужной категорией |
| Vellum | Тесты и раздел Compare models | Выберите испытание под рабочую задачу |
| OpenRouter Rankings | Объём токенов через платформу; Benchmarks вынесены отдельно | Оцените использование моделей, а не точность ответов |
Какие модели лидируют на сентябрь 2026 года
Срез проверен 26.09.2026. Ниже лидеры Artificial Analysis по отдельным критериям.
В таблицах встречаются GPT от OpenAI, Claude от Anthropic, Gemini от Google и DeepSeek. Сохраняйте полное название и режим участника.
| Критерий | Лидер в источнике | Показатель |
|---|---|---|
| Intelligence Index | Claude Opus 5.5 (max with fallback) | 58 баллов |
| Output Speed | Celeris-1 | 1628,3 токена в секунду |
| Latency | Gemini 2.5 Flash-Lite (Non-reasoning) и North Mini Code | Наименьшая задержка |
| Cost per Task | GPT-6 Luna (low) | 0,0045 доллара за задание индекса |
| Открытые веса, Intelligence Index | MiMo-V2.6-Pro | 46 баллов |
| Context Window | Llama 4 Scout и Grok 4.20 0309 | Указаны среди лидеров по объёму контекста |
Как читать баллы и фильтровать таблицу
На Artificial Analysis задайте Weights, Price, Reasoning и Status. Затем откройте Model для деталей или Providers для сравнения поставщиков.
DeepSeek V4 Pro и V4.1 Flash идут отдельными строками. Пропуск оценки не означает нулевое качество.
LLM Stats объединяет сопоставимые результаты тестов с учётом неопределённости. Недостающие измерения не считает поражениями; данные разработчика отделяет от проверенных площадкой.
| Обозначение | Как читать |
|---|---|
| Model / Score | Точная конфигурация и балл по методике площадки |
| Rank Spread / Votes в Arena | Диапазон возможной позиции и число голосов |
| Context / 1M | Объём контекста; 1M означает миллион токенов |
| Input / Output Price | Раздельные ставки за вход и выход; проверьте единицу расчёта |
Цена, скорость и размер контекста
При оплате API за токены учитывайте входной текст и ответ отдельно. Добавьте повторные запросы, инструменты и проверку специалистом.
Стоимость принятого результата считайте так: все затраты на обработку разделите на число заданий, прошедших проверку.
Output Speed показывает скорость генерации. Time to First Token, или TTFT, измеряет ожидание первого токена. Отдельно замерьте полное время ответа.
Не путайте токены и символы в секунду: tok/s и c/s обозначают разные единицы. Сравнивайте одинаковые режимы у конкретного поставщика.
Context Window обозначает общий предел входных и выходных токенов. У длины ответа обычно есть отдельное ограничение.
LLM Arena: мнение людей и русский язык
На arena.ai пользователь сравнивает анонимные ответы. Названия раскрываются после выбора; рейтинг рассчитывается по модели Брэдли-Терри.
В официальный зачёт входят голоса до раскрытия названий. В Side by Side вы выбираете участников сами; голоса не меняют публичный рейтинг.
В Text Arena за 25 сентября 2026 года первым указан claude-opus-5.5-high: 1509 баллов, погрешность ±12, 2307 голосов.
Его Rank Spread составляет от 1 до 10. При такой неопределённости нельзя объявлять его безусловно лучшим.
По запросу LLM Arena встречается и llmarena.ru, отдельная площадка тестирования на русском языке. Её результаты нельзя объединять с arena.ai.
Для проверки русского языка попросите объяснить условия возврата по вашему документу. Проверьте, не добавлены ли выдуманные обещания.
Какие бенчмарки нужны для вашей задачи
Бенчмарк, или benchmark, это набор заданий для оценки навыков. Общий балл скрывает различия между ними.
В Vellum раздел Best in Reasoning показывает результаты рассуждений, Best for Work Automations посвящён рабочей автоматизации.
| Тест в Vellum | Что проверяется |
|---|---|
| Humanity's Last Exam | Сложные вопросы из разных областей знаний |
| GPQA Diamond | Научные вопросы по физике, химии и биологии |
| SWE-bench | Исправление реальных задач из репозиториев GitHub |
| AutoBench | Рабочие процессы с инструментами и несколькими шагами |
| OSWorld | Выполнение действий через интерфейс компьютера |
| BrowseComp | Поиск информации в интернете |
| Terminal-Bench | Работа с командами и инструментами терминала |
Открытые модели и собственный сервер
Open weights означает доступность весов. Для коммерческого использования проверьте лицензию выбранного выпуска.
Для обозначения open source одних весов недостаточно: уточните доступность кода, данных и условия использования.
Для своего сервера оцените память, одновременные запросы и обслуживание. Сравнивайте с API по одинаковому объёму принятой работы.
Ошибки при сравнении нейросетей
- Смешивать измерения площадки с заявлениями разработчика. Ищите исходный отчёт, настройки и отметку независимой проверки.
- Опираться на знакомые тестовые задания. Добавьте собственные примеры, чтобы проверить перенос навыка на новую задачу.
- Принимать красивый ответ за правильный. Перепроверьте утверждения по исходному документу.
- Оценивать только успехи. Включите неоднозначные вопросы, ошибки во входных данных и отсутствие нужной информации.
- Путать популярность с качеством. OpenRouter считает токены; длина ответов тоже влияет на позицию.
- Забывать про подключение. До оплаты проверьте доступность сервиса в вашей стране и правила обработки данных.
Как провести своё сравнение
- Опишите критерии приёмки: верные поля документа, работающий код или ответ покупателю.
- Соберите обычные и сложные задания. Удалите конфиденциальные сведения из примеров для публичных площадок.
- Задайте одинаковые инструкции, данные, доступные инструменты и лимиты.
- Запишите версию, режим, поставщика, расходы, время и ошибки. Повторите задания, чтобы увидеть разброс оценок.
- Попросите специалиста оценить ответы без названий участников. Отдельно отметьте фактические ошибки и нарушения формата.
- Выберите решение по стоимости принятого результата. После обновлений повторяйте контрольные задания.
Внедрение ИИ в бизнес
Услуга «Внедрение ИИ в бизнес»: /uslugi/vnedrenie-ii/. Для брифа подготовьте описание процесса и примеры заданий.
В seosite1 проект ведёт руководитель с опытом с 2009 года. ИИ-агенты работают под его контролем, решения и цифры проверяет человек.
Цена после брифа. Работаем удалённо по всей России.
Источники
- Arena: методика и режимы сравнения
- Arena: текстовый рейтинг за 25 сентября 2026 года
- Artificial Analysis: лидеры и показатели, проверено 26.09.2026
- LLM Stats: методика сводной оценки
- Vellum: сравнение моделей и словарь тестов
- OpenRouter: методика рейтингов использования
- LLM Arena: тестирование на русском языке
- SWE-bench: варианты тестов и результаты