LLM Studio и LM Studio: что это и в чём разница
LM Studio предоставляет графический интерфейс, или GUI, для запуска языковых моделей. Вы скачиваете модель и общаетесь в чате без программирования.
H2O LLM Studio от H2O.ai предназначен для дообучения моделей на собственных данных. Для обычного локального чата нужна программа LM Studio.
Программа и модель решают разные задачи: LM Studio управляет запуском, а выбранная LLM генерирует ответы. Скачанные веса дают возможность работать локально, но открытый доступ к файлу не отменяет лицензию. Качество русского языка и кода проверяйте на своих примерах.
Что можно делать бесплатно
На сентябрь 2026 года страница тарифов lmstudio.ai описывает Bionic: его план Free включает локальные модели. Платные планы добавляют облачный запуск и другие возможности. Эти тарифы нельзя автоматически переносить на отдельное приложение LM Studio.
Для чата со скачанной моделью облачная подписка не нужна. Расходы на компьютер, электричество и обслуживание остаются. Локальная модель не получает свежие сведения из интернета сама по себе.
- Чат: вопросы к модели, черновики писем, объяснение незнакомых терминов.
- Документы: разбор прикреплённого файла и поиск нужных фрагментов.
- Программирование: обсуждение кода и проверка предложенных исправлений в своей среде.
- Локальный API-сервер: подключение модели к приложению или скрипту.
- Сравнение моделей: одинаковые задания для разных вариантов на вашем компьютере.
Системные требования: память, процессор и GPU
Требования приложения и требования выбранной модели различаются. Установленная программа ещё не означает, что любая нейросеть поместится в память. Ниже приведены сведения официальной документации, проверенные в сентябре 2026 года.
| Система | Совместимость | Память и ограничения |
|---|---|---|
| macOS | Apple Silicon, macOS 14.0 или новее | Рекомендовано от 16 ГБ RAM. На 8 ГБ возможны небольшие модели с коротким контекстом. Intel Mac не поддерживается. |
| Windows | x64 с AVX2 либо поддерживаемый ARM на Snapdragon X Elite | Рекомендовано от 16 ГБ RAM. Для GPU рекомендовано от 4 ГБ выделенной видеопамяти. |
| Linux | x64 и ARM64; приложение распространяется как AppImage | В документации указана Ubuntu 20.04 или новее. Для x64 сборка по умолчанию использует AVX2. |
Установка LM Studio и первый запуск
Официальная загрузка: https://lmstudio.ai/download. Для этой инструкции выберите раздел Download LM Studio и свою операционную систему. Кнопка Download Bionic относится к другому приложению. Экспериментальные сборки вынесены отдельно; для знакомства начните с основного установщика.
Для скачивания нужны интернет и место на диске. Для ответа в чате нужны файл модели и подходящий движок.
- Установите LM Studio и откройте Discover: здесь находится поиск моделей Hugging Face.
- Найдите модель по названию или адресу её страницы. Проверьте назначение, лицензию и размер файла.
- Выберите совместимый GGUF либо MLX для Apple Silicon и дождитесь окончания загрузки.
- Откройте Chat, выберите скачанную модель в списке и загрузите её в память.
- Напишите короткий запрос на русском языке, например попросите пересказать знакомый абзац.
- Повторите запрос без сети, если собираетесь работать полностью локально.
Как проверить, что старт прошёл успешно
Проверьте смысл ответа, грамотность и время ожидания. Сохраните исходное задание для сравнения настроек. В My Models можно управлять файлами и выбрать другую папку хранения.
Если файл скачался, но ответа нет, проверьте загрузку модели в память. При нехватке RAM уменьшите контекст или выберите меньшую модель. Скачивание файла и его запуск являются разными этапами.
Как выбрать LLM для LM Studio: модели и квантование
В документации приведены семейства Qwen, Llama, Mistral и DeepSeek. Это примеры моделей для локального запуска, а не рейтинг качества. Совместимость проверяйте для конкретного файла и доступного движка.
Поиск принимает название, адрес Hugging Face или user/model. В карточке проверьте языки, назначение и лицензию.
Квантование уменьшает размер модели за счёт снижения точности представления весов. Оно помогает экономить память, но может ухудшить ответы. Документация советует выбирать вариант от 4 бит, если компьютер позволяет.
Начните с варианта для диалога, указанного в карточке модели. Поддержку изображений и инструментов проверяйте отдельно. Одна модель может хорошо пересказывать текст, но ошибаться в коде. Сравнивайте кандидатов на одинаковых запросах, а не только по размеру файла.
| Вариант | Как используется | Что сравнить |
|---|---|---|
| GGUF | Запуск через llama.cpp на поддерживаемых системах | Размер файла, расход памяти и качество на вашей задаче |
| MLX | Запуск через движок MLX на Apple Silicon | Скорость и точность на том же задании |
Настройка чата: инструкция, контекст и проверка ответа
Системный промпт задаёт общие правила для разговора. Опишите роль помощника, язык и требуемый формат ответа. Отдельно перечислите сведения, которые нельзя додумывать.
Пример инструкции: «Отвечайте по приложенному тексту. Если ответа нет, сообщите об этом. Для каждого вывода приведите подтверждающий фрагмент». Затем задайте конкретный вопрос, а не просьбу рассказать всё сразу.
Контекст объединяет историю беседы, инструкции и материалы, доступные модели при ответе. Его размер ограничен. Передавайте только сведения по задаче.
Как подбирать параметры модели
Temperature меняет случайность выбора продолжения. Низкое значение делает ответы менее разнообразными, но не гарантирует достоверность фактов. Начните с настроек автора модели.
Top-k ограничивает число вероятных продолжений, а Top-p отбирает их по суммарной вероятности. Repeat Penalty снижает вероятность повторов. Слишком сильный штраф может мешать повторять нужные термины.
Max Tokens ограничивает длину ответа в токенах, а не в символах. Если ответ обрывается, проверьте этот лимит и свободный контекст.
Structured Output задаёт схему JSON для машинной обработки. Правильная структура не подтверждает истинность содержимого: проверяйте значения отдельно. Простая просьба «верните JSON» в промпте не равна ограничению схемой.
Меняйте один параметр за попытку и сохраняйте результаты. Удобный вариант настроек вместе с системным промптом можно сохранить как Preset для следующих чатов.
Что делать при медленной генерации
Сравните короткий запрос без вложений с длинной беседой. Большой контекст увеличивает расход памяти; размер файла модели на диске не равен всей памяти при работе.
GPU Offload переносит вычисления на видеокарту. Увеличивайте долю загрузки только в пределах доступной VRAM. При ошибке памяти уменьшите её, сократите контекст или возьмите меньшую модель.
Проверьте движок в LM Runtimes: Ctrl + Shift + R на Windows/Linux или Cmd + Shift + R на Mac. Совместимость зависит от системы, устройства и сборки движка. Наличие видеокарты NVIDIA само по себе не гарантирует нужную скорость.
RAG: как работать с документами офлайн
В чат можно прикрепить DOCX, PDF или TXT. Если документ помещается в контекст, приложение передаёт его целиком. Для длинного текста используется RAG: поиск подходящих фрагментов с передачей их модели.
Так можно отвечать по внутренней инструкции без дообучения. Но поиск может пропустить нужное условие. В вопросе укажите точное название раздела и попросите подтверждающую цитату.
Например, загрузите правила доставки и спросите об условиях для крупного заказа. Сверьте ответ с оригиналом, затем задайте вопрос об исключении из правила.
- Проверьте, что текст файла читается и нужный раздел присутствует.
- Задавайте отдельный вопрос по каждой теме.
- Отсутствие найденного ответа не доказывает отсутствия условия в документе.
Локальный API-сервер: подключение к приложению
LM Studio принимает запросы от приложений через API. Для диалога есть POST /v1/chat/completions, для списка моделей GET /v1/models. Метод /v1/embeddings создаёт векторные представления текста с подходящей моделью.
В примерах документации используется http://localhost:1234/v1. Число 1234 обозначает порт; сверяйте его с настройками сервера. В поле model передавайте идентификатор выбранной модели.
Совместимость с OpenAI API относится к поддерживаемым методам и параметрам. Замена адреса не гарантирует работу любого клиента. До подключения к сайту проверьте обработку недоступного сервера и ошибочного ответа.
- Откройте вкладку Developer и включите Start server. Через установленный CLI сервер запускается командой lms server start.
- Для локальной проверки оставьте доступ только с этого компьютера и проверьте фактический порт.
- Откройте http://localhost:1234/v1/models или выполните GET-запрос: ожидается JSON со списком доступных моделей.
- Выберите идентификатор модели, отправьте короткий запрос к /v1/chat/completions и проверьте содержимое ответа.
- Если включена авторизация, настройте её в клиенте. При отказе в соединении проверьте запуск сервера и адрес.
Подключение к редактору кода
В редакторе нужен клиент, поддерживающий LM Studio, например Continue для Visual Studio Code. Укажите локальный адрес сервера и идентификатор модели в настройках выбранного клиента.
Начните с объяснения короткой функции. Затем попросите предложить исправление и проверьте его в своей среде. Настройки и поддержка инструментов зависят от версии клиента и выбранной модели.
GUI, CLI и MCP: какой способ работы выбрать
Для ручной работы подходит GUI: вы выбираете модель и общаетесь в окне приложения. Для управления из командной строки предусмотрен CLI с именем lms. Без графического интерфейса сервер можно запускать через llmster.
В работе с MCP приложение выступает клиентом и подключает отдельные серверы инструментов. Они могут читать файлы или обращаться к внешним сервисам. Для вызовов инструментов нужна подходящая модель. Проверяйте разрешения и передачу данных каждого подключения.
llmster подходит для машины без рабочего стола: он запускает модели в фоне. Управлять им помогает lms. Инструкция по установке есть на официальной странице загрузки. Для первого знакомства достаточно обычного приложения.
Приватность: когда данные остаются на компьютере
По документации, локальный чат, обработка документов и локальный сервер могут работать без интернета. Поиск и скачивание моделей, загрузка движков и проверка обновлений требуют сети. Подготовьте необходимые файлы заранее.
Bionic поддерживает локальные и облачные модели. Перед передачей внутреннего документа проверьте, где выполняется запрос.
Отключите сеть и повторите задачу, чтобы проверить автономную работу. Это не заменяет проверку разрешений, внешних инструментов и доступа к файлам. Облачный запрос или подключение MCP может передавать данные за пределы компьютера.
Альтернативы: Ollama, GPT4All и Jan
Выбирайте приложение по задаче, затем сравните одну и ту же модель на своих данных. Смена оболочки сама по себе не улучшает её знания.
| Программа | Когда рассмотреть | Что проверить |
|---|---|---|
| LM Studio | Чат, настройка моделей, RAG и локальный API в одном приложении | Память, движок и поддержку нужных методов API |
| Ollama | Запуск моделей и подключение к своим приложениям через API | Выбрана локальная или облачная модель |
| GPT4All | Чат на компьютере и работа с файлами через LocalDocs | Качество поиска по вашим документам |
| Jan | Приложение с открытым исходным кодом и выбором моделей | Локальная модель или подключённый внешний сервис |
Как применять локальный ИИ в рабочих задачах
Локальный ИИ подходит для черновых сводок, классификации заметок и вопросов по инструкции. Перед внедрением определите, кто проверяет результат.
Проверьте обычный запрос, документ с исключением и вопрос без ответа в исходнике. Записывайте ошибки фактов и формата.
Если задача связана с сайтом, начните с описания нужного процесса и доступных данных. Обсудить задачу можно на странице «Внедрение ИИ в бизнес»: /uslugi/vnedrenie-ii/. Итоговую цену в seosite1 называем после брифа.
Источники
- LM Studio: полная официальная документация, установка, требования, RAG, API, память и MCP
- LM Studio и Bionic: официальная загрузка
- Bionic: тарифы и локальный запуск
- LM Studio: параметры генерации
- H2O LLM Studio: дообучение моделей
- Ollama: официальная документация
- GPT4All: чат и локальные документы
- Jan: модели и открытый исходный код