Чтобы получить ответ локальной модели, нужно выбрать совместимый файл, загрузить его в приложение и отправить проверочный запрос. Пройдём этот путь на одном примере: Qwen2.5 1.5B Instruct в формате GGUF и обычный текстовый чат LM Studio.

Если выбираете приложение впервые, начните со сравнения Ollama и LM Studio. Установка и устройство LM Studio разобраны в отдельном руководстве. Здесь предполагается, что приложение уже установлено и работает на вашем компьютере.

📌
Маршрут сверен с официальной документацией и файлами Hub 4 октября 2026 года. В рамках подготовки этого текста модель не скачивалась и не запускалась. Ниже приведены шаги и ожидаемые признаки успеха; время ответа и рабочий расход памяти не измерены.

Что подготовить

Нужны совместимый компьютер, LM Studio с доступным движком llama.cpp, интернет для скачивания и место на диске. Файл примера занимает 1 117 320 736 байт, около 1,12 ГБ. Приложение, его движок и возможные копии весов займут дополнительное место.

Официальные требования LM Studio на дату проверки указывают macOS 14+ на Apple Silicon, Windows x64 с AVX2 и поддерживаемые ARM-системы, а также Linux. Intel Mac в этом маршруте не поддерживается. Рекомендация от 16 ГБ RAM относится к среде; потребление конкретной модели нужно проверить отдельно.

Для первого ответа не нужны ключ модельного API, облачный сервер или подключение кодинг-агента. Используйте учебный текст без клиентских данных. Если компьютер уже обслуживает чужие запросы, проводите опыт в свободном отдельном сеансе.

Порядок действий:

Схема: Как скачать модель с Hugging Face и запустить в LM Studio
Схема: Как скачать модель с Hugging Face и запустить в LM Studio

Редакционная схема методики. Она не изображает выполненное испытание или ответ модели.

1. Проверьте выбранную модель на Hugging Face

Откройте Qwen/Qwen2.5-1.5B-Instruct-GGUF. Это GGUF-сборка в организации Qwen. Она ссылается на исходную Qwen2.5 1.5B Instruct, настроенную на выполнение инструкций.

Проверьте назначение и лицензию. В исходном описании заявлена работа с русским языком; лицензия выбранного варианта — Apache 2.0. На дату проверки репозиторий публичен и не требует одобрения доступа. Эти сведения не заменяют проверку качества ответов.

Во вкладке Files and versions найдите точное имя:

qwen2.5-1.5b-instruct-q4_k_m.gguf

Остановитесь на одном варианте Q4_K_M. Скачивание всех квантизаций репозитория для первого опыта не нужно. В записи о выборе сохраните имя файла и revision сборки: 91cad51170dc346986eccefdc2dd33a9da36ead9. Список файлов этой версии позволяет позднее проверить, что было выбрано.

2. Найдите этот репозиторий в LM Studio

Откройте вкладку Discover и вставьте полную ссылку на GGUF-репозиторий:

https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct-GGUF

Встроенный поиск LM Studio поддерживает полные ссылки Hugging Face и идентификаторы user/model. В результатах проверьте владельца Qwen, размер 1.5B и вариант Instruct. Поиск только по слову Qwen оставляет слишком много похожих результатов.

Выберите вариант с именем qwen2.5-1.5b-instruct-q4_k_m.gguf и запустите скачивание. Если интерфейс предлагает другую сборку, сверяйте её отдельно: совпадение названия семейства недостаточно. Когда загрузка завершится, модель должна появиться в разделе локальных файлов My Models.

На этом этапе получены файлы на диске. Ответа модели ещё нет. Запишите выбранный репозиторий и дату загрузки; приложение может скачивать текущую версию, поэтому контрольная сумма помогает уточнить происхождение файла.

3. Загрузите модель в память

Перейдите к обычному чату. Выберите скачанный вариант в селекторе модели и загрузите его. Для GGUF используется совместимый движок llama.cpp; MLX относится к другому варианту запуска. Названия кнопок могут отличаться между версиями приложения.

Для первого короткого примера задайте окно контекста 4 096 токенов. В настройках генерации используйте температуру 0 и ограничение ответа 512 токенов, если эти параметры доступны. Это предложенные условия воспроизводимой пробы, а не обязательные значения для всей дальнейшей работы.

Температура влияет на вариативность выбора следующих токенов. Низкое значение упрощает сравнение, но не гарантирует одинаковые ответы при смене движка или оборудования. Контекст включает ваш запрос, системную инструкцию, историю и будущий ответ; максимальную длину из карточки модели сразу устанавливать не требуется.

Дождитесь завершения загрузки в память. В селекторе должна быть выбрана именно эта локальная модель, без сообщения об ошибке загрузки. Если приложение показывает оценку ресурсов, сравните её с доступной памятью. Не запускайте несколько тяжёлых моделей одновременно для такого первого опыта.

4. Отправьте короткую заметку в новый диалог

Создайте новый чат, чтобы история не влияла на результат. Не добавляйте файлы, веб-поиск или инструменты. Все данные для ответа уже находятся в запросе; имена и события вымышлены.

Промпт:

Составь краткое содержание заметки на русском языке.
Ответь ровно тремя пунктами: «Решили», «Ответственные», «Не определено».
Сохрани все даты и имена. Не добавляй фактов, которых нет в заметке.

Заметка:
Книжный клуб проведёт открытую встречу 20 ноября 2026 года. Анна подготовит список книг к 12 ноября 2026 года, Павел проверит зал к 14 ноября 2026 года. Участие бесплатное. Книгу для обсуждения пока не выбрали.

Отправьте запрос и дождитесь окончания генерации. Проверьте содержание по эталону ниже. Это допустимый образец правильного ответа, составленный для проверки; он не получен от запущенной модели.

- Решили: провести открытую встречу книжного клуба 20 ноября 2026 года; участие бесплатное.
- Ответственные: Анна подготовит список книг к 12 ноября 2026 года; Павел проверит зал к 14 ноября 2026 года.
- Не определено: книга для обсуждения.

Слова могут отличаться, но дата встречи, обе задачи, их сроки и нерешённый вопрос должны сохраниться. Придуманное название книги или изменённый срок — содержательная ошибка. Если ответ получен, но ошибся, генерация работает; качество этого примера ещё не прошло проверку.

5. Убедитесь, где выполнялся ответ

Посмотрите на выбранную модель и место выполнения. Для этого сценария вычисления должны идти на том же компьютере, где лежит файл. Подключение LM Link к другой машине или обращение к внешнему серверу меняет место запуска даже при локальном интерфейсе.

Если это не мешает вашей текущей работе, после полной загрузки весов и движка проведите повторную пробу на тестовом компьютере полностью без сетевого подключения, включая локальную сеть. Создайте новый диалог и отправьте ту же заметку. Документация LM Studio описывает работу со скачанными моделями без сети.

Полученный офлайн-ответ вместе с локальным файлом и выбранным местным движком подтверждает работоспособность этого сценария без удалённого генератора. Он не доказывает, что все возможные плагины и другие режимы приложения всегда работают без внешних подключений.

Адрес localhost в настройках клиента тоже не доказывает локальные вычисления: на таком порту может слушать прокси или SSH-туннель. Для обычного чата этого практикума отдельный API-сервер вообще не требуется.

Если GGUF уже скачан через браузер

Повторно скачивать тот же файл через Discover не нужно. Проверьте его происхождение и импортируйте в LM Studio. Этот вариант исправляет отсутствие файла в библиотеке приложения; остальные шаги загрузки в память и чата остаются теми же.

На macOS для файла в стандартной папке загрузок вычислите SHA-256:

shasum -a 256 "$HOME/Downloads/qwen2.5-1.5b-instruct-q4_k_m.gguf"

Метаданные файла в указанной версии Hub сообщают такую сумму:

6a1a2eb6d15622bf3c96857206351ba97e1af16c30d7a74ee38970e434e9407e

Совпадение означает соответствие этому опубликованному файлу. Если сумма другая, проверьте версию и имя: автор мог обновить сборку. В подготовке руководства прочитаны метаданные Hub; скачанный на компьютер файл этой суммой не проверялся.

Если установлен CLI LM Studio, сначала посмотрите план импорта:

lms import "$HOME/Downloads/qwen2.5-1.5b-instruct-q4_k_m.gguf" --copy --user-repo Qwen/Qwen2.5-1.5B-Instruct-GGUF --dry-run

Убедившись в правильности пути, выполните импорт:

lms import "$HOME/Downloads/qwen2.5-1.5b-instruct-q4_k_m.gguf" --copy --user-repo Qwen/Qwen2.5-1.5B-Instruct-GGUF

Флаг --copy сохраняет исходный файл, а --user-repo задаёт каталог назначения. Копия потребует дополнительного места. Без --copy команда по умолчанию перемещает файл — это описано в справочнике lms import.

Затем проверьте библиотеку:

lms ls

Это список скачанных моделей, не проверка ответа. Продолжите с загрузки в память и нового чата. Если lms не найден, используйте основной маршрут Discover; подготовка командного интерфейса описана в документации приложения. Установка дополнительного серверного runtime ради этого руководства не требуется.

Почему похожий файл может не открыться

Программа должна поддерживать и формат, и архитектуру модели. Расширение само по себе не гарантирует совместимость.

Файл или репозиторийКак его пониматьЧто сделать новичку
.gguf для Qwen2Готовая сборка для совместимого llama.cppПроверить полный файл и поддержку архитектуры текущим движком
MLX-сборка с .safetensorsВеса для MLX вместе с нужной конфигурацией и токенизаторомИспользовать поддерживаемый MLX-движок на Apple Silicon; для этого практикума выбрать GGUF
Исходный model.safetensors для TransformersЧасть исходного модельного репозиторияНайти готовую GGUF-конверсию того же оригинала
adapter_model.safetensorsАдаптер к другой моделиНайти необходимую базовую модель или готовую объединённую сборку
Маленький текстовый указатель вместо большого файла весовВозможный pointer-файл Git LFSПолучить сами веса через штатную загрузку файла
00001-of-00002.ggufПервая часть разделённой сборкиНужны все части; для первого опыта использовать выбранный одиночный 1.5B-файл

Safetensors хранит тензоры; MLX и Transformers используют дополнительные сведения о модели и её тексте. Переименование .safetensors в .gguf ничего не конвертирует. Поддержка форматов описана в документации LM Studio, GGUF и MLX-LM.

Что делать при ошибке

Где остановился процессЧто проверитьСледующее действие
Поиск не нашёл модельВставлена ли полная ссылка на GGUF-репозиторийПроверить URL и доступ через браузер; использовать импорт уже полученного файла
Скачивание обрываетсяМесто на диске, соединение, сообщение об ошибкеПовторить штатную загрузку после устранения причины; не выдавать частичный файл за готовый
Страница открывается, а веса не скачиваютсяДоступ к файловому CDN, условия репозиторияПрочитать ошибку и правила загрузки Hub; токен не исправляет сетевой тайм-аут
Движок сообщает о неизвестной архитектуреВерсии приложения и runtime, выбранный форматСверить поддержку модели по документации; смена расширения не поможет
Модель не помещается в памятьКонтекст, размер, другие загруженные моделиУменьшить контекст или выбрать меньший совместимый файл; не завершать чужие рабочие процессы
Ответ повторяет запрос или выводит служебные токеныВыбран ли Instruct, правильно ли применён шаблон диалогаПроверить автоматический шаблон этой модели, сбросить случайную ручную подмену в своём тестовом сеансе
Ответ обрываетсяЛимит выходных токенов и причина остановкиУвеличить лимит для учебного запроса; при сравнении менять его одинаково для кандидатов
Факты в ответе ошибочныСам запрос и исходная заметкаСохранить ошибку для сравнения качества; успешная загрузка её не устраняет

Если проблема требует обновления приложения или движка, сначала сохраните свою рабочую конфигурацию и проверьте совместимость. Не меняйте обслуживающий другие задачи runtime во время их выполнения.

Полезные сценарии

Первый сценарий — получить черновой итог короткой заметки. Все факты передаются в запросе, модель составляет три пункта, а вы сверяете их с исходником. Результат — ответ и перечень найденных ошибок. Важные сроки и договорённости требуют проверки даже после удачной первой пробы.

Второй сценарий — подготовить текстовую модель к собственному сравнению. Сохраните выбранный файл, версии приложения и движка, настройки и первый запрос. Результат — воспроизводимая исходная конфигурация. Запуск ещё не даёт оснований назвать модель подходящей для всех рабочих документов.

Запишите результат первого запуска

После опыта заполните короткий журнал:

Дата и компьютер:
Версия LM Studio и llama.cpp runtime:
Репозиторий, revision, имя файла, SHA-256:
Контекст, температура, лимит ответа:
Место выполнения: этот компьютер / другая машина
Файл скачан полностью: да / нет
Модель загружена в память: да / нет
Ответ получен: да / нет
Факты учебного примера сохранены: да / нет, список ошибок
Офлайн-проба: выполнена / не выполнялась

Свой первый запуск считайте завершённым, когда модель загрузилась, вернула содержательный ответ и вы установили место выполнения. Для принятия результата самого примера дополнительно должны сохраниться все проверяемые факты. Строка «скачано» подтверждает только предыдущий этап.

Источники и ограничения

Проверено 04.10.2026: файлы Qwen2.5 1.5B GGUF, исходная модель, загрузка в LM Studio, чаты, импорт, список моделей lms ls, контекст и оценка памяти, работа офлайн.

Названия интерфейса и поддержка конкретной архитектуры зависят от версии. Синтаксис команд сверен по документации; полный цикл загрузки и генерации на компьютере исполнителя не выполнялся. Ожидаемый ответ — учебный эталон. Здесь нет измерений скорости, памяти и точности модели.

Если готовите рабочие файлы с агентом, спецпроект по Codex поможет поставить задачу и проверить результат.

Серия Hugging Face

Все руководства: Hugging Face на практике. Маршрут: 1. Обзор платформы · 2. Готовые приложения Spaces · 3. Выбор модели · 4. Запуск в LM Studio — вы здесь · 5. Сравнение моделей · 6. Первый запрос по API

Следующий шаг

После первого запуска сравните модели на своих задачах: восемь учебных случаев помогут проверить факты и формат ответов, время ожидания и нагрузку на память.

Если переносите работу с заметками на собственный компьютер, полезно проверить не только запуск, но и качество фактов, место выполнения и нагрузку на устройство.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov