В последнее время меня очень увлекло локальное тестирование больших языковых моделей (LLM), и после того, как я увидел все это, я понял, насколько это эффективно. Интересные возможности инструментов MCP.Я понял, что пора немного обновить свои настройки.

Изначально я поддался всеобщему ажиотажу, когда вышел DeepSeek R1, но с тех пор появилось много новых моделей. Учитывая, как быстро всё меняется, я решил оптимизировать и свой рабочий процесс.
Быстрые ссылки
LM Studio — лучшее приложение для локального обучения по программе LLM, которое я когда-либо использовал (пока что).
Ollama хороша, но мне больше нравится эта.
Впервые я начал экспериментировать с локальными большими языковыми моделями (LLM) в прошлом году, используя Ollama.В целом, всё работало неплохо, но мой бедный MacBook Air с всего лишь 8 ГБ оперативной памяти явно не был рассчитан на такую нагрузку. Тем не менее, мне хотелось попробовать что-то другое, отчасти из любопытства, а отчасти чтобы посмотреть, смогу ли я добиться ещё большей производительности.
Поэтому я решил попробовать LM Studio. Это приложение позволяет загружать и запускать большие языковые модели (LLM) локально на вашем компьютере, и у него также есть понятный пользовательский интерфейс. Поскольку я использую Mac, поддержка MLX была для меня крайне важна. Если вы не знакомы с MLX, это фреймворк машинного обучения от Apple, разработанный специально для Apple Silicon.
По сути, это позволяет моделям работать более эффективно, используя графический процессор (GPU). Однако я хотел выразить это в цифрах, поэтому сравнил Ollama и LMStudio напрямую, используя одну и ту же модель.

С LM Studio я получал больше символов в секунду, но разница была настолько мала, что это не сильно повлияло на общее впечатление. Тем не менее, я был рад любому дополнительному повышению производительности.
Однако, я не думаю, что есть большая разница между Ollama и LM Studio, особенно учитывая, что обе программы используют схожие базовые фреймворки для локального запуска моделей.
Вначале меня больше всего беспокоило отсутствие поддержки мультимедиа. Но сейчас это уже неактуально. И Ollama, и LM Studio теперь поддерживают мультимедийные шаблоны, и есть несколько мощных инструментов, которые хорошо обрабатывают текст и изображения на локальных устройствах.
Выбор подходящей модели может быть довольно сложным.
Это может быть дорогостоящим хобби.

При первой установке LM Studio вам нужно будет выбрать шаблон. Это может показаться немного запутанным для новичков, поскольку нет единого, простого ответа на вопрос «использовать этот шаблон». Правильный выбор действительно зависит от вашего оборудования.
Если вы откроете меню «Поиск моделей» в LM Studio, вы увидите список самых популярных моделей. Простой способ понять, насколько востребована та или иная модель, — посмотреть на число, непосредственно предшествующее букве «B» в её названии.
Буква «B» означает миллиарды параметров. Как правило, чем выше это число, тем мощнее модель. Это также означает, что ей потребуется больше ресурсов. На Mac с 8 ГБ видеопамяти, на мой взгляд, оптимальный диапазон — от 3 до 4 миллиардов параметров. На ПК ситуация может быть немного сложнее. Вместо обычной оперативной памяти системы, наиболее важен объем видеопамяти.
Если у вас 8 ГБ видеопамяти, вы можете спокойно экспериментировать с моделями, использующими 7 миллиардов параметров, особенно в более лёгких квантовых конфигурациях. По моему опыту, лучший подход — начать с меньшей модели и постепенно увеличивать её размер, пока не найдёте оптимальный вариант.
Лично меня больше привлекла модель Gemma 3 4B, построенная на той же платформе, что и модели Google Gemini. Однако я бы все же рекомендовал попробовать и модели Qwen. В зависимости от того, чем вы занимаетесь, они могут вам подойти гораздо лучше.
Вы даже можете добавить функцию веб-поиска в свою местную магистерскую программу.
На помощь приходит DuckDuckGo.

Одна из самых распространенных жалоб на встроенные модели обработки больших языков (LLM) заключается в их ограниченности по сравнению с облачными моделями, такими как ChatGPT, когда речь идет о веб-поиске. Не очень полезно спросить о последней модели iPhone, а модель обработки больших языков начнет говорить об iPhone 14. В этом отношении облачные модели оказались лучше.
LM Studio имеет встроенную систему плагинов, и добавить веб-поиск невероятно просто. Просто перейдите по ссылке: Страница дополнения DuckDuckGoИ укажите «Запустить» в LM Studio.
После включения этой функции при запуске формы под окном чата появится опция, спрашивающая, хотите ли вы использовать DuckDuckGo для своего запроса. Если вы её включите, LM Studio будет получать результаты поиска в реальном времени и передавать их в форму перед генерацией ответа.

Это не всё, что можно сделать с помощью плагинов. Команда LM Studio также разработала несколько очень полезных плагинов. Например, у них есть плагин для Википедии, который позволяет вашей большой языковой модели читать и искать статьи в Википедии (разумеется).
Существует также плагин JavaScript Sandbox, который может быть очень полезен, если вас интересует vibe-кодирование и вы хотите быстро получить приблизительное представление о том, что создается. Но я бы не сказал, что стоит прилагать усилия для создания чего-то готового к использованию в продакшене.
Избавьтесь от крупных компаний.
Вы можете настроить LM Studio так, чтобы получать доступ к своей большой языковой модели со своего телефона, но если вы хотите перенести все результаты инференции непосредственно на свой телефон, это тоже возможно. Запуск языковых моделей меньшего и большего размера на телефоне AndroidХотя по мощности он и не будет таким же, как Mac.
Улучшение этих облегченных моделей продолжается быстрыми и впечатляющими темпами. Учитывая ожидаемый рост стоимости оборудования, я не удивлюсь, если такие компании, как OpenAI или Google, повысят цены на свои подписки. Приятно иметь систему, которая остается невосприимчивой к этим изменениям.










