Что значит «запустить нейросеть локально» и почему это вообще обсуждают
Привычный способ работы с нейросетью — облачный: вы пишете запрос в браузере, он уходит на чужие серверы, ответ приходит обратно. Вы платите за подписку или за объём запросов, а ваши данные покидают ваш компьютер.
Локальный запуск: устроен иначе. Модель скачивается на ваш компьютер и работает на вашей видеокарте. Плюсы в том, что ничего не уходит наружу и нет платы за каждый запрос. Минусы в том, что нужна мощная видеокарта, а модели, которые помещаются в домашнее «железо», слабее облачных флагманов.
Инференс — слово, которое постоянно попадается в таких новостях. Это работа уже обученной модели: она получает запрос и выдаёт ответ. Обучение это дорогая разовая история, а инференс происходит каждый раз, когда вы что-то спрашиваете.
Видеопамять (VRAM): память видеокарты. Именно в неё загружается модель, и именно её объём определяет, какую модель вы вообще сможете запустить.
Программы вроде Ollama и LM Studio это оболочки, которые скачивают модель и дают ей интерфейс. Дальше в дело вступает то, о чём новость: у одного человека дома может быть несколько машин, а работает всегда одна.
Что произошло
NVIDIA представила PAIR — бесплатный инструмент с открытым кодом, который автоматически находит совместимые компьютеры в локальной сети, связывает их и распределяет между ними запросы к локальным нейросетям.
Несмотря на слово «роутер» в названии, это не сетевое устройство, а программа. Она встаёт между вашим приложением и программами локального запуска моделей и решает, на какую машину отправить очередной запрос.
Важное ограничение, которое стоит понять сразу: PAIR не объединяет видеопамять разных компьютеров в одну. Модель, которая не влезает в вашу видеокарту, не влезет и в две: она просто не запустится. Инструмент решает другую задачу: чтобы независимые запросы не стояли в очереди к одной видеокарте.
Как это работает по шагам:
- устройства находят друг друга в локальной сети;
- сопряжение проходит по шестизначному коду, после чего связь между ними шифруется;
- при новом запросе планировщик смотрит на длину очереди, загрузку видеокарты и на то, загружена ли уже нужная модель в память конкретной машины;
- если на компьютере запустили игру или тяжёлый рендер, задачи туда временно не идут; освободился, и снова идут.
Между машинами передаются только запрос и ответ, поэтому обычной домашней сети хватает: Wi-Fi или кабеля.
Кому и зачем это нужно
Главный сценарий, ради которого всё затевалось, это агенты, то есть помощники, которые не отвечают одним сообщением, а разбивают задачу на десяток мелких и выполняют их по очереди. На одной видеокарте эти мелкие задачи выстраиваются в очередь, и помощник работает медленно.
Цифра из демонстрации NVIDIA: сценарий с пятью вспомогательными помощниками на модели Qwen3.6 35B A3B, запущенный на двух компьютерах с видеокартами RTX 5090, отработал за 3 минуты 48 секунд вместо 6 минут 18 секунд на одной машине.
Заодно NVIDIA упростила установку таких помощников на Windows: для Hermes Agent, Perplexity Portable Computer и OpenClaw, про который мы писали отдельно. Настройка локальной модели на видеокарте с 24 ГБ памяти теперь занимает несколько кликов вместо ручной сборки окружения.
Второй сценарий: параллельная работа нескольких человек: у каждого свой разговор с моделью, и они не мешают друг другу.
Третий: вынос вычислений. Вы играете или монтируете видео на основном компьютере, а фоновые задачи уходят на второй.
| Что поддерживается | Подробности |
|---|---|
| Видеокарты NVIDIA | GeForce RTX 20-й серии и новее, RTX PRO (архитектура Turing и новее), DGX Spark |
| Компьютеры Apple | чипы M4 и новее |
| Программы запуска моделей | Ollama, LM Studio |
| Операционные системы | Windows, macOS, Linux |
| Интерфейс | оконный и терминальный |
| Лицензия | Apache 2.0, открытый исходный код |
Что это значит для тех, кто работает из России
Для нашего читателя здесь два практичных смысла, и оба не про домашний кластер из четырёх компьютеров.
Данные: локальный запуск означает, что переписка с клиентами, договоры и внутренние документы не уезжают на чужие серверы. Для компаний, которые работают с персональными данными, это не вопрос удобства, а вопрос требований к обработке.
Расходы: у локальной модели нет платы за запросы: заплатили один раз за «железо» и электричество. При постоянной работе помощников это меняет экономику, особенно если облачный доступ вы оплачиваете через посредников с наценкой.
Трезво о минусах. Модели, которые помещаются в домашнюю видеокарту, слабее облачных флагманов, но для рутинной работы с текстом их обычно хватает, для сложного анализа часто нет. Видеокарты уровня RTX 5090 в России стоят дорого, и окупаться такая покупка будет только при реальном потоке задач. А PAIR — это бета: инструмент новый, и на нём стоит проверять сценарии, а не строить рабочий процесс всей компании.
Какие открытые модели сейчас пригодны для локальной работы и чем они отличаются от закрытых, мы разбирали в материале про открытые нейросети.
Что сделать на этой неделе
- Посмотрите, какие видеокарты стоят в компьютерах, которые у вас уже есть: PAIR работает с RTX 20-й серии и новее.
- Поставьте на одну машину Ollama или LM Studio и запустите небольшую открытую модель: это займёт вечер.
- Прогоните на ней три свои типовые задачи и честно сравните с тем, чем пользуетесь сейчас.
- Если задач много и одна машина не тянет, попробуйте связать вторую через PAIR и замерьте время на том же сценарии.
- Отдельно решите, какие данные вы вообще не хотите отправлять в облако: с них и начинается смысл локального запуска.
Частые вопросы
PAIR ускорит одну большую модель?
Нет. Он не объединяет видеопамять и не делит одну модель между компьютерами. Он распределяет независимые запросы между машинами.
Нужен ли интернет?
Для работы — нет, всё происходит внутри локальной сети. Интернет нужен только для скачивания моделей.
Данные уходят в облако?
Нет. Запросы, файлы и контекст остаются в домашней сети, соединения между устройствами шифруются.
Подойдёт ли мой компьютер?
Нужны видеокарты GeForce RTX 20-й серии и новее, профессиональные RTX PRO, системы DGX Spark или компьютеры Apple с чипами M4 и новее.
Сколько это стоит?
Инструмент бесплатный и с открытым кодом. Платить придётся только за «железо» и электричество: видеокарты, которые уже стоят дома, и счёт за свет.
