slotstream запускает Qwen на 125 млрд параметров на Mac с 48 ГБ памяти
Обработка промпта на 8000 токенов занимает около 39 секунд, на 32 000 около трёх минут; только Apple Silicon и macOS 14.

Разработчик Карлос Галарса опубликовал slotstream, инструмент на Swift, который запускает MoE-модель Qwen3.8-Flash-Next на 125 млрд параметров на Mac с 48 ГБ объединённой памяти. Четырёхбитные веса модели занимают на диске 103,77–105,3 ГБ, но процесс держит в памяти около 33 ГБ и выдаёт примерно 12 токенов в секунду на Apple M5 Pro. Инструмент отдаёт HTTP API, совместимый с Ollama и OpenAI, поэтому к нему подключаются Open WebUI, OpenAI SDK и обычный curl.
Для владельца MacBook это означает модель класса, который раньше требовал 128 ГБ памяти или сервера с несколькими GPU. Цена: скорость обработки промпта. По замерам автора, 8000 токенов контекста обрабатываются около 39 секунд, 32 000 около трёх минут, а полный контекст ограничен 32 768 токенами. Проект молодой (246 звёзд на GitHub на момент разведки), работает только на Apple Silicon с macOS 14 и требует около 110 ГБ свободного места на SSD.
Ключевые выводы
- Модель: Qwen3.8-Flash-Next, 125 млрд параметров, 512 экспертов на слой, 10 активных на токен; веса 4 бита, 103,77–105,3 ГБ на диске.
- Память: постоянно загружено 3,8 ГБ, процесс на 48-гигабайтном Mac занимает около 33 ГБ; запуск движка около 2 секунд.
- Скорость на M5 Pro с 48 ГБ: около 12 токенов в секунду генерации; промпт 8000 токенов около 39 секунд, 32 000 около 3 минут; контекст до 32 768 токенов.
- Требования: Apple Silicon, macOS 14 и новее, около 110 ГБ на SSD; Linux, Windows и дискретные GPU не поддерживаются.
- API совместим с Ollama и OpenAI: работают
curl, Open WebUI и OpenAI SDK; в slotstream 0.2.0 подключение Ollama CLI ещё не работало. Лицензия MIT.
Как 105 ГБ помещаются в 48
Qwen3.8-Flash-Next устроена как mixture of experts: в каждом слое 512 экспертов, но для одного токена активируются только 10. Значит, в каждый момент нужна малая часть весов. Эксперты занимают 67,9 ГБ, ещё 32 ГБ уходит на хранилище n-gram и PLE. slotstream держит фиксированный пул слотов в памяти и подгружает нужных экспертов с SSD системным вызовом pread, а не отображает всю модель через mmap. Постоянно в памяти живут только общие части модели, 3,8 ГБ.
Автор описывает, почему очевидные способы не сработали. Обычный загрузчик на 48-гигабайтном Mac уходил примерно в 48 ГБ подкачки и завершался до первого токена. Ленивый mmap тоже не спасал: после короткого промпта резидентная память приближалась к 100 ГБ, потому что система не знает, каких экспертов можно выгрузить. Фиксированный пул решает это ценой того, что каждый новый эксперт читается с SSD, отсюда и медленная обработка длинного промпта: диск становится узким местом.
Что это значит на практике
12 токенов в секунду на генерации это скорость, при которой ответом можно пользоваться в чате. Проблема в prefill: минута ожидания на промпт средней длины и три минуты на длинный документ делают инструмент непригодным для RAG по большим контекстам и для агентов, которые постоянно перечитывают историю. Зато для разовых задач с коротким контекстом, где важно качество большой модели, а не отклик, это рабочий вариант на ноутбуке. Автор прямо пишет, что инструмент рассчитан только на Apple Silicon «и не случайно» (перевод редакции): расчёт на объединённую память и скорость встроенного SSD.
Как попробовать
- Проверить требования: Apple Silicon, macOS 14 или новее, около 110 ГБ свободного места, желательно 48 ГБ памяти (на меньших объёмах автор замеров не приводит).
- Собрать или скачать slotstream по инструкции в README; веса модели скачиваются отдельно, это около 105 ГБ.
- Подключить любой клиент, понимающий API Ollama или OpenAI: Open WebUI, OpenAI SDK с локальным
base_urlилиcurl. в slotstream 0.2.0 Ollama CLI на момент публикации не подключался. - Сверить свои цифры с таблицами в MEASUREMENTS.md: там разложены память, ввод-вывод и время по этапам.
Кому это не подойдёт: владельцам Mac с 16–24 ГБ (замеров для них нет), пользователям Linux и Windows и всем, кому нужен быстрый prefill. Региональных ограничений у проекта нет, веса модели скачиваются из открытых источников. Что можно запустить дома на более скромном железе, мы собирали в обзоре открытых моделей августа; о том, во что обходится обработка длинного контекста у облачных моделей, есть разбор цен API за август.
Источники: Репозиторий slotstream, MEASUREMENTS.md: замеры памяти и скорости












