DFlash 2 ускоряет локальные модели до 4,6 раза без потери качества
DFlash 2 ускоряет локальные модели до 4,6 раза с тем же результатом: как работает параллельный черновик и где его уже можно включить.
Команда Inco AI выпустила DFlash 2, вторую версию метода параллельного спекулятивного декодирования. Модель Qwen3.8-27B на MacBook Pro с M5 Max выдаёт 70 токенов в секунду: до 4,6 раза быстрее обычной генерации, и текст на выходе не меняется ни на один токен.
Механика такая: маленькая черновая модель угадывает сразу блок токенов, большая проверяет его за один проход. Удачные догадки принимаются, остальные отбрасываются. Первая версия DFlash научила черновик предсказывать блок параллельно, и метод уже работает в SGLang, vLLM, TensorRT-LLM и llama.cpp: NVIDIA замерила до 15-кратного роста на Blackwell, Google сообщила о трёхкратном приросте на TPU.
DFlash 2 закрывает два слабых места. Черновик предсказывает каждую позицию независимо, поэтому лёгкий селектор выбирает один связный путь среди топ-16 кандидатов. А чтобы точность не падала к концу блока, добавили короткую свёртку с тремя процентами дополнительных параметров. Итог: каждый проверочный проход принимает на 20% больше токенов при надбавке к задержке около 1%.
У меня Qwen3.8 27B работает локально на Mac mini, так что новость зацепила лично: черновик для этой модели уже лежит на Hugging Face, рядом версия для Muse Glimmer. Локальные модели становятся заметно быстрее без нового железа и без потери качества.
Скорость инференса превращается в отдельную инженерную дисциплину: агенты часами читают документы и вызывают инструменты, и каждый токен стоит времени и денег. Тот, кто выжимает больше токенов из имеющегося железа, получает преимущество, которое не купишь более мощной моделью.
Следующий шаг
Локальные модели в работе: Mac Studio, DAWalka и DeepSeek — рассказ Миши Иванова
Связанные материалы
- Статья: Перестаньте искать самую умную нейросеть. Стройте среду
- Блог: Codex Router: несколько моделей в одном Codex
- База знаний: Ollama — локальный и облачный рантайм для языковых моделей
Если вы запускаете модели локально или собираете агентный контур, где скорость и стоимость токена критичны, эту тему стоит обсудить предметно.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.
Дальше по теме
Gemini Enterprise — агентная платформа Google для бизнеса: поиск по корпоративным данным, готовые и no-code агенты, безопасность, редакции и тарифы.