pimenov.ai

DFlash 2 ускоряет локальные модели до 4,6 раза без потери качества

DFlash 2 ускоряет локальные модели до 4,6 раза с тем же результатом: как работает параллельный черновик и где его уже можно включить.

ИнструментыОбзор

Команда Inco AI выпустила DFlash 2, вторую версию метода параллельного спекулятивного декодирования. Модель Qwen3.8-27B на MacBook Pro с M5 Max выдаёт 70 токенов в секунду: до 4,6 раза быстрее обычной генерации, и текст на выходе не меняется ни на один токен.

Механика такая: маленькая черновая модель угадывает сразу блок токенов, большая проверяет его за один проход. Удачные догадки принимаются, остальные отбрасываются. Первая версия DFlash научила черновик предсказывать блок параллельно, и метод уже работает в SGLang, vLLM, TensorRT-LLM и llama.cpp: NVIDIA замерила до 15-кратного роста на Blackwell, Google сообщила о трёхкратном приросте на TPU.

DFlash 2 закрывает два слабых места. Черновик предсказывает каждую позицию независимо, поэтому лёгкий селектор выбирает один связный путь среди топ-16 кандидатов. А чтобы точность не падала к концу блока, добавили короткую свёртку с тремя процентами дополнительных параметров. Итог: каждый проверочный проход принимает на 20% больше токенов при надбавке к задержке около 1%.

У меня Qwen3.8 27B работает локально на Mac mini, так что новость зацепила лично: черновик для этой модели уже лежит на Hugging Face, рядом версия для Muse Glimmer. Локальные модели становятся заметно быстрее без нового железа и без потери качества.

Скорость инференса превращается в отдельную инженерную дисциплину: агенты часами читают документы и вызывают инструменты, и каждый токен стоит времени и денег. Тот, кто выжимает больше токенов из имеющегося железа, получает преимущество, которое не купишь более мощной моделью.

Следующий шаг

Локальные модели в работе: Mac Studio, DAWalka и DeepSeek — рассказ Миши Иванова

Связанные материалы

Если вы запускаете модели локально или собираете агентный контур, где скорость и стоимость токена критичны, эту тему стоит обсудить предметно.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov