Команда Inco AI выпустила DFlash 2, вторую версию метода параллельного спекулятивного декодирования. Модель Qwen3.8-27B на MacBook Pro с M5 Max выдаёт 70 токенов в секунду: до 4,6 раза быстрее обычной генерации, и текст на выходе не меняется ни на один токен.
Механика такая: маленькая черновая модель угадывает сразу блок токенов, большая проверяет его за один проход. Удачные догадки принимаются, остальные отбрасываются. Первая версия DFlash научила черновик предсказывать блок параллельно, и метод уже работает в SGLang, vLLM, TensorRT-LLM и llama.cpp: NVIDIA замерила до 15-кратного роста на Blackwell, Google сообщила о трёхкратном приросте на TPU.
DFlash 2 закрывает два слабых места. Черновик предсказывает каждую позицию независимо, поэтому лёгкий селектор выбирает один связный путь среди топ-16 кандидатов. А чтобы точность не падала к концу блока, добавили короткую свёртку с тремя процентами дополнительных параметров. Итог: каждый проверочный проход принимает на 20% больше токенов при надбавке к задержке около 1%.
У меня Qwen3.8 27B работает локально на Mac mini, так что новость зацепила лично: черновик для этой модели уже лежит на Hugging Face, рядом версия для Muse Glimmer. Локальные модели становятся заметно быстрее без нового железа и без потери качества.
Скорость инференса превращается в отдельную инженерную дисциплину: агенты часами читают документы и вызывают инструменты, и каждый токен стоит времени и денег. Тот, кто выжимает больше токенов из имеющегося железа, получает преимущество, которое не купишь более мощной моделью.
Следующий шаг
Локальные модели в работе: Mac Studio, DAWalka и DeepSeek — рассказ Миши Иванова
Если вы запускаете модели локально или собираете агентный контур, где скорость и стоимость токена критичны, эту тему стоит обсудить предметно.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov



