Gemma 4 E2B — младшая модель семейства Gemma 4 от Google. Она принимает текст, изображения и звук, поддерживает контекст до 128K токенов и рассчитана на локальный запуск на устройствах с ограниченной памятью. Ниже — требования к железу и три способа запуска: Ollama, LM Studio и Python.

Данные о моделях, памяти, Transformers, Ollama и LM Studio проверены по указанным источникам 7 сентября 2026 года. Практические показатели скорости зависят от компьютера, формата весов, длины контекста и выбранного рантайма.

Что такое Gemma 4 E2B

Gemma 4 — семейство моделей с открытыми весами. Их можно скачивать, дообучать и разворачивать в собственных приложениях. Ответственное коммерческое использование допускается условиями Gemma, поэтому перед внедрением стоит проверить актуальные условия лицензии и правила допустимого использования.

В семейство входят пять размеров: E2B, E4B, 12B, 26B A4B и 31B. Буква E означает число эффективных параметров. В E2B и E4B применяется архитектура Per-Layer Embeddings (PLE): каждый слой декодера получает собственную таблицу эмбеддингов. Это повышает эффективность компактных моделей, хотя требуемый объём памяти для статических весов остаётся больше, чем можно предположить по обозначению E2B.

Основные возможности E2B:

  • текстовые, графические и звуковые входные данные;
  • контекст до 128K токенов;
  • настраиваемый режим рассуждения;
  • встроенная поддержка вызова функций;
  • нативная системная роль в диалоге;
  • отдельная черновая модель для ускорения генерации методом спекулятивного декодирования (speculative decoding).

Когда полезен локальный запуск

После загрузки весов и установки зависимостей модель может использоваться без обращения к облачному API. Это подходит для трёх типов задач:

  • Конфиденциальная обработка. Документы и записи остаются на устройстве, если выбранный интерфейс не обращается к внешним сервисам.
  • Автономная работа. Текстовые запросы, изображения и аудиофайлы можно обрабатывать без сети после предварительной настройки, если веса и входные файлы находятся на устройстве.
  • Предсказуемые расходы. Локальная генерация не тарифицируется по токенам, но использует ресурсы компьютера и требует места для весов.

E2B предназначена для компактного локального инференса. Для сложного программирования, длинных рассуждений и задач с высокими требованиями к точности может понадобиться более крупная модель. Результаты OCR, транскрипции и извлечения фактов нужно проверять перед использованием в важных документах.

Полезные сценарии

Разбор изображения документа

Передайте модели фотографию или изображение страницы вместе с вопросом: например, попросите извлечь реквизиты или перечислить пункты таблицы. Наблюдаемый результат — текстовый ответ с распознанным содержимым.

Gemma не заменяет специализированный OCR в процессах, где требуется гарантированная точность. PDF может потребоваться предварительно преобразовать в изображения страниц: прямой ввод PDF в приведённом ниже примере не настроен.

Локальная расшифровка речи

Передайте аудиофайл и попросите вернуть только расшифровку. Для E2B документация Gemma 4 описывает распознавание речи, перевод аудио и общее понимание звуковых данных.

В официальном примере запись WebM предварительно преобразуют в WAV, а затем передают конвейеру. Точность на конкретной записи не гарантируется: результат стоит проверить сравнением нескольких фрагментов с исходным аудио.

Ответы по изображениям

Поместите изображение перед текстовым вопросом в содержимом сообщения. Модель может описать сцену, прочитать видимые элементы или ответить на вопрос по схеме. Для чисел и важных деталей полезно запросить структурированный ответ и сверить его с оригиналом.

Локальный помощник со своими функциями

Встроенная поддержка вызова функций позволяет связать модель с локальными командами и программами. Приложение может принять предложенный моделью вызов, проверить аргументы, выполнить разрешённое действие и вернуть результат в диалог.

Не передавайте модели неограниченный доступ к оболочке или файлам. Список функций, аргументы и права выполнения лучше задавать явно.

Требования к памяти

Официальная таблица Google приводит приблизительный объём памяти GPU или TPU с учётом 20% накладных расходов на загрузку дополнительных компонентов.

Квантизация уменьшает размер и требования к памяти за счёт меньшей точности представления весов; при этом качество может снижаться.

Формат E2BОриентир по памятиКогда выбирать
Q4_0, 4-bit2,9 ГБМинимальный локальный вариант для совместимого рантайма
SFP8, 8-bit5,7 ГБКогда памяти достаточно для более высокой точности весов
BF16, 16-bit11,4 ГБДля совместимого ускорителя с достаточным запасом памяти
Mobile1,1 ГБСпециализированные мобильные веса LiteRT-LM
Mobile, только текст0,84 ГБМобильный режим без мультимодальных входов
⚖️
Эти значения относятся к загрузке модели. Контекст и генерируемый ответ занимают дополнительную память в кэше ключей и значений (KV-кэше). Чем длиннее диалог, тем больше итоговое потребление RAM или VRAM.

Для локального запуска на CPU и Apple Silicon в источниках указаны GGUF-веса для llama.cpp и LM Studio; в каталоге Ollama перечислены варианты MLX. Реальная скорость зависит от процессора, пропускной способности памяти, квантизации и рантайма, поэтому её лучше измерить на собственном запросе.

Как выбрать способ запуска

СпособКому подойдётЧто даёт
OllamaДля быстрого старта из терминалаЗагрузка и запуск одной командой
LM StudioТем, кому нужен графический интерфейсПоиск моделей, выбор квантизации и локальный чат
TransformersРазработчикамИнтеграция текста, изображений и аудио в Python-код

Быстрый запуск через Ollama

Установите Ollama, затем выполните:

ollama run gemma4:e2b

Команда обращается к тегу gemma4:e2b; при первом запуске потребуется загрузить соответствующие веса. После загрузки в терминале появится строка ввода для диалога. Тег gemma4:e2b присутствовал в каталоге Ollama на дату проверки.

В каталоге на ту же дату перечислены варианты E2B, включая e2b-it-qat (QAT, квантизация с учётом обучения), e2b-it-q4_K_M, e2b-it-q8_0, e2b-it-bf16 и e2b-mlx.

Для проверки задайте короткий запрос:

Промпт:

Объясни в двух предложениях, чем локальная модель отличается от облачного API.

Успешный результат — связный ответ без ошибки загрузки модели. Если команда не находит тег, откройте актуальный список вариантов Gemma 4 в каталоге Ollama.

Запуск через LM Studio

  1. Откройте раздел поиска моделей.
  2. Найдите Gemma 4 по названию или вставьте идентификатор модели с Hugging Face.
  3. Выберите совместимый вариант. В документации LM Studio советуют выбирать 4-битную квантизацию или выше, если компьютер справляется с её объёмом.
  4. Загрузите модель и откройте её в локальном чате.
  5. Отправьте простой текстовый запрос и проверьте, что ответ генерируется без выгрузки системы в своп.

Официальные QAT-веса Gemma 4 в формате GGUF предназначены, среди прочего, для локального запуска через llama.cpp и LM Studio.

Запуск через Python и Transformers

Для примера Google указывает transformers>=5.10.1. Установите PyTorch и Transformers:

pip install -U torch "transformers>=5.10.1" accelerate

Минимальный текстовый пример:

from transformers import GenerationConfig, pipeline

MODEL_ID = "google/gemma-4-E2B-it"

pipe = pipeline(
    task="any-to-any",
    model=MODEL_ID,
    device_map="auto",
    dtype="auto",
)

config = GenerationConfig.from_pretrained(MODEL_ID)
config.max_new_tokens = 256

messages = [
    {
        "role": "system",
        "content": [
            {"type": "text", "text": "Ты полезный ассистент."}
        ],
    },
    {
        "role": "user",
        "content": [
            {
                "type": "text",
                "text": "Объясни, что такое локальная модель, в двух предложениях.",
            }
        ],
    },
]

result = pipe(
    messages,
    return_full_text=False,
    generate_kwargs={"generation_config": config},
)
print(result[0]["generated_text"])

Успешный результат — текст ответа в поле generated_text. Первый запуск требует доступа к весам модели и достаточного места на диске.

Для изображения добавьте элемент {"type": "image", "url": "..."} перед текстом внутри content. Для звука сначала поместите текстовую инструкцию, затем элемент {"type": "audio", "audio": "..."}. В официальных мультимодальных примерах такой список передаётся в pipe(text=messages, ...).

Настройки и формат диалога

Для многоходового диалога передавайте сообщения со свойствами role и content. Содержимое мультимодального сообщения оформляется списком типизированных элементов: text, image или audio.

Начните с конфигурации генерации, поставляемой вместе с моделью, и меняйте параметры под свою задачу. Универсального набора значений для всех сценариев в использованных официальных источниках нет.

Режим рассуждения у Gemma 4 настраивается, но точный способ управления зависит от используемого рантайма и его версии. Перед добавлением специальных токенов сверяйтесь с актуальной документацией выбранного интерфейса.

Проверка результата и типовые проблемы

Модель загружается без ошибки нехватки памяти.
Простой текстовый запрос возвращает связный ответ.
Длинный диалог не приводит к резкому росту свопа.
Изображение или аудио передаётся в поддерживаемом формате.
Критичные цифры, распознанный текст и транскрипция сверены с оригиналом.
Приложение не отправляет локальные данные во внешние сервисы без вашего решения.
⚠️
Если памяти не хватает, сократите контекст, выберите более компактную квантизацию или закройте тяжёлые приложения. Размер файла весов не учитывает весь KV-кэш и накладные расходы рантайма.

Материал основан на документации и каталогах, перечисленных ниже. Показатели скорости на конкретном компьютере отдельно не проверялись.

Официальные ссылки

Следующий шаг

LM Studio — локальный запуск LLM и агент Bionic

Локальную модель можно встроить в приватный рабочий контур для документов, аудио и внутренних инструментов. При проектировании такого контура нужно отдельно определить границы доступа, требования к железу и способ проверки результатов.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov