Gemma 4 E2B — младшая модель семейства Gemma 4 от Google. Она принимает текст, изображения и звук, поддерживает контекст до 128K токенов и рассчитана на локальный запуск на устройствах с ограниченной памятью. Ниже — требования к железу и три способа запуска: Ollama, LM Studio и Python.
Данные о моделях, памяти, Transformers, Ollama и LM Studio проверены по указанным источникам 7 сентября 2026 года. Практические показатели скорости зависят от компьютера, формата весов, длины контекста и выбранного рантайма.
Что такое Gemma 4 E2B
Gemma 4 — семейство моделей с открытыми весами. Их можно скачивать, дообучать и разворачивать в собственных приложениях. Ответственное коммерческое использование допускается условиями Gemma, поэтому перед внедрением стоит проверить актуальные условия лицензии и правила допустимого использования.
В семейство входят пять размеров: E2B, E4B, 12B, 26B A4B и 31B. Буква E означает число эффективных параметров. В E2B и E4B применяется архитектура Per-Layer Embeddings (PLE): каждый слой декодера получает собственную таблицу эмбеддингов. Это повышает эффективность компактных моделей, хотя требуемый объём памяти для статических весов остаётся больше, чем можно предположить по обозначению E2B.
Основные возможности E2B:
- текстовые, графические и звуковые входные данные;
- контекст до 128K токенов;
- настраиваемый режим рассуждения;
- встроенная поддержка вызова функций;
- нативная системная роль в диалоге;
- отдельная черновая модель для ускорения генерации методом спекулятивного декодирования (speculative decoding).
Когда полезен локальный запуск
После загрузки весов и установки зависимостей модель может использоваться без обращения к облачному API. Это подходит для трёх типов задач:
- Конфиденциальная обработка. Документы и записи остаются на устройстве, если выбранный интерфейс не обращается к внешним сервисам.
- Автономная работа. Текстовые запросы, изображения и аудиофайлы можно обрабатывать без сети после предварительной настройки, если веса и входные файлы находятся на устройстве.
- Предсказуемые расходы. Локальная генерация не тарифицируется по токенам, но использует ресурсы компьютера и требует места для весов.
E2B предназначена для компактного локального инференса. Для сложного программирования, длинных рассуждений и задач с высокими требованиями к точности может понадобиться более крупная модель. Результаты OCR, транскрипции и извлечения фактов нужно проверять перед использованием в важных документах.
Полезные сценарии
Разбор изображения документа
Передайте модели фотографию или изображение страницы вместе с вопросом: например, попросите извлечь реквизиты или перечислить пункты таблицы. Наблюдаемый результат — текстовый ответ с распознанным содержимым.
Gemma не заменяет специализированный OCR в процессах, где требуется гарантированная точность. PDF может потребоваться предварительно преобразовать в изображения страниц: прямой ввод PDF в приведённом ниже примере не настроен.
Локальная расшифровка речи
Передайте аудиофайл и попросите вернуть только расшифровку. Для E2B документация Gemma 4 описывает распознавание речи, перевод аудио и общее понимание звуковых данных.
В официальном примере запись WebM предварительно преобразуют в WAV, а затем передают конвейеру. Точность на конкретной записи не гарантируется: результат стоит проверить сравнением нескольких фрагментов с исходным аудио.
Ответы по изображениям
Поместите изображение перед текстовым вопросом в содержимом сообщения. Модель может описать сцену, прочитать видимые элементы или ответить на вопрос по схеме. Для чисел и важных деталей полезно запросить структурированный ответ и сверить его с оригиналом.
Локальный помощник со своими функциями
Встроенная поддержка вызова функций позволяет связать модель с локальными командами и программами. Приложение может принять предложенный моделью вызов, проверить аргументы, выполнить разрешённое действие и вернуть результат в диалог.
Не передавайте модели неограниченный доступ к оболочке или файлам. Список функций, аргументы и права выполнения лучше задавать явно.
Требования к памяти
Официальная таблица Google приводит приблизительный объём памяти GPU или TPU с учётом 20% накладных расходов на загрузку дополнительных компонентов.
Квантизация уменьшает размер и требования к памяти за счёт меньшей точности представления весов; при этом качество может снижаться.
| Формат E2B | Ориентир по памяти | Когда выбирать |
| Q4_0, 4-bit | 2,9 ГБ | Минимальный локальный вариант для совместимого рантайма |
| SFP8, 8-bit | 5,7 ГБ | Когда памяти достаточно для более высокой точности весов |
| BF16, 16-bit | 11,4 ГБ | Для совместимого ускорителя с достаточным запасом памяти |
| Mobile | 1,1 ГБ | Специализированные мобильные веса LiteRT-LM |
| Mobile, только текст | 0,84 ГБ | Мобильный режим без мультимодальных входов |
Для локального запуска на CPU и Apple Silicon в источниках указаны GGUF-веса для llama.cpp и LM Studio; в каталоге Ollama перечислены варианты MLX. Реальная скорость зависит от процессора, пропускной способности памяти, квантизации и рантайма, поэтому её лучше измерить на собственном запросе.
Как выбрать способ запуска
| Способ | Кому подойдёт | Что даёт |
| Ollama | Для быстрого старта из терминала | Загрузка и запуск одной командой |
| LM Studio | Тем, кому нужен графический интерфейс | Поиск моделей, выбор квантизации и локальный чат |
| Transformers | Разработчикам | Интеграция текста, изображений и аудио в Python-код |
Быстрый запуск через Ollama
Установите Ollama, затем выполните:
ollama run gemma4:e2bКоманда обращается к тегу gemma4:e2b; при первом запуске потребуется загрузить соответствующие веса. После загрузки в терминале появится строка ввода для диалога. Тег gemma4:e2b присутствовал в каталоге Ollama на дату проверки.
В каталоге на ту же дату перечислены варианты E2B, включая e2b-it-qat (QAT, квантизация с учётом обучения), e2b-it-q4_K_M, e2b-it-q8_0, e2b-it-bf16 и e2b-mlx.
Для проверки задайте короткий запрос:
Промпт:
Объясни в двух предложениях, чем локальная модель отличается от облачного API.Успешный результат — связный ответ без ошибки загрузки модели. Если команда не находит тег, откройте актуальный список вариантов Gemma 4 в каталоге Ollama.
Запуск через LM Studio
- Откройте раздел поиска моделей.
- Найдите Gemma 4 по названию или вставьте идентификатор модели с Hugging Face.
- Выберите совместимый вариант. В документации LM Studio советуют выбирать 4-битную квантизацию или выше, если компьютер справляется с её объёмом.
- Загрузите модель и откройте её в локальном чате.
- Отправьте простой текстовый запрос и проверьте, что ответ генерируется без выгрузки системы в своп.
Официальные QAT-веса Gemma 4 в формате GGUF предназначены, среди прочего, для локального запуска через llama.cpp и LM Studio.
Запуск через Python и Transformers
Для примера Google указывает transformers>=5.10.1. Установите PyTorch и Transformers:
pip install -U torch "transformers>=5.10.1" accelerateМинимальный текстовый пример:
from transformers import GenerationConfig, pipeline
MODEL_ID = "google/gemma-4-E2B-it"
pipe = pipeline(
task="any-to-any",
model=MODEL_ID,
device_map="auto",
dtype="auto",
)
config = GenerationConfig.from_pretrained(MODEL_ID)
config.max_new_tokens = 256
messages = [
{
"role": "system",
"content": [
{"type": "text", "text": "Ты полезный ассистент."}
],
},
{
"role": "user",
"content": [
{
"type": "text",
"text": "Объясни, что такое локальная модель, в двух предложениях.",
}
],
},
]
result = pipe(
messages,
return_full_text=False,
generate_kwargs={"generation_config": config},
)
print(result[0]["generated_text"])Успешный результат — текст ответа в поле generated_text. Первый запуск требует доступа к весам модели и достаточного места на диске.
Для изображения добавьте элемент {"type": "image", "url": "..."} перед текстом внутри content. Для звука сначала поместите текстовую инструкцию, затем элемент {"type": "audio", "audio": "..."}. В официальных мультимодальных примерах такой список передаётся в pipe(text=messages, ...).
Настройки и формат диалога
Для многоходового диалога передавайте сообщения со свойствами role и content. Содержимое мультимодального сообщения оформляется списком типизированных элементов: text, image или audio.
Начните с конфигурации генерации, поставляемой вместе с моделью, и меняйте параметры под свою задачу. Универсального набора значений для всех сценариев в использованных официальных источниках нет.
Режим рассуждения у Gemma 4 настраивается, но точный способ управления зависит от используемого рантайма и его версии. Перед добавлением специальных токенов сверяйтесь с актуальной документацией выбранного интерфейса.
Проверка результата и типовые проблемы
Материал основан на документации и каталогах, перечисленных ниже. Показатели скорости на конкретном компьютере отдельно не проверялись.
Официальные ссылки
- Обзор Gemma 4
- Запуск Gemma через Hugging Face Transformers
- Работа Gemma со звуком
- Актуальные теги Gemma 4 в Ollama
- Загрузка моделей в LM Studio
Следующий шаг
LM Studio — локальный запуск LLM и агент Bionic
Локальную модель можно встроить в приватный рабочий контур для документов, аудио и внутренних инструментов. При проектировании такого контура нужно отдельно определить границы доступа, требования к железу и способ проверки результатов.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov


