
MiniMax H3 (Hailuo 3): обзор нейросети для видео со звуком - цены и наш тест
На Genova AI появилась MiniMax H3 - новая видеонейросеть от создателей Hailuo AI, ее еще называют Hailuo 3. Она делает ролики до 15 секунд в качестве 2K, и звук у нее появляется вместе с картинкой: речь героев, шумы, музыка. Мы прогнали модель на своих промптах и показываем три ролика как есть, без пересъемок. Ниже - что она умеет по документации, сколько стоит секунда и где она сильнее или слабее соседей.
Разработчик: MiniMax, Китай · Вышла: 31 июля 2026 · Длительность: 4-15 секунд · Качество: 768P или 2K · Звук: стерео, речь на 11 языках, включая русский · Цена: от 120 Дженов за секунду

Кадры из роликов MiniMax H3, которые мы сгенерировали для этого обзора
Что такое MiniMax H3 и при чем тут Hailuo AI
MiniMax - китайская компания, ее сервис для видео называется Hailuo AI. Ее прошлые видеомодели назывались Hailuo 02 (июнь 2025) и Hailuo 2.3 (октябрь 2025). Новую версию MiniMax выпустила 31 июля 2026 года под именем MiniMax H3, а на сайте Hailuo прямо пишут, что Hailuo 3, Hailuo H3 и H3 - одна и та же модель. Так что если вы искали "хайлуо 3", "hailuo 3.0" или просто новую версию Hailuo AI, это она.
Главное отличие от прошлых версий - звук. Hailuo 02 и 2.3 делали немое видео, а H3 генерирует картинку, речь, шумы и музыку одним проходом, в стерео. Через три дня после выхода, 3 августа, MiniMax выложила веса модели в открытый доступ, и на начало августа, по данным рейтинга Arena, H3 была лучшей видеомоделью с открытыми весами.
Что нового по сравнению с Hailuo 02 и Hailuo 2.3
Параметр | Hailuo 02 и 2.3 | MiniMax H3 |
|---|---|---|
Звук | нет, видео немое | стерео: речь, шумы, музыка |
Длительность | 6 или 10 секунд | 4-15 секунд, любое целое число |
Качество | 768P или 1080P, 1080P только на 6 секунд | 768P или 2K (2560×1440) |
Длина описания | до 2 000 символов | до 7 000 символов |
Формат кадра из текста | выбрать нельзя | 6 вариантов, от 21:9 до 9:16 |
Референсы | одно фото лица в отдельной модели | до 9 фото, 3 видео и 3 аудио в одном запросе |
По слепым сравнениям видно, что это не косметика. В рейтинге Artificial Analysis, где люди выбирают лучший из двух роликов, не зная названий моделей, H3 без звука набирает 1302 очка в режиме "текст в видео" против 1176 у Hailuo 2.3.
Что MiniMax H3 выдает на практике: наш тест
29 сентября мы сделали на H3 восемь роликов в разных режимах. Здесь три самых показательных, каждый с первого прогона. Промпты лежат под роликами, их можно скопировать и повторить у себя. Звук мы проверяли расшифровкой дорожки, а не на слух.
Моряк говорит по-русски
Промпт целиком:
Крупный план: пожилой моряк в вязаном свитере смотрит в камеру и спокойно говорит по-русски: "Море никогда не прощает спешки". За спиной шумит прибой и кричат чайки, мягкий вечерний свет.
Реплику модель произнесла слово в слово и без искажений, губы двигаются, пока он говорит. Точную синхронность мы не мерили. Лицо не плывет все шесть секунд: морщины, щетина и растрепанные ветром волосы остаются теми же от первого кадра до последнего. Два отступления от промпта: чаек в дорожке не слышно, зато появилась тихая фоновая музыка, которую никто не просил.
Это один прогон, а не бенчмарк. Автор независимого теста на YouTube оценил русскую речь H3 примерно на уровне Veo 3, но заметил ошибки в отдельных словах и неточный липсинк. Короткая реплика, как у нас, - самый надежный вариант.
Надпись кириллицей и ролик без музыки
Промпт целиком:
Рекламный ролик: бутылка холодного лимонада на мокром камне, капли стекают по стеклу, камера медленно облетает бутылку. В конце крупная надпись "СВЕЖЕСТЬ ЛЕТА" появляется над бутылкой. Яркий солнечный свет, звук шипения газировки. Без музыки.
Надпись появляется на первой секунде и держится до конца, все буквы на месте, кириллица без ошибок. Просьбу "Без музыки" модель выполнила: в дорожке только шипение, правда, похожее скорее на жарку на сковороде, чем на газировку. Две вещи не сработали. Камера почти не двигается, облета не получилось. А бутылку модель положила на бок: в промпте не было сказано, что она стоит, и H3 решила по-своему.
Машина превращается в робота
Промпт - одна фраза:
Машина превращается в робота
На входе было одно фото седана на мокрой парковке. За четыре секунды машина раскладывается в робота, и он сохраняет черный лак, форму фар и светодиодные полосы исходной модели. Парковка, дома и дождливое небо остаются на месте. Звук модель придумала сама: оркестровая музыка, удары и взрыв. Для ролика с одной фразой в промпте это хороший результат.
Что еще мы замерили
Ролик в 768P с форматом 16:9 выходит размером 1344×768, в 2K - 2560×1440. Частота всегда 24 кадра в секунду, звук стерео. Длина получается чуть больше заказанной: вместо 6 секунд - 6,6, вместо 4 - 4,5.
Режимы, длительность, разрешение и звук
Длина ролика - от 4 до 15 секунд, любое целое число. Качество - 768P или 2K. Звук генерируется всегда: отдельного выключателя нет, но музыку или тишину можно попросить текстом. Режимов три, и на Genova AI они собраны на одной странице.
Из текста
Описываете сцену словами, до 7 000 символов. Формат кадра выбираете сами: 21:9, 16:9, 4:3, 1:1, 3:4 или 9:16. Звук появляется без отдельной настройки.
Из фото
Загружаете кадр начала и, по желанию, кадр конца, модель строит движение между ними. Формат ролика берется из картинки. В описании лучше писать про движение, а не про то, что уже есть на снимке.
По референсам
Самый гибкий режим. Модели можно дать до 9 фото (герой, товар, стиль, место), до 3 видео с нужным движением или камерой и до 3 аудио с голосом или атмосферой. Видео и аудио - по 2-15 секунд каждое и в сумме не больше 15. Всего MiniMax принимает до 12 файлов на один ролик. Аудио работает только вместе с фото или видео.
Режимы взаимоисключающие: задать первый кадр и одновременно добавить референсы нельзя.
Можно ли скачать MiniMax H3 и запустить на компьютере
Можно, но это задача для мощного железа. 3 августа MiniMax выложила веса H3 на Hugging Face: это модель на 33 млрд параметров, ее запускают через ComfyUI, diffusers, SGLang или vLLM. В официальном примере запуска модель работает сразу на четырех видеокартах. Энтузиасты запускали ее и на одной RTX 5090 с 32 ГБ памяти, но в 768P. Качество 2K MiniMax отдает только через свой API, в открытой версии его нет. Там же, только через API, работает модуль, который перед генерацией разворачивает короткий промпт в подробный сценарий, а по словам самой MiniMax он сильно влияет на результат.
Если под рукой нет видеокарты уровня RTX 5090, проще пользоваться онлайн: на Genova AI ничего скачивать не нужно, доступны оба качества, 768P и 2K, и все три режима.
Сколько стоит MiniMax H3 и как оплатить из России
Цена считается за секунду готового ролика и зависит от качества.
Качество | За секунду | Ролик 6 сек | Ролик 10 сек | Ролик 15 сек |
|---|---|---|---|---|
768P | 120 Дженов | 720 | 1 200 | 1 800 |
2K | 180 Дженов | 1 080 | 1 800 | 2 700 |
В режиме референсов есть два дополнения. Секунды загруженных видео оплачиваются по той же ставке, что и секунды результата: 5 секунд видео-образца к ролику на 6 секунд в 768P дадут 11 × 120 = 1 320 Дженов. Фото: первые пять бесплатно, каждое следующее стоит 50 Дженов. Аудио ничего не стоит. Итог всегда виден на кнопке до запуска, а Джены списываются только за готовое видео.
Подписки нет: вы покупаете пакет Дженов российской картой или через СБП и тратите их на любые модели сайта. В рублях все зависит от пакета: чем он больше, тем дешевле Джен. Ролик на 6 секунд в 2K обойдется примерно в 85-150 рублей.
Цены указаны на 29 сентября 2026 года, актуальные всегда на странице MiniMax H3.
Альтернативы: MiniMax H3 против Seedance 2.5, Veo 3.1 и Kling 3.0
Параметр | MiniMax H3 | Seedance 2.5 | Veo 3.1 | Kling 3.0 |
|---|---|---|---|---|
Разработчик | MiniMax | ByteDance | Kuaishou | |
Длительность | 4-15 сек | 4-30 сек | до 8 сек, можно продлить | 3-15 сек |
Максимум качества | 2K | 1080p | 4K | 1080p |
Звук | всегда, речь и шумы | нативный, можно выключить | речь и эффекты | по желанию |
Референсы | 9 фото, 3 видео, 3 аудио | 30 фото, 10 видео, 10 аудио | 1-3 фото | первый и последний кадр |
Цена на Genova AI | 120-180 Дженов за секунду | 300-1 530 Дженов за секунду | от 300 Дженов за ролик | 200-390 Дженов за секунду |
По слепым голосованиям H3 сейчас в верхней группе. В рейтинге Artificial Analysis на 29 сентября у нее 1220 очков в категории "текст в видео со звуком" (4-е место), у Veo 3.1 - 1088, у Kling 3.0 Pro - 1095. В режиме "фото в видео" H3 делит 2-5 места с Seedance 2.0 и Gemini Omni Flash. Внутри рейтинга у H3 первое место по физике движения и второе по тексту в кадре.
Рейтинг - не приговор. В независимом обзоре Curious Refuge Seedance 2.5 уверенно выигрывала у H3 на крупных сценах с экшеном: у H3 там появлялись артефакты текстур и искажения лиц. А авторы теста Vmake поставили H3 4,3 балла из 5 против 4,6 у Seedance 2.5 и 4,0 у Kling 3.0, отметив, что подписи в кадре у H3 читаемые.
Коротко: H3 берет качеством 2K со звуком за умеренную цену, Seedance 2.5 - длиной ролика и числом референсов, Veo 3.1 - максимальным разрешением 4K.
Как писать промпт для MiniMax H3: советы и примеры
Правила ниже - из наших прогонов и официального гайда MiniMax по промптам.
Реплику пишите в кавычках и называйте язык. Формулировка "говорит по-русски: "..."" сработала с первого раза. Короткая фраза надежнее длинного монолога.
Если музыка не нужна, так и напишите. Без этого H3 часто подкладывает фоновую музыку сама, а "Без музыки" в конце промпта она выполнила. Отдельного выключателя звука у модели нет, тишину тоже можно попросить только текстом.
Надпись - в кавычках, крупно и коротко. Два-три слова модель пишет чисто. Мелкий текст на заднем плане она рисует хуже: в ролике с кофе, который мы тоже делали, газета на столе покрылась неразборчивыми буквами.
Положение предметов и движение камеры описывайте явно. "Облетает бутылку" модель проигнорировала. В гайде MiniMax для облета используется формулировка arc shot - движение камеры по дуге вокруг объекта, а для наезда push in. Если важно, стоит ли предмет или лежит, скажите это прямо.
Для нескольких сцен в одном ролике используйте разметку. Официальный гайд описывает склейки через "[Shot 2] At 00:04.500" - так модель понимает, в какой момент сменить план. Это мы пока не проверяли.
В режиме фото описывайте только движение. Все, что есть на снимке, модель уже видит.
Сколько ждать результат
По нашим восьми запускам ролики 768P длиной 4-7 секунд считались от 2,5 до 7 минут. Два ролика в 2K по 6 секунд - 6 и 11 минут. Держать страницу открытой не нужно: готовое видео само появится в блоке "Последние генерации" и в истории.
Как попробовать MiniMax H3 в России без VPN
Модель доступна на странице генерации MiniMax H3. VPN не нужен, оплата российской картой, интерфейс и промпты на русском. Все три режима на одной странице, переключатель над полем описания.
Если нужен ролик длиннее 15 секунд или много референсов, посмотрите наш обзор Seedance 2.5. А бесплатно попробовать генерацию видео можно в Grok Imagine: стартовых Дженов хватает на шестисекундный ролик в 480p.
Коротко: брать или нет
MiniMax H3 стоит брать, когда нужен ролик до 15 секунд в хорошем качестве и сразу со звуком: реклама товара с надписью, короткая сцена с репликой героя, превращение объекта по фото. По цене секунды в 2K она заметно дешевле Seedance 2.5 в 1080p и Kling 3.0 со звуком.
Если ролик длиннее 15 секунд, сцена с быстрым экшеном или нужен 4K, H3 не лучший выбор, для этого на сайте есть Seedance 2.5 и Veo 3.1. Начинать с H3 разумно в 768P на 4-6 секунд: так дешевле всего понять, как модель реагирует на ваши формулировки, а финал уже собирать в 2K.
Часто задаваемые вопросы
Комментарии
Пока нет комментариев. Будьте первым!
📖 Похожие статьи

Генерация изображений по описанию бесплатно - пошаговый гайд
🎨 Как создать картинку по описанию с помощью нейросети - бесплатно и на русском языке? Написали пошаговый гайд: как правильно составить описание, какие настройки выбрать и как получить качественный результат с первого раза. Внутри - примеры промптов и готовые результаты.
Читать
Seedream 5.0 Lite: новый уровень AI генерации изображений - что нужно знать в 2026 году
Seedream 5.0 Lite от ByteDance - новый AI-генератор изображений с 4K-качеством, точной генерацией текста и web-поиском. В статье: сравнение с версией 4.5, реальные примеры и инструкция. Попробуйте бесплатно с стартовыми Дженами на Genova AI.
Читать
Генерация картинок нейросетью: Топ-5 сервисов, где ИИ рисует по описанию (2026 год)
Обзор 5 лучших нейросетей для генерации изображений в 2026 году. Сравниваем Шедеврум, Kandinsky, Leonardo и другие сервисы. Узнайте, где можно бесплатно сгенерировать картинки по тексту на русском языке и как использовать передовые ИИ-модели без включения VPN.
Читать
