Мы используем cookie и сервис «Яндекс.Метрика» (счётчик 106640303, включая Вебвизор) для работы авторизации, аналитики и улучшения сайта. Подробнее — Политика обработки ПДн и Политика cookie.

    MiniMax H3 (Hailuo 3): обзор нейросети для видео со звуком - цены и наш тест
    Статья
    29 сентября 20269 мин

    MiniMax H3 (Hailuo 3): обзор нейросети для видео со звуком - цены и наш тест

    На Genova AI появилась MiniMax H3 - новая видеонейросеть от создателей Hailuo AI, ее еще называют Hailuo 3. Она делает ролики до 15 секунд в качестве 2K, и звук у нее появляется вместе с картинкой: речь героев, шумы, музыка. Мы прогнали модель на своих промптах и показываем три ролика как есть, без пересъемок. Ниже - что она умеет по документации, сколько стоит секунда и где она сильнее или слабее соседей.

    Разработчик: MiniMax, Китай · Вышла: 31 июля 2026 · Длительность: 4-15 секунд · Качество: 768P или 2K · Звук: стерео, речь на 11 языках, включая русский · Цена: от 120 Дженов за секунду

    MiniMax H3 (Hailuo 3) - обзор нейросети для видео в 2K со звуком: кадры из тестовых роликов

    Кадры из роликов MiniMax H3, которые мы сгенерировали для этого обзора

    Что такое MiniMax H3 и при чем тут Hailuo AI

    MiniMax - китайская компания, ее сервис для видео называется Hailuo AI. Ее прошлые видеомодели назывались Hailuo 02 (июнь 2025) и Hailuo 2.3 (октябрь 2025). Новую версию MiniMax выпустила 31 июля 2026 года под именем MiniMax H3, а на сайте Hailuo прямо пишут, что Hailuo 3, Hailuo H3 и H3 - одна и та же модель. Так что если вы искали "хайлуо 3", "hailuo 3.0" или просто новую версию Hailuo AI, это она.

    Главное отличие от прошлых версий - звук. Hailuo 02 и 2.3 делали немое видео, а H3 генерирует картинку, речь, шумы и музыку одним проходом, в стерео. Через три дня после выхода, 3 августа, MiniMax выложила веса модели в открытый доступ, и на начало августа, по данным рейтинга Arena, H3 была лучшей видеомоделью с открытыми весами.

    Что нового по сравнению с Hailuo 02 и Hailuo 2.3

    Параметр

    Hailuo 02 и 2.3

    MiniMax H3

    Звук

    нет, видео немое

    стерео: речь, шумы, музыка

    Длительность

    6 или 10 секунд

    4-15 секунд, любое целое число

    Качество

    768P или 1080P, 1080P только на 6 секунд

    768P или 2K (2560×1440)

    Длина описания

    до 2 000 символов

    до 7 000 символов

    Формат кадра из текста

    выбрать нельзя

    6 вариантов, от 21:9 до 9:16

    Референсы

    одно фото лица в отдельной модели

    до 9 фото, 3 видео и 3 аудио в одном запросе

    По слепым сравнениям видно, что это не косметика. В рейтинге Artificial Analysis, где люди выбирают лучший из двух роликов, не зная названий моделей, H3 без звука набирает 1302 очка в режиме "текст в видео" против 1176 у Hailuo 2.3.

    Что MiniMax H3 выдает на практике: наш тест

    29 сентября мы сделали на H3 восемь роликов в разных режимах. Здесь три самых показательных, каждый с первого прогона. Промпты лежат под роликами, их можно скопировать и повторить у себя. Звук мы проверяли расшифровкой дорожки, а не на слух.

    Моряк говорит по-русски

    0:00 / 0:06
    MiniMax H3, 2K (2560×1440), 6 секунд, режим "Из текста". Включите звук: реплика по-русски, прибой и тихая фоновая музыка

    Промпт целиком:

    Крупный план: пожилой моряк в вязаном свитере смотрит в камеру и спокойно говорит по-русски: "Море никогда не прощает спешки". За спиной шумит прибой и кричат чайки, мягкий вечерний свет.

    Реплику модель произнесла слово в слово и без искажений, губы двигаются, пока он говорит. Точную синхронность мы не мерили. Лицо не плывет все шесть секунд: морщины, щетина и растрепанные ветром волосы остаются теми же от первого кадра до последнего. Два отступления от промпта: чаек в дорожке не слышно, зато появилась тихая фоновая музыка, которую никто не просил.

    Это один прогон, а не бенчмарк. Автор независимого теста на YouTube оценил русскую речь H3 примерно на уровне Veo 3, но заметил ошибки в отдельных словах и неточный липсинк. Короткая реплика, как у нас, - самый надежный вариант.

    Надпись кириллицей и ролик без музыки

    0:00 / 0:06
    MiniMax H3, 768P (1344×768), 6 секунд, режим "Из текста". В дорожке только шипение, музыки нет

    Промпт целиком:

    Рекламный ролик: бутылка холодного лимонада на мокром камне, капли стекают по стеклу, камера медленно облетает бутылку. В конце крупная надпись "СВЕЖЕСТЬ ЛЕТА" появляется над бутылкой. Яркий солнечный свет, звук шипения газировки. Без музыки.

    Надпись появляется на первой секунде и держится до конца, все буквы на месте, кириллица без ошибок. Просьбу "Без музыки" модель выполнила: в дорожке только шипение, правда, похожее скорее на жарку на сковороде, чем на газировку. Две вещи не сработали. Камера почти не двигается, облета не получилось. А бутылку модель положила на бок: в промпте не было сказано, что она стоит, и H3 решила по-своему.

    Машина превращается в робота

    0:00 / 0:07
    MiniMax H3, 768P, 7 секунд, режим "По референсам": одно фото черного седана на парковке

    Промпт - одна фраза:

    Машина превращается в робота

    На входе было одно фото седана на мокрой парковке. За четыре секунды машина раскладывается в робота, и он сохраняет черный лак, форму фар и светодиодные полосы исходной модели. Парковка, дома и дождливое небо остаются на месте. Звук модель придумала сама: оркестровая музыка, удары и взрыв. Для ролика с одной фразой в промпте это хороший результат.

    Что еще мы замерили

    Ролик в 768P с форматом 16:9 выходит размером 1344×768, в 2K - 2560×1440. Частота всегда 24 кадра в секунду, звук стерео. Длина получается чуть больше заказанной: вместо 6 секунд - 6,6, вместо 4 - 4,5.

    Режимы, длительность, разрешение и звук

    Длина ролика - от 4 до 15 секунд, любое целое число. Качество - 768P или 2K. Звук генерируется всегда: отдельного выключателя нет, но музыку или тишину можно попросить текстом. Режимов три, и на Genova AI они собраны на одной странице.

    Из текста

    Описываете сцену словами, до 7 000 символов. Формат кадра выбираете сами: 21:9, 16:9, 4:3, 1:1, 3:4 или 9:16. Звук появляется без отдельной настройки.

    Из фото

    Загружаете кадр начала и, по желанию, кадр конца, модель строит движение между ними. Формат ролика берется из картинки. В описании лучше писать про движение, а не про то, что уже есть на снимке.

    По референсам

    Самый гибкий режим. Модели можно дать до 9 фото (герой, товар, стиль, место), до 3 видео с нужным движением или камерой и до 3 аудио с голосом или атмосферой. Видео и аудио - по 2-15 секунд каждое и в сумме не больше 15. Всего MiniMax принимает до 12 файлов на один ролик. Аудио работает только вместе с фото или видео.

    Режимы взаимоисключающие: задать первый кадр и одновременно добавить референсы нельзя.

    Можно ли скачать MiniMax H3 и запустить на компьютере

    Можно, но это задача для мощного железа. 3 августа MiniMax выложила веса H3 на Hugging Face: это модель на 33 млрд параметров, ее запускают через ComfyUI, diffusers, SGLang или vLLM. В официальном примере запуска модель работает сразу на четырех видеокартах. Энтузиасты запускали ее и на одной RTX 5090 с 32 ГБ памяти, но в 768P. Качество 2K MiniMax отдает только через свой API, в открытой версии его нет. Там же, только через API, работает модуль, который перед генерацией разворачивает короткий промпт в подробный сценарий, а по словам самой MiniMax он сильно влияет на результат.

    Если под рукой нет видеокарты уровня RTX 5090, проще пользоваться онлайн: на Genova AI ничего скачивать не нужно, доступны оба качества, 768P и 2K, и все три режима.

    Сколько стоит MiniMax H3 и как оплатить из России

    Цена считается за секунду готового ролика и зависит от качества.

    Качество

    За секунду

    Ролик 6 сек

    Ролик 10 сек

    Ролик 15 сек

    768P

    120 Дженов

    720

    1 200

    1 800

    2K

    180 Дженов

    1 080

    1 800

    2 700

    В режиме референсов есть два дополнения. Секунды загруженных видео оплачиваются по той же ставке, что и секунды результата: 5 секунд видео-образца к ролику на 6 секунд в 768P дадут 11 × 120 = 1 320 Дженов. Фото: первые пять бесплатно, каждое следующее стоит 50 Дженов. Аудио ничего не стоит. Итог всегда виден на кнопке до запуска, а Джены списываются только за готовое видео.

    Подписки нет: вы покупаете пакет Дженов российской картой или через СБП и тратите их на любые модели сайта. В рублях все зависит от пакета: чем он больше, тем дешевле Джен. Ролик на 6 секунд в 2K обойдется примерно в 85-150 рублей.

    Цены указаны на 29 сентября 2026 года, актуальные всегда на странице MiniMax H3.

    Альтернативы: MiniMax H3 против Seedance 2.5, Veo 3.1 и Kling 3.0

    Параметр

    MiniMax H3

    Seedance 2.5

    Veo 3.1

    Kling 3.0

    Разработчик

    MiniMax

    ByteDance

    Google

    Kuaishou

    Длительность

    4-15 сек

    4-30 сек

    до 8 сек, можно продлить

    3-15 сек

    Максимум качества

    2K

    1080p

    4K

    1080p

    Звук

    всегда, речь и шумы

    нативный, можно выключить

    речь и эффекты

    по желанию

    Референсы

    9 фото, 3 видео, 3 аудио

    30 фото, 10 видео, 10 аудио

    1-3 фото

    первый и последний кадр

    Цена на Genova AI

    120-180 Дженов за секунду

    300-1 530 Дженов за секунду

    от 300 Дженов за ролик

    200-390 Дженов за секунду

    По слепым голосованиям H3 сейчас в верхней группе. В рейтинге Artificial Analysis на 29 сентября у нее 1220 очков в категории "текст в видео со звуком" (4-е место), у Veo 3.1 - 1088, у Kling 3.0 Pro - 1095. В режиме "фото в видео" H3 делит 2-5 места с Seedance 2.0 и Gemini Omni Flash. Внутри рейтинга у H3 первое место по физике движения и второе по тексту в кадре.

    Рейтинг - не приговор. В независимом обзоре Curious Refuge Seedance 2.5 уверенно выигрывала у H3 на крупных сценах с экшеном: у H3 там появлялись артефакты текстур и искажения лиц. А авторы теста Vmake поставили H3 4,3 балла из 5 против 4,6 у Seedance 2.5 и 4,0 у Kling 3.0, отметив, что подписи в кадре у H3 читаемые.

    Коротко: H3 берет качеством 2K со звуком за умеренную цену, Seedance 2.5 - длиной ролика и числом референсов, Veo 3.1 - максимальным разрешением 4K.

    Как писать промпт для MiniMax H3: советы и примеры

    Правила ниже - из наших прогонов и официального гайда MiniMax по промптам.

    Реплику пишите в кавычках и называйте язык. Формулировка "говорит по-русски: "..."" сработала с первого раза. Короткая фраза надежнее длинного монолога.

    Если музыка не нужна, так и напишите. Без этого H3 часто подкладывает фоновую музыку сама, а "Без музыки" в конце промпта она выполнила. Отдельного выключателя звука у модели нет, тишину тоже можно попросить только текстом.

    Надпись - в кавычках, крупно и коротко. Два-три слова модель пишет чисто. Мелкий текст на заднем плане она рисует хуже: в ролике с кофе, который мы тоже делали, газета на столе покрылась неразборчивыми буквами.

    Положение предметов и движение камеры описывайте явно. "Облетает бутылку" модель проигнорировала. В гайде MiniMax для облета используется формулировка arc shot - движение камеры по дуге вокруг объекта, а для наезда push in. Если важно, стоит ли предмет или лежит, скажите это прямо.

    Для нескольких сцен в одном ролике используйте разметку. Официальный гайд описывает склейки через "[Shot 2] At 00:04.500" - так модель понимает, в какой момент сменить план. Это мы пока не проверяли.

    В режиме фото описывайте только движение. Все, что есть на снимке, модель уже видит.

    Сколько ждать результат

    По нашим восьми запускам ролики 768P длиной 4-7 секунд считались от 2,5 до 7 минут. Два ролика в 2K по 6 секунд - 6 и 11 минут. Держать страницу открытой не нужно: готовое видео само появится в блоке "Последние генерации" и в истории.

    Как попробовать MiniMax H3 в России без VPN

    Модель доступна на странице генерации MiniMax H3. VPN не нужен, оплата российской картой, интерфейс и промпты на русском. Все три режима на одной странице, переключатель над полем описания.

    Если нужен ролик длиннее 15 секунд или много референсов, посмотрите наш обзор Seedance 2.5. А бесплатно попробовать генерацию видео можно в Grok Imagine: стартовых Дженов хватает на шестисекундный ролик в 480p.

    Коротко: брать или нет

    MiniMax H3 стоит брать, когда нужен ролик до 15 секунд в хорошем качестве и сразу со звуком: реклама товара с надписью, короткая сцена с репликой героя, превращение объекта по фото. По цене секунды в 2K она заметно дешевле Seedance 2.5 в 1080p и Kling 3.0 со звуком.

    Если ролик длиннее 15 секунд, сцена с быстрым экшеном или нужен 4K, H3 не лучший выбор, для этого на сайте есть Seedance 2.5 и Veo 3.1. Начинать с H3 разумно в 768P на 4-6 секунд: так дешевле всего понять, как модель реагирует на ваши формулировки, а финал уже собирать в 2K.

    Часто задаваемые вопросы

    2

    Комментарии

    Пока нет комментариев. Будьте первым!

    ?

    📖 Похожие статьи

    Генерация изображений по описанию бесплатно - пошаговый гайд
    Статья

    Генерация изображений по описанию бесплатно - пошаговый гайд

    🎨 Как создать картинку по описанию с помощью нейросети - бесплатно и на русском языке? Написали пошаговый гайд: как правильно составить описание, какие настройки выбрать и как получить качественный результат с первого раза. Внутри - примеры промптов и готовые результаты.

    Читать
    Seedream 5.0 Lite: новый уровень AI генерации изображений - что нужно знать в 2026 году
    Статья

    Seedream 5.0 Lite: новый уровень AI генерации изображений - что нужно знать в 2026 году

    Seedream 5.0 Lite от ByteDance - новый AI-генератор изображений с 4K-качеством, точной генерацией текста и web-поиском. В статье: сравнение с версией 4.5, реальные примеры и инструкция. Попробуйте бесплатно с стартовыми Дженами на Genova AI.

    Читать
    Генерация картинок нейросетью: Топ-5 сервисов, где ИИ рисует по описанию (2026 год)
    Статья

    Генерация картинок нейросетью: Топ-5 сервисов, где ИИ рисует по описанию (2026 год)

    Обзор 5 лучших нейросетей для генерации изображений в 2026 году. Сравниваем Шедеврум, Kandinsky, Leonardo и другие сервисы. Узнайте, где можно бесплатно сгенерировать картинки по тексту на русском языке и как использовать передовые ИИ-модели без включения VPN.

    Читать