Локальная генерация видео на видеокарте: Wan 2.2, LTX-2.5 и HunyuanVideo 1.5

38 мин. чтения

Коротко: что реально сгенерирует карта на 8, 12, 16, 24 и 32 ГБ

Три открытые видеомодели — Wan 2.2 от Alibaba, LTX-2.3 от Lightricks и HunyuanVideo 1.5 от Tencent — запускаются дома, но «запускается» и «работает так, как вы ожидаете» — разные вещи. Короткий ответ по объёмам видеопамяти:

  • 8 ГБ — работает только младшая Wan 2.2 в варианте 5B и только за счёт нативной выгрузки ComfyUI; это режим «посмотреть, как оно вообще выглядит», а не производство.
  • 12 ГБ — квантованная Wan 2.2 в формате GGUF на пониженном разрешении. Реальный замер на RTX 3060: ролик 840×420 на 81 кадр — 900 секунд.
  • 16 ГБ — минимум, который NVIDIA называет системным требованием для LTX в ComfyUI; здесь начинается вменяемая работа с 720p.
  • 24 ГБ — планка, которую сам Alibaba пишет для Wan 2.2 в варианте 5B, и объём, на котором комфортно живёт HunyuanVideo 1.5. Пик потребления LTX-2.3 в замере на 97 кадров — 24,2 ГБ.
  • 32 ГБ — LTX-2.3 в кванте Q4_K_M вместе с текстовым энкодером занимает около 26,6 ГБ, то есть влезает с небольшим запасом. Полная Wan 2.2 A14B в исходной точности не влезает и сюда: ей нужно 80 ГБ.

Отдельная оговорка про LTX, без которой дальше будет путаница. Текущая открытая модель Lightricks — LTX-2.5, её веса выложили 11 августа 2026 года, то есть за четыре дня до этого разбора. Все измеренные цифры по видеопамяти и скорости, которые есть в открытом доступе, сняты на предыдущей версии LTX-2.3 — она осталась в репозитории и по числу загрузок пока сильно опережает новую. Поэтому в таблицах ниже вы увидите именно 2.3: переносить её цифры на 2.5 никто не имеет права, включая нас.

Главная ловушка темы не в цифрах, а в том, что они несопоставимы между собой. Одна и та же модель встречается в выдаче и как «6 ГБ», и как «80 ГБ и выше» — потому что источники молча говорят о разных вещах. Ниже разобрано, что именно стоит за каждым числом, сколько времени уходит на ролик на конкретных стендах, что разрешают три очень разные лицензии и сколько стоит секунда видео, посчитанная по электричеству.

Wan 2.2, LTX-2.5 и HunyuanVideo 1.5: чем эти три модели различаются

Это три разных инженерных подхода, а не три версии одного и того же.

МодельРазработчикПараметрыАрхитектураЗвукЛицензияВеса выложены
Wan 2.2 T2V-A14BAlibaba27B всего, 14B активныхMixture-of-Experts: отдельный эксперт для высокого и низкого шуманетApache 2.028 июля 2025
Wan 2.2 TI2V-5BAlibaba5Bплотная, VAE со сжатием 4×32×32нетApache 2.028 июля 2025
LTX-2.5Lightricks22BDiT, видео и звук одной моделью, мультишотда, синхронныйLTX-2.x Community11 августа 2026
LTX-2.3Lightricks22BDiT, видео и звук одной модельюда, синхронныйLTX-2.x Communityпредыдущая версия, в репозитории
HunyuanVideo 1.5Tencent8,3BDiT со sparse-вниманиемнетTencent Hunyuan Community20 ноября 2025

Разберём, что стоит за строками. Mixture-of-Experts у Wan 2.2 означает, что модель состоит из двух специализированных половин: одна работает на ранних, «шумных» шагах генерации, вторая доводит картинку на поздних. Из 27 миллиардов параметров в каждый момент считаются 14 — отсюда путаница в названиях, где модель зовут то 14B, то 27B. Практическое следствие важнее терминологии: обе половины нужны обе, и в расчёт памяти надо закладывать оба файла, а не один. Оригинальную карточку модели можно открыть на Hugging Face — там же лежит и текст лицензии.

Линейка LTX — единственная из трёх, кто генерирует звук вместе с картинкой. В карточке модели это сформулировано прямо: аудио-видео модель, которая создаёт синхронизированные видео и звук внутри одной модели, а не склеивает их постфактум. Взамен у неё жёсткие формальные ограничения на формат: ширина и высота должны делиться на 32, а число кадров подчиняется правилу «кратное восьми плюс один» — то есть 49, 65, 97, 121 кадр и так далее. У LTX-2.5 к этому добавились мультишот-генерация (несколько связанных планов одним прогоном), диффузионный видеодекодер вместо реконструкции через VAE и собственный текстовый энкодер Gemma 4 12B; официальная документация ComfyUI заявляет для неё native 4K HDR и до 50 кадров в секунду.

HunyuanVideo 1.5 — самая компактная, 8,3 миллиарда параметров против 22 и 27. Она умеет 480p и 720p нативно, до 121 кадра при 24 кадрах в секунду, а 1080p получает отдельным этапом апскейла. У неё же самая живая история релизов: веса вышли 20 ноября 2025, дистилляция по шагам добавлена 5 декабря 2025, поддержка FP8 GEMM — 23 декабря 2025.

Отдельно про версии, потому что вокруг них много шума и путаницы.

У Lightricks версия сменилась только что. Веса LTX-2.5 выложены 11 августа 2026 года, вместе с ними — дистиллированный трансформер, готовые для ComfyUI кванты int8 и NVFP4, отдельные видео- и аудио-VAE и апскейлеры. На 15 августа 2026 года у карточки LTX-2.5 около 378 тысяч загрузок, у LTX-2.3 — 1,69 миллиона: предыдущая версия никуда не делась, обновлялась на этой же неделе и пока остаётся тем, на чём реально работают люди. Именно поэтому все измеренные цифры ниже относятся к 2.3.

Скорость LTX-2.5, о которой писали при релизе, к домашней карте отношения не имеет. Заявление вендора звучит так: 10-секундный ролик из картинки за 6,8 секунды — но на двух суперчипах NVIDIA GB200, дистиллированной моделью. Через собственный API Lightricks называет около 23,7 секунды. Это серверное железо стоимостью в десятки тысяч долларов, и переносить эти секунды на RTX 5090 нельзя ни в какой пропорции.

Про «Wan 2.7» подтверждения нет. О ней пишет целая сеть сайтов, но в официальном репозитории Wan2.2 на 15 августа 2026 года нет ни одного упоминания версий 2.5, 2.6 или 2.7 — последняя запись в журнале изменений датирована 13 ноября 2025 года. Те же сайты сами признают, что весов на Hugging Face нет, и предлагают идти на ModelScope. Считать это подтверждённым фактом нельзя.

Почему требования к видеопамяти у одной модели расходятся в 13 раз

Если пройти по первой странице выдачи, Wan 2.2 14B встречается с требованием 6 ГБ, 16 ГБ, 24 ГБ, 54 ГБ, 65 ГБ и «80 ГБ и выше». Разброс в тринадцать раз — это не ошибка одного из авторов. Это четыре разных класса утверждений, которые никто не разделяет.

Первое. Заявление вендора и заявление бекенда — не одно и то же. Alibaba про вариант 5B пишет: нужно не менее 24 ГБ видеопамяти, например RTX 4090. ComfyUI про ту же модель пишет: версия 5B нормально помещается в 8 ГБ благодаря нативной выгрузке. Оба утверждения верны, потому что говорят о разном. Вендор описывает модель, целиком лежащую в памяти карты. Бекенд описывает режим, в котором в памяти держится только активный блок, а остальное подкачивается из системной оперативной памяти. Это разница не в точности измерения, а в том, что именно измеряют.

Второе. Квантование меняет вес модели в разы. GGUF — формат хранения весов с пониженной точностью; чем агрессивнее квант, тем меньше файл и тем сильнее просадка качества. По реальному листингу файлов Wan 2.2 T2V-A14B: Q2_K — 5,3 ГБ, Q4_K_M — 9,65 ГБ, Q8_0 — 15,4 ГБ. Именно эти числа кочуют по обзорам как «требования к видеопамяти», хотя это размер файла, а не пик потребления.

Третье, и его почти нигде нет: у Wan 2.2 таких файлов ДВА. Каждая половина MoE квантуется отдельно, и обе нужны для генерации. По нашему подсчёту это значит, что «Wan 2.2 в Q4_K_M» — это не 9,65 ГБ весов, а около 19,3 ГБ. Модель можно гонять, подгружая половины по очереди, но тогда вы платите временем на переключение — и именно это переключение объясняет часть отставания Wan по скорости.

Четвёртое. Текстовый энкодер считают не все. Модель не работает в одиночку: промпт превращает в числа отдельная языковая модель. В замере на RTX 5090 к файлу LTX-2.3 на 17,8 ГБ добавляется энкодер Gemma 3 12B в fp4 ещё на 8,8 ГБ. Итого 26,6 ГБ вместо 17,8 — если энкодер держать на видеокарте. Его можно выгрузить в системную память, и тогда цифра снова меняется.

Пятое. Тайловая обработка сдвигает планку скачком. В декабре 2024 года ComfyUI добавил временнýю нарезку в VAE — декодер обрабатывает видео кусками, а не целиком. Требование к исходной HunyuanVideo упало с 32 ГБ до 8 ГБ на той же модели и том же железе. Ничего не изменилось, кроме способа декодирования.

Отсюда простое правило чтения любых таблиц по этой теме: число без указания кванта, разрешения, длины ролика и режима выгрузки не значит ничего. Ниже все цифры даны с этими уточнениями. Сама логика «модель под объём видеопамяти» для локальных моделей не нова — подробно она разобрана у нас в материале о том, какую локальную LLM выбрать; разница в том, что у видео шаг между тирами гораздо жёстче.

Что влезет в вашу видеокарту: модель, квант, разрешение и память

Сводная таблица по тирам видеопамяти. В колонке «откуда цифра» указано, чьё это утверждение: вендора, бекенда или замерщика — потому что, как показано выше, это разные вещи.

ВидеопамятьЧто реально запускаетсяКвант / режимФормат результатаОткуда цифра
8 ГБWan 2.2 TI2V-5Bнативная выгрузка ComfyUI720p, короткие ролики, очень медленнозаявление ComfyUI
8 ГБHunyuanVideo (исходная, 13B)тайловое декодирование VAE + fp8базовые роликизаявление ComfyUI, декабрь 2024
12 ГБWan 2.2 14BGGUF Q3_K_S + ускоряющая LoRA840×420, 81 кадр — 900 секундсторонний замер на RTX 3060
16 ГБLTX в ComfyUI (гайд написан по линейке 2.3)не уточнён1280×720 как рабочее разрешениесистемное требование NVIDIA, 17 марта 2026
16 ГБWan 2.2 14BGGUF Q4_K_M, половины по очереди480p уверенно, 720p с оговоркаминаш расчёт по размерам файлов
24 ГБWan 2.2 TI2V-5Bисходная точность720p при 24 к/с, 5 секунд менее чем за 9 минутзаявление Alibaba
24 ГБHunyuanVideo 1.5исходная точность, без выгрузки480p и 720p, до 121 кадразаявление Tencent
24 ГБLTX-2.3 distilledfp8-cast, тайловый VAE1280×704, 97 кадров, пик 24,2 ГБсторонний замер на RTX 5090
32 ГБLTX-2.3 distilled + энкодерQ4_K_M + Gemma 3 12B fp4832×480, 81 кадрсторонний замер на RTX 5090
80 ГБWan 2.2 T2V-A14Bисходная точность, одна карта480p и 720p, 5 секундзаявление Alibaba
14 ГБHunyuanVideo 1.5с включённой выгрузкой модели480p и 720pзаявление Tencent
данных нетLTX-2.5int8 convrot и NVFP4 готовы для ComfyUInative 4K HDR, до 50 к/стребований не называют ни Lightricks, ни ComfyUI

Последняя строка — не пропуск в таблице, а состояние дел. Веса LTX-2.5 лежат в открытом доступе неделю, ComfyUI поддержал её в день релиза, но ни карточка модели, ни официальная документация workflow не называют ни минимального объёма видеопамяти, ни рекомендованной карты. Независимых замеров на домашнем железе на 15 августа 2026 года тоже нет. Через пару недель выдача наверняка заполнится числами вида «LTX-2.5 требует столько-то гигабайт» — имейте в виду, что сам разработчик таких цифр не публиковал, и спрашивайте у таких таблиц методику.

Два вывода, которые из этой таблицы не следуют напрямую, но следуют из арифметики.

RTX 5090 с её 32 ГБ действительно не тянет полную Wan 2.2 A14B — и дело не в оптимизациях. 27 миллиардов параметров в формате bf16 занимают по два байта на параметр, то есть около 54 ГБ только под веса, без активаций, VAE и текстового энкодера. Заявленные Alibaba 80 ГБ на одну карту с этим согласуются. Никакой драйвер и никакая настройка не сделают 54 ГБ из 32 — здесь работает только квантование, и обсуждать «Wan 2.2 14B на потребительской карте» имеет смысл исключительно в терминах GGUF или FP8.

Порог входа сегодня — 16 ГБ, а не 8. Восьмигигабайтные сценарии существуют и честно задокументированы вендором бекенда, но они держатся на постоянной подкачке весов, и цена этого видна в следующем разделе.

Если вы только присматриваетесь к железу под такие задачи, у нас разобраны обе крайние точки: сборка на RTX 5090 с её потолком 32 ГБ и вариант с двумя RTX 3090 на 48 ГБ суммарно. Оговорка для второго случая: у текстовых моделей память двух карт складывается почти линейно, а диффузионные видеомодели так не делятся — вторая карта здесь помогает заметно хуже, чем при запуске LLM.

Сколько ждать ролик: замеры на RTX 5090, RTX 4090 и H100

Собственного стенда с этими моделями у нас нет, поэтому ниже — только чужие замеры, и каждый идёт с методикой. Без методики цифра в этой теме бессмысленна: ниже видно, как одна и та же модель на одной и той же карте даёт 22 и 43 секунды.

СтендМодель и настройкиФорматВремяИсточник
RTX 5090 32 ГБ, ComfyUI v0.16.4, PyTorch 2.9.1+cu130LTX-2.3 distilled Q4_K_M (17,8 ГБ) + Gemma 3 12B fp4, 8 шагов, euler + CFGGuider832×480, 81 кадр22,1 с прогретый прогон, 48,5 с холодныйzenn.dev, март 2026
тот же стендWan 2.2 14B, High + Low Noise Q4_K_M (по 9 ГБ), 6 шагов (3+3), dpm++_sde832×480, 81 кадр125 с с sageattn3, 143,9 с безzenn.dev, март 2026
RTX 5090 32 ГБ, torch 2.10+cu128LTX-2.3 distilled 1.1, fp8-cast, тайловый VAE, SDPA, энкодер Gemma-3-12B q4_0768×512, 97 кадров43,5 с (39 с в устойчивом режиме), пик 24,2 ГБдатасет rtx-5090-benchmarks
тот же стендто же1280×704, 97 кадров49,8 с, пик 24,2 ГБдатасет rtx-5090-benchmarks
RTX 4090HunyuanVideo 1.5, step-distilled, 8–12 шагов480p, image-to-video75 сзаявление Tencent
RTX 4090Wan 2.2 TI2V-5B, исходная точность720p, 5 секундменее 9 минутзаявление Alibaba
H100 PCIe 81,5 ГБ, 12 vCPU, 128 ГБ RAMWan 2.2, FP8 scaled, high + low noise (заняли 34 ГБ)640×640, 5 секунд20–30 сHabr / Selectel, апрель 2026
RTX A2000 6 ГБтот же сценарий640×640, 5 секунд600 сHabr / Selectel, апрель 2026
RTX 3060 12 ГБWan 2.2 GGUF Q3_K_S + четырёхшаговая LoRA840×420, 81 кадр900 сNext Diffusion, август 2025

Из этой таблицы читаются три вещи, которых нет в разговорах о «лучшей модели».

Разрыв в скорости между LTX-2.3 и Wan 2.2 на одном стенде — около 5,7 раза (22,1 против 125 секунд). Автор замера объясняет его архитектурой: LTX-2.3 в дистиллированном виде сходится за 8 шагов по неравномерному расписанию, а Wan 2.2 переключается между двумя экспертами и платит за переключение. Он же приводит важную деталь: ускоритель внимания sageattn3 дал Wan около 13% прироста, а LTX-2.3 в GGUF — ничего, потому что узким местом там становится деквантование, а не расчёт внимания. Полная методика замера — в оригинальном разборе на zenn.dev.

Основное время съедает не модель. В датасете замеров на RTX 5090 отдельно посчитано: на сам диффузионный трансформер приходится лишь 12–28% времени генерации. Остальное — тайловое декодирование VAE, декодирование звука и кодирование готового файла в h264/AAC. Это переворачивает практический вывод: гнаться за вычислительной мощностью чипа во многих сценариях менее осмысленно, чем за памятью и настройками декодирования.

Цифр по LTX-2.5 в этой таблице нет намеренно. Единственное публичное число по новой версии — заявление Lightricks про 6,8 секунды на 10-секундный ролик, и оно снято на двух суперчипах NVIDIA GB200 дистиллированной моделью; через API самой Lightricks на тот же ролик уходит около 23,7 секунды. Ни то, ни другое не говорит вам ничего о вашей карте, поэтому в сравнение эти секунды не идут: строки таблицы выше сняты на потребительском и серверном железе, доступном частному человеку, и с раскрытой методикой.

Нехватка памяти бьёт нелинейно. Один и тот же сценарий на H100 занимает 20–30 секунд, а на RTX A2000 с 6 ГБ — 600 секунд. Разница в двадцать-тридцать раз не объясняется разницей в производительности чипов: на 6 ГБ модель работает через постоянную подкачку из системной памяти, и это качественный переход, а не количественный. Практически это значит, что «влезло» и «работает» — разные состояния, и между ними нет плавного перехода.

Слабые места этих замеров: где ваши цифры разойдутся с табличными

Всё, что выше, собрано из чужих измерений на разном железе и в разное время. Вот что в них не входит, какие риски эти пробелы создают и почему ваши числа почти наверняка разойдутся с табличными.

  • Единого стенда нет. Ни один источник не прогнал все три модели на одной машине с одинаковыми настройками. Сравнение LTX-2.3 и Wan 2.2 корректно только внутри строки zenn.dev, где условия совпадают; сопоставлять их с цифрами Tencent или Alibaba нельзя — там другие разрешения, шаги и дистилляты.
  • Заявления вендоров относятся к дистиллятам. «75 секунд на RTX 4090» у HunyuanVideo 1.5 — это step-distilled модель на 480p в режиме image-to-video при 8–12 шагах, а не базовая модель на 720p. Независимого замера ровно на этих условиях в открытом доступе найти не удалось.
  • Прогретый прогон и холодный старт различаются вдвое. У LTX-2.3 в замере на RTX 5090 это 22,1 против 48,5 секунды. Табличные цифры обычно относятся ко второму и последующим прогонам, а первый ролик за вечер вы будете ждать дольше.
  • Скачивание и место на диске не считает почти никто. Один только LTX-2.3 в кванте Q4_K_M — это 17,8 ГБ, плюс энкодер на 8,8 ГБ, плюс апскейлеры. Коллекция из трёх моделей с несколькими квантами легко переваливает за сотню гигабайт, и первый запуск упирается в скорость интернета, а не видеокарты.
  • Число попыток на пригодный ролик не измеряет никто. Все таблицы неявно предполагают, что клип получается с первого раза. На практике время до приемлемого результата — это время одной генерации, умноженное на количество попыток, и множитель зависит от промпта, а не от железа.
  • Потеря качества от квантования нигде не измерена. В обзорах она описывается словами «минимальная» и «почти незаметная», но ни одного сравнения кадров на одном сиде между Q4, FP8 и исходной точностью в разобранных материалах нет. Считайте, что за экономию памяти вы платите чем-то, что просто не посчитали.
  • Всё, кроме видеопамяти, вынесено за скобки. Системная оперативная память при выгрузке, скорость накопителя, блок питания, троттлинг на длинном прогоне — этих факторов в замерах нет, а на длинной серии генераций они дают о себе знать.
  • Замеров на AMD и Intel практически нет. Вся публичная статистика по этим моделям снята на NVIDIA. Если у вас Radeon, вопрос упирается не в модель, а в бекенд — эту развилку мы разбирали отдельно в материале про ROCm против CUDA.
  • Версии сдвигают всё, и прямо сейчас это видно на LTX. У HunyuanVideo 1.5 за месяц после релиза появились дистилляты и FP8 GEMM. У Lightricks 11 августа 2026 года вышла LTX-2.5, и по ней на момент публикации нет ни заявленных требований к видеопамяти, ни независимых замеров на домашних картах — все цифры по LTX в этом материале сняты на предыдущей версии 2.3. Любой замер живёт до следующего обновления модели или бекенда.

Лицензии Wan, LTX и HunyuanVideo: что из этого можно продавать

Это тот раздел, где выдача врёт чаще всего. Из тринадцати разобранных материалов топа двое приписывают HunyuanVideo лицензию Apache 2.0, ещё один называет её «только для некоммерческих исследований». Неверно и то, и другое. Ниже — по текстам самих лицензий.

МодельЛицензияКоммерческое использованиеОграниченияПрава на результат
Wan 2.2Apache 2.0разрешено без условийобщие запреты на противоправное применение«мы не заявляем прав на созданный вами контент»
LTX-2.5 и LTX-2.3LTX-2.x Community Licenseбесплатно при годовой выручке менее $10 млнвыше порога — платная лицензия; порог считается по всей группе компаний«Licensor claims no rights in the Output»
HunyuanVideo 1.5Tencent Hunyuan Community Licenseразрешено с условиямитерритория исключает ЕС, Великобританию и Южную Корею; свыше 100 млн активных пользователей в месяц — отдельная лицензиятребуется notice-файл и раскрытие своего юрлица

Развернём три момента, которые реально влияют на выбор.

У Wan 2.2 лицензия самая простая — Apache 2.0. Формулировка в репозитории прямая: модели лицензированы под Apache 2.0, и разработчик не претендует на права в отношении сгенерированного вами контента. Для коммерческой работы это самый спокойный вариант из трёх.

У LTX порог по выручке, а не по типу использования, и он один и тот же для 2.3 и 2.5. Компания с годовым доходом менее десяти миллионов долларов пользуется моделью коммерчески бесплатно; от десяти миллионов нужна платная лицензия. Ловушка в определении: порог считается совокупно по всем дочерним, аффилированным и находящимся под общим контролем компаниям — то есть небольшая студия внутри крупного холдинга под него попадает. Отдельным пунктом лицензия требует явно помечать распространяемый контент как машинно сгенерированный.

У Tencent ограничение территориальное, и это самое неожиданное условие в тройке. Лицензионная территория описана как всемирная, за исключением территории Европейского союза, Великобритании и Южной Кореи. То есть для коммерческой работы с клиентами оттуда модель формально не подходит — при том что об этом молчат двенадцать из тринадцати материалов первой страницы выдачи. Украины в списке исключений нет, и на неё ограничение не распространяется. Второе условие — порог в 100 миллионов активных пользователей в месяц, выше которого нужна отдельная лицензия от Tencent; для подавляющего большинства читателей он неактуален, но знать о нём стоит. Полный текст доступен в файле лицензии на Hugging Face.

Практический вывод простой: если ролики уйдут в коммерческий проект, лицензия отсекает варианты раньше, чем бенчмарк. Сначала смотрим, что разрешено, потом — что быстрее.

Своя видеокарта против облака: считаем себестоимость секунды видео

Аргумент «на своей карте генерации бесплатные» звучит в каждом обсуждении. Посчитаем, сколько это стоит на самом деле. Методика открыта — подставьте своё железо и свой тариф.

Исходные данные. Берём LTX-2.3 на RTX 5090 в разрешении 1280×704: по замеру, на одну секунду готового видео уходит 12,3 секунды счёта. Заявленная NVIDIA полная мощность RTX 5090 — 575 Вт; берём её как верхнюю границу, реально под диффузией карта потребляет меньше. Тариф на электроэнергию для населения Украины зафиксирован на уровне 4,32 грн за кВт·ч до 31 октября 2026 года.

Расчёт. 12,3 секунды при 575 Вт — это около 0,00196 кВт·ч на одну секунду видео. По тарифу выходит менее одной копейки за секунду готового ролика (примерно 0,0085 грн). Час непрерывной генерации обходится в 0,575 кВт·ч, то есть около 2,48 грн электричества. За этот час при тех же настройках карта выдаёт примерно 293 секунды видео.

С чем сравниваем. На 15 августа 2026 года готовая генерация по API стоит от $0,04 за секунду видео у LTX-2 Fast в 1080p и от $0,05 за секунду у моделей Wan. То есть те же 293 секунды, полученные через API, стоили бы порядка 11–15 долларов. Аренда карты — промежуточный вариант: RTX 4090 в community-тарифе RunPod идёт по $0,34 в час, RTX 5090 в secure-тарифе — по $0,99 в час, тарификация посекундная.

Сведём три способа получить одну секунду видео в одну таблицу — при тех же настройках LTX-2.3 и разрешении 1280×704.

СпособЧто платитеЗа 1 секунду видеоЗа час работы
Своя RTX 5090электричество, 575 Вт по тарифу 4,32 грн/кВт·чоколо 0,0085 грн2,48 грн, примерно 293 секунды видео
Аренда RTX 5090 на RunPodпосекундная оплата GPU, $0,99 в часоколо $0,0034$0,99
Готовая генерация по APIцена за секунду результата, от $0,04от $0,0411–15 долларов за те же 293 секунды

Цена карты в таблицу не входит намеренно: она у всех своя, а её вклад в себестоимость зависит только от того, сколько часов машина реально отработает.

Что это значит. Электричество в этой задаче — статистическая погрешность. Реальная стоимость локальной генерации — это цена карты, поделённая на количество часов, которые она отработает. Формула для вашего случая: карта окупается против аренды за цена карты / (стоимость часа аренды − стоимость часа электричества) часов работы. Пока вы генерируете десятки роликов в месяц, дешевле платить за секунды в облаке. Точка перелома наступает там, где карта загружена регулярно — и тогда своя машина выигрывает с большим отрывом, потому что предельная стоимость следующего ролика у вас почти нулевая, а в облаке она постоянная.

Три оговорки к расчёту, без которых он превращается в рекламу. Первая: неудачные попытки стоят столько же, сколько удачные, и в облаке, и дома. Вторая: кроме карты потребляет и остальная система, а блок питания имеет КПД — реальный счётчик покажет больше, чем 575 Вт умноженные на время. Третья: тариф зафиксирован до конца октября 2026 года, после чего входные данные расчёта поменяются.

Как уместить модель в карту: пять рычагов и цена каждого

Ни один из этих приёмов не бесплатный. Порядок — от самого выгодного к самому болезненному.

  1. Квантование весов. Переводит модель в пониженную точность: GGUF-варианты Wan 2.2 идут от 5,3 ГБ (Q2_K) до 15,4 ГБ (Q8_0) на каждую половину. Цена — качество и, неожиданно, скорость: в замере на RTX 5090 деквантование GGUF стало узким местом, из-за чего ускоритель внимания перестал давать эффект.
  2. Выгрузка модели в системную память. Именно она стоит за цифрами «5B в 8 ГБ» и «HunyuanVideo 1.5 от 14 ГБ». Цена — время, причём нелинейно: сравнение H100 и RTX A2000 показывает, что при сильной нехватке памяти генерация замедляется в десятки раз.
  3. Тайловое декодирование VAE. Декодер обрабатывает ролик кусками, а не целиком; именно этот приём в своё время опустил планку HunyuanVideo с 32 ГБ до 8 ГБ. Цена — дополнительное время и риск артефактов на стыках при слишком мелких тайлах.
  4. Текстовый энкодер в оперативную память. Освобождает от 8,8 ГБ и выше — ровно столько занимает Gemma 3 12B в fp4 рядом с LTX-2.3. Цена — требования к системной памяти и задержка на старте генерации.
  5. Разрешение и длина ролика. Самый прямой рычаг: он не ухудшает модель, он уменьшает результат. У LTX (и в 2.3, и в 2.5) число кадров подчиняется правилу «кратное восьми плюс один», у HunyuanVideo 1.5 потолок — 121 кадр при 24 кадрах в секунду.

Порядок применения имеет значение. Сначала снижают разрешение и длину, потом выгружают энкодер, потом включают тайлинг, и только затем идут в агрессивные кванты — потому что первые три рычага стоят времени, а последний стоит качества, и вернуть его нельзя.

Кому какая модель: выбор по объёму видеопамяти и задаче

  • 8–12 ГБ. Реалистичный сценарий один: Wan 2.2 в варианте 5B или в агрессивном GGUF-кванте, невысокое разрешение, готовность ждать минутами. Это режим знакомства с технологией. Если цель — результат, а не эксперимент, на этом объёме дешевле платить за секунды в облаке, а деньги отложить на карту — с чего начинать выбор, разобрано в гиде по тому, как выбрать железо для локального ИИ.
  • 16 ГБ. Рабочий минимум. LTX в ComfyUI по системным требованиям NVIDIA начинается отсюда, Wan 2.2 в Q4_K_M живёт с подгрузкой половин по очереди. Здесь уже имеет смысл говорить о 720p.
  • 24 ГБ. Самый сбалансированный вариант: сюда помещается Wan 2.2 TI2V-5B в исходной точности, комфортно работает HunyuanVideo 1.5, а LTX-2.3 в дистилляте укладывается с пиком 24,2 ГБ.
  • 32 ГБ. LTX-2.3 вместе с энкодером и запасом, самые быстрые прогоны из публичных замеров. Полная Wan 2.2 A14B сюда всё равно не помещается — только квантованная.
  • Нужен звук. Выбор без вариантов: линейка LTX — единственная из трёх, кто генерирует синхронизированное аудио одной моделью.
  • Хотите самую свежую модель. Это LTX-2.5 от 11 августа 2026 года: открытые веса, поддержка ComfyUI с первого дня, кванты int8 и NVFP4 уже выложены. Здраво оценивайте риск: требований к железу вендор не публиковал, независимых замеров нет, и сколько она попросит именно у вашей карты — сейчас не знает никто. Нужна предсказуемость — берите 2.3, по ней цифры есть.
  • Коммерческий проект с клиентами из ЕС или Великобритании. HunyuanVideo 1.5 отпадает по территории лицензии. Остаются Wan 2.2 с её Apache 2.0 и линейка LTX, если выручка компании ниже порога в $10 млн.

И последнее, о чём стоит помнить, примеряясь к теме: видео — самая тяжёлая из локальных модальностей. Требования у генерации картинок нейросетями на порядок мягче, и если задача в том, чтобы просто начать работать с моделями на своём железе, разумнее заходить оттуда.

FAQ

Можно ли генерировать видео на видеокарте с 8 ГБ памяти? Да, но с оговорками. ComfyUI прямо заявляет, что версия Wan 2.2 на 5 миллиардов параметров помещается в 8 ГБ за счёт нативной выгрузки, а исходная HunyuanVideo запускается на этом же объёме благодаря тайловому декодированию VAE. Платите вы временем: при сильной нехватке памяти модель постоянно подкачивает веса, и генерация замедляется в разы, а иногда в десятки раз.

Нужна ли для локальной генерации видео NVIDIA или подойдёт Radeon? Формально модели не привязаны к вендору, но вся публичная статистика по Wan 2.2, LTX и HunyuanVideo 1.5 снята на картах NVIDIA. На AMD вопрос упирается не в модель, а в бекенд и зрелость ROCm: часть оптимизаций, включая ускорители внимания, там либо отсутствует, либо ведёт себя иначе. Планировать работу на Radeon можно, но закладывайте время на настройку.

Сколько места на диске занимают локальные видеомодели? Больше, чем ожидают почти все. Один дистиллят LTX-2.3 в кванте Q4_K_M весит 17,8 ГБ, текстовый энкодер к нему — ещё 8,8 ГБ. Wan 2.2 в GGUF требует двух файлов сразу: по 9,65 ГБ в Q4_K_M или по 15,4 ГБ в Q8_0. Если держать несколько моделей в нескольких квантах плюс апскейлеры и VAE, коллекция уверенно переваливает за сотню гигабайт.

Можно ли продавать ролики, сгенерированные Wan 2.2? Да. Модели Wan 2.2 выложены под лицензией Apache 2.0, и разработчик отдельно указывает, что не заявляет прав на созданный вами контент. Это самый простой случай из трёх рассмотренных моделей: ни порога по выручке, ни территориальных исключений, ни требования получать отдельное разрешение. Общие запреты на противоправное использование, разумеется, остаются.

Что выгоднее: своя видеокарта или оплата генерации по секундам? Зависит от загрузки. Электричество стоит копейки: около 0,0085 грн на секунду готового видео при тарифе 4,32 грн за кВт·ч. Но карта стоит денег, и окупается она только объёмом. При десятке роликов в месяц дешевле платить за секунды в облаке, где на 15 августа 2026 года ставка начинается от $0,04. При регулярной загрузке своя карта выигрывает: предельная стоимость следующего ролика у вас почти нулевая.

Почему у меня генерация идёт дольше, чем в опубликованных замерах? Причин обычно три. Первая — холодный старт: первый прогон после запуска занимает вдвое больше времени, чем последующие. Вторая — другой квант или разрешение: одна и та же LTX-2.3 на одной и той же RTX 5090 в разных замерах даёт 22 и 43 секунды именно из-за этого. Третья — нехватка памяти, при которой включается подкачка весов, и время растёт нелинейно.

Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.