Локальна генерація відео: Wan 2.2, LTX-2.5 і HunyuanVideo на 8–32 ГБ

38 хв. читання

Коротко: що реально згенерує карта на 8, 12, 16, 24 і 32 ГБ

Три відкриті відеомоделі — Wan 2.2 від Alibaba, LTX-2.3 від Lightricks і HunyuanVideo 1.5 від Tencent — запускаються вдома, але «запускається» і «працює так, як ви очікуєте» — різні речі. Коротка відповідь за обсягами відеопам’яті:

  • 8 ГБ — працює лише молодша Wan 2.2 у варіанті 5B і тільки завдяки нативному вивантаженню ComfyUI; це режим «подивитися, як воно взагалі виглядає», а не виробництво.
  • 12 ГБ — квантована Wan 2.2 у форматі GGUF на зниженій роздільній здатності. Реальний замір на RTX 3060: ролик 840×420 на 81 кадр — 900 секунд.
  • 16 ГБ — мінімум, який NVIDIA називає системною вимогою для LTX у ComfyUI; звідси починається притомна робота з 720p.
  • 24 ГБ — планка, яку сам Alibaba пише для Wan 2.2 у варіанті 5B, і обсяг, на якому комфортно живе HunyuanVideo 1.5. Пік споживання LTX-2.3 у замірі на 97 кадрів — 24,2 ГБ.
  • 32 ГБ — LTX-2.3 у кванті Q4_K_M разом із текстовим енкодером займає близько 26,6 ГБ, тобто влізає з невеликим запасом. Повна Wan 2.2 A14B у вихідній точності не влізає й сюди: їй потрібно 80 ГБ.

Окреме застереження про LTX, без якого далі буде плутанина. Поточна відкрита модель Lightricks — LTX-2.5, її ваги виклали 11 серпня 2026 року, тобто за чотири дні до цього розбору. Усі виміряні цифри щодо відеопам’яті та швидкості, які є у відкритому доступі, зняті на попередній версії LTX-2.3 — вона лишилася в репозиторії й за кількістю завантажень поки що значно випереджає нову. Тому в таблицях нижче ви побачите саме 2.3: переносити її цифри на 2.5 ніхто не має права, і ми теж.

Головна пастка теми не в цифрах, а в тому, що вони незіставні між собою. Одна й та сама модель трапляється у видачі і як «6 ГБ», і як «80 ГБ і вище» — бо джерела мовчки говорять про різні речі. Нижче розібрано, що саме стоїть за кожним числом, скільки часу йде на ролик на конкретних стендах, що дозволяють три дуже різні ліцензії та скільки коштує секунда відео, порахована за електрикою.

Wan 2.2, LTX-2.5 і HunyuanVideo 1.5: чим ці три моделі різняться

Це три різні інженерні підходи, а не три версії того самого.

МодельРозробникПараметриАрхітектураЗвукЛіцензіяВаги виклали
Wan 2.2 T2V-A14BAlibaba27B усього, 14B активнихMixture-of-Experts: окремий експерт для високого й низького шумунемаєApache 2.028 липня 2025
Wan 2.2 TI2V-5BAlibaba5Bщільна, VAE зі стисненням 4×32×32немаєApache 2.028 липня 2025
LTX-2.5Lightricks22BDiT, відео та звук однією моделлю, мультишоттак, синхроннийLTX-2.x Community11 серпня 2026
LTX-2.3Lightricks22BDiT, відео та звук однією моделлютак, синхроннийLTX-2.x Communityпопередня версія, у репозиторії
HunyuanVideo 1.5Tencent8,3BDiT зі sparse-увагоюнемаєTencent Hunyuan Community20 листопада 2025

Розберімо, що стоїть за рядками. Mixture-of-Experts у Wan 2.2 означає, що модель складається з двох спеціалізованих половин: одна працює на ранніх, «шумних» кроках генерації, друга доводить картинку на пізніх. Із 27 мільярдів параметрів у кожен момент обчислюються 14 — звідси плутанина в назвах, де модель звуть то 14B, то 27B. Практичний наслідок важливіший за термінологію: потрібні ОБИДВІ половини, і в розрахунок пам’яті треба закладати обидва файли, а не один. Оригінальну картку моделі можна відкрити на Hugging Face — там же лежить і текст ліцензії.

Лінійка LTX — єдина з трьох, хто генерує звук разом із картинкою. У картці моделі це сформульовано прямо: аудіо-відео модель, яка створює синхронізовані відео та звук усередині однієї моделі, а не склеює їх постфактум. Натомість у неї жорсткі формальні обмеження на формат: ширина й висота мають ділитися на 32, а кількість кадрів підпорядковується правилу «кратне восьми плюс один» — тобто 49, 65, 97, 121 кадр і так далі. У LTX-2.5 до цього додалися мультишот-генерація (кілька пов’язаних планів одним проходом), дифузійний відеодекодер замість реконструкції через VAE і власний текстовий енкодер Gemma 4 12B; офіційна документація ComfyUI заявляє для неї native 4K HDR і до 50 кадрів на секунду.

HunyuanVideo 1.5 — найкомпактніша, 8,3 мільярда параметрів проти 22 і 27. Вона вміє 480p і 720p нативно, до 121 кадра за 24 кадрів на секунду, а 1080p отримує окремим етапом апскейлу. У неї ж найжвавіша історія релізів: ваги вийшли 20 листопада 2025, дистиляція за кроками додана 5 грудня 2025, підтримка FP8 GEMM — 23 грудня 2025.

Окремо про версії, бо навколо них багато шуму й плутанини.

У Lightricks версія змінилася щойно. Ваги LTX-2.5 виклали 11 серпня 2026 року, разом із ними — дистильований трансформер, готові для ComfyUI кванти int8 і NVFP4, окремі відео- та аудіо-VAE й апскейлери. На 15 серпня 2026 року в картки LTX-2.5 близько 378 тисяч завантажень, у LTX-2.3 — 1,69 мільйона: попередня версія нікуди не зникла, оновлювалася цього ж тижня й поки лишається тим, на чому реально працюють люди. Саме тому всі виміряні цифри нижче стосуються 2.3.

Швидкість LTX-2.5, про яку писали на релізі, до домашньої карти стосунку не має. Заява вендора звучить так: 10-секундний ролик із картинки за 6,8 секунди — але на двох суперчипах NVIDIA GB200, дистильованою моделлю. Через власний API Lightricks називає близько 23,7 секунди. Це серверне залізо вартістю в десятки тисяч доларів, і переносити ці секунди на RTX 5090 не можна в жодній пропорції.

Про «Wan 2.7» підтвердження немає. Про неї пише ціла мережа сайтів, але в офіційному репозиторії Wan2.2 на 15 серпня 2026 року немає жодної згадки версій 2.5, 2.6 чи 2.7 — останній запис у журналі змін датований 13 листопада 2025 року. Ті самі сайти самі визнають, що ваг на Hugging Face немає, і пропонують іти на ModelScope. Вважати це підтвердженим фактом не можна.

Чому вимоги до відеопам’яті в однієї моделі різняться в 13 разів

Якщо пройти першою сторінкою видачі, Wan 2.2 14B трапляється з вимогою 6 ГБ, 16 ГБ, 24 ГБ, 54 ГБ, 65 ГБ і «80 ГБ і вище». Розкид у тринадцять разів — це не помилка одного з авторів. Це чотири різні класи тверджень, які ніхто не розділяє.

Перше. Заява вендора і заява бекенда — не одне й те саме. Alibaba про варіант 5B пише: потрібно не менш ніж 24 ГБ відеопам’яті, наприклад RTX 4090. ComfyUI про ту саму модель пише: версія 5B нормально вміщується у 8 ГБ завдяки нативному вивантаженню. Обидва твердження правильні, бо говорять про різне. Вендор описує модель, що цілком лежить у пам’яті карти. Бекенд описує режим, у якому в пам’яті тримається лише активний блок, а решта підкачується із системної оперативної пам’яті. Це різниця не в точності вимірювання, а в тому, що саме вимірюють.

Друге. Квантування змінює вагу моделі в рази. GGUF — формат зберігання ваг зі зниженою точністю; що агресивніший квант, то менший файл і то сильніше просідає якість. За реальним переліком файлів Wan 2.2 T2V-A14B: Q2_K — 5,3 ГБ, Q4_K_M — 9,65 ГБ, Q8_0 — 15,4 ГБ. Саме ці числа кочують оглядами як «вимоги до відеопам’яті», хоча це розмір файлу, а не пік споживання.

Третє, і його майже ніде немає: у Wan 2.2 таких файлів ДВА. Кожна половина MoE квантується окремо, і обидві потрібні для генерації. За нашим підрахунком це означає, що «Wan 2.2 у Q4_K_M» — це не 9,65 ГБ ваг, а близько 19,3 ГБ. Модель можна ганяти, підвантажуючи половини по черзі, але тоді ви платите часом на перемикання — і саме це перемикання пояснює частину відставання Wan за швидкістю.

Четверте. Текстовий енкодер рахують не всі. Модель не працює наодинці: промпт перетворює на числа окрема мовна модель. У замірі на RTX 5090 до файлу LTX-2.3 на 17,8 ГБ додається енкодер Gemma 3 12B у fp4 ще на 8,8 ГБ. Разом 26,6 ГБ замість 17,8 — якщо енкодер тримати на відеокарті. Його можна вивантажити в системну пам’ять, і тоді цифра знову змінюється.

П’яте. Тайлова обробка зсуває планку стрибком. У грудні 2024 року ComfyUI додав часову нарізку у VAE — декодер обробляє відео шматками, а не цілком. Вимога до вихідної HunyuanVideo впала з 32 ГБ до 8 ГБ на тій самій моделі й тому самому залізі. Нічого не змінилося, крім способу декодування.

Звідси просте правило читання будь-яких таблиць за цією темою: число без зазначення кванта, роздільної здатності, довжини ролика й режиму вивантаження не означає нічого. Нижче всі цифри подано з цими уточненнями. Сама логіка «модель під обсяг відеопам’яті» для локальних моделей не нова — докладно її розібрано в нашому матеріалі про те, яку локальну LLM обрати; різниця в тому, що у відео крок між тирами набагато жорсткіший.

Що влізе у вашу відеокарту: модель, квант і обсяг пам’яті

Зведена таблиця за тирами відеопам’яті. У колонці «звідки цифра» вказано, чиє це твердження: вендора, бекенда чи замірника — бо, як показано вище, це різні речі.

Відеопам’ятьЩо реально запускаєтьсяКвант / режимФормат результатуЗвідки цифра
8 ГБWan 2.2 TI2V-5Bнативне вивантаження ComfyUI720p, короткі ролики, дуже повільнозаява ComfyUI
8 ГБHunyuanVideo (вихідна, 13B)тайлове декодування VAE + fp8базові роликизаява ComfyUI, грудень 2024
12 ГБWan 2.2 14BGGUF Q3_K_S + пришвидшувальна LoRA840×420, 81 кадр — 900 секундсторонній замір на RTX 3060
16 ГБLTX у ComfyUI (гайд написаний за лінійкою 2.3)не уточнений1280×720 як робоча роздільна здатністьсистемна вимога NVIDIA, 17 березня 2026
16 ГБWan 2.2 14BGGUF Q4_K_M, половини по черзі480p упевнено, 720p із застереженняминаш розрахунок за розмірами файлів
24 ГБWan 2.2 TI2V-5Bвихідна точність720p за 24 к/с, 5 секунд менш ніж за 9 хвилинзаява Alibaba
24 ГБHunyuanVideo 1.5вихідна точність, без вивантаження480p і 720p, до 121 кадразаява Tencent
24 ГБLTX-2.3 distilledfp8-cast, тайловий VAE1280×704, 97 кадрів, пік 24,2 ГБсторонній замір на RTX 5090
32 ГБLTX-2.3 distilled + енкодерQ4_K_M + Gemma 3 12B fp4832×480, 81 кадрсторонній замір на RTX 5090
80 ГБWan 2.2 T2V-A14Bвихідна точність, одна карта480p і 720p, 5 секундзаява Alibaba
14 ГБHunyuanVideo 1.5з увімкненим вивантаженням моделі480p і 720pзаява Tencent
даних немаєLTX-2.5int8 convrot і NVFP4 готові для ComfyUInative 4K HDR, до 50 к/свимог не називають ані Lightricks, ані ComfyUI

Останній рядок — не пропуск у таблиці, а стан справ. Ваги LTX-2.5 лежать у відкритому доступі тиждень, ComfyUI підтримав її в день релізу, але ані картка моделі, ані офіційна документація workflow не називають ні мінімального обсягу відеопам’яті, ні рекомендованої карти. Незалежних замірів на домашньому залізі на 15 серпня 2026 року теж немає. За пару тижнів видача напевно заповниться числами на кшталт «LTX-2.5 потребує стільки-то гігабайтів» — майте на увазі, що сам розробник таких цифр не публікував, і питайте в таких таблиць методику.

Два висновки, які з цієї таблиці не випливають прямо, але випливають з арифметики.

RTX 5090 зі своїми 32 ГБ справді не тягне повну Wan 2.2 A14B — і річ не в оптимізаціях. 27 мільярдів параметрів у форматі bf16 займають по два байти на параметр, тобто близько 54 ГБ лише під ваги, без активацій, VAE й текстового енкодера. Заявлені Alibaba 80 ГБ на одну карту з цим узгоджуються. Жоден драйвер і жодне налаштування не зроблять 54 ГБ із 32 — тут працює тільки квантування, і обговорювати «Wan 2.2 14B на споживчій карті» має сенс винятково в термінах GGUF або FP8.

Поріг входу сьогодні — 16 ГБ, а не 8. Восьмигігабайтні сценарії існують і чесно задокументовані вендором бекенда, але вони тримаються на постійній підкачці ваг, і ціна цього видна в наступному розділі.

Якщо ви лише придивляєтеся до заліза під такі завдання, у нас розібрано обидві крайні точки: збірка на RTX 5090 з її стелею 32 ГБ і варіант із двома RTX 3090 на 48 ГБ сумарно. Застереження для другого випадку: у текстових моделей пам’ять двох карт додається майже лінійно, а дифузійні відеомоделі так не діляться — друга карта тут допомагає помітно гірше, ніж під час запуску LLM.

Скільки чекати ролик: заміри на RTX 5090, RTX 4090 і H100

Власного стенда з цими моделями в нас немає, тому нижче — тільки чужі заміри, і кожен іде з методикою. Без методики цифра в цій темі беззмістовна: нижче видно, як одна й та сама модель на одній і тій самій карті дає 22 і 43 секунди.

СтендМодель і налаштуванняФорматЧасДжерело
RTX 5090 32 ГБ, ComfyUI v0.16.4, PyTorch 2.9.1+cu130LTX-2.3 distilled Q4_K_M (17,8 ГБ) + Gemma 3 12B fp4, 8 кроків, euler + CFGGuider832×480, 81 кадр22,1 с прогрітий прохід, 48,5 с холоднийzenn.dev, березень 2026
той самий стендWan 2.2 14B, High + Low Noise Q4_K_M (по 9 ГБ), 6 кроків (3+3), dpm++_sde832×480, 81 кадр125 с із sageattn3, 143,9 с безzenn.dev, березень 2026
RTX 5090 32 ГБ, torch 2.10+cu128LTX-2.3 distilled 1.1, fp8-cast, тайловий VAE, SDPA, енкодер Gemma-3-12B q4_0768×512, 97 кадрів43,5 с (39 с у сталому режимі), пік 24,2 ГБдатасет rtx-5090-benchmarks
той самий стендте саме1280×704, 97 кадрів49,8 с, пік 24,2 ГБдатасет rtx-5090-benchmarks
RTX 4090HunyuanVideo 1.5, step-distilled, 8–12 кроків480p, image-to-video75 сзаява Tencent
RTX 4090Wan 2.2 TI2V-5B, вихідна точність720p, 5 секундменш ніж 9 хвилинзаява Alibaba
H100 PCIe 81,5 ГБ, 12 vCPU, 128 ГБ RAMWan 2.2, FP8 scaled, high + low noise (зайняли 34 ГБ)640×640, 5 секунд20–30 сHabr / Selectel, квітень 2026
RTX A2000 6 ГБтой самий сценарій640×640, 5 секунд600 сHabr / Selectel, квітень 2026
RTX 3060 12 ГБWan 2.2 GGUF Q3_K_S + чотирикрокова LoRA840×420, 81 кадр900 сNext Diffusion, серпень 2025

Із цієї таблиці читаються три речі, яких немає в розмовах про «найкращу модель».

Розрив у швидкості між LTX-2.3 і Wan 2.2 на одному стенді — близько 5,7 раза (22,1 проти 125 секунд). Автор заміру пояснює його архітектурою: LTX-2.3 у дистильованому вигляді сходиться за 8 кроків за нерівномірним розкладом, а Wan 2.2 перемикається між двома експертами й платить за перемикання. Він же наводить важливу деталь: пришвидшувач уваги sageattn3 дав Wan близько 13% приросту, а LTX-2.3 у GGUF — нічого, бо вузьким місцем там стає деквантування, а не розрахунок уваги. Повна методика заміру — в оригінальному розборі на zenn.dev.

Основний час з’їдає не модель. У датасеті замірів на RTX 5090 окремо пораховано: на сам дифузійний трансформер припадає лише 12–28% часу генерації. Решта — тайлове декодування VAE, декодування звуку й кодування готового файлу в h264/AAC. Це перевертає практичний висновок: гнатися за обчислювальною потужністю чипа в багатьох сценаріях менш осмислено, ніж за пам’яттю й налаштуваннями декодування.

Цифр щодо LTX-2.5 у цій таблиці немає навмисно. Єдине публічне число щодо нової версії — заява Lightricks про 6,8 секунди на 10-секундний ролик, і воно зняте на двох суперчипах NVIDIA GB200 дистильованою моделлю; через API самої Lightricks на той самий ролик іде близько 23,7 секунди. Ані те, ані інше не говорить вам нічого про вашу карту, тому в порівняння ці секунди не йдуть: рядки таблиці вище зняті на споживчому й серверному залізі, доступному приватній людині, і з розкритою методикою.

Нестача пам’яті б’є нелінійно. Один і той самий сценарій на H100 займає 20–30 секунд, а на RTX A2000 із 6 ГБ — 600 секунд. Різниця у двадцять-тридцять разів не пояснюється різницею в продуктивності чипів: на 6 ГБ модель працює через постійну підкачку із системної пам’яті, і це якісний перехід, а не кількісний. Практично це означає, що «влізло» і «працює» — різні стани, і між ними немає плавного переходу.

Слабкі місця замірів Wan, LTX і HunyuanVideo: чому ваші цифри інші

Усе, що вище, зібрано з чужих вимірювань на різному залізі й у різний час. Ось що в них не входить, які ризики ці прогалини створюють і чому ваші числа майже напевно розійдуться з табличними.

  • Єдиного стенда немає. Жодне джерело не прогнало всі три моделі на одній машині з однаковими налаштуваннями. Порівняння LTX-2.3 і Wan 2.2 коректне лише всередині рядка zenn.dev, де умови збігаються; зіставляти їх із цифрами Tencent чи Alibaba не можна — там інші роздільні здатності, кроки й дистиляти.
  • Заяви вендорів стосуються дистилятів. «75 секунд на RTX 4090» у HunyuanVideo 1.5 — це step-distilled модель на 480p у режимі image-to-video за 8–12 кроків, а не базова модель на 720p. Незалежного заміру рівно за цих умов у відкритому доступі знайти не вдалося.
  • Прогрітий прохід і холодний старт різняться вдвічі. У LTX-2.3 в замірі на RTX 5090 це 22,1 проти 48,5 секунди. Табличні цифри зазвичай стосуються другого й наступних проходів, а перший ролик за вечір ви чекатимете довше.
  • Завантаження й місце на диску майже ніхто не враховує. Один тільки LTX-2.3 у кванті Q4_K_M — це 17,8 ГБ, плюс енкодер на 8,8 ГБ, плюс апскейлери. Колекція з трьох моделей із кількома квантами легко переходить за сотню гігабайтів, і перший запуск упирається у швидкість інтернету, а не відеокарти.
  • Кількість спроб на придатний ролик не міряє ніхто. Усі таблиці неявно припускають, що кліп виходить з першого разу. На практиці час до прийнятного результату — це час однієї генерації, помножений на кількість спроб, і множник залежить від промпта, а не від заліза.
  • Втрата якості від квантування ніде не виміряна. В оглядах її описують словами «мінімальна» і «майже непомітна», але жодного порівняння кадрів на одному сиді між Q4, FP8 і вихідною точністю в розібраних матеріалах немає. Вважайте, що за економію пам’яті ви платите чимось, що просто не порахували.
  • Усе, крім відеопам’яті, винесено за дужки. Системна оперативна пам’ять за вивантаження, швидкість накопичувача, блок живлення, тротлінг на довгому проході — цих чинників у замірах немає, а на довгій серії генерацій вони даються взнаки.
  • Замірів на AMD та Intel практично немає. Уся публічна статистика щодо цих моделей знята на NVIDIA. Якщо у вас Radeon, питання впирається не в модель, а в бекенд — цю розвилку ми розбирали окремо в матеріалі про ROCm проти CUDA.
  • Версії зсувають усе, і просто зараз це видно на LTX. У HunyuanVideo 1.5 за місяць після релізу з’явилися дистиляти й FP8 GEMM. У Lightricks 11 серпня 2026 року вийшла LTX-2.5, і щодо неї на момент публікації немає ні заявлених вимог до відеопам’яті, ні незалежних замірів на домашніх картах — усі цифри щодо LTX у цьому матеріалі зняті на попередній версії 2.3. Будь-який замір живе до наступного оновлення моделі або бекенда.

Ліцензії Wan, LTX і HunyuanVideo: що з цього можна продавати

Це той розділ, де видача бреше найчастіше. З тринадцяти розібраних матеріалів топу двоє приписують HunyuanVideo ліцензію Apache 2.0, ще один називає її «лише для некомерційних досліджень». Хибне й те, й інше. Нижче — за текстами самих ліцензій.

МодельЛіцензіяКомерційне використанняОбмеженняПрава на результат
Wan 2.2Apache 2.0дозволено без умовзагальні заборони на протиправне застосування«ми не заявляємо прав на створений вами контент»
LTX-2.5 і LTX-2.3LTX-2.x Community Licenseбезкоштовно за річного доходу менш ніж $10 млнвище порога — платна ліцензія; поріг рахують за всією групою компаній«Licensor claims no rights in the Output»
HunyuanVideo 1.5Tencent Hunyuan Community Licenseдозволено з умовамитериторія виключає ЄС, Велику Британію та Південну Корею; понад 100 млн активних користувачів на місяць — окрема ліцензіяпотрібен notice-файл і розкриття своєї юрособи

Розгорнімо три моменти, які реально впливають на вибір.

У Wan 2.2 ліцензія найпростіша — Apache 2.0. Формулювання в репозиторії пряме: моделі ліцензовано під Apache 2.0, і розробник не претендує на права щодо згенерованого вами контенту. Для комерційної роботи це найспокійніший варіант із трьох.

У LTX поріг за доходом, а не за типом використання, і він однаковий для 2.3 та 2.5. Компанія з річним доходом менш ніж десять мільйонів доларів користується моделлю комерційно безкоштовно; від десяти мільйонів потрібна платна ліцензія. Пастка у визначенні: поріг рахують сукупно за всіма дочірніми, афілійованими та підконтрольними спільному власнику компаніями — тобто невелика студія всередині великого холдингу під нього потрапляє. Окремим пунктом ліцензія вимагає явно позначати поширюваний контент як машинно згенерований.

У Tencent обмеження територіальне, і це найнесподіваніша умова в трійці. Ліцензійну територію описано як всесвітню, за винятком території Європейського Союзу, Великої Британії та Південної Кореї. Тобто для комерційної роботи з клієнтами звідти модель формально не підходить — при тому що про це мовчать дванадцять із тринадцяти матеріалів першої сторінки видачі. України в переліку винятків немає, тож українському виконавцю ця ліцензія дозволяє комерційну роботу на загальних умовах. Ширше цього норму не розтягуйте: якщо замовник — компанія з ЄС або Великої Британії і ролики йдуть у її продукт, питання території постає вже для неї, і з’ясовувати його варто до здачі, а не після. Друга умова — поріг у 100 мільйонів активних користувачів на місяць, вище якого потрібна окрема ліцензія від Tencent; для переважної більшості читачів він неактуальний, але знати про нього варто. Повний текст доступний у файлі ліцензії на Hugging Face.

Практичний висновок простий: якщо ролики підуть у комерційний проєкт, ліцензія відсікає варіанти раніше, ніж бенчмарк. Спочатку дивимося, що дозволено, потім — що швидше.

Своя відеокарта проти хмари: собівартість секунди відео

Аргумент «на своїй карті генерації безкоштовні» звучить у кожному обговоренні. Порахуймо, скільки це коштує насправді. Методика відкрита — підставте своє залізо і свій тариф.

Вихідні дані. Беремо LTX-2.3 на RTX 5090 у роздільній здатності 1280×704: за заміром, на одну секунду готового відео йде 12,3 секунди рахунку. Заявлена NVIDIA повна потужність RTX 5090 — 575 Вт; беремо її як верхню межу, реально під дифузією карта споживає менше. Тариф на електроенергію для населення України зафіксовано на рівні 4,32 грн за кВт·год до 31 жовтня 2026 року.

Розрахунок. 12,3 секунди за 575 Вт — це близько 0,00196 кВт·год на одну секунду відео. За тарифом виходить менш ніж одна копійка за секунду готового ролика (приблизно 0,0085 грн). Година безперервної генерації обходиться в 0,575 кВт·год, тобто близько 2,48 грн електрики. За цю годину за тих самих налаштувань карта видає приблизно 293 секунди відео.

Із чим порівнюємо. На 15 серпня 2026 року готова генерація через API коштує від $0,04 за секунду відео в LTX-2 Fast у 1080p і від $0,05 за секунду в моделей Wan. Тобто ті самі 293 секунди, отримані через API, коштували б близько 11–15 доларів. Оренда карти — проміжний варіант: RTX 4090 у community-тарифі RunPod іде по $0,34 на годину, RTX 5090 у secure-тарифі — по $0,99 на годину, тарифікація посекундна.

Зведімо три способи отримати одну секунду відео в одну таблицю — за тих самих налаштувань LTX-2.3 і роздільної здатності 1280×704.

СпосібЩо платитеЗа 1 секунду відеоЗа годину роботи
Своя RTX 5090електрика, 575 Вт за тарифом 4,32 грн/кВт·годблизько 0,0085 грн2,48 грн, приблизно 293 секунди відео
Оренда RTX 5090 на RunPodпосекундна оплата GPU, $0,99 на годинублизько $0,0034$0,99
Готова генерація через APIціна за секунду результату, від $0,04від $0,0411–15 доларів за ті самі 293 секунди

Ціна карти в таблицю не входить навмисно: вона у всіх своя, а її внесок у собівартість залежить лише від того, скільки годин машина реально відпрацює.

Що це означає. Електрика в цьому завданні — статистична похибка. Реальна вартість локальної генерації — це ціна карти, поділена на кількість годин, які вона відпрацює. Формула для вашого випадку: карта окупається проти оренди за ціна карти / (вартість години оренди − вартість години електрики) годин роботи. Поки ви генеруєте десятки роликів на місяць, дешевше платити за секунди у хмарі. Точка перелому настає там, де карта завантажена регулярно — і тоді своя машина виграє з великим відривом, бо гранична вартість наступного ролика у вас майже нульова, а у хмарі вона стала.

Три застереження до розрахунку, без яких він перетворюється на рекламу. Перше: невдалі спроби коштують стільки ж, скільки вдалі, і у хмарі, і вдома. Друге: крім карти споживає й решта системи, а блок живлення має ККД — реальний лічильник покаже більше, ніж 575 Вт, помножені на час. Третє: тариф зафіксовано до кінця жовтня 2026 року, після чого вхідні дані розрахунку зміняться.

Як умістити модель у карту: п’ять важелів і ціна кожного

Жоден із цих прийомів не безкоштовний. Порядок — від найвигіднішого до найболючішого.

  1. Квантування ваг. Переводить модель у знижену точність: GGUF-варіанти Wan 2.2 ідуть від 5,3 ГБ (Q2_K) до 15,4 ГБ (Q8_0) на кожну половину. Ціна — якість і, несподівано, швидкість: у замірі на RTX 5090 деквантування GGUF стало вузьким місцем, через що пришвидшувач уваги перестав давати ефект.
  2. Вивантаження моделі в системну пам’ять. Саме воно стоїть за цифрами «5B у 8 ГБ» і «HunyuanVideo 1.5 від 14 ГБ». Ціна — час, причому нелінійно: порівняння H100 і RTX A2000 показує, що за сильної нестачі пам’яті генерація сповільнюється в десятки разів.
  3. Тайлове декодування VAE. Декодер обробляє ролик шматками, а не цілком; саме цей прийом свого часу опустив планку HunyuanVideo з 32 ГБ до 8 ГБ. Ціна — додатковий час і ризик артефактів на стиках за надто дрібних тайлів.
  4. Текстовий енкодер в оперативну пам’ять. Звільняє від 8,8 ГБ і вище — рівно стільки займає Gemma 3 12B у fp4 поряд із LTX-2.3. Ціна — вимоги до системної пам’яті й затримка на старті генерації.
  5. Роздільна здатність і довжина ролика. Найпряміший важіль: він не погіршує модель, він зменшує результат. У LTX (і в 2.3, і в 2.5) кількість кадрів підпорядковується правилу «кратне восьми плюс один», у HunyuanVideo 1.5 стеля — 121 кадр за 24 кадрів на секунду.

Порядок застосування має значення. Спочатку знижують роздільну здатність і довжину, потім вивантажують енкодер, потім вмикають тайлінг, і лише тоді йдуть в агресивні кванти — бо перші три важелі коштують часу, а останній коштує якості, і повернути її не можна.

Кому яка модель: вибір за обсягом відеопам’яті та завданням

  • 8–12 ГБ. Реалістичний сценарій один: Wan 2.2 у варіанті 5B або в агресивному GGUF-кванті, невисока роздільна здатність, готовність чекати хвилинами. Це режим знайомства з технологією. Якщо мета — результат, а не експеримент, на цьому обсязі дешевше платити за секунди у хмарі, а гроші відкласти на карту — з чого починати вибір, розібрано в гіді про те, як обрати залізо для локального ШІ.
  • 16 ГБ. Робочий мінімум. LTX у ComfyUI за системними вимогами NVIDIA починається звідси, Wan 2.2 у Q4_K_M живе з підвантаженням половин по черзі. Тут уже має сенс говорити про 720p.
  • 24 ГБ. Найзбалансованіший варіант: сюди вміщується Wan 2.2 TI2V-5B у вихідній точності, комфортно працює HunyuanVideo 1.5, а LTX-2.3 у дистиляті вкладається з піком 24,2 ГБ.
  • 32 ГБ. LTX-2.3 разом з енкодером і запасом, найшвидші проходи з публічних замірів. Повна Wan 2.2 A14B сюди все одно не вміщується — тільки квантована.
  • Потрібен звук. Вибір без варіантів: лінійка LTX — єдина з трьох, хто генерує синхронізоване аудіо однією моделлю.
  • Хочете найсвіжішу модель. Це LTX-2.5 від 11 серпня 2026 року: відкриті ваги, підтримка ComfyUI з першого дня, кванти int8 і NVFP4 уже викладено. Тверезо оцінюйте ризик: вимог до заліза вендор не публікував, незалежних замірів немає, і скільки вона попросить саме у вашої карти — зараз не знає ніхто. Потрібна передбачуваність — беріть 2.3, щодо неї цифри є.
  • Комерційний проєкт із клієнтами з ЄС або Великої Британії. HunyuanVideo 1.5 відпадає за територією ліцензії. Лишаються Wan 2.2 з її Apache 2.0 і лінійка LTX, якщо річний дохід компанії нижчий за поріг у $10 млн.

І останнє, про що варто пам’ятати, приміряючись до теми: відео — найважча з локальних модальностей. Вимоги в генерації картинок нейромережами на порядок м’якші, і якщо завдання в тому, щоб просто почати працювати з моделями на своєму залізі, розумніше заходити звідти.

FAQ

Чи можна генерувати відео на відеокарті з 8 ГБ пам’яті? Так, але із застереженнями. ComfyUI прямо заявляє, що версія Wan 2.2 на 5 мільярдів параметрів вміщується у 8 ГБ завдяки нативному вивантаженню, а вихідна HunyuanVideo запускається на цьому ж обсязі завдяки тайловому декодуванню VAE. Платите ви часом: за сильної нестачі пам’яті модель постійно підкачує ваги, і генерація сповільнюється в рази, а іноді в десятки разів.

Чи потрібна для локальної генерації відео NVIDIA, чи підійде Radeon? Формально моделі не прив’язані до вендора, але вся публічна статистика щодо Wan 2.2, LTX і HunyuanVideo 1.5 знята на картах NVIDIA. На AMD питання впирається не в модель, а в бекенд і зрілість ROCm: частина оптимізацій, включно з пришвидшувачами уваги, там або відсутня, або поводиться інакше. Планувати роботу на Radeon можна, але закладайте час на налаштування.

Скільки місця на диску займають локальні відеомоделі? Більше, ніж очікують майже всі. Один дистилят LTX-2.3 у кванті Q4_K_M важить 17,8 ГБ, текстовий енкодер до нього — ще 8,8 ГБ. Wan 2.2 у GGUF потребує двох файлів одразу: по 9,65 ГБ у Q4_K_M або по 15,4 ГБ у Q8_0. Якщо тримати кілька моделей у кількох квантах плюс апскейлери й VAE, колекція впевнено переходить за сотню гігабайтів.

Чи можна продавати ролики, згенеровані Wan 2.2? Так. Моделі Wan 2.2 викладено під ліцензією Apache 2.0, і розробник окремо зазначає, що не заявляє прав на створений вами контент. Це найпростіший випадок із трьох розглянутих моделей: ні порога за доходом, ні територіальних винятків, ні вимоги отримувати окремий дозвіл. Загальні заборони на протиправне використання, звісно, лишаються.

Що вигідніше: своя відеокарта чи оплата генерації за секундами? Залежить від завантаження. Електрика коштує копійки: близько 0,0085 грн на секунду готового відео за тарифу 4,32 грн за кВт·год. Але карта коштує грошей, і окупається вона тільки обсягом. За десятка роликів на місяць дешевше платити за секунди у хмарі, де на 15 серпня 2026 року ставка починається від $0,04. За регулярного завантаження своя карта виграє: гранична вартість наступного ролика у вас майже нульова.

Чому в мене генерація йде довше, ніж в опублікованих замірах? Причин зазвичай три. Перша — холодний старт: перший прохід після запуску займає вдвічі більше часу, ніж наступні. Друга — інший квант або роздільна здатність: одна й та сама LTX-2.3 на одній і тій самій RTX 5090 у різних замірах дає 22 і 43 секунди саме через це. Третя — нестача пам’яті, за якої вмикається підкачка ваг, і час зростає нелінійно.

Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.