Narzędzia AI · Wideo i obraz

Generator promptów do AI

Cztery modele w jednym miejscu: dwa do wideo i dwa do obrazu. Wybierasz model, klikasz gotowy przykład i masz prompt do skopiowania. Piszesz po polsku, dostajesz prompt po angielsku - bo na angielskim te modele były uczone.

Bez rejestracji i bez wysyłania czegokolwiek na serwer. Jedyny ruch na zewnątrz to tłumaczenie wpisanego tekstu, a gdy ono nie działa, prompt i tak się składa.

Krok 1

Do czego generujesz

Nie wiesz, który wybrać? Niżej jest tabela porównawcza czterech modeli - co robią, czego nie zrobią i ile kosztują.

Krok 2

Co chcesz zrobić

Masz gotowy obraz i chcesz go ożywić. Opisujesz wyłącznie to, co się rusza - reszta już istnieje w pliku.

Wersja modelu

Domyślny wybór do pracy z promptu. Multi-shot, natywny dźwięk w pięciu językach, do 4K.

Wersje i parametry sprawdzone 2026-08-14 wobec skilla kling-ai. Modele zmieniają się co kilka tygodni - jeśli widzisz rozjazd, napisz.

Krok 3

Zacznij od gotowego przykładu

Kliknięcie wypełnia cały formularz. Potem podmieniasz to, co chcesz mieć inaczej - to szybsza droga niż pusty formularz.

Krok 4

Opisz, co ma powstać

Opisz TYLKO ruch, nie zawartość obrazu. Przykład: włosy poruszają się na delikatnym wietrze, powieki mrugają naturalnie

Bez wskazania kamera improwizuje. Przykład: kamera statyczna, jeśli ma się ruszać tylko postać

Więcej ustawień 11 pól

Charakter światła w ujęciu. Przykład: złota godzina do ciepłego, wieczornego kadru

Styl wizualny

Można zaznaczyć kilka. Przykład: filmowy plus ziarno filmowe daje klimat taśmy

Tempo ruchu

Modyfikatory doklejane do opisu kamery. Przykład: wolno i płynnie przy portrecie

Logo i napisy lubią się rozjeżdżać. Przykład: logo i tekst w prawym górnym rogu

Długość ujęcia. Przykład: 5 sekund na pętlę do mediów społecznościowych

Proporcje kadru. Przykład: 9:16 do rolki na telefon

Bez wskazania mówcy dźwięk rozjeżdża się z ustami. Przykład: Anna, prowadząca po lewej stronie kadru

Kwestia zostaje w języku, w którym ma zabrzmieć - nie tłumaczymy jej. Przykład: Nie wierzę, że to zadziałało

Doklejany do kwestii jako wskazówka aktorska. Przykład: ciepły, zaskoczony

Dźwięk zsynchronizowany z akcją. Przykład: kroki na żwirze w rytm chodu

Dźwięk otoczenia. Przykład: szum ruchu ulicznego, odległe ptaki

Twój prompt

Co zrobić z tym promptem

Wklej go tutaj: app.klingai.com/global. Zakładka AI Videos, potem Image to Video albo Text to Video. Konto jest wymagane, plan darmowy nie pozwala na użycie komercyjne.

Używasz Claude'a? To samo robi skill kling-ai, tylko bez przeklejania: prowadzi przez briefing, dobiera wersję modelu i od razu pisze gotowy prompt. Instalacja skilli.

Dlaczego prompt jest po angielsku, skoro piszę po polsku? Bo wszystkie cztery modele były trenowane głównie na angielskim i chińskim, a na polskim prompcie dają wyraźnie gorszy wynik. Narzędzie tłumaczy Twój opis w locie, żebyś nie musiał pisać po angielsku sam. Wyjątki, które celowo zostają w Twoim języku: kwestie dialogowe (mają tak zabrzmieć) i napisy, które mają pojawić się w obrazie.

Który model do czego

Cztery modele, cztery różne zadania. Poniżej to, co realnie decyduje o wyborze - stan na 2026-08-14.

Model Do czego Tryby Gdzie działa
Kling AI wideo Najlepszy wybór, gdy masz gotowy obraz i chcesz go ożywić albo potrzebujesz ujęcia z mówiącą postacią. Obraz do wideo, Tekst do wideo, Kontrola ruchu, Edycja gotowego filmu app.klingai.com/global
Nano Banana obraz Najlepszy wybór, gdy potrzebujesz obrazu z czytelnym napisem albo chcesz poprawić fragment zdjęcia, nie tracąc reszty. Obraz z opisu, Edycja obrazu, Tłumaczenie napisów w obrazie, Miniatura na YouTube, Infografika aistudio.google.com
Seedance 2.0 wideo Najlepszy wybór, gdy scena ma kilka ujęć i dialog - obraz i dźwięk powstają razem, nie doklejane po fakcie. Nowe wideo z ujęć, Edycja istniejącego filmu, Przedłużenie filmu BytePlus ModelArk albo Dreamina
Z-Image obraz Najlepszy wybór, gdy chcesz generować lokalnie, bez konta i bez opłaty za obraz - i gdy zależy Ci na fotorealizmie. Wariant Turbo - bez promptu negatywnego, Wariant bazowy - z promptem negatywnym lokalnie: diffusers, ComfyUI albo mflux

Kling AI

wideo

Kling zamienia gotowy obraz w ruch albo buduje ujęcie od zera z opisu. Ma dźwięk generowany razem z obrazem i dialog w pięciu językach, tryb wielu ujęć w jednym przebiegu oraz osobny wariant, który przenosi ruch z filmu wzorcowego na Twoją postać. To najbardziej rozbudowany z czterech modeli i jedyny, który potrafi jednocześnie trzymać tożsamość postaci między ujęciami i mówić jej głosem.

Kiedy to jest właściwy wybór

  • Masz zdjęcie albo grafikę i chcesz, żeby się poruszyła.
  • W kadrze ktoś mówi. Wtedy Turbo, bo synchronizacja ust jest w tej rodzinie jego przewagą.
  • Scena potrzebuje kilku ujęć z zachowaną ciągłością stylu.
  • Ta sama postać ma wystąpić w wielu generowaniach i musi wyglądać identycznie. Wtedy Omni z referencją elementu.
  • Masz film wzorcowy z ruchem i chcesz przenieść ten ruch na inną postać.

Czego nie zrobi

  • Nie zrobi pojedynczego obrazu. Kling ma osobną rodzinę modeli obrazowych, ale skill i to narzędzie obejmują wyłącznie wideo - do obrazu są tu Nano Banana i Z-Image.
  • Nie przekroczy 15 sekund w zwykłych wariantach. Trzydzieści sekund daje tylko kontrola ruchu, a pięć minut tylko Avatar 2.0, którego generator nie obsługuje (powód niżej).
  • Nie da 4K na wariancie Turbo. W cenniku nie ma takiego poziomu dla Turbo, więc materiał w 4K wymaga VIDEO 3.0 albo Omni.
  • Nie pozwoli użyć wyniku komercyjnie na planie darmowym. To twarde ograniczenie licencji, nie kwestia jakości.
  • Nie sklonuje głosu w innym języku niż angielski i chiński. Voice Control obsługuje tylko te dwa, choć umie przenieść barwę między nimi.
  • Nie edytuje filmu w każdym wariancie. Edycja gotowego materiału to wyłącznie VIDEO 3.0 Omni, a film wejściowy musi mieć od 3 do 15 sekund.
Ile kosztuje

W dostępie programowym Kling liczy za sekundę wyniku, w jednostkach po 0,14 USD. VIDEO 3.0 Turbo w 1080p z dźwiękiem to 1,0 jednostki za sekundę, czyli 0,14 USD, VIDEO 3.0 z dźwiękiem 1,2 jednostki (0,168 USD), a bez dźwięku 0,8 jednostki (0,112 USD). Wyłączenie dźwięku oszczędza w 1080p około jednej trzeciej. 4K to 3,0 jednostki za sekundę niezależnie od wariantu, czyli od dwóch i pół do pięciu razy więcej niż 1080p - dlatego iteruje się w 1080p, a 4K zostawia na wersję finalną. W samej aplikacji obowiązują kredyty i abonament, a plan darmowy nie daje prawa do użycia komercyjnego.

Stawki sprawdzone przez skill kling-ai wobec cennika producenta i mogą się zmienić bez uprzedzenia. Przed policzeniem budżetu sprawdź je u źródła. Źródło: kling.ai/dev/pricing.

Nano Banana

obraz

Nano Banana to obrazowa część modeli Gemini od Google. Robi obraz z opisu, ale jej realną przewagą jest edycja rozmową: podajesz jedną zmianę, a nie opisujesz całej scenki od nowa, i model trzyma resztę obrazu. Dobrze radzi sobie z czytelnym napisem w obrazie, złożonymi układami graficznymi i podmianą tekstu w gotowej grafice na inny język. Przyjmuje do czternastu obrazów wzorcowych, a w wariancie Nano Banana 2 również film na wejściu, z którego składa kadr.

Kiedy to jest właściwy wybór

  • Obraz ma zawierać napis, który musi być czytelny i poprawnie napisany.
  • Masz zdjęcie, w którym 80 procent jest dobre, i chcesz zmienić jedną rzecz bez utraty reszty.
  • Robisz miniaturę do filmu, który już jest zmontowany. Nano Banana 2 jako jedyna przyjmuje wideo na wejściu.
  • Potrzebujesz infografiki albo złożonego układu z liczbami. Wtedy Pro, bo tekst wychodzi najpewniej.
  • Masz gotową grafikę po angielsku i chcesz tę samą w innym języku, z zachowanym układem.

Czego nie zrobi

  • Nie zrobi wideo. To model obrazowy - ruch robią tu Kling i Seedance.
  • Nie ma darmowego progu w dostępie programowym. Płacisz od pierwszego obrazu; darmowa jest tylko interaktywna piaskownica Google AI Studio, i to w ramach limitów konta.
  • Nie zagwarantuje poprawnych polskich znaków w napisie wewnątrz obrazu. Polski nie jest na liście języków o najlepszej jakości renderowania. Zwykle wychodzi, bo litery są łacińskie, ale przed publikacją trzeba zrobić próbkę, a przy problemach z ogonkami wygenerować obraz bez tekstu i złożyć napis w edytorze.
  • Nie ugruntuje obrazu w wyszukiwarce na wariancie Lite. Lite nie ma tej funkcji, podobnie jak nie znosi wielu obrazów wzorcowych ani długiego łańcucha edycji.
  • Nie użyje zdjęcia prawdziwej osoby z wyników wyszukiwania. To udokumentowane ograniczenie ugruntowania w Nano Banana 2.
  • Nie ustawi rozmiaru obrazu samym zdaniem w prompcie. Proporcje i rozdzielczość są parametrem wywołania - napisanie „16:9" pomaga w kompozycji, ale nie zmienia płótna.
Ile kosztuje

Płatność jest za obraz i zależy od wariantu oraz rozdzielczości. Lite kosztuje 0,0336 USD i działa tylko w 1K. Nano Banana 2 to 0,045 USD w 0,5K, 0,067 USD w 1K, 0,101 USD w 2K i 0,151 USD w 4K. Pro kosztuje 0,134 USD w 1K i 2K oraz 0,24 USD w 4K, czyli około dwa razy tyle co Nano Banana 2. Tryb wsadowy obniża stawkę o połowę w zamian za czas oczekiwania do doby. Ugruntowanie w wyszukiwarce liczy się osobno: 5000 zapytań miesięcznie w rodzinie Gemini 3 jest bez opłaty, potem 14 USD za tysiąc.

Stawki sprawdzone przez skill nano-banana wobec cennika Google i mogą się zmienić bez uprzedzenia. Przed policzeniem budżetu sprawdź je u źródła. Źródło: ai.google.dev/gemini-api/docs/pricing.

Seedance 2.0

wideo

Seedance to rodzina wideo od ByteDance. Jej cechą wyróżniającą jest to, że obraz i dźwięk powstają razem, w jednym przebiegu, a nie doklejane po fakcie - dlatego dialog w prompcie steruje ruchem ust, a nie tylko dopisuje napis. Model rozkłada wejście na to, co jest w kadrze, i na to, jak zmienia się w czasie, więc prompt pisze się ujęciami w kolejności zdarzeń. Poza generowaniem od zera przyjmuje dwa zadania, których nie ma w tej formie w Klingu: edycję istniejącego filmu i przedłużenie go w czasie.

Kiedy to jest właściwy wybór

  • Scena ma kilka ujęć i dialog, a Ty chcesz jeden przebieg zamiast montażu.
  • Chcesz podmienić jedną rzecz w filmie, który już masz, zachowując ruch kamery.
  • Chcesz dołożyć czas do gotowego materiału, w przód albo w tył.
  • Dźwięk otoczenia i muzyka mają powstać razem z obrazem, a nie w montażu.

Czego nie zrobi

  • Nie przyjmie sterowania czasem pojedynczego ujęcia. Podawanie sekund jest w dokumentacji opisane jako niestabilne i wymuszanie go może dać nienormalny wynik. Dlatego generator nie ma pola na sekundy przy ujęciach.
  • Nie zagwarantuje braku napisów, logo ani znaku wodnego. Klauzule zakazujące zmniejszają prawdopodobieństwo, ale go nie zerują. Dokumentacja mówi to wprost, więc obietnica byłaby nieuczciwa.
  • Nie zniesie gwałtownego ruchu. Sprint, duże skoki i przewroty to miejsce, w którym modele wideo się psują; dokumentacja zaleca ruchy powolne, ciągłe i małe.
  • Nie przyjmie wejścia złożonego tylko z tekstu i dźwięku ani samego dźwięku. Do pliku audio musi iść obraz albo film.
  • Nie da 4K poza najdroższym wariantem, a to 4K wychodzi jako dziesięciobitowy H.265, którego część odtwarzaczy i przeglądarek nie otworzy bez konwersji. Limity zapytań przy 4K są też znacznie ostrzejsze, więc partia materiału i tak pójdzie po kolei.
  • Nie uruchomi się na platformie producenta, dopóki nie wykupisz pakietu zasobów. To brama płatności przed pierwszym generowaniem, nie po nim.
Ile kosztuje

Tutaj świadomie nie ma jednej liczby i nie jest to wykręt. Dokumentacja ByteDance nie publikuje stawki na stronach, z których korzysta skill: platforma producenta jest zamknięta za pakietami zasobów, a pośrednicy wystawiają własne identyfikatory modeli i własne ceny. Rachunek zależy od wariantu, rozdzielczości, długości, proporcji i tego, czy generujesz dźwięk, więc pojedyncza cena „za klip" znaleziona w sieci jest stawką bazową dla jednej konkretnej konfiguracji. Praktyczna reguła z dokumentacji: iteruj w trybie roboczym albo w 480p i 720p, odczytaj koszt zwrócony po prawdziwym wywołaniu i dopiero wtedy licz budżet.

Brak podanej kwoty jest tu informacją, nie luką. Skill seedance wprost nie stawia tezy o cenie, bo producent jej nie publikuje w dostępnej dokumentacji. Źródło: docs.byteplus.com - ModelArk.

Z-Image

obraz

Z-Image to model o otwartych wagach od Tongyi-MAI, części Alibaby: sześć miliardów parametrów na licencji Apache 2.0, czyli do użytku komercyjnego. Kluczowa różnica wobec pozostałych trzech jest architektoniczna, nie jakościowa - ten model chodzi na Twoim komputerze. Po pobraniu wag nie płacisz za obraz i nic z Twojego promptu nie wychodzi na cudzy serwer. Wariant Turbo mieści się w 16 GB pamięci karty graficznej. Jego mocną stroną jest fotorealizm, a prompt pisze się gęstymi, konkretnymi frazami, nie płynną prozą.

Kiedy to jest właściwy wybór

  • Zależy Ci na fotorealizmie i chcesz sterować nim słownikiem fotograficznym, nie przymiotnikami.
  • Nie chcesz płacić za obraz ani wysyłać treści promptu na zewnątrz.
  • Robisz dużo obrazów i koszt jednostkowy zaczyna mieć znaczenie.
  • Potrzebujesz prawdziwego promptu negatywnego. Wtedy wariant bazowy, nie Turbo.
  • Chcesz douczyć model na własnych danych. Wagi są otwarte, a wariant bazowy jest oznaczony jako łatwy do douczenia.

Czego nie zrobi

  • W wariancie Turbo prompt negatywny nie działa w ogóle. Nie jest odradzany - kanał jest martwy, bo Turbo nie ma prowadzenia. Cokolwiek tam wpiszesz, zostanie zignorowane, dlatego wykluczenia zapisuje się jako obecność czegoś innego.
  • W Turbo zmiana ziarna prawie nic nie daje. Twórcy sami oceniają różnorodność tego wariantu jako niską, bo był douczany wzmocnieniem w stronę jednego preferowanego wyniku. Trzy różne obrazy wymagają trzech różnych promptów, nie trzech ziaren.
  • Nie deklaruje poprawnego renderowania napisów w językach innych niż angielski i chiński. Polski działa często, bo litery są łacińskie, ale jest poza tym, co producent obiecuje.
  • Nie ma jeszcze wariantów Z-Image-Edit ani Z-Image-Omni-Base. W oficjalnym spisie modeli miały status „do wydania", więc generator ich nie zna i nie należy na nich planować pracy.
  • Nie zrobi wideo ani dźwięku.
  • Nie wybaczy przeniesienia ustawień z innego modelu. Turbo uruchomiony z prowadzeniem 4 i 50 krokami albo model bazowy z prowadzeniem 0 i 8 krokami dają śmieci, a to najczęstszy błąd konfiguracji, gdy domyślne wartości programu zostały napisane pod inny model.
Ile kosztuje

Wagi są darmowe i na licencji Apache 2.0, więc kosztem jest Twój sprzęt i prąd, a nie opłata za obraz. Producent podaje, że Turbo mieści się w 16 GB pamięci karty i osiąga czas poniżej sekundy na karcie H800 - to liczba z centrum danych, nie z laptopa, więc czasu na własnym komputerze nie da się z niej wyliczyć. Do samego sprawdzenia promptu, bez pobierania wag, wystarczy oficjalna przestrzeń demonstracyjna na Hugging Face albo ModelScope.

Licencja i wymagania sprawdzone przez skill z-image wobec repozytorium i karty modelu. Czas generowania na konkretnym komputerze jest pomiarem lokalnym, nie właściwością modelu. Źródło: github.com/Tongyi-MAI/Z-Image.

Jak pisze się prompt do każdego z tych modeli

Cztery modele nie mają wspólnej struktury promptu i to jest najważniejsza rzecz na tej stronie. Zestaw pól w generatorze wygląda inaczej dla każdego z nich nie z lenistwa, a dlatego, że uśrednienie ich do jednego formularza produkowałoby prompty niezgodne z tym, na czym te modele były trenowane. Poniżej reguły każdego z nich, z przykładem tego samego zamiaru zapisanego słabo i dobrze.

Kling AI wideo

Przestań pisać podpis pod zdjęciem, zacznij wydawać polecenia operatorowi. Kolejność, którą model rozumie najlepiej: scena, postać, akcja, kamera, dźwięk i styl.

Rozwiń szczegółowe reguły (7) i przykład promptu przed i po

Ruch kamery trzeba nazwać wprost. Bez tego kamera improwizuje, a improwizacja modelu wideo rzadko trafia w to, co masz w głowie. „Kamera statyczna" jest pełnoprawnym poleceniem i często najlepszym, gdy ruszać ma się tylko postać.

Ruch musi mieć punkt domknięcia. Otwarta akcja bez wskazanego końca to najczęstsza przyczyna generowania, które wisi na 99 procentach. Dopisanie zdania o powrocie do pozycji wyjściowej rozwiązuje to i jednocześnie robi z ujęcia materiał do zapętlenia. W generatorze odpowiada za to przełącznik domykający ruch, włączony domyślnie.

Jedna główna akcja na ujęcie. Akcję można rozłożyć w czasie, bo VIDEO 3.0 pewnie obsługuje ciąg zdarzeń: najpierw podnosi wzrok, potem odwraca głowę, w końcu się uśmiecha. Czego nie należy robić, to upychać trzech niezależnych rzeczy w jednym prompcie - do tego jest tryb wielu ujęć.

Konkret bije ogólnik na każdym poziomie. „Cyberpunkowa uliczka o północy, odbicia neonów na mokrym asfalcie" daje przewidywalny wynik, „ulica" nie daje żadnego.

Limit słów zależy od wariantu i to nie jest kosmetyka: od 100 do 200 słów na rodzinie 3.0, od 50 do 80 na 2.6, od 40 do 60 na 2.5 Turbo. Generator liczy słowa na żywo i zmienia kolor licznika, gdy zbliżasz się do limitu wybranego wariantu.

Przy dialogu trzeba przypisać mówcę. Kwestia bez wskazania, kto ją wypowiada, rozjeżdża dźwięk z ustami. Generator składa to w udokumentowaną składnię z nazwą mówcy przed kwestią, a samą kwestię zostawia w Twoim języku, bo ona ma tak zabrzmieć.

Przy edycji gotowego filmu obowiązuje dodatkowa reguła: jedna intencja zmiany na generowanie i jawna lista tego, co ma zostać nietknięte. Kąt kamery, tor ruchu, układ przestrzenny, pozycje postaci. Bez tej listy edycja odjeżdża od materiału źródłowego. Jeśli coś wklejasz do kadru, dochodzi jeszcze klauzula o dopasowaniu światła i cieni, bez której obiekt wygląda jak naklejka.

Ten sam zamiar, dwa prompty

Słabo

A woman in a cafe, cinematic, very beautiful.

Prompt w stylu podpisu pod zdjęciem - dokładnie to, od czego odchodzi dokumentacja Klinga. Nie ma tu ani kamery, ani akcji, ani punktu domknięcia, a dwa ostatnie słowa nie niosą żadnej informacji wizualnej.

Dobrze

A 35-year-old woman with long dark hair, wearing a linen blazer first looks up from her laptop, then turns her head towards the window in a morning cafe with large windows, steam rising over a cup. Camera: smooth slow push in. Motion settles back to its starting position. Duration: 10s. Aspect ratio: 16:9.

Dokładnie to, co składa generator: tryb „Tekst do wideo", wersja VIDEO 3.0, 53 słowa przy limicie 200.

Co się zmieniło

  • Postać ma cechy rozpoznawcze, nie jest „kobietą".
  • Akcja jest rozłożona na dwa następujące po sobie zdarzenia, co ten model obsługuje wprost.
  • Kamera jest nazwana i ma tempo, więc nie improwizuje.
  • Ruch ma punkt domknięcia, więc generowanie nie zawiesi się na końcu.
  • Czas i proporcje są w prompcie, a nie w domysłach.
  • Zniknęły słowa bez treści wizualnej („very beautiful"), bo zjadają uwagę modelu.

Nano Banana obraz

Zachowuj się jak dyrektor kreatywny, nie jak wyszukiwarka. Pełne zdania opisujące scenę, nie lista tagów - i sześć czynników, na których ten model był uczony: podmiot, akcja, miejsce, kompozycja, światło, styl.

Rozwiń szczegółowe reguły (7) i przykład promptu przed i po

Lista tagów jest najczęstszym błędem przy tym modelu. „Pies, park, 4k, realistyczne, słonecznie" to zapis pod poprzednią generację narzędzi. Nano Banana rozumie zdania, a puste wzmacniacze w rodzaju „arcydzieło" albo „8k" po prostu ignoruje, zabierając przy tym miejsce w prompcie.

Edytuj, nie generuj od nowa. Jeśli obraz jest dobry w 80 procentach, opisz zmianę i zachowaj resztę. To najmocniejsza rzecz w tym modelu i główny powód, dla którego warto go wybrać nad model, który każdą poprawkę zaczyna od zera.

Najważniejsze pole przy edycji nazywa to, co ma zostać nietknięte. Jego pominięcie daje niekontrolowane zmiany: twarz, która się zmienia, tło, które odjeżdża, światło, które przeskakuje. Dlatego w generatorze to pole jest podstawowe, nie schowane, a jego treść trafia do promptu wielkimi literami jako osobna instrukcja.

Podaj powód, do czego obraz posłuży. „Do okładki książki kucharskiej" pomaga modelowi podjąć decyzje artystyczne, których inaczej nie ma na czym oprzeć. To nie ozdoba promptu - trzy z czterech wariantów są modelami rozumującymi, więc kontekst realnie zmienia wynik.

Napis w obrazie ma dwie reguły. Pierwsza: dokładna treść w cudzysłowie, z miejscem i krojem. Druga, prosto z dokumentacji: przy grafikach z dużą ilością tekstu najpierw ustal samą treść, a dopiero w drugim kroku poproś o obraz z tym tekstem. Jednoczesne wymyślanie treści i składanie jej w układ wychodzi gorzej.

Kolory podawaj kodem szesnastkowym, nie nazwą. „Niebieski" jest nieprecyzyjny, a marka ma jeden konkretny odcień. To samo dotyczy proporcji i rozdzielczości: napisanie ich w prompcie pomaga kompozycji, ale rozmiar płótna ustawia się parametrem wywołania.

Jeden styl na prompt. Mieszanie dwóch rodzin stylistycznych daje breję, a nie połączenie. Jeśli zależy Ci na spójnej serii obrazów z tą samą osobą, zamiast opisywać ją od nowa w każdym prompcie, podaj obraz wzorcowy i zablokuj wygląd postaci.

Ten sam zamiar, dwa prompty

Słabo

Change the shirt to black.

Polecenie edycji bez listy tego, co ma zostać. Dokumentacja wymienia dokładnie ten przypadek jako przyczynę objawu „twarz zmienia się przy edycji" - model nie wie, że twarz, poza i tło były w porządku.

Dobrze

Replace the white shirt worn by the person in the foreground - a black t-shirt with natural fabric folds. KEEP UNCHANGED: face, hairstyle, pose, background, direction and colour of the light. Photorealistic result, natural lighting.

Dokładnie to, co składa generator: tryb „Edycja obrazu", wersja Nano Banana 2, 35 słów.

Co się zmieniło

  • Czasownik jest jawny i wskazuje strukturę zmiany: zastąp, a nie „zmień coś".
  • Element jest wskazany tak, że nie da się go pomylić z innym.
  • Stan docelowy ma opisaną fakturę, więc nie wyjdzie płaska plama.
  • Jest lista tego, co ma zostać nietknięte, i to ona chroni pozostałe 80 procent obrazu.
  • Na końcu stoi wymóg co do wyniku, doklejany osobnym zdaniem.

Seedance 2.0 wideo

To nie opis, to instrukcja inżynierska. Model rozkłada wejście na to, co jest w kadrze, i na to, jak zmienia się w czasie - więc prompt jest scenopisem ujęć w kolejności zdarzeń, bez podawania sekund.

Rozwiń szczegółowe reguły (9) i przykład promptu przed i po

Zdefiniuj bohatera, zamiast liczyć na domysł. Obraz wzorcowy zawiera zwykle więcej niż jedną rzecz, więc trzeba wskazać, co jest podmiotem: dwie, trzy stałe cechy, które go jednoznacznie odróżniają, i ta sama nazwa przy każdej dalszej wzmiance. Sprzeczne cechy jednego podmiotu to gwarantowany rozjazd.

Rozpisz ujęcia i trzymaj w każdym tę samą kolejność: ruch kamery albo cięcie, potem akcja i mimika, potem pozycja w przestrzeni, na końcu dźwięk. Nie przypisuj ujęciom czasu. Dokumentacja mówi wprost, że sterowanie sekundami jest niestabilne i wymuszanie go może dać nienormalny wynik.

Jeden ruch kamery na ujęcie. Najazd, odjazd, panorama i przesunięcie naraz zwiększają niestabilność obrazu. Jeśli potrzebujesz złożonego ruchu, daj mu osobne ujęcie.

Rozbij akcję na części ciała i podaj miarę. Nie „biegnie", a „powoli podnosi rękę", „szybko odwraca głowę", „mocno odbija się od ziemi". I preferuj ruchy powolne, ciągłe, małe - duży ruch jest miejscem, w którym modele wideo się psują, więc to ograniczenie modelu, nie ostrożność bez powodu.

Emocję zapisuj jako fizyczny szczegół, nie jako nazwę uczucia. Zamiast „smutna" - opuszczona głowa, lekko drżące ramiona, palce mimowolnie zaciskające skraj ubrania. Dokumentacja producenta ma na to całą tabelę tłumaczeń i to jest jedna z rzeczy, które najbardziej podnoszą jakość wyniku.

Model ma własne znaki dla rodzajów dźwięku i to konwencja, nie ozdoba: nawiasy klamrowe dla kwestii dialogowych, ostre dla efektów, okrągłe dla muzyki, kwadratowe dla napisów. Dialog w innym języku niż angielski i chiński trzeba oznaczyć wprost, więc polska kwestia jedzie jako „says in Polish" plus treść w klamrach. Generator robi to za Ciebie na podstawie pola z językiem dialogu.

Klauzule ograniczające są w dokumentacji nazwane bardzo ważnymi, nie opcjonalnym wykończeniem. Zakaz napisów, logo i znaku wodnego plus wymóg stabilnej twarzy i płynnego ruchu tłumią zniekształcenia i przypadkowe elementy. Generator dokleja je na końcu, a przełącznik zakazu napisów jest domyślnie włączony.

Przy edycji obowiązuje jedna pułapka, która cicho psuje zadanie: do filmu trzeba odnieść się bezpośrednio, a nie „na podstawie" niego. Słowo o odnoszeniu się przestawia model na zadanie referencyjne, czyli dostajesz nowy film zainspirowany Twoim, zamiast edycji Twojego. Dlatego prompt składany przez generator zaczyna się od polecenia edycji.

Mniej materiałów wzorcowych niż wolno. Limit to dziewięć obrazów, trzy filmy i trzy pliki audio, ale producent zaleca cztery do pięciu sztuk łącznie: jeden lub dwa obrazy postaci, jeden obraz scenerii, jeden film z ruchem kamery, jeden plik dźwiękowy. Za dużo materiałów utrudnia modelowi ocenę, co jest ważniejsze, i kończy się konfliktem stylów.

Ten sam zamiar, dwa prompty

Słabo

A man runs nervously down the street, and the scene feels very cinematic.

Przykład negatywny wzięty dosłownie z dokumentacji producenta. Jedno zdanie na całe wideo, zero ujęć, zero kamery, a „filmowo" jest oceną, nie instrukcją.

Dobrze

Define a man in a grey hoodie with a canvas backpack in Image 1 as Subject 1. Scene: a narrow old-town alley at dusk. Shot 1: The camera holds a side shot of the alley, the man slowly starts to run, his breathing quickening. Shot 2: The camera shakes and cuts to a close-up of his frightened face. Shot 3: The camera slowly pulls back and settles on the empty street. <a dog barking in the distance> Visual style: retro film, warm tone. The entire video should be high-definition with cinematic texture, natural colors and soft lighting. The character's face remains stable without deformation; movements are natural and smooth, with no stutter or flicker. Keep it subtitle-free. Do not generate a logo or a watermark.

Dokładnie to, co składa generator: tryb „Nowe wideo z ujęć", wersja Seedance 2.0, 125 słów.

Co się zmieniło

  • Bohater jest zdefiniowany i powiązany z materiałem wzorcowym pod jedną nazwą.
  • Scena rozpada się na trzy ujęcia w kolejności zdarzeń, każde z jednym ruchem kamery.
  • Nigdzie nie ma sekund, bo sterowanie czasem ujęcia jest udokumentowane jako niestabilne.
  • Efekt dźwiękowy jedzie w nawiasach ostrych, czyli w znaku, po którym model rozpoznaje jego rodzaj.
  • Styl jest nazwany konkretnie, więc model nie zjedzie domyślnie w fotorealizm.
  • Na końcu stoją klauzule stabilności i zakaz napisów, logo oraz znaku wodnego.

Z-Image obraz

Gęsty stos krótkich, konkretnych fraz, od podmiotu na zewnątrz, z terminami fotograficznymi na końcu. Ani lista tagów, ani płynna proza - dokładnie taki kształt mają oba oficjalne przykłady twórcy modelu.

Rozwiń szczegółowe reguły (8) i przykład promptu przed i po

Najpierw rozstrzygnij Turbo czy bazowy, bo od tego zależy sposób pisania, a nie tylko szybkość. Turbo nie ma prowadzenia, więc prompt negatywny jest w nim martwy, a różnorodność między ziarnami niska. Model bazowy ma jedno i drugie, kosztem czterech do sześciu razy większej liczby kroków. Jeśli blokuje Cię brak wykluczeń albo brak wariantów, zmień wariant, nie walcz z promptem.

W Turbo każde „bez czegoś" trzeba przepisać na obecność czegoś innego. „Bez napisów" nie zadziała, „czysta, nieprzerwana powierzchnia" zadziała. „Bez bałaganu" nie zadziała, „pusty blat, jeden przedmiot na środku, szerokie puste marginesy" zadziała. Generator ma na to osobne pole i to jest jedyne miejsce w narzędziu, gdzie wykluczenia lądują w prompcie pozytywnym.

Zero słów nastroju. W oficjalnym przykładzie nie ma ani „piękny", ani „arcydzieło", ani „8k" - każda fraza niesie informację wizualną. Zasada praktyczna: jeśli nie umiesz powiedzieć, co dane słowo zmienia w obrazie, wytnij je.

Grupuj szczegóły obszarami, jedna grupa na zdanie: ubranie, twarz, włosy i nakrycie głowy, dłonie i trzymane przedmioty, potem tło. I nazywaj układ wprost. „Lampa nad wyciągniętą lewą dłonią" mówi modelowi coś, czego „trzyma lampę" nie mówi.

Fotorealizm buduje się słownikiem fotograficznym, nie przymiotnikami. Trzy warstwy: nazwij aparat albo rodzaj kliszy, złam symetrię twarzy i sylwetki (trzydniowy zarost, widoczne pory, zwyczajny wygląd, nie modelka), nazwij fakturę materiału. Brak tej trzeciej warstwy jest główną przyczyną plastikowego wyglądu skóry.

Długo w konkretach jest dobrze, długo w modyfikatorach jest źle. Twórca modelu mówi, że model działa najlepiej na długich, szczegółowych promptach - i to nie kłóci się z radą, żeby nie mieszać stylów. Więcej konkretu o jednej spójnej scenie pomaga; czterdzieści przymiotników jakości i dwie rywalizujące rodziny stylistyczne rozmywają uwagę.

Napisy w obrazie: dokładna treść w cudzysłowie, z miejscem i wagą kroju opisaną słowami. Producent deklaruje angielski i chiński. Mniej tekstu wychodzi znacznie pewniej niż akapit, a polskie ogonki są poza deklarowanym wsparciem, więc przy materiale do publikacji lepiej wygenerować obraz czysty i złożyć napis w edytorze.

Zamierzony sposób pracy z tym modelem to rozwijanie promptu przed generowaniem: piszesz krótko, co ma być, ktoś rozbudowuje to do gęstych fraz, generujesz z wersji rozbudowanej. Twórca modelu wprost tak to opisuje i dlatego krótkie prompty wydają się słabe. Generator robi właśnie ten drugi krok, tylko na podstawie pól, a nie zgadywania.

Ten sam zamiar, dwa prompty

Słabo

Realistic photo of an average middle-aged French man in a cafe.

Przykład słabego promptu z materiałów o tym modelu. „Realistic photo" to prośba o realizm, a nie opis tego, co ma go zbudować - nie ma ani aparatu, ani faktury, ani jednej cechy odróżniającej tę osobę od dowolnej innej.

Dobrze

Middle-aged French man, thinning hair, three-day stubble, deep smile lines. Worn grey wool coat, elbow on the marble surface, holding a small espresso cup. Half-empty carafe and a folded newspaper on the right of the table. Small cafe, marble table by a large window. Overcast midday light through the window, soft directional shadows from the left. Point-and-shoot film camera, mild grain, medium depth of field, face in sharp focus. Muted warm-grey palette, candid unstaged photograph. Visible skin pores and natural fabric weave, ordinary everyday appearance, not a model.

Dokładnie to, co składa generator: tryb „Wariant Turbo - bez promptu negatywnego", wersja Z-Image-Turbo, 88 słów.

Co się zmieniło

  • Podmiot ma trzy cechy rozpoznawcze zamiast słowa „przeciętny".
  • Szczegóły są pogrupowane obszarami, po jednej grupie na zdanie.
  • Układ przedmiotów jest nazwany wprost, więc kompozycja nie jest zgadywana.
  • Zamiast „realistic" stoi konkretny aparat i rodzaj ziarna.
  • Paleta barw i charakter zdjęcia zamykają prompt, tak jak w przykładach twórcy modelu.
  • Wykluczenia („nie plastikowa skóra", „nie modelka") są zapisane jako obecność faktury i zwyczajnego wyglądu, bo w Turbo prompt negatywny nie działa.

Czego ten generator nie obsługuje i dlaczego

Te modele mają więcej funkcji, niż widać w formularzu. Niżej 6 rzeczy, których tu celowo nie ma, razem z powodem - luka bez wyjaśnienia wygląda na przeoczenie i ktoś jej potem szuka.

Rozwiń wszystkie zawężenia: Avatar 2.0, Modele obrazowe Klinga, Canvas Agent, Voice Control i klonowanie głosu, Z-Image-Edit i Z-Image-Omni-Base, Seedance 2.5

Avatar 2.0 Kling AI

Gadająca postać z jednego zdjęcia i jednego pliku dźwiękowego: model dopasowuje mimikę, ruch ciała i gesty rąk do nagrania, do pięciu minut ciągłego materiału w 1080p. To jedyny wariant w całej rodzinie Klinga, który wychodzi tak daleko poza piętnaście sekund, i jedyny robiący prezentera bez sterowania sceną.

Bo tu nie ma czego generować. Prompt do Avatara to od 20 do 50 słów samego kadrowania i energii, w rodzaju „spokojny prezenter, oszczędne gesty" - całą robotę wykonuje plik dźwiękowy, który wnosisz sam. Formularz produkujący takie zdanie nie dodałby niczego, czego nie da się napisać wprost, a udawałby, że to jest trudne. Warto natomiast wiedzieć dwie rzeczy: język wynika z nagrania, nie z promptu, więc polskie audio działa, choć producent oficjalnie wymienia angielski, japoński, koreański i chiński; i jeśli potrzebujesz pełnej kontroli nad sceną, właściwym narzędziem jest zwykły tryb tekst do wideo, a nie Avatar.

Modele obrazowe Klinga Kling AI

Kling wypuszcza też rodzinę modeli do obrazów nieruchomych, z własnymi wersjami i trybem serii.

Bo skill kling-ai celowo obejmuje wyłącznie wideo, a generator nie może wyprzedzać skilla - to reguła, nie przypadek. Do obrazu w tym narzędziu są Nano Banana i Z-Image.

Canvas Agent Kling AI

Orkiestrator na wierzchu modeli Klinga: z zarysu fabuły składa scenopis, generuje spójne ujęcia z jednego elementu wzorcowego, rozpisuje kadr na wiele perspektyw i przetwarza partie promptów jednocześnie. Potrafi też pracować w drugą stronę - z filmu albo obrazu wyciągnąć prompt.

Bo jego wejściem jest zarys opowieści i materiały, nie pole formularza. To narzędzie do kompletnego materiału z wieloma ujęciami, więc leży o poziom wyżej niż pojedynczy prompt. Gdy potrzebujesz krótkiego filmu z konsekwentnymi postaciami, a nie jednego ujęcia, zaczyna się właśnie od niego.

Voice Control i klonowanie głosu Kling AI

Wyciąga barwę głosu z Twojego nagrania do wielokrotnego użytku i wiąże ją z postacią w prompcie przez uchwyt z nazwą głosu. Biblioteka trzyma do 200 głosów, a do wytrenowania jednego wystarczy czysty fragment od 5 do 30 sekund.

Bo uchwyt odwołuje się do biblioteki głosów w Twoim koncie, której to narzędzie nie zna i nie ma jak poznać. Wpisanie w prompt nazwy głosu, którego u Ciebie nie ma, dałoby prompt wyglądający poprawnie i niedziałający. Warto wiedzieć, że tworzenie i użycie głosu obsługuje na razie tylko angielski i chiński.

Z-Image-Edit i Z-Image-Omni-Base Z-Image

Pierwszy to wariant douczony do edycji obrazu poleceniem w języku naturalnym, drugi to surowy punkt wyjścia do douczania własnych modeli.

Bo w oficjalnym spisie modeli oba miały status „do wydania" w dniu weryfikacji skilla. Obiecywanie funkcji, której nie ma, jest gorsze od jej braku - jeśli planujesz na nich pracę, najpierw sprawdź w spisie, czy już wyszły.

Seedance 2.5 Seedance

Następna generacja po 2.0, ogłoszona na platformie producenta z własną stroną modelu, ale bez dostępu przez piaskownicę i bez dostępu programowego.

Bo w dniu weryfikacji skilla jedno i drugie było opisane jako „już wkrótce", a budowanie pól pod model, którego nie da się uruchomić, jest obietnicą bez pokrycia. Generator zna więc trzy warianty Seedance 2.0. Warto wiedzieć, że poprzednia generacja to Seedance 1.5 Pro i ma u producenta osobny przewodnik po promptach - reguły z tej strony w większości do niej pasują, ale szczegóły trzeba sprawdzić tam.

Pytania, które wracają najczęściej

13 pytań o samo narzędzie i o cztery modele, do których pisze prompty. Odpowiedzi są w źródle strony także przy zwiniętym panelu.

Dlaczego prompt wychodzi po angielsku, skoro piszę po polsku?

Bo wszystkie cztery modele były trenowane głównie na angielskim i chińskim, a na polskim prompcie dają wyraźnie gorszy i mniej przewidywalny wynik. Dokumentacja każdego z nich mówi to wprost, a przy Nano Bananie idzie dalej: Google publikuje listę piętnastu języków o najlepszej jakości i polskiego na niej nie ma.

Narzędzie tłumaczy Twój opis w locie, żebyś nie musiał pisać po angielsku samodzielnie. Dwa rodzaje treści celowo zostają w Twoim języku: kwestie dialogowe, bo mają dokładnie tak zabrzmieć i to one sterują ruchem ust, oraz napisy, które mają pojawić się w obrazie, bo one są treścią, a nie instrukcją.

Czy muszę mieć konto, żeby użyć generatora?

Nie. Generator działa w przeglądarce, bez rejestracji i bez logowania. Nie wysyła Twoich pól na nasz serwer, bo tu nie ma serwera aplikacji - strona jest statyczna. Jedyne żądanie na zewnątrz to tłumaczenie wpisanego tekstu, a gdy ono nie odpowiada, prompt i tak się składa.

Konto będzie natomiast potrzebne tam, gdzie prompt wkleisz. Kling wymaga konta, Nano Banana działa przez piaskownicę Google albo płatne API, Seedance wymaga wykupienia pakietu zasobów przed pierwszym generowaniem. Wyjątkiem jest Z-Image: wagi są otwarte, więc możesz uruchomić go na własnym komputerze bez żadnego konta.

Skąd wiadomo, że wersje modeli na tej stronie są aktualne?

Bo strona nie jest źródłem prawdy o modelach. Źródłem są cztery skille do Claude, które audytujemy wobec oficjalnej dokumentacji producentów, a strona nosi odcisk każdego z tych plików wraz z datą weryfikacji. Zmiana skilla psuje test i nie da się go odhaczyć bez przejrzenia generatora.

Ten mechanizm powstał z konkretnej wpadki: poprzedni generator pokazywał „Kling 2.5", gdy zaudytowany skill znał już Kling 3.0, i stało tak przez trzy miesiące, mimo że lista wydawnicza kazała aktualizować strony. Ręcznie odhaczana checklista przegrała z rzeczywistością, więc zastąpił ją test.

Data weryfikacji jest wypisana przy każdym modelu, nad wyborem wersji. Modele generatywne zmieniają się co kilka tygodni, więc jeśli widzisz rozjazd między stroną a tym, co masz w narzędziu producenta, to informacja dla nas, a nie Twój błąd.

Czym różni się skill dla Claude od tego generatora?

Robią to samo dwiema drogami. Generator jest formularzem: wybierasz model, tryb i wersję, wypełniasz pola, kopiujesz gotowy prompt. Nic nie instalujesz i nie potrzebujesz żadnego konta.

Skill to ta sama wiedza wpuszczona do Claude. Zamiast wypełniać pola, opisujesz, co chcesz osiągnąć, a Claude przeprowadza Cię przez briefing, dobiera wersję modelu, dopisuje to, o czym nie pomyślałeś, i od razu podaje prompt. Wygrywa, gdy nie wiesz jeszcze, czego chcesz, albo gdy prompt jest jednym krokiem w większej pracy.

Cztery skille odpowiadają czterem modelom w generatorze i są do zainstalowania za darmo. Formularz wygrywa, gdy dokładnie wiesz, co chcesz dostać, i chcesz to dostać w trzy kliknięcia.

Co zrobić, gdy tłumaczenie nie działa?

Nic się nie psuje. Gdy usługa tłumaczenia nie odpowie w trzy sekundy, w prompcie zostaje Twój polski tekst, a nad wynikiem pojawia się o tym komunikat. Prompt nadal się składa i nadal ma poprawną strukturę.

Ten komunikat jest widoczny celowo. Cicha podmiana na polski byłaby gorsza od błędu: wysłałbyś polski prompt do modelu trenowanego na angielskim, dostał słaby obraz i nie miał pojęcia, dlaczego. Skoro wiesz, że tłumaczenie padło, możesz przetłumaczyć wpisane zdania samodzielnie przed wklejeniem.

Osobna sprawa: przerwanie żądania, bo piszesz dalej, nie jest awarią i nie zapala komunikatu. Gotowe przykłady mają wpisany angielski w danych, więc kliknięcie przykładu nie wykonuje ani jednego żądania.

Dlaczego każdy model ma inny formularz?

Bo cztery modele nie mają wspólnej struktury promptu i uśrednienie ich do jednego formularza produkowałoby prompty niezgodne z tym, na czym te modele były trenowane.

Nano Banana chce pełnych zdań wokół sześciu czynników. Seedance chce scenopisu ujęć z własnymi znakami dla dialogu, efektów i muzyki, i wywala się na podawaniu sekund. Z-Image chce gęstych fraz, a w wariancie Turbo w ogóle nie przyjmuje wykluczeń. Kling chce kolejności scena, postać, akcja, kamera, dźwięk i styl, z limitem słów zależnym od wybranej wersji.

To są cztery różne języki, nie cztery dialekty jednego. Dlatego każdy model ma tu własny zestaw pól i własną regułę składania.

Ile kosztuje wygenerowanie obrazu albo filmu?

Zależy od modelu i konfiguracji, a różnice są duże. Modele wideo liczą za sekundę wyniku, modele obrazowe za obraz. Rachunek zmieniają: rozdzielczość, długość, proporcje i to, czy generujesz dźwięk.

Rzędy wielkości przy stawkach sprawdzonych 2026-08-04: film w 1080p z dźwiękiem u Klinga to około 0,14 USD za sekundę, obraz w 1K to od 0,0336 USD na najtańszym wariancie Nano Banany do 0,134 USD na Pro, a 4K jest wszędzie skokiem, nie krokiem. Z-Image nie kosztuje nic za obraz, bo chodzi lokalnie na otwartych wagach. Przy Seedance nie ma jednej liczby, bo producent nie publikuje stawki w dostępnej dokumentacji.

Ceny u dostawców zmieniają się bez uprzedzenia, więc przed policzeniem budżetu sprawdź je u źródła. Reguła praktyczna wspólna dla wszystkich czterech: iteruj w niskiej rozdzielczości, a najwyższą włącz raz, na wersję finalną.

Czy mogę użyć wyniku komercyjnie?

Zależy od modelu i to jedna z niewielu rzeczy, w których warto sprawdzić regulamin, a nie zaufać podsumowaniu. Kling ma tu twarde ograniczenie: materiał z planu darmowego nie może być użyty komercyjnie, potrzebny jest plan płatny. Z-Image jest na drugim końcu: wagi są na licencji Apache 2.0, czyli do użytku komercyjnego.

Przy modelach Google warto wiedzieć, że każdy wygenerowany obraz nosi niewidoczny znak wodny identyfikujący go jako wygenerowany przez AI, a na jednym z wariantów dokumentacja wymienia dodatkowo standard poświadczeń treści.

Niezależnie od modelu: prawo do wyniku to jedno, a prawo do tego, co wnosisz na wejściu, to drugie. Cudze zdjęcie, cudza postać i cudze logo nie stają się Twoje przez to, że przeszły przez model.

Wpisałem prompt negatywny i nic się nie zmieniło. Dlaczego?

Jeśli to był Z-Image w wariancie Turbo, to zachowuje się poprawnie. Turbo nie ma prowadzenia, więc kanał promptu negatywnego jest martwy - cokolwiek tam wpiszesz, zostanie zignorowane. To właściwość modelu, nie Twój błąd.

Wyjścia są dwa. Pierwsze: przepisz wykluczenie na obecność czegoś innego, bo „bez napisów" nie działa, a „czysta, nieprzerwana powierzchnia" działa. Generator ma na to osobne pole w trybie Turbo. Drugie: przełącz się na wariant bazowy, w którym prompt negatywny działa i jest przez twórcę modelu wprost zalecany, kosztem cztero- do sześciokrotnie większej liczby kroków.

U pozostałych modeli sprawa wygląda inaczej. Kling ma stałą listę artefaktów, którą generator dokleja obok promptu głównego. Nano Banana i Seedance nie mają tego pojęcia w ogóle - u nich wykluczenia zapisuje się w treści promptu.

Generowanie zawiesiło się na 99 procentach. Co teraz?

To znany objaw i ma zwykle jedną przyczynę: ruch bez wskazanego końca. Model nie wie, gdzie akcja ma się domknąć, i nie potrafi zamknąć ujęcia.

Rozwiązanie to jedno zdanie o powrocie do pozycji wyjściowej albo o zatrzymaniu ruchu. W generatorze odpowiada za to przełącznik domykający ruch, włączony domyślnie właśnie z tego powodu. Ubocznie daje to materiał, który dobrze się zapętla.

W wygenerowanym filmie pojawiły się napisy, których nie chciałem.

Przy Seedance tego nie da się wyeliminować z pewnością, tylko uczynić mniej prawdopodobnym - i tak mówi dokumentacja producenta, więc nikt nie powinien obiecywać inaczej.

Trzy rzeczy realnie pomagają. Klauzule zakazujące napisów, logo i znaku wodnego, które generator dokleja domyślnie. Usunięcie tekstu z materiałów wzorcowych, zanim je podasz, bo model chętnie go powtarza. I generowanie w kadrze poziomym, w którym prawdopodobieństwo napisów jest wyraźnie niższe niż w pionowym - materiał na pionowe wideo można wygenerować w 16:9 i przyciąć.

Twarz postaci zmienia się w połowie filmu.

Przy Seedance przyczyną jest zwykle mieszany obraz wzorcowy: twarz, poza, strój i tło w jednym kadrze, przy zbyt małym udziale samej twarzy. Rozwiązanie: dołóż osobne zdjęcie głowy, bez wyrazu i bez tła, przypisz mu wprost rolę wzorca twarzy, a zdjęciu całej sylwetki rolę wzorca stroju, i postaw wzorzec twarzy na pierwszym miejscu. Czego nie robić: arkuszy z postacią w wielu widokach, bo różne kąty są łatwo czytane jako kilka różnych osób i pogarszają sprawę.

Przy Klingu właściwym narzędziem jest wariant Omni z referencją elementu, która pozwala zapisać postać raz i wracać do niej w kolejnych generowaniach. Przy powtarzającym się dryfie tożsamości lepiej napisać prompt od nowa niż powtarzać próbę z tymi samymi ustawieniami.

Przy Nano Bananie wystarczy jawne zdanie blokujące wygląd postaci wobec obrazu wzorcowego, a przy edycji lista tego, co ma zostać nietknięte, z twarzą na pierwszym miejscu.

Czy to, co wpisuję, gdzieś się zapisuje?

Nie na naszej stronie. Strona jest statyczna, nie ma bazy danych ani konta, a pola formularza żyją wyłącznie w Twojej przeglądarce.

Jedno żądanie wychodzi na zewnątrz: tłumaczenie wpisanego tekstu przez usługę zewnętrzną. Wysyłane jest to, co wpisałeś w pola podlegające tłumaczeniu, i nic poza tym. Jeśli treść promptu jest wrażliwa, wpisz ją po angielsku - wtedy tłumaczenie nie ma czego wysyłać.

Osobno warto pamiętać, że narzędzie producenta, w którym prompt wkleisz, ma własne zasady przetwarzania i one nie mają z tą stroną nic wspólnego.

Słownik pojęć

15 terminów, które wracają w opisach tych modeli - z konsekwencją, a nie samą definicją. Materiał do wracania punktowo, dlatego stoi zwinięty.

Rozwiń słownik - 15 pojęć
Prompt negatywny
Osobne pole z listą tego, czego w wyniku być nie ma. Nie każdy model je ma i to jest źródłem nieporozumień: Kling używa stałej listy artefaktów, Z-Image bazowy przyjmuje Twoją listę i wprost ją zaleca, Z-Image Turbo ma ten kanał martwy, a Nano Banana i Seedance nie mają tego pojęcia w ogóle.
Prowadzenie (guidance, CFG)
Liczba mówiąca, jak mocno model ma trzymać się promptu, zamiast generować swobodnie. Przy Z-Image bazowym mieści się między 3,0 i 5,0. Turbo działa z prowadzeniem ustawionym na zero i właśnie dlatego prompt negatywny w nim nie działa - to ten sam mechanizm.
Kroki (steps)
Ile razy model poprawia obraz, zanim uzna go za gotowy. Więcej kroków to zwykle więcej szczegółu i dłuższe generowanie. Z-Image Turbo robi osiem, wariant bazowy od 28 do 50. Uruchomienie jednego z ustawieniami drugiego daje śmieci.
Ziarno (seed)
Liczba ustawiająca punkt startowy losowości. Ta sama liczba i ten sam prompt dają ten sam obraz, więc ziarno jest sposobem na powtarzalność. Przy Z-Image Turbo zmiana ziarna prawie nic nie zmienia, bo różnorodność tego wariantu jest niska - trzy różne wyniki wymagają trzech różnych promptów.
Ujęcie i tryb wielu ujęć
Ujęcie to jeden ciągły kadr z jednym ruchem kamery. Tryb wielu ujęć pozwala wyreżyserować kilka takich kadrów w jednym generowaniu, z zachowaną ciągłością stylu. W Klingu doszedł dopiero w rodzinie 3.0, a Seedance oczekuje ujęć jako naturalnej formy promptu.
Natywny dźwięk
Dźwięk powstający razem z obrazem w tym samym przebiegu, a nie doklejany w montażu. Konsekwencja jest praktyczna: dialog w prompcie steruje ruchem ust, więc trzeba wskazać, kto mówi, inaczej dźwięk rozjeżdża się z obrazem.
Synchronizacja ust (lip sync)
Zgodność ruchu ust z wypowiadaną kwestią. W rodzinie Klinga najlepiej wychodzi na wariancie Turbo i to jest główny powód, żeby go wybrać do ujęcia z mówiącą postacią. Przy Avatarze 2.0 synchronizacja idzie wprost za plikiem dźwiękowym, który wnosisz.
Referencja elementu
Mechanizm Klinga do trzymania tożsamości postaci, przedmiotu albo scenerii między generowaniami: zapisujesz element z obrazów wzorcowych, nadajesz mu nazwę i odwołujesz się do niej w prompcie. Biblioteka elementów zostaje, więc da się ją użyć wielokrotnie.
Ugruntowanie w wyszukiwarce (grounding)
Sięgnięcie modelu do wyników wyszukiwania po prawdziwe, aktualne dane przed wygenerowaniem obrazu - przydatne przy wykresach, prognozach i schematach realnych miejsc. Mają je Nano Banana 2 i Pro, nie ma Lite. Zdjęć prawdziwych osób z wyszukiwarki mechanizm nie użyje, a zapytania liczą się osobno od obrazów.
Niewidoczny znak wodny (SynthID)
Znacznik wbudowany w obraz przez modele Google, pozwalający rozpoznać go jako wygenerowany przez AI. Jest w każdym obrazie z tej rodziny i nie da się go wyłączyć.
Otwarte wagi
Opublikowany plik modelu, który da się pobrać i uruchomić u siebie, zamiast wywoływać cudze API. Tak działa Z-Image: licencja Apache 2.0 pozwala na użycie komercyjne, a wariant Turbo mieści się w 16 GB pamięci karty. Kosztem jest sprzęt, zyskiem brak opłaty za obraz i brak wysyłania promptu na zewnątrz.
Jednostka i kredyt
Dwa różne sposoby rozliczenia u tego samego dostawcy, łatwe do pomylenia. Kling liczy jednostki po 0,14 USD za sekundę wyniku w dostępie programowym, a kredyty w abonamencie aplikacji. Stawka zależy od wersji modelu, rozdzielczości i tego, czy dźwięk jest włączony.
Tryb wsadowy (batch)
Zlecenie wielu generowań bez gwarancji szybkiej odpowiedzi, w zamian za niższą cenę. U modeli obrazowych Google obniża stawkę o połowę, kosztem czasu oczekiwania nawet do doby - sensowne wszędzie tam, gdzie wynik nie jest potrzebny natychmiast.
Dryf tożsamości
Sytuacja, w której postać zmienia twarz w trakcie filmu albo między ujęciami. Najczęstsza przyczyna to jeden mieszany obraz wzorcowy, na którym twarz zajmuje za mało miejsca. Lekarstwem jest osobne zdjęcie głowy z jawnie przypisaną rolą, postawione przed zdjęciem sylwetki.
Dziesięciobitowy H.265
Format, w którym wychodzi 4K z Seedance 2.0. Daje łagodne przejścia tonalne, ale część odtwarzaczy i przeglądarek nie otworzy go bez konwersji, więc do przeglądania materiału trzeba zaplanować przekodowanie.

Stan wiedzy o modelach sprawdzony 2026-08-14 wobec czterech skilli w tym repozytorium, a ceny 2026-08-04 wobec cenników producentów. Jedno i drugie zmienia się co kilka tygodni.

Co dalej

Jeśli pracujesz z Claude'em

Te same cztery modele mają skille, które robią to samo bez przeklejania - Claude prowadzi przez briefing, dobiera wersję modelu i od razu pisze prompt. Zobacz cztery skille i sposób instalacji.

Jeśli szukasz innych narzędzi

Na stronie jest ich więcej i wszystkie są darmowe: klasyfikator systemu pod AI Act, generator polityki AI dla firmy oraz ocena ryzyka wdrożenia AI. Pełna lista: narzędzia.

Jeśli zastanawiasz się nad AI w firmie

Generowanie obrazów i wideo to jedno, wdrożenie AI w organizacji to zupełnie co innego. O tym drugim pisałem w tekstach o skuteczności reklam robionych generatywnie, o marce w reklamie tworzonej przez AI i o samym wdrożeniu.

Jeśli potrzebujesz tego w zespole

Prowadzę szkolenia z AI dla firm - także praktyczne, przy komputerach. Jeśli nie wiesz, które pasuje, pięć pytań dobierze je za Ciebie, a tutaj można napisać wprost.