4.4 Il fotogramma d’inizio e quello di fine

di Luca Desiderato

in alto i due estremi approvati. Sotto, tre fotogrammi di fine alla prova delle tre condizioni
Figura 4.4 · in alto i due estremi approvati. Sotto, tre fotogrammi di fine alla prova delle tre condizioni

C’è una tecnica che nel nostro lavoro cambia il rapporto di forze più di ogni altra, e sta in una frase: invece di chiedere un movimento, si consegnano i due estremi del video e si chiede di collegarli. Il fotogramma d’inizio[1] lo hai generato e approvato; quello di fine anche. Al sistema resta un solo problema, come si passa dall’uno all’altro, e su quel problema è bravo.

Il vantaggio è duplice. Il primo: gli estremi non derivano, perché non sono generati, sono dati. Chi guarda una clip giudica soprattutto il primo e l’ultimo secondo, ed è esattamente dove hai il controllo totale[2]. Il secondo: la parte in cui il sistema è libero, il mezzo, è anche quella in cui l’occhio perdona di più, perché il movimento nasconde. Si ottiene così la distribuzione opposta a quella naturale: controllo dove si guarda, libertà dove non si guarda.

Inoltre quando ci sono due fotogrammi solidi, il testo che li accompagna deve essere molto breve: una ventina di parole, poco più. Le immagini portano quasi tutto il carico; un prompt[3] lungo, in quella condizione, non aggiunge precisione ma introduce istruzioni che possono contraddire ciò che si vede. Sempre nella nostra esperienza, con due estremi buoni il risultato utilizzabile arriva di regola entro il quarto tentativo: non è una statistica, ed è il tipo di affermazione da misurare sul proprio archivio prima di crederci.

Le tre condizioni perché la tecnica funzioni:

  • I due estremi devono essere coerenti fra loro. Stessa persona, stessa luce, stesso ambiente: se non lo sono, il sistema costruirà una transizione fra due mondi, e si vedrà.
  • La distanza fra i due deve essere percorribile. Un movimento plausibile in pochi secondi; non un cambio di scena[4].
  • La geometria deve cambiare poco. Se fra inizio e fine la camera si sposta molto, il mezzo diventa un’invenzione, e le invenzioni nel mezzo sono le più difficili da nascondere.

Quando una di queste tre condizioni non c’è, la risposta non è insistere: è spezzare il movimento in due clip con un fotogramma intermedio approvato.


Come è nata la figura

Nano Banana Pro, 2K, 16:9[5]. Serie di 5 riquadri: il primo generato da testo, gli altri usando il primo come immagine di riferimento, così la scena resta la stessa e cambia una cosa per volta. Il ritratto del personaggio Ginevra è stato usato come immagine di riferimento solo per il riquadro 1.

Prompt del riquadro 1 (l’estremo d’inizio), in inglese come è stato inviato al modello:

Il prompt

A woman of twenty-five with long straight dark-blonde hair worn over one shoulder, plain white t-shirt and blue jeans stands at a kitchen counter with a window on the left, seen from the front at her chest height. Morning daylight, pale tiles, a glass of water on the counter. Editorial documentary finish, natural contrast. She stands square to the counter, both hands flat on it, looking down at the glass.

Prompt del riquadro 2 (l’estremo di fine), in inglese come è stato inviato al modello:

Keep the supplied photograph identical in room, light, framing, camera height and wardrobe. She has now turned towards the window and holds the glass at chest height, looking out.

Prompt del riquadro 3 (percorso breve, geometria che cambia poco), in inglese come è stato inviato al modello:

Keep the room, light, framing and wardrobe. She is now half turned towards the window, shoulders at an angle to the counter, the glass just lifted clear of the surface and still held low.

Prompt del riquadro 4 (percorso lungo, la distanza non è percorribile), in inglese come è stato inviato al modello:

Keep the room, light and framing. She is now at the far side of the kitchen, leaning back against the opposite wall with her arms folded, and there is no glass anywhere in the frame.

Prompt del riquadro 5 (estremi incoerenti fra loro), in inglese come è stato inviato al modello:

Keep the framing and the camera height. The light now comes from the right instead of the left, and the tiles behind the counter are dark green instead of pale.
Glossario
1. ↑ fotogramma d’inizio ( fotogramma d’inizio )

L'immagine da cui parte un video generato. Viene fissato prima della generazione e il sistema costruisce il movimento successivo. Serve a mantenere controllata la scena all'avvio della clip.

2. ↑ totale.

Inquadratura (spesso utilizzata per gli interni, equivalente del "campo lungo" per gli esterni) che mostra l'interezza di un ambiente (es. una stanza) e la totalità dei personaggi presenti al suo interno. La sua funzione primaria è descrittiva e orientativa : stabilisce la geografia della scena, la posizione reciproca dei personaggi e le loro relazioni spaziali prima di passare a inquadrature più strette.

3. ↑ prompt.

Il comando, o la richiesta (scritta in linguaggio naturale), che un utente fornisce a un modello di intelligenza artificiale generativa per istruirlo sul contenuto che deve creare (es. "genera un'inquadratura grandangolare di una foresta al tramonto con stile anamorfico").

4. ↑ scena.

Unità narrativa fondamentale del film che si svolge in un unico luogo e in un tempo continuo; ogni cambiamento di location o di tempo richiede la creazione di una nuova scena (e relativa intestazione).

5. ↑ 16:9 ( 16:9 )

L'aspect ratio widescreen diventato lo standard universale per l'alta definizione (HDTV), i monitor dei computer e la maggior parte dei contenuti video online (es. YouTube, Vimeo). È considerato il formato più versatile per una visione immersiva e moderna.



Torna in alto