Google Lumiere: Fremtiden for realistisk videogenerering med AI

  • Den bruker Space-Time-U-Net-arkitekturen til Ã¥ generere komplette videoer i ett trinn, og unngÃ¥r visuelle forvrengninger.
  • Den lar deg lage videoer fra tekst, animere statiske bilder og gjøre presise redigeringer av objekter i eksisterende klipp.
  • Den overvinner begrensningene ved generering bilde for bilde, og oppnÃ¥r overlegen tidsmessig koherens og flyt i bevegelsen.
  • Den er for tiden i den eksperimentelle og forskningsfasen, uten allmenn tilgang av sikkerhetsmessige og etiske Ã¥rsaker.

Video kunstig intelligens

Har du noen gang stoppet opp og tenkt på hvor utrolig det ville være å skrive en enkel tekstlinje og, på et blunk, ha en Fotorealistisk og sammenhengende videoDet er ikke science fiction, det er løftet fra Google Lumiere, en kunstig intelligensmodell som bryter med standarden for visuell skapelse gjennom en banebrytende teknologi kalt spatiotemporal diffusjonFor alle som er involvert i teknologisektoren eller rett og slett fascinert av innovasjon, er det viktig å forstå dette spranget for å ikke bli hengende etter i dagens digitale landskap.

I motsetning til hva mange tror, ​​snakker vi ikke om et program som bare legger til bevegelse i statiske bilder. Vi har å gjøre med en arkitektur designet fra bunnen av å forstå fysikken bak objektforskyvning i både tid og rom. Dette prosjektet, unnfanget i Googles laboratorier, ble født med det klare målet å eliminere brå hopp Og de merkelige bevegelsene som fikk AI-genererte videoer til å virke litt surrealistiske frem til nå.

Hva er egentlig Lumières magi?

Det største problemet med generativ AI-video var mangelen på konsistens. Man ville oppdage at et objekt ville endre form eller bli forvrengt fra ett sekund til det neste. Lumiere løser dette fordi behandler all informasjon samtidighindrer AI-en i å «glemme» hvordan den første rammen så ut når den når den tiende. Dette sikrer at visuell stabilitet vær total: hvis en katt løper gjennom hagen, vil den forbli den samme katten gjennom hele klippet, uten å forvandle seg til noe annet halvveis.

Den tekniske nøkkelen ligger i systemet Rom-tid-U-nett (STUNet)Mens de fleste tradisjonelle verktøy lager video bilde for bilde (klassisk animasjonsstil), genererer Lumiere hele sekvensen i ett enkelt trinnDenne tilnærmingen muliggjør flytende og naturlig bevegelse, ettersom modellen analyserer piksler og tid samtidig, og forstår grunnleggende fysikkbegreper som vannstrøm eller vekten av fallende gjenstander.

Kreative evner og redigeringsverktøy

Mulighetene for kreative avdelinger er, ærlig talt, vanvittige. En av stjernefunksjonene deres er tekst til videohvor det å bare beskrive en detaljert scene er nok for at AI-en skal bringe den til live. Men det stopper ikke der; det kan også å bringe fotografier til liveå transformere et statisk bilde til en video der skyene beveger seg eller elven renner naturlig.

Videre utmerker Lumiere seg innen automatisert etterproduksjon. Den muliggjør oppgaver som maling og selektiv redigering ved hjelp av tekstkommandoer. Du kan for eksempel be den om å bare endre fargen på en persons klær i en tidligere innspilt video, eller legge til tilbehør som briller eller kroner, samtidig som resten av scenen beholdes. helt intakt og konsistentDen lar deg til og med lage cinemagraphs, og animere bare et bestemt område av et bilde mens resten forblir stille.

Teknisk analyse og ytelse

Når det gjelder tallene, er systemet i stand til å generere klipp på omtrent fem sekunderproduserer 80 bilder med en hastighet på 16 fps og en oppløsning på 1.024 x 1.024 piksler. Selv om Google vurderer disse resultatene som "lav oppløsning", er realismen i hudteksturer, metallurgi og dynamisk lysstyring Det er overraskende. For å oppnå dette ble modellen trent med en massiv utplassering av 30 millioner videoer ledsaget av tekstlige beskrivelser.

Sammenligning med konkurrentene og tilgjengeligheten

Hvis vi sammenligner det med andre giganter, ser vi interessante nyanser. Mens Sora av OpenAI Selv om Lumiere skiller seg ut for å lage lengre klipp, fokuserer den på effektiviteten til sin ett-trinnsarkitektur og redigeringspresisjon. Sammenlignet med Rullebane eller PikaGoogles forslag velger en mer fotografisk og teknisk realisme, ideelt for det profesjonelle og markedsføringsmiljøet, og beveger seg noe bort fra de mer fantastiske stilene.

Nå, her er den lille skriften: Det er ikke åpent for publikum. Generelt. Det er for tiden et forskningsprosjekt innen kontrollert testing. Google er svært forsiktige med utgivelsen for å forbedre sikkerhetsfiltre og forhindre opprettelse av deepfakes eller desinformasjonDet ryktes at noen funksjoner kan bli integrert i YouTube eller Google Workspace i nær fremtid.

Virkningen på industri og etikk

Utrullingen av denne teknologien vil føre til en radikal endring innen film, slik at regissører kan gjøre forhåndsvisning av scene veldig billig før filming. Innen markedsføring vil merkevarer automatisk kunne generere hyperpersonaliserte annonser. Denne makten kommer imidlertid med et enormt ansvar, noe som tvinger bransjen til å skape vannmerker og verifiseringssystemer å skille det som er ekte fra det som er kunstig generert.

Denne modellen, som hyller filmpionerene, Lumière-brødrene, markerer et vendepunkt der Kreativitet har ikke lenger tekniske grenser.Evnen til å forstå tredimensjonalitet og tid i et enkelt nevralt nettverk bringer oss nærmere en fremtid der barrieren mellom fantasi og visuell utførelse praktisk talt har forsvunnet, noe som forvandler måten vi forteller historier på i den digitale tidsalderen.


Legg til som foretrukket kilde