Door AI gegenereerde video heeft zich de afgelopen tien maanden in een oogverblindend tempo ontwikkeld, en het opmerkelijke nieuwe spatiotemporele diffusiemodel van Google, Lumiere, heeft de doelpalen opnieuw veranderd. Lumiere kan zeer realistische of hoogwaardige surrealistische videoclips van maximaal 5 seconden maken. Het kan ook statische afbeeldingen of delen van afbeeldingen animeren op basis van tekstprompts in natuurlijke taal om u te laten weten wat u wilt zien.
Het kan een foto maken, de stijl van die foto klonen en die stijl vervolgens gebruiken om een hele reeks video's te maken over andere onderwerpen die er zo op lijken en aanvoelen dat ze door een brandingbureau geproduceerd hadden kunnen zijn.
Het kan uw eigen bronvideo gebruiken om alles in Lego, origami of bloemen te veranderen - u hoeft het maar te vertellen.
Zoals je kunt zien in de demo hierboven, beschikt Lumiere over de meest geavanceerde in-video-functie die we tot nu toe hebben gezien. Het enige wat u hoeft te doen is de delen van de afbeelding in te schilderen die u niet bevallen, en Lumiere vult dat gebied automatisch in met een prachtig effect dat u misschien niet eens opmerkt als u niet goed kijkt. Ex-vriend verschijnt in je favoriete video? Het zal niet lang meer duren.
Het relevante onderzoeksteam stelde dat Lumiere's "spatio-temporele U-vormige netwerkarchitectuur" de hele lengte van de video in één keer kan construeren - terwijl eerdere modellen meestal eerst het startframe en het eindframe genereren en dan raden wat er in het midden zal gebeuren.
Hoe je het ook doet, de resultaten spreken voor zich: dit is de nieuwe stand van zaken op het gebied van generatieve AI-video.
Voorlopig is dit slechts een onderzoeksproject - zodat Google het systeem niet zwaar hoeft te ontmaskeren op het gebied van auteursrecht, desinformatie, veiligheid, haatzaaiende uitlatingen, naaktheid, privacy en diverse andere beleidsvormen - een proces dat onvermijdelijk zal leiden tot een afname van de kwaliteit van de output van deze generatieve modellen.