E107_Google ahora Crea INFLUENCERS HiperRealistas y Consistentes por IA GRATIS 🤯
Ep. 107

E107_Google ahora Crea INFLUENCERS HiperRealistas y Consistentes por IA GRATIS 🤯

Episode description

Episodio de BIMPRAXIS: El fin de los influencers tradicionales y la revolución de la IA en la publicidad

La inteligencia artificial está revolucionando la industria publicitaria con la capacidad de crear avatares consistentes y personalizados de forma gratuita. Con la plataforma de Google Flow, cualquier persona puede crear su propio avatar digital con una consistencia paramétrica y variabilidad contextual impresionantes. Esto ha abierto las puertas a una nueva era en la publicidad, donde la creación de contenido de alta calidad ya no requiere de grandes presupuestos o equipos de producción. La IA ha democratizado la producción de contenido publicitario, permitiendo a creadores y marcas llegar a su audiencia de manera más efectiva y personalizada.

Download transcript (.srt)
0:09

Buenas, esto es BIMPRAXIS, el podcast donde el

0:15

BIM se encuentra con la inteligencia artificial.

0:20

Exploramos la ciencia, la tecnología y el futuro

0:23

desde el enfoque de la arquitectura, ingeniería y

0:26

construcción.

0:28

¡Empezamos!

0:36

Muy buenas, bienvenidas, bienvenidos a un nuevo episodio

0:40

de BIMPRAXIS.

0:40

Hoy os traemos el fin de los influencers

0:43

tradicionales y cómo Google permite crear avatares consistentes

0:47

con IA de forma gratuita.

0:49

Y bueno, para arrancar este análisis a fondo,

0:51

imaginemos por un momento la siguiente escena.

0:53

¿Un paseo virtual por el catálogo de Ikea?

0:57

En uno de esos salones de ensueño que

0:59

tienen, de repente aparece una modelo impecable dictando

1:04

las próximas tendencias de decoración.

1:06

Claro, la típica figura que factura miles de

1:08

euros al mes en colaboraciones.

1:10

Exacto.

1:10

Tiene la agenda de campañas abarrotada, millones de

1:14

interacciones en redes, pero, y aquí viene lo

1:16

fuerte, hay un pequeño detalle técnico.

1:19

Nunca ha respirado.

1:20

Es increíble.

1:21

Es un conjunto de píxeles hiperrealistas.

1:24

Eso es, un avatar.

1:26

Como es el caso de Inma .gram, que

1:29

está siendo contratada por corporaciones multinacionales para, digamos,

1:33

vivir en sus tiendas.

1:34

Así que hoy vamos a sumergirnos en una

1:37

serie de informes recientes de la industria publicitaria.

1:39

Y sobre todo...

1:40

Y sobre todo, en la documentación técnica de

1:42

una nueva plataforma de Google.

1:44

Google Flow.

1:45

Eso es, Google Flow.

1:46

Unos documentos que explican cómo, básicamente, los laboratorios

1:50

de Silicon Valley acaban de reducir a cero

1:53

absoluto la barrera técnica y económica.

1:55

O sea, para que cualquier persona pueda crear

1:58

a la próxima superestrella digital desde el sofá

2:01

de su casa.

2:01

Y fíjate, el planteamiento de estos informes es

2:04

fascinante porque expone la solución definitiva al gran

2:07

cuello de botella histórico que ha tenido la

2:09

inteligencia artificial generada.

2:10

Que era la consistencia, ¿verdad?

2:13

Exactamente, la falta de consistencia.

2:15

A ver, hasta ahora, conseguir que un rostro

2:18

generado por algoritmos mantuviera sus facciones intactas a

2:23

lo largo de, no sé, 100 imágenes distintas,

2:25

requería un esfuerzo computacional inmenso.

2:28

Horas y horas de ensayo y error.

2:30

Sí, sí, horas perdidas.

2:32

Por eso, la misión de nuestra inmersión de

2:34

hoy es desgranar las cuatro tecnologías clave que

2:38

Flow y los modelos de la familia Gemini...

2:40

Ponen sobre la mesa.

2:42

Hablamos de la consistencia paramétrica, la variabilidad contextual,

2:46

la cinemática y la transferencia espacial.

2:49

Suena muy técnico, pero es vital.

2:51

Es que comprender la mecánica de estos cuatro

2:53

pilares equivale a entender cómo todo el ecosistema

2:56

publicitario se está reescribiendo ahora mismo desde sus

2:59

cimientos.

3:00

Vale, pues vamos a desgranar esto.

3:02

Empecemos precisamente por el primer bloque.

3:05

La consistencia perfecta.

3:07

Porque, claro, antes crear un personaje con inteligencia

3:10

artificial...

3:10

Era como, no sé, intentar rodar una película

3:13

independiente donde para cada escena contratas a un

3:16

actor distinto.

3:17

Un actor que simplemente se da un aire

3:19

al anterior, sí.

3:21

Exacto.

3:21

En un plano, pues la estructura maxilar era

3:24

más ancha.

3:24

En otro, la distancia entre los ojos variaba

3:27

milímetros.

3:27

Y claro, se rompía la ilusión por completo.

3:30

Totalmente.

3:31

Pero, según la documentación de Flow, la plataforma

3:35

incluye ahora un botón, una función nativa llamada

3:38

Personajes, que está impulsada por Gemini mediante lo

3:42

que denominan una gema.

3:44

Una instrucción personalizada, ¿no?

3:46

Eso es.

3:47

En lugar de depender de la aleatoriedad, de

3:50

poner un texto descriptivo kilométrico y rezar para

3:53

que salga bien, el sistema te obliga a

3:55

establecer nueve pilares fundamentales antes de procesar un

3:59

solo gráfico.

4:00

Y ese paso de lo simplemente descriptivo a

4:03

lo paramétrico es el verdadero salto, ¿verdad?

4:06

Es el avance radical.

4:07

La gema funciona...

4:09

Funciona como un ancla en el espacio latente

4:11

del modelo.

4:11

O sea, no se limita a pedir un

4:14

chico con gafas.

4:15

Exige definir cosas como el tipo de encuadre,

4:18

la óptica exacta y el realismo técnico.

4:21

El operador puede especificar distancias focales o el

4:24

comportamiento de lentes fotográficas concretas.

4:27

¡Ostras!

4:28

Y luego pasa a la topología facial.

4:31

Requiere las medidas de la estructura de la

4:33

mandíbula, los pómulos y hasta identificadores inmutables, ¿eh?

4:37

Cicatrices, piercings, asimetrías...

4:39

...o el color exacto del iris.

4:41

Espera, sobre eso de las lentes me surge

4:43

una duda técnica.

4:44

Si en ese segundo pilar se especifica, por

4:47

ejemplo, un objetivo de 50 milímetros, ¿el modelo

4:49

realmente aplica principios de óptica o simplemente desenfoca

4:53

el fondo de forma así, genérica?

4:54

No, no, aplica principios ópticos simulados.

4:58

Entiende cómo la compresión de planos de un

5:00

objetivo de 50 milímetros afecta la proporción de

5:03

la nariz respecto a las orejas, por ejemplo.

5:06

¡Madre mía!

5:07

A diferencia de un gran angular, que distorsionaría

5:09

el centro del rostro.

5:11

Por eso los pilares quinto y sexto, que

5:13

se centran en la textura y la iluminación,

5:15

son tan críticos.

5:17

Claro, ahí es donde te la juegas con

5:19

el fotorrealismo.

5:20

¡Exacto!

5:21

La diferencia entre un renderizado que parece sacado

5:24

de un videojuego antiguo y un perfil comercial

5:26

de alto nivel que factura miles de euros,

5:28

residen en la imperfección.

5:30

En el defecto.

5:31

¡Eso es!

5:32

Al pedir parámetros como piel húmeda, asimetría en

5:35

los poros o micro lunares bajo una luz

5:38

muy alta, muy controlada, el algoritmo cruza la

5:40

frontera de la percepción humana.

5:42

Y a esto le sumas el séptimo pilar,

5:44

la definición del vestuario, especificando la textura, el

5:48

peso y la caída de la tela.

5:49

Y terminando con la composición y el tono

5:51

emocional, ¿no?

5:53

¡Exactamente!

5:54

Los pilares octavo y noveno.

5:56

¡Es una locura!

5:57

De hecho, los ejemplos que citan en las

5:58

fuentes muestran resultados que desafían cualquier escrutinio.

6:02

Analizaban un avatar de un divulgador científico hiperrealista,

6:05

otro de fantasía con el pelo simulando un

6:08

brócoli, texturas vegetales súper complejas y hasta un

6:11

pirata de estética ciberpunk.

6:13

Sí, sí.

6:13

También detallan que puedes subir una fotografía real

6:16

de un humano, de uno mismo y parametrizarlo.

6:18

Pero a ver, la mecánica que cimienta toda

6:21

esta identidad me resulta curiosa.

6:23

Una vez que introduces estos nueve pilares, el

6:26

sistema no te devuelve una sola imagen.

6:28

Fuerza la generación simultánea de tres perspectivas.

6:31

Frontal, de perfil estricto y de espaldas.

6:34

¡Exacto!

6:34

Es como si le hicieran un escáner 3D

6:36

y le firmaran un contrato de escritura.

6:38

Es una exclusividad al personaje.

6:39

Y esa triangulación es la piedra angular del

6:42

sistema.

6:43

Al obligar a la IA a proyectar el

6:45

mismo rostro desde tres ángulos opuestos, se está

6:48

construyendo un mapa topográfico tridimensional.

6:51

El modelo ya no tiene que adivinar o

6:53

alucinar el volumen craneal del personaje cuando le

6:55

pides una toma lateral.

6:56

Ya tiene la base de datos.

6:58

Eso es.

6:59

Posee una base de datos volumétrica exclusiva de

7:02

esa entidad.

7:03

Pero, a ver, pongámonos en la situación.

7:05

Si un usuario pide una toma en escorzo,

7:07

digamos un ángulo de 45 grados, ¿no existe

7:10

el riesgo de que la IA se invente

7:11

información en ese punto ciego que hay entre

7:13

el perfil y el frontal?

7:15

A ver, podría parecerlo, pero aquí entra en

7:17

juego la interpolación avanzada.

7:19

Los modelos modernos no almacenan imágenes como tal.

7:23

Almacenan vectores de relación espacial.

7:25

Si la herramienta conoce la profundidad exacta del

7:28

tabique nasal desde el frente y desde el

7:30

lateral, el cálculo del ángulo intermedio es puramente

7:32

matemático.

7:33

Por lo tanto, la integridad anatómica se mantiene

7:36

intacta en cualquier rotación.

7:39

Entendido.

7:39

O sea, esto no es solo una nueva

7:41

herramienta de diseño.

7:42

Es como si hubieran liberado el código fuente

7:45

de toda la producción audiovisual.

7:46

Han transformado la logística física de un casting

7:49

y las sesiones de fotos en variables de

7:52

texto.

7:53

Totalmente.

7:53

Pero claro, ese escaneo estático nos lleva al

7:56

verdadero problema comercial.

7:57

Un rostro tridimensional congelado en el vacío, pues

8:01

no sirve para hacer campañas de marketing.

8:03

Claro que no.

8:04

Las marcas necesitan a alguien sujetando su producto

8:06

en el mundo real.

8:07

Y aquí entramos en la segunda clave de

8:09

nuestra inmersión, las variaciones y la interacción en

8:12

el mundo real.

8:13

Correcto.

8:13

Porque la identidad visual no vale de nada

8:16

si no la integras en algo dinámico.

8:18

Y los documentos de Flow muestran cómo, una

8:21

vez que has anclado al personaje, basta con

8:23

utilizar el símbolo del arroba para invocarlo.

8:26

Igual que etiquetas a alguien en Instagram.

8:28

Tal cual.

8:29

El uso del comando arroba ciencia, por ejemplo,

8:32

llama a todos esos cálculos volumétricos al instante.

8:34

Y lo más destacable es que se ejecuta

8:37

a través de motores gratuitos como NanoBanana Pro,

8:40

NanoBanana 2 o Imagen 4.

8:42

O sea, modelos gratuitos.

8:44

Operan ahora mismo sin requerir consumo de créditos

8:47

de pago en sus configuraciones básicas.

8:49

El caso del científico ilustra esto fenomenal.

8:52

Porque la agencia cogió a este personaje y

8:54

lo ubicó dando una clase magistral frente a

8:57

un auditorio lleno de robots en una universidad

8:59

futurista.

9:00

Y la geometría del rostro reaccionaba a la

9:03

luz de ese entorno nuevo de forma impecable.

9:05

Pero aquí es donde se pone verdaderamente interesante.

9:09

La demostración que altera las reglas del juego

9:11

de la publicidad es la del perfume.

9:13

El informe describe a una creadora virtual que

9:16

se llama el Abby.

9:17

Sí, el caso del Abby es tremendo.

9:20

El usuario aportó una fotografía externa completamente real

9:23

de un frasco de perfume de una marca.

9:25

Y usando el comando de arroba tanto para

9:27

el avatar como para el archivo del producto,

9:30

ordenó generar una publicación profesional de Instagram sujetando

9:34

el producto.

9:34

A ver, ¿no es esto un terremoto absoluto

9:37

para las agencias de publicidad?

9:39

Es un cataclismo.

9:40

Porque si conectamos esto con el panorama general,

9:43

el reto computacional que acaba de resolver el

9:46

algoritmo en ese escenario es colosal.

9:49

La IA no está simplemente recortando y pegando

9:52

el frasto de colonia sobre una mano falsa.

9:54

Está analizando los vectores de luz que inciden

9:57

sobre el cristal real del producto y calculando

10:00

cómo esa luz se refractaría proyectando las sombras

10:03

coherentes sobre la piel sintética de la mano

10:05

que lo sujeta.

10:05

O sea, es una simulación de físicas de

10:08

contacto pero en tiempo real.

10:10

Exacto.

10:11

Y la profundidad de campo lo integra todo.

10:13

El desenfoque del dedo índice pulsando el vaporizador

10:16

hace que sea indistinguible saber qué parte es

10:19

foto real y qué parte es código puro.

10:21

La barrera de entrada para la publicidad de

10:24

alto nivel acaba de desaparecer.

10:25

Porque tradicionalmente, para conseguir este nivel de acabado

10:28

tenías que localizar un perfil adecuado, pagarle, alquilar

10:32

un estudio, contratar dirección de arte, técnicos de

10:34

luces, semanas de postproducción y ahora editas directamente

10:38

la realidad comercial con un presupuesto de cero

10:41

euros, cero créditos.

10:43

Y esta democratización a nivel de estudio se

10:46

multiplica cuando escalas la complejidad.

10:48

Porque la herramienta no sufre degradación al meterle

10:52

variables adicionales.

10:54

Probaron a invocar a tres personajes distintos a

10:57

la vez en la misma imagen.

10:58

¡Ostras!

10:59

Tres avatares creados previamente.

11:01

Sí.

11:02

Un equipo de seguridad cibernética caminando por un

11:05

pasillo y el sistema mantuvo la consistencia de

11:08

los tres cráneos, la coherencia de la ropa

11:10

y las físicas de la luz sin pestañear,

11:12

sin colapsar.

11:13

¡Qué barbaridad!

11:14

Encima, la plataforma tiene herramientas de edición de

11:16

flow nativas.

11:17

Tienes ajustes de brillo, de contraste, desenfoque y

11:21

puedes añadir texto que se integra perfectamente en

11:24

la imagen.

11:25

O sea, las letras proyectan su propia oclusión

11:28

ambiental sobre el decorado.

11:29

Y el inpainting para modificar partes, claro.

11:32

Exacto.

11:32

O redimensionar la imagen.

11:34

Si tienes una foto apaisada y la quieres

11:37

para un formato vertical en redes, el motor

11:39

entiende el contexto e inventa con precisión el

11:42

techo y el suelo que faltaban.

11:44

Y fíjate que este nivel de integración no

11:46

se queda solo en crear imágenes.

11:48

Los informes incluyen una nota incidental muy reveladora

11:51

sobre el patrocinador de uno de los creadores,

11:54

el caso de las gafas EVEN G2.

11:57

Ah, sí, sí.

11:58

Un apunte brillante, porque ilustra que el uso

12:01

de la inteligencia artificial en el día a

12:02

día ya es real.

12:04

Totalmente.

12:05

Las EVEN G2 parecen unas gafas de graduación

12:07

estándar, ¿no?

12:08

Sí.

12:09

Cristales normales, montura convencional.

12:11

Pero esconden un sistema de telepónter invisible en

12:14

el cristal y asistencia por IA, todo operado

12:17

de forma superdiscreta por un anillo, el EVEN

12:19

R1.

12:20

Lo que demuestra cómo la capa computacional se

12:23

está volviendo invisible, ya sea renderizando poros en

12:26

un embajador de marca virtual o superponiendo datos

12:30

en la retina en una sala de juntas,

12:32

la frontera entre lo tangible y lo sintético

12:35

se ha disuelto.

12:37

La IA ya es una infraestructura silenciosa, no

12:40

una promesa.

12:41

Pero, y aquí viene la gran pregunta, las

12:44

fotos de Instagram están muy bien, pero la

12:46

prueba de fuego de la influencia moderna es

12:48

el vídeo y la voz.

12:49

Por supuesto.

12:50

¿Cómo damos el salto del estatismo al movimiento

12:52

con flow?

12:54

Porque una fotografía, por compleja que sea la

12:56

luz, sigue siendo un objeto estático.

12:58

La influencia real exige cadencia, respiración… ¿Sonido?

13:03

Claro.

13:04

¿Cómo se traslada este mapa estático a un

13:06

flujo de vídeo?

13:07

Pues para lograr este salto, la plataforma le

13:10

asigna una voz consistente al avatar, una huella

13:14

biométrica permanente.

13:15

Y utilizan motores de vídeo como Gemini 3

13:18

.1 Lite, que es más barato, gasta unos

13:20

10 créditos, o el modelo FAST para una

13:22

calidad mayor.

13:23

Y el desafío aquí ya no es sólo

13:26

generar el movimiento, sino mantener la elasticidad facial

13:29

sincronizada con el audio.

13:31

Lo del lip sync y los ejemplos que

13:33

documentan son espeluznantes.

13:35

Muestran al personaje sintético en dos contextos súper

13:38

distintos.

13:39

En uno aparece tomando un café y dice

13:41

con claridad, vale, este es el mejor café

13:44

que he probado en mi vida.

13:45

Y en el otro clip está en la

13:46

playa.

13:46

Eso es.

13:47

El mismo avatar en la playa, con otra

13:50

luz, diciendo, ojalá la vida tuviese siempre esta

13:53

calma.

13:53

Y la sincronización labial es perfecta.

13:56

La coherencia de la voz es total.

13:58

La musculatura de la boca reacciona anatómicamente a

14:00

cada sílaba.

14:01

Es que la audiencia empieza a percibir una

14:03

firma acústica confiable, no sólo un rostro.

14:07

Y, técnicamente, para evitar el clásico efecto gelatina

14:10

de la IA en los vídeos… Que todo

14:12

se deforma de fondo, sí.

14:14

Claro.

14:14

Pues la herramienta te permite marcar el fotograma

14:16

de inicio y el fotograma de fin.

14:18

Así guías la transición temporal y la red

14:21

neuronal asegura que el entorno no se desintegre

14:24

mientras el personaje habla.

14:25

Estabilidad total.

14:27

Pero leyendo las fuentes sobre la transferencia a

14:29

través del modelo Omni, madre mía, aquí es

14:32

donde se desmorona todo.

14:34

La revolución de Omni es brutal.

14:36

Porque permite mezclar inputs.

14:38

O sea, detallan que puedes subir un vídeo

14:40

selfie grabándote con el móvil, apuntando a una

14:42

pared vacía, y pedirle a la IA que

14:44

añada a Super Mario y a Luigi en

14:47

la habitación.

14:47

Y no está pegando una pegatina digital sobre

14:49

el vídeo, ¿eh?

14:51

El modelo Omni decodifica el espacio físico, analiza

14:55

la luz de la ventana, la profundidad y

14:57

proyecta esas propiedades sobre Mario.

14:59

Hace que arrojes sombras reales en la pared

15:01

de tu cuarto.

15:02

Pero lo que de verdad plantea una pregunta

15:04

clave para los creadores humanos es el proceso

15:06

a la inversa.

15:07

La transferencia de identidad.

15:09

Si la IA puede clonar mi voz, ponerme

15:11

un traje a medida y enviarme a un

15:13

estudio de televisión profesional simplemente subiendo un vídeo

15:15

mío en pijama recién levantado, ¿qué significa todo

15:18

esto?

15:19

Es que plantea una pregunta importantísima sobre la

15:21

identidad vegetal.

15:22

El modelo Omni no solo crea de cero,

15:25

sino que transfiere realidades, extrae la intención del

15:28

humano, sus gestos y cambia todo el envoltorio.

15:32

Mencionan hasta transferencia de movimiento, ¿no?

15:34

Sí, sí.

15:35

Puedes subir un vídeo de una persona real

15:37

bailando agresivamente y aplicar exactamente esos movimientos fluidos

15:42

al avatar del científico, por ejemplo.

15:45

Transfiere la energía humana a la malla 3D.

15:48

Hay una nota técnica en la fuente que

15:50

dice que, por políticas de seguridad, a veces

15:53

esto se bloquea.

15:54

Sí, requiere poner el prompt en inglés o

15:56

usar no VPN de Estados Unidos para evitar

15:59

los bloqueos regionales.

16:00

Ya, la eterna lucha de la moderación.

16:03

Y para quienes agotan los 50 créditos diarios

16:06

de Flow, recomiendan una plataforma gratuita, ¿verdad?

16:09

OneVideo.

16:10

OneVideo, o Ken, sí.

16:13

Resuelve la escalabilidad, te permite animar personajes y

16:16

sincronizar audio de forma totalmente ilimitada y gratuita.

16:20

La pega es que, si desactivas lo mismo,

16:22

los créditos pasas a una cola de espera

16:24

más larga.

16:25

Tienes que tener paciencia, claro.

16:27

Exacto.

16:27

Pero la IA ya no es solo una

16:29

herramienta de creación, es un motor de traducción

16:32

de la realidad.

16:33

Y esto nos lleva a la gran reflexión

16:34

final, el mensaje central de todas estas fuentes.

16:38

Porque, claro, si el presupuesto para tener un

16:40

plató increíble, una voz perfecta y un rostro

16:43

de alta costura es cero euros… ¿Dónde reside

16:46

el valor ahora?

16:47

Exacto.

16:48

Las fuentes concluyen que el cómo se hace

16:50

y el quién lo dice, ya no importa.

16:52

Los rostros se van a olvidar o se

16:54

van a fabricar en masa.

16:55

Es la inflación masiva de la estética.

16:58

Habrá una sobreabundancia de carisma sintético en las

17:01

redes.

17:01

Totalmente.

17:02

Así que lo único que realmente va a

17:04

marcar la diferencia de ahora en adelante es

17:06

el qué, el mensaje.

17:08

Porque un rostro falso puede atraer las miradas

17:10

unos segundos, pero solo un mensaje real hace

17:13

pensar a la audiencia.

17:14

Exactamente.

17:15

La tecnología es el megáfono, pero el guión

17:18

lo seguimos escribiendo los humanos.

17:20

Qué gran cierre para este análisis.

17:22

Antes de despedirnos hasta el próximo programa, os

17:26

informamos de que las voces que oyes han

17:28

sido generadas por la IA de Notebook LM

17:30

y que dirigiendo el podcast se encuentra Julio

17:33

Pablo Vázquez, un humano que te envía saludos.

17:37

En caso de error, probablemente sean errores humanos.

17:40

¡Nos escuchamos!

17:52

Y hasta aquí el episodio de hoy.

17:54

Muchas gracias por tu atención.

18:06

Esto es BIMPRAXIS.

18:08

Nos escuchamos en el próximo episodio.

18:10

¡Gracias!