E116_Tiiny, un gadget de bolsillo con 128GB de inferencia
Ep. 116

E116_Tiiny, un gadget de bolsillo con 128GB de inferencia

Episode description

En este episodio de BIMPRAXIS, exploramos la revolución de la IA de bolsillo con el dispositivo Tiny AI Pocket Lab. Este aparato, que pesa apenas 305 gramos y opera sin conexión a internet, es capaz de ejecutar modelos masivos con hasta 120.000 millones de parámetros. A diferencia del paradigma actual en el sector, este dispositivo democratiza la IA al permitir su uso en dispositivos portátiles básicos, como un MacBook Air, gracias a su memoria unificada y unidad de almacenamiento SSD de un terabyte de capacidad. Sin embargo, también presenta desafíos técnicos y económicos que deben ser abordados para una adopción más amplia.

Download transcript (.srt)
0:09

Buenas, esto es BIMPRAXIS, el podcast donde el

0:15

BIM se encuentra con la inteligencia artificial.

0:20

Exploramos la ciencia, la tecnología y el futuro

0:23

desde el enfoque de la arquitectura, ingeniería y

0:26

construcción.

0:28

¡Empezamos!

0:36

Muy buenas, bienvenidas, bienvenidos a un nuevo episodio

0:40

de BIMPRAXIS.

0:42

Hoy os traemos la revolución de la IA

0:45

de bolsillo.

0:46

¿Estáis listos?

0:47

Pues entramos en materia.

0:48

A ver, imaginemos por un instante la infraestructura

0:52

física que impulsa hoy en día a las

0:55

inteligencias artificiales más avanzadas del panorama.

0:58

Claro, la imagen mental nos lleva directamente a

1:01

naves industriales, naves que ocupan hectáreas enteras.

1:05

Totalmente.

1:06

Decenas de miles de tarjetas gráficas gigantes apiladas

1:10

en servidores, con unos sistemas de refrigeración que,

1:13

bueno, exigen un consumo energético comparable al de

1:16

una ciudad pequeña.

1:17

Eso es.

1:18

Ese es el paradigma establecido en el sector

1:20

ahora mismo.

1:21

La inteligencia artificial de vanguardia es un coloso

1:24

inamovible.

1:25

Es extremadamente caro y, por pura definición, un

1:28

privilegio exclusivo de un puñado de megacorporaciones.

1:32

Exacto, pero revisando las fuentes y los datos

1:35

técnicos de hoy, nos encontramos con una anomalía

1:37

brutal.

1:38

Una anomalía que desafía toda la física y

1:41

la economía de este sector.

1:42

Sí, sí.

1:43

Un dispositivo capaz de ejecutar modelos masivos, ojo.

1:47

De hasta 120 .000 millones de parámetros.

1:50

120 .000 millones.

1:52

Y atención al dato, pesando apenas 305 gramos

1:56

y operando totalmente desenchufado de la nube.

1:58

Es una locura.

1:59

El contraste con la narrativa dominante de la

2:02

industria es abismal.

2:04

Mientras todo el mercado avanza hacia el gigantismo

2:07

de los centros de datos, hoy analizamos el

2:10

Tiny AI Pocket Lab.

2:12

Que de bolsillo tiene el nombre, pero de

2:14

potencia va sobrado.

2:15

A ver, vamos a desgranar esto, porque las

2:17

cifras… Las cifras resultan casi inverosímiles.

2:19

Hasta que analizas la ingeniería que hay detrás,

2:22

claro.

2:23

Físicamente, es un bloque con el tamaño de

2:25

una batería externa convencional.

2:27

Y como decías, ostenta el récord Guinness al

2:30

superordenador de inteligencia artificial más pequeño del mundo.

2:34

Fíjate, 305 gramos.

2:37

Para poner una referencia super cotidiana, un iPhone

2:40

moderno, si le pones una funda protectora normalita,

2:43

ya te ronda los 230 gramos.

2:46

Exacto.

2:48

Es que, por una fracción mínima de peso

2:52

adicional, este aparato promete democratizar modelos de lenguaje

2:55

gigantes.

2:56

Y para que esa promesa no se quede

2:58

en puro marketing, la clave tiene que estar

3:00

en el interior, ¿no?

3:01

Justo.

3:02

Porque esto no es un disco duro externo

3:04

glorificado.

3:05

Ni mucho menos.

3:06

Este dispositivo viene equipado con 80 GB de

3:10

memoria unificada.

3:11

80 GB unificados, que se dice pronto.

3:13

Es una barbaridad.

3:15

En un ordenador tradicional… Sabes que el procesador

3:18

central y la tarjeta gráfica tienen sus memorias

3:20

separadas.

3:21

Pierden un tiempo y una energía inmensos copiando

3:24

datos de un lado a otro.

3:25

¿Yendo y viniendo constantemente?

3:27

Eso es.

3:28

La memoria unificada crea una especie de piscina

3:31

común a la que todos los componentes acceden

3:33

al instante.

3:34

Se acabó el cuello de botella.

3:36

Claro.

3:36

Y a eso le sumamos la unidad de

3:38

almacenamiento.

3:39

Sí, un SSD de un terabyte de capacidad.

3:41

A ver, que suena a jerga impenetrable, pero

3:44

el impacto aquí es vital.

3:45

Básicamente, no es solo un almacén enorme… Es

3:48

una autopista de altísima velocidad.

3:51

Exactamente.

3:52

Permite leer y escribir gigabytes de información por

3:54

segundo sin atascos.

3:56

Porque, claro, sin esa autopista, cargar un modelo

3:59

tan bestia sería eterno.

4:00

Vale.

4:01

Pero aquí es donde se me plantea un

4:03

reto analítico clarísimo.

4:05

Planteemos un escenario de la vida real basado

4:07

en las fuentes.

4:08

Tú coges este pequeño bloque y lo enchufas

4:12

por cable USB -C a tu portátil básico.

4:14

Un portátil cualquiera, ¿sí?

4:16

Imagínate un MacBook Air de entrada y entrada.

4:17

De estos que no tienen ni ventiladores, con

4:19

apenas 8 o 16 gigas de RAM.

4:22

Si el modelo de IA pesa una tonelada

4:25

y el portátil va justito, ¿cómo evita el

4:27

colapso absoluto al gestionar esa carga por un

4:30

simple puerto USB?

4:31

Pues mira, el error de base en ese

4:33

planteamiento es asumir que tu portátil está gestionando

4:35

el modelo.

4:36

Ah, no lo hace.

4:37

No, no.

4:37

El portátil no hace absolutamente nada a nivel

4:40

de procesamiento.

4:41

El Tiny Chronid actúa de forma completamente autónoma.

4:45

O sea que el portátil es solo la

4:46

pantalla.

4:47

Justo.

4:47

Ese disco SSD de 1 TB que mencionábamos

4:51

almacena los pesos del modelo, es decir, el

4:54

cerebro del sistema.

4:55

Y todo el cálculo ocurre dentro de los

4:57

procesadores del cacharro de bolsillo.

4:59

Entonces tu ordenador se queda como un terminal

5:02

ciego.

5:03

Un teclado y una pantalla para mandar instrucciones

5:06

y punto.

5:07

Eso es.

5:08

Así, el disco duro y la memoria de

5:10

tu portátil se mantienen intactos.

5:12

El espacio del usuario no se toca.

5:14

Vale, me resuelves el cuello de botella del

5:16

almacenamiento.

5:17

Así caben los datos.

5:19

Pero mover esos datos y procesarlos se exige

5:21

superar un límite mucho peor.

5:23

El límite térmico.

5:25

Claro.

5:25

Las tarjetas gráficas de escritorio que mueven estos

5:28

modelos consumen fácilmente entre 400 y 1000 vatios.

5:32

Son estufas.

5:33

Literales.

5:34

Pero este dispositivo, según las especificaciones, opera con

5:37

un TDP de tan solo 30 vatios.

5:40

30 vatios.

5:41

Se alimenta con un cargador de móvil normal.

5:44

¿Cómo no se derrite la carcasa al exigirle

5:47

cálculos?

5:47

Lo fascinante aquí es la división quirúrgica que

5:51

han hecho en la arquitectura interna.

5:52

El dispositivo alcanza un rendimiento total de 160

5:56

TOPS.

5:57

TOPS para clarificar trillones de operaciones por segundo,

6:00

¿verdad?

6:01

Exacto.

6:01

Es la métrica estándar para medir el músculo

6:04

en IA.

6:04

Pues bien, para lograr esos 160 TOPS sin

6:07

disparar el consumo eléctrico, no usan un procesador

6:10

generalista.

6:11

Lo dividen en dos cerebros especializados.

6:14

¿Y cómo se reparten la carga?

6:16

El componente principal es una NPU, una unidad

6:19

neuronal dedicada solo a IA.

6:21

Esta NPU acapara 48 GB de esa memoria

6:24

RAM unificada, con un ancho de banda altísimo,

6:27

y está enfocada en cálculos de formato FP16

6:30

e INT8.

6:31

Vale.

6:32

Detengámonos en esos formatos, FP16 e INT8, porque

6:36

requieren traducción para entender su impacto.

6:38

O sea, una red neuronal hace miles de

6:41

millones de multiplicaciones para adivinar la siguiente palabra,

6:44

¿no?

6:44

Sí.

6:45

Matemáticas, puras ideas.

6:46

Y duras.

6:46

Y, tradicionalmente, esas matemáticas usan números decimales larguísimos,

6:50

de alta precisión.

6:52

Ocupan mucho y gastan muchísima energía.

6:54

Una locura de energía, sí.

6:56

Pues lo que permiten esos formatos, FP16 e

6:59

INT8, es comprimir.

7:01

En lugar de 10 decimales, redondea y usa

7:04

números enteros más cortos.

7:06

Pierde una precisión microscópica, pero… Pero a cambio

7:10

es rapidísimo.

7:10

Es como pagar en efectivo y redondear los

7:13

céntimos, en lugar de hacer transferencias exactas por

7:16

cada centímetro.

7:16

El proceso huella, y el resultado es funcionalmente

7:19

idéntico.

7:20

Exactamente esa es la idea.

7:22

Y luego, complementando a la NPU, el dispositivo

7:26

lleva un SOC, un sistema en chip secundario,

7:28

que administra los 32 gigas de RAM restantes

7:32

y aporta a otros 30 TEOPS.

7:34

Esa es la base de hardware.

7:36

Pero las fuentes nos dicen que el hierro

7:39

es solo la mitad del cuento.

7:40

La verdadera magia, la brujería técnica que hace

7:44

que esto consuma tan poco, es la verdad.

7:46

Es el software de código abierto.

7:48

PowerInfer y TurboSparse.

7:50

Justo.

7:51

A ver, para explicar cómo sincronizan la NPU

7:54

con el SOC, introducen el concepto de la

7:57

localidad de activación.

7:59

Mantener neuronas calientes frente a neuronas frías.

8:02

Es un concepto clave, sí.

8:03

Se me ocurre una analogía con la alta

8:05

cocina.

8:06

Imagina que el modelo de 120 .000 millones

8:08

de parámetros es la despensa de un restaurante

8:11

gigante.

8:11

En cualquier charla con la IA hay conocimientos

8:14

básicos, lógica o gramática que se usan siempre.

8:18

Esas serían las neuronas calientes.

8:20

Exacto.

8:20

Son los ingredientes críticos.

8:22

La sal, el aceite, los cuchillos.

8:25

Todo eso lo pones directamente en la encimera

8:27

principal del chef, que sería la NPU, súper

8:30

rápida y siempre lista.

8:32

Totalmente.

8:32

En cambio, las neuronas frías serían las especias

8:35

raras que usas una vez al mes para

8:37

un plato exótico.

8:38

Esas las guardas en la despensa del fondo,

8:41

que sería el SOC o la CPU.

8:43

Fíjate que la analogía es perfecta.

8:44

Y Power Infer es el chef que orquesta

8:46

todo esto.

8:48

Optimiza la velocidad de forma brutal sin colapsar

8:50

el sistema.

8:51

Porque el sistema no pierde energía yendo y

8:54

viniendo a la despensa del fondo a cada

8:55

segundo.

8:56

Claro, mantiene lo crítico a mano.

8:58

Y el por qué importa esto es brutal.

9:01

Importa porque es lo que permite llevar computación

9:03

de altísimo rendimiento a un enchufe estándar o

9:06

a una batería portátil en una cafetería.

9:08

Se acabaron los costes recurrentes.

9:10

Eliminas el pago por tokens en la nube

9:12

por completo.

9:13

Y te garantiza una privacidad.

9:14

Tu datos, tu código, tus documentos no salen

9:19

de ese aparatito de 300 gramos.

9:21

Pero a ver, de nada sirve una arquitectura

9:24

innovadora si te exige un doctorado para poder

9:27

usarla.

9:28

Pasemos de los chips a la experiencia de

9:30

usuario.

9:31

Porque yo me esperaba la típica pantalla de

9:34

terminal negra con letras verdes y comandos supercrípticos.

9:38

Era lo habitual en IA local hasta hace

9:40

nada, ¿sí?

9:40

Pues aquí es donde la cosa se pone

9:42

muy interesante.

9:44

Entras a través de un panel de control

9:46

llamado TinyOS y es supervisual.

9:50

Es que democratizar el acceso es vital para

9:52

la adopción masiva y TinyOS es totalmente transparente.

9:56

Te monitoriza el rendimiento en tiempo real.

9:58

Ves la carga exacta de la NPU, la

10:01

RAM unificada, el uso de tokens histórico.

10:04

Te da una sensación de control real.

10:06

Pero el salto cualitativo de verdad está en

10:07

la Agent Store.

10:09

La tienda de aplicaciones, ¿sí?

10:10

Es una especie de tienda de apps que

10:12

convierte modelos supercomplejos en herramientas listas para usar.

10:16

Incluye desde KiloCode para programar hasta interfaces completas

10:20

de Stable Diffusion Web UI.

10:22

O sea, para generar imágenes sin instalar 50

10:25

dependencias de software, que es un dolor de

10:27

cabeza.

10:28

Exacto.

10:29

O Silly Tavern para crear conversaciones de rol

10:31

inmersivas.

10:32

Lo instalas con un clic, como en el

10:34

móvil.

10:35

Y dentro de ese ecosistema me ha volado

10:37

la cabeza la herramienta TinyBot.

10:39

Ah, la integración remota.

10:40

Sí, sí.

10:41

Inspirada en interfaces como OpenClose.

10:43

Te permite conectar tu pequeño servidor en casa

10:46

a través de un bot de Telegram o

10:48

Discord.

10:49

Eso es fascinante.

10:50

A ver, yo estoy fuera de casa, saco

10:52

el móvil, abro Telegram y le pido un

10:54

resumen de un PDF o el clima de

10:56

Melbourne a través de una API.

10:57

Y es mi propio dispositivo físico en mi

11:00

escritorio procesando eso.

11:01

Claro.

11:02

En términos prácticos, lo que tienes ahí es

11:05

tu propia infraestructura en la sombra.

11:07

Literalmente.

11:08

Es el puente perfecto entre mantener el control

11:10

absoluto y paranoico de tus datos a nivel

11:13

local y seguir teniendo la tremenda conveniencia de

11:16

la nube.

11:16

Vale.

11:17

Pasemos de la teoría a las trincheras.

11:19

Porque, sobre el papel, todo suena perfecto.

11:22

¿Qué pasa cuando realmente le exigimos tareas complejas

11:25

al cacharro?

11:26

Que salen a la luz las peculiaridades de

11:28

una tecnología emergente, como es normal.

11:31

Las fuentes detallan pruebas que te dan un

11:33

baño de realidad.

11:34

Mira la generación de imágenes con el modelo

11:36

Z -Image TuneWall.

11:37

Las anécdotas de esas pruebas son muy buenas.

11:39

Son para enmarcar.

11:40

Le piden al modelo generar la imagen, y

11:42

un gato con un sombrero.

11:43

Y el resultado devuelto es...

11:45

¿Un cuadrado rojo?

11:47

Un cuadrado plano y rojo, sí.

11:48

Un fallo de lógica total.

11:50

Un colapso absoluto.

11:51

Pero luego le piden un gato tocando la

11:53

guitarra y...

11:54

¡Pum!

11:55

Genera una imagen fotorrealista perfecta al primer intento.

11:59

A ver, es que esos saltos, entre fallo

12:01

catastrófico y éxito perfecto, muestran la naturaleza experimental

12:04

de comprimir modelos en ecosistemas tan cerrados.

12:07

Y no solo con imágenes.

12:09

Hubo un intento de programar un juego de

12:11

vuelo en 3D, usando el asistente KiloCode.

12:14

Ese caso es interesantísimo.

12:16

Tela marinera.

12:17

El programador usa el modelo GLM 4 .7

12:21

Flash y le pide que inspeccione la pantalla

12:23

del navegador para corregir errores visuales.

12:26

Y falla estrepitosamente.

12:28

Falla porque ese modelo no es multimodal.

12:30

Es ciego.

12:31

No puede ver píxeles en pantalla.

12:33

Solo texto.

12:34

Claro, el sistema no podía ver el problema

12:36

en absoluto.

12:37

Aunque, curiosamente, el código subyacente que escribió para

12:40

el terreno 3D en JavaScript fue sorprendentemente bueno

12:44

a la primera.

12:44

Es que ahí entran los datos duros de

12:46

rendimiento para dar contexto a estas anécdotas.

12:48

Porque a pesar de esos tropiezos lógicos, las

12:51

métricas son de otra liga.

12:52

Dímelas.

12:53

Si ejecutas un modelo generalista mastodóntico, como el

12:56

GPTOS de 120 .000 millones, el sistema rinde

12:59

entre 12 y 18 tokens por segundo.

13:01

Que es una velocidad de lectura superior a

13:03

la humana, ejecutándose en local y con 30

13:05

vatios.

13:06

Exacto.

13:06

Y si te vas a modelos más ligeros

13:08

y especializados en código, como Qen3C Coder de

13:11

30 .000 millones, alcanza los 25 tokens por

13:13

segundo.

13:14

No despeinarse, vamos.

13:15

Nada.

13:16

Ni mutarse.

13:17

En las pruebas fue capaz de generar una

13:18

web educativa interactiva sobre serpientes, con 710 líneas

13:22

de código continuo, incluyendo lógica, diseño visual y

13:25

animaciones.

13:25

Pues entonces, ¿qué significa todo esto al final

13:28

del día?

13:28

Porque hay que hacer de abogado del diablo.

13:30

No todo es perfecto, la física existe.

13:33

La física es la que manda.

13:35

Siempre.

13:35

Y concentrar esa potencia genera calor.

13:38

Para enfriar la NPU, el dispositivo tiene un

13:41

ventilador pensado Sí, operando a unas revoluciones altísimas.

13:45

Y las fuentes mencionan un ruido agudo constante.

13:48

Un zumbido que en un entorno silencioso de

13:51

oficina se hace notar.

13:52

Es el peaje inevitable de la miniaturización extrema,

13:55

claro.

13:56

Pero aparte del ruido, de momento el ecosistema

13:58

de software es lo que llamamos un jardín

14:01

vallado.

14:01

Ese es el gran hándicap para los usuarios

14:04

muy técnicos.

14:05

O sea, los modelos están curados por Tiny

14:07

AI.

14:08

No puedes irte alegremente a Hugging Face, descargarte

14:11

un archivo, un archivo libre estándar y ponerlo

14:13

a funcionar.

14:14

Estás limitado a lo que te dan ellos

14:16

en su tiembla.

14:17

Probablemente porque cada modelo exige un trabajo de

14:20

compilación previo para exprimir esa arquitectura dual Powering

14:23

Fair.

14:24

Tienen que ajustar muy bien qué va a

14:25

la NPU y qué va al SOC.

14:27

Claro, te cambian Rilibertad por estabilidad.

14:30

Y por último, el tema del precio, que

14:33

no es moco de pavo.

14:35

Salió a 1 .399 dólares en Kickstarter y

14:39

su precio final estimado es de casi 1

14:41

.900 dólares.

14:42

Es una inversión seria, sí.

14:44

Por ese dinero te montas un ordenador de

14:47

sobremesa tradicional bastante capaz.

14:49

¿Realmente esto lo sustituye?

14:51

A ver, sintetizando, no.

14:53

No reemplaza a un monstruo de estación de

14:55

trabajo con múltiples tarjetas gráficas gigantes.

14:58

Si vas a entrenar modelos desde cero, esto

15:00

no es para ti.

15:02

Lógico.

15:02

Pero es que abre una categoría completamente nueva.

15:05

Hablamos de IA significativa, portátil, privada y de

15:09

muy bajo consumo.

15:10

Totalmente.

15:11

Totalmente.

15:12

Lleva a un pensamiento final para dejar resonando

15:14

a quien nos escuche.

15:16

Si un despacho de abogados o un equipo

15:18

de programadores puede amortizar este hardware en un

15:21

par de meses… Porque se ahorran las suscripciones

15:23

mensuales a la nube, claro.

15:25

Exacto.

15:25

Tienen una fábrica de tokens ilimitados y confidenciales

15:30

en el bolsillo.

15:31

A largo plazo, ¿cómo de sostenible es el

15:34

modelo de negocio basado en suscripciones de los

15:38

gigantes tecnológicos de la nube?

15:40

Es la gran pregunta.

15:41

Estamos asomándonos a una posible descentralización masiva del

15:45

poder de cómputo.

15:46

Una revolución desde la mochila de cada usuario,

15:48

literalmente.

15:49

Antes de despedirnos, hasta el próximo programa os

15:52

informamos de que las voces que oyes han

15:54

sido generadas por la IA de Notebook LM

15:57

y que dirigiendo el podcast se encuentra Julio

16:00

Pablo Vázquez, un humano que te envía saludos.

16:02

En caso de error, probablemente sean errores humanos.

16:05

Nos escuchamos.

16:17

Y hasta aquí el episodio de hoy.

16:19

Muchas gracias.

16:21

Muchas gracias por tu atención.

16:31

Esto es BIMPRAXIS, nos escuchamos en el próximo

16:35

episodio.