E115_Neuralwatt provee inferencia IA pero cobra por kWh en vez de por tokens y sale baratísimo
Ep. 115

E115_Neuralwatt provee inferencia IA pero cobra por kWh en vez de por tokens y sale baratísimo

Episode description

En este episodio de BIMPRAXIS, exploramos cómo la inteligencia artificial está revolucionando la economía del desarrollo de software. Un desarrollador compartió su experiencia utilizando un modelo de IA para refactorizar un proyecto personal, consumiendo casi 20 millones de tokens en un solo día y pagando literalmente lo que cuesta un café por el proceso. Esto rompe con las reglas tradicionales de facturación en la industria tecnológica, ya que los costos se basan ahora en el consumo real de energía del hardware, no en el volumen de tokens procesados. La eficiencia y calidad de los modelos de IA están mejorando rápidamente, lo que podría transformar radicalmente cómo construimos software en el futuro.

Download transcript (.srt)
0:09

Buenas, esto es BIMPRAXIS, el podcast donde el

0:15

BIM se encuentra con la inteligencia artificial.

0:20

Exploramos la ciencia, la tecnología y el futuro

0:23

desde el enfoque de la arquitectura, ingeniería y

0:26

construcción.

0:28

¡Empezamos!

0:36

Muy buenas, bienvenidas, bienvenidos a un nuevo episodio

0:40

de BIMPRAXIS.

0:41

Hoy os traemos el revolucionario coste de IA

0:44

por kilovatio.

0:45

¿Estáis listos?

0:46

Pues entramos en materia.

0:48

Bueno, a ver, imaginemos por un momento una

0:50

situación.

0:51

Te escucho.

0:52

Le pedimos a un modelo de inteligencia artificial

0:54

que reescriba por completo una base de código

0:57

inmensa.

0:58

Que eso ya de por sí es un

0:59

reto importante.

1:00

Exacto.

1:01

Le exigimos que la lea una y otra

1:03

vez, analizando la arquitectura, proponiendo cambios y procesando

1:07

casi 20 millones de palabras de ida y

1:10

vuelta.

1:10

Una barbaridad de datos, o sea, un volumen

1:12

industrial.

1:13

Pues fíjate, la locura es que, al terminar,

1:15

la factura final que llega es literalmente lo

1:18

que cuesta un café solo.

1:20

¡Madre mía!

1:20

Sí, sí, unos 2 dólares con 70 centavos.

1:23

Y, a ver, esto no es un escenario

1:25

de ciencia ficción para la próxima década.

1:27

No que va.

1:29

Principalmente porque rompe con todo lo que asumíamos

1:31

sobre la economía de la computación.

1:33

O sea, con las reglas básicas.

1:35

Totalmente.

1:36

Normalmente, en este sector, pues, debatimos sobre teorías

1:38

abstractas o proyecciones a 5 años vista.

1:41

Pero lo que tenemos sobre la mesa hoy

1:43

son facturas reales.

1:44

Dinero de verdad.

1:45

Exacto.

1:47

Desarrolladores independientes que están operando con márgenes de

1:49

coste que, a primera vista, parecen un fallo

1:51

flagrante en el sistema de facturación del proveedor.

1:54

O sea que parece que se han equivocado

1:55

al cobrarles.

1:56

Eso es.

1:57

Y claro, para comprender el terremoto que esto

1:59

supone, necesitamos destripar cómo interactúan, pues, la física

2:03

del hardware, la eficiencia del software y un

2:05

modelo comercial que, fíjate, desafía directamente a los

2:08

gigantes de Silicon Valley.

2:09

Pues vamos a empezar por el origen del

2:11

revuelo, porque el contexto aquí lo es todo.

2:14

¿Qué es lo que se está haciendo?

2:15

¿Qué es lo que se está haciendo?

2:15

Es un proyecto de Reddit, concretamente en la

2:17

comunidad OpenCodeKlee.

2:19

Un desarrollador que utiliza el seudónimo Purplenipis compartió

2:24

una captura de pantalla de su uso diario

2:26

que dejó a todo el mundo boquiabierto.

2:28

No es para menos, claro.

2:30

Es que este usuario estaba trabajando con el

2:32

modelo GLM 5 .2 utilizando una herramienta que

2:35

se llama OpenCodeCode y el objetivo era sumamente

2:39

intensivo.

2:39

Sí, querían refactorizar un proyecto personal de tamaño

2:42

medio, ¿verdad?

2:43

Exacto.

2:43

Usando una habilidad técnica muy especializada.

2:45

Una habilidad específica llamada Improved Codebase Architecture que

2:48

fue diseñada originalmente por Matt Pocock.

2:51

Claro, y eso es importante recalcarlo.

2:53

Sí, porque no le estaba pidiendo a la

2:55

IA que escribiera un simple bloque de texto,

2:57

¿no?

2:57

¿Qué va, qué va?

2:58

Le estaba exigiendo que iterara sobre una arquitectura

3:02

de código compleja, evaluando dependencias, reestructurando toda la

3:07

lógica profunda de la aplicación.

3:09

Y ese tipo de tareas, a ver, tradicionalmente

3:12

es un pozo sin fondo por el consumo

3:14

de tokens.

3:14

Claro.

3:15

Si pides a un modelo que mejore una

3:17

arquitectura completa, no puedes simplemente mirar el archivo

3:19

suelto en el que estás trabajando.

3:21

Tiene que ver la foto grande.

3:23

Exactamente.

3:24

Tiene que cargar en su memoria el contexto

3:26

entero del proyecto.

3:27

Y cada vez que hace un pequeño ajuste,

3:29

necesita releer y revaluar cómo ese cambio afecta

3:32

al resto del ecosistema de tu código.

3:34

O sea, un proceso iterativo masivo.

3:37

Sí, sí.

3:37

Y los números que reporta este usuario en

3:39

Reddit reflejan exactamente esa carga de trabajo.

3:42

Hablamos de 19 ,2 millones de tokens consumidos,

3:45

en un solo día de desarrollo.

3:47

Yo me quedé impactada.

3:48

Quiero que nos detengamos un momento en ese

3:50

número para dimensionarlo correctamente.

3:53

Consumir 19 millones de tokens por menos de

3:56

tres dólares es, a ver, es una escala

3:59

de asimilación de datos casi absurda.

4:01

Sí.

4:01

Sería el equivalente a entrar en la biblioteca

4:04

central de una gran universidad, pedirle a un

4:07

asistente que devore absolutamente todos los libros de

4:10

la sección de ingeniería informática en segundos.

4:13

Madre mía, la imagen es buena.

4:15

Es de toda esa información para reescribir tu

4:18

propia tesis doctoral desde cero.

4:19

Y al salir, pues dejarle unas monedas de

4:21

propina.

4:22

Es que es tal cual.

4:23

Es un volumen que rompe nuestros esquemas actuales.

4:26

De hecho, el propio usuario hizo la comparativa

4:28

usando los precios estándar del mercado a través

4:31

de Open Router para ese mismo modelo, el

4:33

GLM 5 .2.

4:34

¿Y cuánto salía ahí?

4:35

Pues en un escenario tradicional, esa misma refactorización

4:39

habría costado unos ocho dólares con tres centavos.

4:42

Guau.

4:43

Y eso asumiendo que los precios de Open

4:45

Router ya son competitivos, claro.

4:47

Claro, claro.

4:47

Además, un aspecto crucial que menciona este desarrollador

4:50

es la percepción de la calidad y la

4:53

velocidad.

4:54

Ajá, porque si es barato pero lento, no

4:57

sirve de mucho.

4:58

Exacto.

4:59

Pero empíricamente, este usuario compara la experiencia de

5:02

usar este modelo en esta plataforma con correr

5:05

Opus 4 .6 en alto.

5:07

O sea, niveles máximos de rendimiento.

5:10

Eso es.

5:10

No estamos ante un servicio de bajo coste

5:13

que tarda minutos en hacer o que te

5:15

devuelve un código inservible.

5:17

Y fíjate, cuando el coste de la inferencia

5:19

de alta calidad se desploma de esta manera,

5:22

la viabilidad matemática de cómo construimos software cambia

5:26

radicalmente.

5:26

O sea, ya no tienes miedo a equivocarte.

5:29

Exacto.

5:29

El desarrollo asistido por IA deja de ser

5:32

una consulta quirúrgica y súper cuidadosa para no

5:35

gastar presupuesto.

5:36

Claro, que antes lo pensabas dos veces antes

5:39

de darle al intro.

5:41

Totalmente.

5:41

Se convierte en un motor contimo de prueba

5:43

y error.

5:44

Puedes pedirle al modelo que genere 20 versiones

5:47

diferentes de un mismo módulo, descartar 19 y

5:50

no sentir que estás quemando billetes.

5:52

Pero claro, semejante descuento monumental nos surge por

5:56

arte de magia.

5:57

A ver, las empresas no regalan capacidad de

5:59

computo.

6:00

No, desde luego.

6:01

Tiene que haber una mecánica técnica muy afinada

6:04

que sostenga esto financieramente.

6:06

Y si miramos el desglose exacto de esos

6:09

19 millones de tokens en la factura de

6:11

nuestro protagonista, encontramos la primera revelación.

6:15

A ver.

6:16

Resulta que 17 millones de esos tokens fueron

6:20

etiquetados como tokens de entrada en caché.

6:23

Ajá, ahí está la clave.

6:24

Solo 1 ,9 millones fueron de entrada regular

6:28

y apenas 192 .900 fueron de salida.

6:32

Un contraste brutal.

6:34

Es que otros usuarios en el mismo hilo,

6:36

como uno llamado Luke, reportaban tasas de acierto

6:39

de la caché de entre el 89 y

6:41

el 94 por ciento.

6:43

Confieso que esas cifras me parecen magia negra.

6:46

Es normal que te lo parezca.

6:48

¿Qué es exactamente esta caché a nivel técnico

6:51

y cómo logran un porcentaje de acierto tan

6:53

salvaje?

6:54

Bueno, la explicación reside en cómo funciona la

6:57

memoria a corto plazo de estos modelos, lo

7:00

que conocemos como la caché KV o Key

7:03

Value Catch.

7:04

¿Vale?

7:05

Usemos una analogía del mundo de la alta

7:07

cocina para que se entienda mejor.

7:08

Me gusta.

7:09

A ver.

7:10

Imagina que un chef con estrella tiene que

7:12

preparar un plato extremadamente complejo.

7:15

Si cada vez que le piden el plato

7:17

tiene que ir a la huerta a recoger

7:19

las verduras, lavarlas, cortarlas y preparar las salsas

7:23

base desde cero, el tiempo y el esfuerzo

7:25

son enormes.

7:26

Inviables para un restaurante, claro.

7:28

Eso sería procesar tokens regulares.

7:31

Pero ¿qué pasa si tiene un equipo de

7:33

ayudantes que ya ha preprocesado, pesado y ordenado

7:36

todos los ingredientes en la mesa de trabajo?

7:38

Pues que el chef solo tiene que ejecutar

7:40

la receta final.

7:41

Exacto.

7:42

La caché KV hace exactamente eso con el

7:45

contexto matemático del código.

7:47

Entiendo.

7:47

Entonces, como la base de código del proyecto,

7:50

digamos, no cambia en su gran mayoría entre

7:52

una petición y la siguiente.

7:54

El sistema no la vuelve a leer.

7:55

Exactamente.

7:56

Al refactorizar, el contexto principal, o sea, los

8:00

cientos de archivos de tu proyecto, pues permanece

8:02

estático.

8:03

Lo único que cambia es el pequeño prompt,

8:05

¿no?

8:06

La instrucción específica de ese momento.

8:08

Eso es.

8:09

NeuralWatt, que es la plataforma detrás de esto,

8:12

es un sistema avanzado que guarda esa representación

8:15

matemática ya precomputada de los archivos en la

8:18

memoria de las tarjetas gráficas.

8:19

Ya veo.

8:20

Cuando tú envías la siguiente petición, el sistema

8:23

reconoce que el 90 por ciento del contexto

8:25

es idéntico al de hace dos segundos y

8:26

recupera ese plato preparado instantáneamente y sólo invierte

8:30

esfuerzo computacional real en calcular la respuesta nueva.

8:33

Por eso facturan esos 17 millones de tokens

8:36

a una fracción ridícula del precio normal.

8:39

El servidor apenas sudó para procesarlos.

8:41

Vale.

8:41

El caché justifica una enorme reducción del esfuerzo.

8:45

Sí, pero al indagar en la documentación técnica

8:48

de NeuralWatt Cloud hay otra pieza fundamental de

8:51

la que presumen para bajar los costes y

8:53

es la cuantización FP8.

8:55

Así eso es vital.

8:57

Dicen que reducen la precisión de los cálculos

9:00

de coma flotante de 16 bits a 8

9:03

bits para literalmente cortar por la mitad el

9:06

ancho de banda de memoria necesario.

9:08

Correcto.

9:09

Y aquí tengo que hacer un poco de

9:10

abogada del diablo.

9:11

Adelante, adelante.

9:12

En el foro de Reddit, usuarios como Longjumpingpush351

9:18

defienden que en tareas de programación la caída

9:21

de calidad por usar FP8 es apenas perceptible.

9:24

Y a ver, me cuesta creer que recortar

9:26

la precisión a la mitad no afecte al

9:28

resultado.

9:29

Es una duda muy lógica.

9:31

¿Es esto un hecho técnico real o los

9:33

desarrolladores simplemente se están conformando con un código

9:37

mediocre porque es tan barato que pueden pedirle

9:39

a la IA que lo arregle luego?

9:40

Pues mira, es una pregunta buenísima.

9:42

Y toca el corazón de cómo las redes

9:44

neuronales procesan diferentes tipos de información.

9:48

A ver, ilumínanos.

9:49

Para entender la cuantización FP8, pensemos en la

9:52

diferencia entre una fotografía en formato RAW de

9:55

altísima resolución y una imagen JPG ligeramente comprimida.

10:00

Vale.

10:00

Si estás fotografiando una puesta de sol con

10:03

miles de degradados de color supersutiles, la compresión

10:07

JPG destruye esa belleza.

10:09

¿Ves cómo va?

10:10

Tienes bandas de color abruptas, ¿verdad?

10:12

Sí, claro, se pixela todo.

10:14

Eso equivaldría a pedirle a la IA que

10:16

escriba poesía compleja o literatura muy emocional.

10:20

Ahí sí necesitas la máxima precisión, los 16

10:23

bits, para captar los matices del lenguaje humano.

10:26

Ya, pero el código informático no es un

10:29

atardecer.

10:30

Exacto.

10:31

El código es más bien como un plano

10:32

arquitectónico.

10:33

Es verdad, es pura lógica.

10:35

Es como un mapa de carreteras o un

10:36

plano en blanco y negro.

10:38

Si tú comprimes un plano arquitectónico JPG, las

10:41

líneas siguen estando claras.

10:42

Una puerta sigue siendo una puerta y un

10:45

muro es un muro.

10:45

Increíblemente rígida y estructurada.

10:47

Una llave de cierre o un bucle condicional

10:49

no requieren de sutilezas poéticas.

10:52

Por tanto, reducir la precisión matemática de los

10:55

pesos neuronales de 16 a 8 bits ahorra

10:58

una cantidad colosal de memoria y energía en

11:01

los servidores.

11:02

¿Y el modelo sigue siendo perfectamente capaz de

11:04

seguir la lógica de la programación?

11:06

Eso es.

11:07

Además, sacrificar esa precisión permite mantener mucha más

11:11

cantidad de código en esa caché ultra rápida

11:14

de la que hablábamos.

11:15

Es un intercambio técnico brillante para este caso

11:17

de uso en concreto.

11:18

Viéndola así, la verdad es que tiene una

11:20

lógica aplastante.

11:22

Optimización matemática por un lado, más una gestión

11:25

de memoria inteligente por otro.

11:26

Así es.

11:27

Pero, a ver, por mucha tecnología que haya

11:30

detrás, el verdadero terremoto, lo que hace que

11:33

estemos analizando todo esto hoy, es su modelo

11:36

de negocio.

11:37

Totalmente.

11:37

Ahí está la disrupción real.

11:39

Y aquí es donde la propuesta de NeuralWatt

11:42

Cloud se vuelve verdaderamente rompedora.

11:45

Se presentan como la primera API de inferencia

11:48

de IA con precios basados en energía.

11:51

¡Qué locura!

11:51

Están cobrando 5 dólares por kilowatt y hora

11:54

consumido por sus servidores.

11:56

Ni rastro de los clásicos precios por millón

11:59

de tokens.

12:00

Y yo me pregunto, ¿por qué la industria

12:02

adoptó el precio por token en primer lugar,

12:04

si ahora resulta que facturar por energía es

12:07

más justo?

12:08

Bueno, la historia del precio por token nace

12:10

de una necesidad de abstracción, básicamente.

12:13

De hacerlo más fácil para el cliente.

12:15

Claro.

12:15

Cuando OpenAI y otros pioneros lanzaron sus primeras

12:18

APIs, necesitaban una métrica que el usuario final

12:21

pudiera entender y predecir de forma sencilla.

12:23

Un token, que equivale más o menos a

12:26

tres cuartas partes de una palabra, pues era

12:28

una unidad fácil de calcular.

12:30

Era como un puente psicológico entre el texto

12:33

humano y el cálculo de la máquina.

12:36

Exactamente.

12:36

Pero claro, el token siempre fue un parche,

12:39

un representante muy imperfecto del verdadero coste real.

12:44

Porque entiendo que no todos los tokens exigen

12:47

el mismo esfuerzo físico a la máquina, ¿no?

12:49

Efectivamente.

12:50

Generar un token para la palabra hola en

12:53

un saludo básico casi no consume ciclos de

12:56

procesador.

12:57

Es pan comido.

12:57

Pero generar un token que resuelve un problema

13:00

matemático complejo o que requiere conectar conceptos a

13:03

lo largo de 100 páginas de contexto.

13:05

Claro, ahí la cosa cambia.

13:07

Hace que las tarjetas gráficas de los servidores

13:09

trabajen al máximo, consumiendo picos masivos de electricidad.

13:14

Y al unificarlo todo bajo un precio por

13:16

token, los proveedores de la nube estaban promediando

13:20

los costes.

13:20

O sea que unos subsidiaban a otros.

13:22

Eso es.

13:23

NeuralWatt elimina esa abstracción por completo.

13:26

Prometen una transparencia energética del 100 por ciento.

13:30

Si tu petición es fácil, el servidor consume

13:33

poca electricidad y pagas poquísimo.

13:35

Y si tu petición es compleja, ¿pagas más?

13:38

Claro.

13:39

Pero siempre pagas por el estrés físico real

13:41

del servidor, no por un margen de beneficio

13:44

arbitrario que esté escondido detrás de una palabra.

13:46

Fíjate, para visualizar bien este cambio de paradigma

13:49

comercial, imaginemos una panadería tradicional.

13:53

Me gustan tus analogías.

13:54

A ver.

13:55

El estándar de la industria hasta ahora ha

13:57

sido entrar a la panadería y pagar un

13:59

precio fijo por cada rebanada de pan que

14:02

te llevas.

14:03

Ajá.

14:03

Al panadero le da exactamente igual.

14:05

Si para hacer esa rebanada ha usado una

14:08

amasadora industrial gigante durante horas o si lo

14:11

ha hecho a mano en dos minutos, te

14:13

cobra la rebanada a precio fijo.

14:14

Tal cual.

14:15

Pues el modelo de Neural Watt es como

14:17

decirle al panadero oye, no te voy a

14:20

pagar por la cantidad de pan que salga.

14:23

Te voy a conectar un medidor eléctrico al

14:26

horno y a la amasadora y te pagaré

14:28

exclusivamente por la electricidad que consuman tus máquinas

14:32

mientras trabajas para mí.

14:33

Espectacular.

14:34

Si resulta que con muy poca electricidad puedes

14:38

sacar 50 barras de pan porque eres super

14:40

eficiente, el beneficio de ese ahorro me lo

14:43

llevo yo como cliente.

14:44

Es una analogía perfecta, la verdad.

14:46

Y la razón por la que Neural Watt

14:48

se atreve a conectar ese medidor eléctrico de

14:50

cara al público es porque saben de sobra

14:52

que tienen unas máquinas increíblemente eficientes.

14:55

Están muy seguros de sí mismos.

14:57

Es que afirman ser un 40 por ciento

14:59

más eficientes energéticamente que la media del sector.

15:02

Tela.

15:03

Y ojo, no sólo en coste, sino también

15:05

en velocidad.

15:06

Su documentación oficial, que es la de la

15:08

tienda, es la de la tienda.

15:08

Su documentación oficial refleja una mediana de tiempo

15:09

hasta el primer token, lo que en la

15:11

industria se llama TTFT, inferior a los 50

15:14

milisegundos.

15:15

O sea, medio segundo.

15:17

Es prácticamente instantáneo desde que pulsas la tecla

15:20

de intro.

15:20

Exacto.

15:21

Pero claro, al revisar cómo logran esa velocidad

15:24

extrema, la documentación te lanza una pared de

15:27

jerga técnica brutal.

15:28

Hablan de VLMM, de procesamiento por lotes continuo

15:32

o continuos batching y de paralelismo tensorial.

15:35

Suena súper intimidante, sí.

15:38

Impresionante, pero necesitamos aterrizar todo esto.

15:41

¿Qué significan realmente estas arquitecturas en las tripas

15:44

de un centro de datos?

15:45

Pues bajémoslo al mundo físico.

15:47

Empecemos por el procesamiento por lotes tradicional.

15:50

Imagina que los servidores son como autobuses urbanos.

15:54

Vale.

15:54

En los sistemas antiguos, el autobús esperaba en

15:57

la parada hasta que se llenaba de pasajeros,

15:59

es decir, de peticiones de los usuarios.

16:02

Cerraba las puertas y hacía el trayecto entero

16:05

antes de volver a abrir.

16:06

O sea, que si era ser el primer

16:08

pasajero en subir, tenías que esperar ahí sentado

16:12

a que se llenara el autobús.

16:13

Exactamente.

16:14

Una pérdida de tiempo, pues el procesamiento por

16:18

lotes continuo, el continuous batching, cambia ese autobús

16:21

por un remonte de esquí continuo.

16:23

Ah, qué buena imagen mental.

16:26

Las peticiones de los usuarios se suben y

16:28

bajan de la tarjeta gráfica constantemente, en tiempo

16:31

real, sin esperar a que otros terminen.

16:33

Nadie espera.

16:34

Por eso el tiempo de respuesta baja a

16:36

esos segundos.

16:38

Clarísimo.

16:39

¿Y qué hay de lo del paralelismo tensorial?

16:42

Porque la palabra tensor, a ver, siempre impone

16:46

un poco de respeto.

16:47

Sí, sí impone.

16:48

A ver, el paralelismo tensorial soluciona un problema

16:50

puramente de tamaño.

16:52

Cuéntame.

16:53

Imagina que tienes que transportar un bloque de

16:55

piedra de 100 toneladas, pero tus camiones sólo

16:58

aguantan 20 toneladas cada uno.

17:01

Evidentemente no puedes meter la piedra en un

17:03

solo camión.

17:04

Eso es.

17:04

El paralelismo tensorial es la capacidad de transportar

17:08

ese bloque matemático en pedazos perfectos, poner cada

17:11

pedazo en un camión distinto, que en este

17:13

caso serían múltiples tarjetas gráficas, y hacer que

17:16

todos esos camiones conduzcan a la misma velocidad

17:19

milimétrica para que el sistema funcione como un

17:21

solo motor gigante.

17:23

Porque cuando tienes modelos de IA enormes, claro,

17:25

no caben en un solo chip.

17:27

Imposible.

17:28

Tienes que dividirlos y hacerlos sin perder velocidad.

17:31

Es un prodigio absoluto de la ingeniería.

17:34

Totalmente.

17:34

Pero claro, todo esto suena a una infraestructura

17:38

colosal, y esto me hace pensar que, a

17:41

ver, no montas un sistema de remonte continuo

17:44

y transporte de 100 toneladas simplemente para que

17:47

desarrolladores independientes se ahorren unos dólares en sus

17:50

proyectillos de fin de semana, ¿no?

17:52

Desde luego que no.

17:53

Tiene que haber una estrategia corporativa a gran

17:56

escala detrás de esto.

17:57

Sí la hay.

17:58

Y revisando la documentación, la verdad es que

18:00

se ve claramente.

18:02

NeuralWatt no es solo una API suelta.

18:04

Han desplegado todo un ecosistema con tres pilares.

18:08

Exacto.

18:08

Han diseñado una arquitectura pensada para colorizar el

18:11

mundo empresarial.

18:12

Cuéntanos.

18:13

El primer pilar es NeuralWatt Cloud, que es

18:16

el servicio alojado en la nube que utilizó

18:18

nuestro usuario de Reddit, ¿no?

18:19

La solución rápida y accesible para cualquiera.

18:22

Vale.

18:22

Pero el segundo pilar es donde la cosa

18:25

se pone seria de verdad.

18:26

NeuralWatt Deploy.

18:28

Ajá, para empresas.

18:29

Esto permite a las grandes corporaciones llevarse toda

18:32

esta magia de optimización de energía e instalarla

18:35

directamente en sus propios centros de datos.

18:37

En sus servidores privados.

18:39

Garantizando la seguridad y el control absoluto de

18:42

sus datos corporativos.

18:43

Exacto.

18:43

Lo que se conoce como infraestructura on -premise,

18:46

que es vital para sectores como la banca

18:48

o la sanidad.

18:49

Lógico.

18:50

¿Y cuál es el tercer pilar?

18:52

El tercer pilar es el cerebro subyacente de

18:54

todo.

18:55

NeuralWatt Optimize.

18:56

Ah, el software de control.

18:58

Eso es.

18:58

Es el motor de software que regula el

19:00

consumo de electricidad en tiempo real de esas

19:02

tarjetas gráficas.

19:04

Hace como malabarismos constantes entre el rendimiento que

19:07

exige el modelo de IA y el voltaje

19:09

que se le inyecta al procesador.

19:10

Buscando siempre el punto de máxima eficiencia, supongo.

19:13

Exactamente.

19:14

Y aseguran que logran ahorrar enormes cantidades de

19:17

energía con una penalización en el rendimiento, fíjate,

19:20

inferior al cero con un por ciento.

19:23

O sea que el ahorro no sacrifica ni

19:25

la velocidad ni la calidad para nada.

19:27

Nada.

19:27

Es imperceptible.

19:29

Y creo que esa mínima penalización va a

19:31

ser crucial para lo que viene.

19:33

Porque está claro que no estamos estancados en

19:35

los modelos actuales.

19:37

Esto avanza muy rápido.

19:38

La propia NeuralWatt anuncia en su web una

19:41

lista de futuros modelos soportados que la verdad

19:44

da bastante vértigo.

19:45

Sí, sí.

19:46

Hablan del inminente Devstral 2 de 123 .000

19:49

millones de parámetros de Mistral, el Yema 4

19:52

de 31 .000 millones o el gigantesco GPTOS

19:56

de 120 .000 millones.

19:58

Monstruos.

19:59

Son auténticos monstruos.

20:01

Y a medida que escalamos a estos titanes,

20:04

la pura fuerza bruta eléctrica se mete en

20:07

el problema central de todos.

20:09

Ya no se trata sólo de quién tiene

20:11

el modelo más listo, sino de quién puede

20:13

mantener los servidores encendidos sin ir a la

20:16

bancarrota.

20:17

Has dado en el clavo.

20:18

Ese es el verdadero campo de batalla de

20:20

la próxima década.

20:21

Históricamente, el cuello de botella era el acceso

20:24

al conocimiento, el conseguir los pesos matemáticos del

20:27

modelo.

20:28

Claro.

20:29

Hoy, la tendencia hacia el código abierto está

20:31

democratizando el acceso a modelos excepcionales.

20:34

Cualquiera puede tenerlos.

20:36

La barrera de entrada ya no es el

20:38

software.

20:38

Ahora es puramente el hardware y la factura

20:41

de la luz.

20:41

Madre mía.

20:42

Las empresas que puedan ofrecer la inferencia más

20:45

eficiente por vatio consumido van a ser las

20:47

que dominen la infraestructura del futuro.

20:49

Y ojo, porque están empujando esta adopción de

20:51

forma súper agresiva desde las trincheras.

20:54

Ya te digo.

20:54

Volviendo al hilo de Reddit que originó todo

20:57

esto, se veía claramente cómo fomentan el boca

21:01

a boca entre los usuarios.

21:02

Sí, con los programas de referidos.

21:05

Exacto.

21:05

Por ejemplo, un usuario llamado Aotrex le decía

21:08

al autor original que si hubiera usado su

21:11

código de referidos, ambos habrían ganado saldo.

21:14

Concretamente, ofrecen un sistema donde si gastas 10

21:18

dólares, te regalan otros 10 y el que

21:20

te invitó se lleva 20.

21:22

Es un incentivo brutal.

21:23

Sumado a un crédito inicial de 5 dólares

21:26

solo por crear la cuenta de prueba.

21:29

Están inyectando capital real directamente en los bolsillos

21:32

de los desarrolladores para obligarlos, las compañías, a

21:36

probar el sistema.

21:37

Y está funcionando, claro.

21:38

Vaya que sí.

21:39

En ese mismo foro, usuarios como Milquipidia expresaban

21:44

su angustia existencial.

21:46

Y lo digo en serio, porque con su

21:48

plan de suscripción actual, el Zeta .ai Lite,

21:51

estaban quemando 340 millones de tokens a la

21:55

semana.

21:55

Qué barbaridad.

21:56

Una necesidad absoluta de supervivencia financiera.

22:00

Totalmente.

22:01

Y esto nos plantea una disyuntiva fascinante para

22:03

los gigantes tecnológicos internacionales.

22:06

A ver.

22:06

Porque las grandes empresas de IA han construido

22:09

imperios enteros basados en modelos de suscripción mensual

22:12

o facturación por volumen de tokens, ¿verdad?

22:14

Sí.

22:15

Estos modelos, que son típicos del software como

22:17

servicio, están diseñados para generar ingresos recurrentes, altamente

22:21

predecibles.

22:22

Lo cual, claro, encanta a los inversores de

22:25

Wall Street.

22:25

Todo cuadra a final de mes.

22:27

Pero a menudo ocultan el hecho de que

22:29

los usuarios que apenas usan el servicio están

22:31

de alguna manera subsidiando los inmensos costes de

22:34

computación de los superusuarios.

22:35

La facturación por energía expone la cruda realidad

22:38

del coste del hardware.

22:40

Obliga a una transparencia total en el mercado.

22:43

Exacto.

22:43

Lo cual me lleva a la gran pregunta

22:45

de la industria que quería hacerte.

22:47

Si esta migración hacia el pago por kilovatio

22:49

gana tracción masiva entre los desarrolladores pesados, ¿crees

22:54

que los titanes de la industria se verán

22:56

obligados a abandonar sus opacos multiplicadores por token

22:58

y adoptar métricas estrictas de consumo eléctrico?

23:02

Porque de ser así, sus márgenes de beneficio

23:04

podrían sufrir un impacto monumental.

23:06

Pues mira, van a resistirse todo lo que

23:08

puedan.

23:09

De eso no hay duda.

23:10

Yo también lo creo.

23:11

Desmontar un modelo de precios opaco pero inmensamente

23:14

rentable es algo que ninguna corporación va a

23:16

hacer voluntariamente.

23:17

Obvio.

23:18

Pero, claro, si competidores como NeuralWatt logran demostrar

23:22

que escalar modelos de 120 .000 millones de

23:25

parámetros es viable pagando solo el coste de

23:27

la electricidad más un pequeño margen, el mercado

23:30

corporativo forzará el cambio.

23:32

Las propias empresas lo van a exigir.

23:34

Exacto.

23:35

Las direcciones financieras de las grandes empresas que

23:38

compran estos servicios van a exigir auditorías del

23:41

coste real por vatio y no estarán dispuestas

23:43

a seguir pagando ese impuesto del token si

23:45

pueden evitarlo de alguna manera.

23:47

Es que es asombroso observar el clásico efecto

23:50

mariposa de la tecnología desplegándose justo ante nuestros

23:53

ojos.

23:54

Comenzamos analizando un simple pantallazo en un foro

23:58

donde alguien celebraba haberse gastado menos de lo

24:01

que cuesta un café.

24:02

Ya.

24:02

Y al tirar del hilo nos encontramos con

24:05

que una optimización de memoria mediante cuantización FP8,

24:09

sumada a la eficiencia del procesamiento por lotes

24:12

continuo, ha dado a luz a un modelo

24:15

de negocio que amenaza con reestructurar literalmente cómo

24:19

se comercializa el intelecto sintético a nivel mundial.

24:22

Es una pasada, sí.

24:23

Para quienes construyen software hoy en día, esto

24:25

significa acceder a un nivel de experimentación e

24:28

iteración que era financieramente prohibitivo hace solo unos

24:32

meses y eso, fíjate, nos empuja hacia una

24:34

reflexión ineludible que quiero dejar hoy en el

24:36

aire para que le demos una vuelta.

24:38

A ver, cuéntanos si la capacidad computacional necesaria

24:41

para analizar, reescribir y optimizar arquitecturas enteras de

24:45

software pasa a costar meros céntimos gracias al

24:47

uso inteligente de cachés y a la facturación

24:49

energética.

24:50

Sí, cabe preguntarnos dónde residirá el verdadero valor

24:53

del profesional de la tecnología en el próximo

24:55

lustro.

24:56

Wow, buena pregunta.

24:57

Todo apunta a que vamos a asistir a

24:59

una evolución muy profunda.

25:01

El trabajo diario dejará de centrarse en ser

25:04

un escritor de código meticuloso.

25:06

Claro, porque eso ya lo hará la máquina

25:08

casi gratis.

25:09

Exacto.

25:09

La labor fundamental será la de actuar como

25:12

un gestor de flujos de energía y un

25:14

orquestador de contexto masivo.

25:16

Qué potente.

25:17

Es un horizonte apasionante, la verdad, y desafía

25:20

las bases mismas de lo que consideramos trabajo

25:23

intelectual de alto valor hoy en día.

25:25

Pues con esa reflexión final nos vamos a

25:27

quedar hoy.

25:27

Antes de despedirnos hasta el próximo programa, os

25:30

informamos de que las voces que oyes han

25:32

sido generadas por la IA de Notebook LM

25:34

y que dirigiendo el podcast se encuentra Julio

25:37

Pablo Vázquez, un humano que te envía saludos.

25:39

En caso de error, probablemente sean errores humanos.

25:42

Nos escuchamos.

25:54

Y hasta aquí el episodio de hoy.

25:56

Muchas gracias por tu atención.

26:08

Esto es BIMPRAXIS.

26:10

Nos escuchamos en el próximo episodio.