¿Y si un modelo pudiera tomar decisiones sin escribir ni una sola palabra?
Eso es lo que propone Jev, el modelo que acaba de lanzar TypeSafe.
Le das un contexto y una lista de preguntas con sus respuestas posibles, y te devuelve la opción elegida, la probabilidad de cada opción y un valor de confianza. Como un examen tipo test.
Es lo que se comenta en X desde el lanzamiento.
Y puede haber parte de razón.
La arquitectura Transformer original tenía dos partes, el encoder y el decoder.
Los modelos GPT se quedaron con el decoder, porque su objetivo era generar texto.
En 2018 Google publicó BERT e hizo la apuesta contraria, quedarse solo con el encoder.
Un encoder no sirve para generar texto, pero entiende muy bien. Lee la frase entera de una vez, mirando las palabras de antes y las de después, y construye una representación de lo que significa.
Y con un encoder pre-entrenado y una pequeña cabeza de clasificación encima, se lleva años construyendo clasificadores rápidos y baratos.
Entonces, ¿por qué se presenta Jev como una revolución?
Eso es lo que abordamos en el episodio premium junto a lo que se sabe sobre su entrenamiento y arquitectura.
En menos de 48 horas tras su lanzamiento aparecieron seis reimplementaciones open source de Jev.
Y como en el open source sí se publican arquitecturas, datos y recetas, los clones nos enseñan mucho sobre cómo podría estar construido el original.
Este episodio se apoya mucho en los anteriores de la saga, sobre todo en el del Transformer y en el del ajuste fino.
Es buen momento para repasarlos junto a este capítulo del libro sobre cómo construir un LLM desde cero.
🎧 Escucha el episodio premium completo para entender qué hay detrás de Jev, qué aporta de verdad y por dónde empezar si os apetece trastear con alguno de los clones.
Si tenéis dudas, nos vemos en Discord.