Cómo Funcionan los Modelos de Lenguaje

Una explicación no técnica de cómo los modelos de lenguaje de IA generan texto.

Los Modelos de Lenguaje Grandes (LLM) como ChatGPT, Claude y otros son la tecnología detrás de los asistentes de IA modernos. Comprender cómo funcionan — a nivel conceptual — te ayuda a usarlos más efectivamente y a reconocer sus limitaciones. La idea clave: predicen qué texto debería venir a continuación, una pieza a la vez.

Objectives

  • Comprender el concepto básico de predicción del siguiente token
  • Explicar por qué los LLM pueden parecer conocedores sin "saber" nada
  • Reconocer cómo los datos de entrenamiento moldean el comportamiento del modelo
  • Comprender por qué los LLM pueden generar información falsa que suena plausible
  • Apreciar la diferencia entre recuperación y generación

Key Takeaways

  • Los LLM predicen texto una pieza a la vez basados en patrones aprendidos
  • No recuperan hechos de una base de datos — generan texto probable
  • Los datos de entrenamiento determinan qué patrones aprendió el modelo
  • Una salida que suena plausible no es lo mismo que una salida correcta
  • El modelo no tiene forma de verificar lo que genera