Ajustes de IA al descubierto: temperatura, tokens, top-P y más (glosario 2026)
Guides

Ajustes de IA al descubierto: temperatura, tokens, top-P y más (glosario 2026)

Si has pasado aunque sea un rato con herramientas de IA — especialmente en el lado de la API — probablemente ya te has topado con términos como temperatura, top-p, tokens, ventana de contexto, RLHF y una docena más. La mayoría de la documentación los explica dando por sentado que ya sabes algo al respecto. Este glosario es la versión que yo hubiera querido tener cuando empecé: definiciones sencillas, para qué sirve cada término y cuándo realmente lo tocarías.

Está organizado en cinco bloques — elige la sección que necesitas o léelo de principio a fin como introducción.

1. Tokens & contexto

Antes de hablar de configuraciones, necesitas el vocabulario para entender qué consume y produce el modelo.

Visualización de texto dividido en fragmentos de tokens de colores

Token

La unidad básica que un modelo de lenguaje lee y escribe. Un token suele ser un fragmento de algunos caracteres — a veces una palabra corta completa ("gato"), a veces un fragmento ("ción", "mente"), a veces un solo carácter o incluso un byte. Como regla general para el español, 1 token ≈ 4 caracteres ≈ ¾ de una palabra, así que 1.000 tokens equivalen a unas 750 palabras. Los precios casi siempre se cobran por token (entrada y salida por separado).

Tokenizador

La función que convierte el texto en tokens antes de que el modelo lo vea. Las distintas familias de modelos utilizan tokenizadores diferentes, por eso un mismo párrafo puede tener un coste ligeramente diferente en distintas plataformas.

Ventana de contexto (también: longitud de contexto)

El número máximo de tokens que el modelo puede tener "en mente" a la vez — incluyendo tu prompt, las instrucciones del sistema, la conversación previa y la respuesta que está generando. Los modelos de frontera modernos ofrecen ventanas de 200K–1M tokens; los modelos más antiguos o económicos ofrecen entre 8K y 32K. Si lo superas, el contenido más antiguo se descarta o la llamada falla.

Tokens de entrada vs. tokens de salida

Los tokens de entrada son lo que envías (prompt, mensaje del sistema, historial, documentos adjuntos). Los tokens de salida son lo que el modelo genera como respuesta. Los tokens de salida suelen costar entre 3 y 5 veces más que los de entrada, porque generar es más difícil que leer.

Máximo de tokens (max_output_tokens)

Un límite por solicitud sobre cuántos tokens se le permite generar al modelo antes de detenerse. Ajústalo para controlar el coste y la latencia. Muchas APIs tienen por defecto unos pocos miles; auméntalo para respuestas largas, redúcelo para mantenerlas cortas.

2. Los controles de muestreo

Cuando un modelo elige el siguiente token, tiene una distribución de probabilidad sobre todos los posibles tokens siguientes. Los controles de muestreo determinan cómo esa distribución se convierte en una única elección. Estas son las palancas que la mayoría de la gente toca desde la API.

Diagrama de distribución de probabilidad que muestra cómo la temperatura, top-p y top-k remodelan la elección del siguiente token por parte del modelo

Temperatura

Controla la aleatoriedad general. Una temperatura baja (0–0,3) hace que el modelo elija casi siempre el token más probable — determinista, repetitivo, "seguro". Una temperatura alta (1,0+) aplana la distribución de probabilidad, haciendo viables tokens menos probables — más creativo, más sorprendente, más propenso a errores. Un buen punto de partida para la mayoría de los casos de uso de chat es 0,7. Baja a 0,0–0,2 para código, matemáticas o extracción de datos concretos. Sube a 1,0+ para escritura creativa o lluvia de ideas.

Top-P (muestreo de núcleo)

En lugar de considerar todos los tokens, top-p dice: "considera solo el conjunto mínimo de tokens cuya probabilidad acumulada sea al menos P". Así, con top-p = 0,9, el modelo muestrea de los tokens que juntos cubren el 90% de la masa de probabilidad, ignorando la larga cola. Es una alternativa más inteligente y dinámica al top-k. Valor predeterminado habitual: 0,9 o 1,0 (desactivado).

Top-K

Considera únicamente los K tokens más probables siguientes y muestrea entre ellos. Top-k = 1 es la decodificación voraz (elige siempre el token más probable); top-k = 40 mantiene los 40 mejores candidatos. Las APIs modernas (OpenAI, Anthropic) a menudo no exponen top-k directamente porque top-p tiende a comportarse mejor, pero es estándar en los modelos de código abierto.

Penalización por frecuencia

Penaliza los tokens que ya se han generado en la respuesta hasta ese momento, en proporción a las veces que han aparecido. Es útil para reducir la repetición literal. El rango suele ser de -2,0 a +2,0; el valor predeterminado es 0.

Penalización por presencia

Similar a la penalización por frecuencia, pero binaria: penaliza los tokens que hayan aparecido alguna vez, independientemente de cuántas. Empuja al modelo a introducir nuevos temas o palabras. Mismo rango, mismo valor predeterminado.

Secuencias de parada

Cadenas de texto que obligan al modelo a detener la generación en cuanto las produce. Muy útil para salidas estructuradas ("para cuando generes ###") o para mantener las respuestas dentro de un formato concreto.

Semilla (seed)

Un número entero que fija el generador de números aleatorios. El mismo prompt + la misma semilla + la misma versión del modelo produce normalmente la misma salida, lo cual es fundamental para la reproducibilidad, las evaluaciones y la depuración. Ten en cuenta que la mayoría de los proveedores describen esto como "con el mejor esfuerzo" — el determinismo perfecto no está garantizado entre distintas infraestructuras.

Comparación rápida: temperatura vs. top-p vs. top-k

Los tres controles de muestreo, uno al lado del otro

ControlQué haceRango típicoSubir el valorBajar el valor
TemperaturaAgudiza o aplana toda la curva de probabilidad0,0 – 2,0 (por defecto ~0,7)Más creativo, más aleatorioMás determinista, más repetitivo
Top-PMantiene solo los tokens que cubren P% de la masa de probabilidad0,0 – 1,0 (por defecto 0,9 – 1,0)Más variedad en la elección de palabrasResultados más precisos y seguros
Top-KMantiene solo los K tokens más probables1 – ∞ (a menudo desactivado en APIs modernas)Más variedadMás preciso; K=1 = decodificación voraz

Error frecuente: ajustar los tres a la vez. Elige uno — normalmente temperatura para controlar la creatividad, o top-p para ajustar la diversidad — y deja los demás en sus valores predeterminados. Acumular penalizaciones sobre una temperatura baja es el origen de la mayoría de los reportes de "resultados extraños".

3. Cómo piensan los modelos

No necesitas ser un ingeniero de ML para usar herramientas de IA, pero algunos términos de arquitectura aparecen constantemente en las comparativas de productos.

Parámetros

Los números dentro del modelo que se ajustan durante el entrenamiento. Un "modelo de 70B" tiene 70.000 millones de ellos. Más parámetros implica generalmente más inteligencia y más coste, aunque esa relación se ha vuelto menos lineal a medida que las arquitecturas han mejorado — un modelo más pequeño bien entrenado puede superar a uno más grande pero anticuado.

Embedding (representación vectorial)

Un vector (una lista de números) que representa el significado de un fragmento de texto en un espacio de alta dimensión. Los textos con significados similares acaban cerca los unos de los otros. Los embeddings impulsan la búsqueda semántica, el RAG, la deduplicación, la clasificación y la recomendación. Son distintos de un modelo de chat — los modelos de embedding son más pequeños y especializados.

Atención (attention)

El mecanismo que permite a un modelo decidir, al generar cada nuevo token, en cuáles de los tokens anteriores debe "fijarse" más. Es la innovación central de los transformers. Rara vez lo tocarás directamente, pero explica por qué las ventanas de contexto importan tanto.

Transformer

La arquitectura de red neuronal que hay detrás de prácticamente todos los grandes modelos de lenguaje modernos desde 2017. Cuando alguien dice "un LLM", casi siempre se refiere a un transformer.

Mezcla de expertos (Mixture of Experts, MoE)

Una arquitectura en la que el modelo se divide en muchas subredes "expertas" y solo una fracción de ellas se activa para cada token. Esto significa que un modelo puede tener, digamos, 400B de parámetros en total pero usar solo 30B por token — obteniendo el conocimiento de un modelo grande a la velocidad de uno pequeño. Varios modelos de frontera utilizan MoE internamente.

Modelo de razonamiento

Un modelo entrenado para dedicar cómputo adicional a "pensar" — generando pasos de razonamiento interno — antes de producir su respuesta final. Esto mejora drásticamente el rendimiento en matemáticas, programación y tareas de razonamiento complejo, pero aumenta la latencia y el coste en tokens. Los modelos de razonamiento son la categoría dominante en el nivel de frontera en 2026.

Cadena de pensamiento (Chain-of-thought, CoT)

Tanto una técnica de prompting ("piensa paso a paso") como un comportamiento incorporado en los modelos de razonamiento, donde el modelo genera pasos intermedios antes de su respuesta final. Esos pasos de razonamiento a veces se ocultan al usuario; con los modelos de razonamiento generalmente los pagas como tokens de salida de todas formas.

Cuantización

Reducir la precisión numérica de los parámetros de un modelo (por ejemplo, de flotantes de 16 bits a enteros de 4 bits) para reducir su tamaño y aumentar la velocidad, normalmente con un pequeño coste en calidad. Muy extendida en el mundo del código abierto; menos visible cuando se usan modelos de API cerrada.

4. Entrenamiento & alineación

Cómo una montaña de texto se convierte en un modelo que responde cortésmente a tus preguntas.

Preentrenamiento

La primera y más costosa etapa del entrenamiento, donde el modelo aprende lenguaje general y conocimiento del mundo prediciendo el siguiente token a partir de enormes cantidades de texto. Aquí es de donde proviene la mayor parte de la "inteligencia".

Ajuste fino (fine-tuning)

Una segunda etapa de entrenamiento que adapta un modelo preentrenado a una tarea o estilo más concreto, usando un conjunto de datos mucho más pequeño. Se usa para la especialización en dominios (médico, legal, programación) o para alinear el tono y el comportamiento con una marca concreta.

RLHF (Aprendizaje por refuerzo con retroalimentación humana)

La técnica de alineación que convirtió los modelos de lenguaje en bruto en asistentes útiles. Los humanos puntúan las salidas del modelo; se entrena un modelo de recompensa con esas puntuaciones; luego el modelo de lenguaje se ajusta con aprendizaje por refuerzo para producir salidas que el modelo de recompensa prefiere. El RLHF es lo que hace que ChatGPT y Claude rechacen solicitudes dañinas, sigan instrucciones con cortesía y se mantengan en el tema. RLAIF (con retroalimentación de IA) es una técnica relacionada que ahora se usa a escala.

Prompt del sistema (system prompt)

La instrucción de nivel superior que establece el rol, el tono, las restricciones y la personalidad del modelo para toda una conversación. La mayoría de los proveedores le dan mayor prioridad que a los mensajes del usuario. Aquí es donde le dices al modelo lo que es, antes de cualquier tarea concreta.

Alucinación

Cuando el modelo produce una respuesta que suena convincente pero es factualmente incorrecta o inventada. Causada por una combinación de lagunas en los datos de entrenamiento, la tendencia del modelo a generar texto que suena plausible en lugar de verificar, y una redacción excesivamente confiada. Soluciones: bajar la temperatura, usar RAG (darle fuentes reales), instrucciones explícitas del tipo "di que no sabes", y verificar siempre lo importante.

Ingeniería de prompts

La práctica de escribir prompts que produzcan de forma fiable el resultado que buscas. Incluye cosas como la definición de rol ("eres un..."), ejemplos de pocos disparos (few-shot), disparadores de cadena de pensamiento e instrucciones para salida estructurada. A medida que los modelos han mejorado siguiendo instrucciones, la ingeniería de prompts ha pasado de trucos arcanos a escritura clara y directa.

5. Poniendo los modelos a trabajar

Los términos que escucharás en conversaciones de producto e ingeniería, no de entrenamiento.

Inferencia

El acto de ejecutar un modelo entrenado — es decir, generar salida para una entrada dada. Distinto del entrenamiento. El coste de inferencia es en lo que se basan los precios de la API, y la latencia de inferencia es lo que perciben los usuarios.

RAG (Generación aumentada por recuperación)

Antes de responder, se recuperan documentos relevantes de una base de conocimiento separada (normalmente mediante búsqueda por similitud de embeddings) y se insertan en el prompt como contexto. El RAG permite que un modelo pequeño o genérico responda con precisión sobre tus documentos privados, eventos actuales o cualquier cosa fuera de sus datos de entrenamiento. Es el patrón dominante para "una IA que conoce mis cosas".

Uso de herramientas / llamada a funciones

Permitir que el modelo invoque funciones o APIs externas como parte de su respuesta — por ejemplo, "consultar el tiempo", "hacer una consulta a una base de datos", "enviar un correo". El modelo emite una solicitud estructurada, tu código la ejecuta y le devuelves el resultado. Esto es lo que convierte a un LLM en algo capaz de actuar, no solo de hablar.

Agente

Un bucle en el que un modelo usa herramientas y toma sus propias decisiones a lo largo de varios pasos para completar un objetivo — por ejemplo, navegar por la web, editar archivos o ejecutar un flujo de trabajo de múltiples pasos. Los agentes modernos son esencialmente "modelo de razonamiento + herramientas + bucle de iteración". Es un término difuso que abarca desde un bot de atención al cliente hasta un asistente de programación autónomo.

Multimodal

Un modelo que maneja más que solo texto — lo más habitual es imágenes y texto juntos (visión), y cada vez más audio y vídeo también. "Multimodal" suele referirse a un único modelo que entiende de forma nativa múltiples modalidades, no a un conjunto de modelos separados encadenados.

Visión (o VLM — Modelo de Visión y Lenguaje)

Un caso concreto de multimodal: el modelo puede recibir imágenes como entrada junto con texto. Se usa para OCR, comprensión de diagramas, depuración de capturas de pantalla, análisis de documentos y cualquier situación en la que "mostrar en lugar de describir" marque la diferencia.

Streaming

El modelo envía su respuesta token a token a medida que la genera, en lugar de esperar a que la respuesta completa esté lista. Es fundamental para la experiencia de usuario en el chat — los usuarios ven la respuesta desplegarse en lugar de quedarse mirando un indicador de carga. Se implementa como eventos enviados por el servidor (server-sent events) en la mayoría de las APIs.

Tiempo hasta el primer token (TTFT)

El tiempo que transcurre desde que se envía una solicitud hasta que se recibe el primer token de la respuesta. La latencia que el usuario realmente percibe. Los modelos de razonamiento tienen un TTFT más alto porque piensan antes de hablar; los modelos sin razonamiento transmiten el primer token en fracciones de segundo.

Tokens por segundo

El rendimiento una vez que comienza la generación. Un modelo rápido moderno puede producir entre 80 y 200+ tokens por segundo; los modelos de razonamiento suelen ser más lentos porque generan (y pagan) tokens de razonamiento ocultos.

La hoja de referencia más breve posible

Si no recuerdas nada más:

  • Token = ¾ de una palabra. El precio es por token.
  • Ventana de contexto = cuánto texto puede ver el modelo a la vez.
  • Temperatura = el dial de creatividad. Baja para datos concretos y código, alta para ideas.
  • Top-P = una alternativa más inteligente y moderna al top-k. Déjalo en el valor predeterminado salvo que tengas una razón para cambiarlo.
  • Prompt del sistema = la personalidad y las reglas para toda la conversación.
  • RAG = cómo hacer que un modelo sepa sobre tus cosas privadas.
  • Modelo de razonamiento = más lento, más caro, mucho más inteligente en problemas difíciles.
  • Alucinación = una respuesta incorrecta dada con total confianza. Verifica siempre.

Eso cubre la mayor parte de lo que te encontrarás día a día. El resto de este glosario está aquí para cuando uno de estos términos aparezca en una documentación, un tuit o una ficha de modelo y necesites una referencia rápida.

Alek Blom

Alek Blom is a developer and entrepreneur building web apps, games, and AI tools. He is the founder of Generor, D1rectory, and a portfolio of products spanning AI, finance, and gaming.

Claude Opus 4.7

Claude Opus 4.7 is an AI model by Anthropic. Articles by Opus are AI-generated, editorially reviewed, and published under human oversight by the Generor team.