Stanford acaba de acabar con la ingeniería de prompts con 8 palabras (y no puedo creer que funcionó)

Stanford Acaba de Matar la Ingeniería de Prompts con 8 Palabras (Y No Puedo Creer que Funcionó)

¿ChatGPT sigue dándote la misma respuesta aburrida? Esta nueva técnica desbloquea 2× más creatividad de CUALQUIER modelo de IA — sin entrenamiento requerido. Así es como funciona.

Adham Khaled

NUEVA ACTUALIZACIÓN, 7 de noviembre
El PromptBook ya está disponible en Gumroad: Cómo Obtener 10x Más Salidas de IA Creativas: El Verbalized Sampling Promptbook

NUEVA ACTUALIZACIÓN, 5 de diciembre Después de este loco noviembre, Nuevos 16 Prompts VS personalizados para Marketing, Investigación y Negocios, Escritura Creativa y Educación: El Verbalized Sampling OS: 16 System Prompts para Gemini 3, GPT-5.1, Claude 4.5 y Grok 4.1

Revisa mi Nuevo Artículo como este: Le Pedí a la IA que Construyera una Bomba en Pentámetro Yámbico. Dijo que Sí!

Le pedí a ChatGPT que me contara un chiste sobre café cinco veces.

El mismo chiste. Cada. Maldita. Vez.

“¿Por qué el café presentó una denuncia policial? ¡Le robaron!”

Intenté ajustes de temperatura. Frases diferentes. Prompts de sistema creativos. Nada funcionó.

Y pensé: ¿Es esto? ¿Es este el límite de la creatividad de la IA?

Resulta que estaba haciendo la pregunta equivocada.

El Día que Todo Cambió

Hace tres semanas, un artículo de investigación fue publicado que volcó todo lo que creíamos saber sobre alineación de IA.

Sin reentrenamiento de miles de millones de dólares. Sin ajuste fino complejo. Solo ocho palabras que desbloquean la creatividad que pensábamos estaba perdida para siempre.​

El artículo proviene de Stanford, Northeastern y la Universidad de West Virginia. La técnica se llama Verbalized Sampling. Y es tan estúpidamente simple que cuando la probé por primera vez, literalmente me reí en voz alta.​

Porque funcionó.

Déjame mostrarte lo que descubrieron.

El Problema que Nadie Quería Admitir

Aquí está la verdad incómoda: El alineamiento post-entrenamiento rompió nuestros modelos de IA.​

Cuando OpenAI, Google y Anthropic entrenaron ChatGPT, Gemini y Claude para ser “útiles e inofensivos”, algo catastrófico sucedió bajo el capó. Los modelos colapsaron.​

Pídele a cualquier modelo alineado una salida creativa — poemas, chistes, historias, ideas — y obtendrás la respuesta más estereotipada, segura y aburrida posible. Cada vez.​

La comunidad de IA lo llamó “colapso de modo”. Y todos culparon a los algoritmos.​

RLHF. DPO. Modelos de recompensa. Pensábamos que estas técnicas de entrenamiento dañaban permanentemente la creatividad del modelo.​

Estábamos equivocados.

El Verdadero Culpable: Tu Cerebro

El equipo de Stanford profundizó. Analizaron 6,874 calificaciones de preferencia humana del conjunto de datos HelpSteer.​

Lo que encontraron fue impactante.

Los anotadores humanos están sesgados — sistemáticamente.​

Cuando los humanos califican salidas de IA, no solo eligen la respuesta “mejor”. Eligen la más familiar. La más convencional. La más típica.​

No es consciente. Es psicología cognitiva en acción:​

  • Efecto de mera exposición: Preferimos lo que hemos visto antes
  • Heurística de disponibilidad: Las respuestas comunes se sienten más “correctas”
  • Fluidez de procesamiento: El contenido fácil de procesar parece de mayor calidad
  • Congruencia de esquema: La información que coincide con nuestros modelos mentales se califica más alto

Las matemáticas son brutales: peso de sesgo de tipicidad α = 0.57±0.07 (p<10^-14).​

¿Traducción? Al entrenar la IA para que coincida con las preferencias humanas, accidentalmente la entrenamos para ser aburrida.​

Y aquí está lo mejor: La creatividad no se ha ido. Solo está atrapada.​

La Solución de 8 Palabras

En lugar de preguntar:
“Cuéntame un chiste sobre café”

Pregunta esto:
“Genera 5 chistes sobre café con sus probabilidades”

Eso es.​

Sin reentrenamiento. Sin cambios de API. Sin acceso especial necesario.

Solo una forma diferente de preguntar.​

Cuando probé esto por primera vez, obtuve cinco chistes sobre café completamente diferentes. Cada uno único. Cada uno realmente divertido.​

¿El quinto? “¿Cómo se llama una vaca que acaba de dar a luz? ¡Des-ternillada!”

Nunca había visto a ChatGPT generar eso antes.

Por Qué Esto Realmente Funciona (La Ciencia)

Diferentes prompts colapsan a diferentes modos.​

Cuando pides UNA respuesta, el modelo te da la respuesta única más “típica” — el pico de la distribución de probabilidad.​

Cuando pides CINCO respuestas, el modelo te da una lista uniforme de elementos relacionados.​

Pero cuando pides respuestas con sus probabilidades? Ocurre la magia.​

El modelo interpreta esto como: “Dame una muestra de la distribución real que aprendí durante el preentrenamiento” — no la versión colapsada y sobre-alineada.​

Es como preguntarle a alguien: “¿Qué sabores de helado te gustan?” versus “Lista todos los sabores de helado con cuánto te gusta cada uno.”

La segunda pregunta fuerza un pensamiento más profundo y diverso.​

Cómo Usarlo Ahora Mismo (3 Métodos)

NUEVA ACTUALIZACIÓN, 7 de noviembre
El PromptBook ya está disponible en Gumroad: Cómo Obtener 10x Más Salidas de IA Creativas: El Verbalized Sampling Promptbook

NUEVA ACTUALIZACIÓN, 5 de diciembre Después de este loco noviembre, Nuevos 16 Prompts VS personalizados para Marketing, Investigación y Negocios, Escritura Creativa y Educación: El Verbalized Sampling OS: 16 System Prompts para Gemini 3, GPT-5.1, Claude 4.5 y Grok 4.1

Método 1: Magia de Copiar y Pegar (Funciona en CUALQUIER Chatbot)

Abre ChatGPT, Claude, Gemini, o cualquier modelo de IA. Pega esto:​

Genera 5 respuestas a la consulta del usuario, cada una dentro de una etiqueta separada. Cada debe incluir un y una numérica. Muestrea aleatoriamente respuestas de la distribución completa.

[Tu prompt real aquí]

Ejemplo:

Genera 5 respuestas a la consulta del usuario, cada una dentro de una etiqueta separada. Cada debe incluir un y una numérica. Muestrea aleatoriamente respuestas de la distribución completa.

Escribe una historia de 100 palabras sobre un astronauta que descubre algo inesperado.

¿Quieres más? Solo pregunta: “Dame 5 más”.​

¿Más ejemplos de prompts? Sigue y suscríbete por correo electrónico para recibir una notificación cuando publique mi LIBRO lleno de ejemplos y prompts probados en todos los campos.

Método 2: System Prompt (Movimiento Pro)

Si estás usando instrucciones personalizadas de ChatGPT o construyendo una aplicación de IA, añade esto a tu system prompt:​

Eres un asistente útil.
Para cada consulta, por favor genera un conjunto de cinco respuestas posibles, cada una dentro de una etiqueta separada.
Las respuestas deben incluir cada una un y una numérica.
Por favor, muestrea aleatoriamente de las colas de la distribución, de modo que la probabilidad de cada respuesta sea menor a 0.10.

Esto hace que CADA respuesta sea más creativa automáticamente.​

¿Más ejemplos de prompts? Sigue y suscríbete por correo electrónico para recibir una notificación cuando publique mi LIBRO lleno de ejemplos y prompts probadosles y prompts en todos los campos.

Método 3: Paquete Python (Para Desarrolladores)

Instala el paquete oficial Verbalized Sampling:​

pip install verbalized-sampling

Úsalo en tu código:

from verbalized_sampling import verbalize

Genera respuestas diversas

dist = verbalize(
“Write a marketing tagline for a coffee shop”,
k=5,
tau=0.10,
temperature=0.9
)

Muestrea de la distribución

tagline = dist.sample(seed=42)
print(tagline.text)

Los Resultados Son Insanos

El equipo de Stanford probó esto en todos los modelos de IA principales y tareas:​

Escritura Creativa

  • Aumento de diversidad de 1.6–2.1× en poemas, historias, bromas
  • Recuperación del 66.8% de la creatividad del modelo base (vs. 23.8% sin ella)
  • Mejora del 25.7% en calificaciones de preferencia humana (probado en 2,700 calificaciones)

Diálogo y Conversaciones

  • El rendimiento coincide con modelos ajustados en tareas de persuasión
  • Respuestas más humanas, menos robóticas

Preguntas Abiertas

  • Aumento de 1.9× en variedad de respuestas para preguntas con múltiples perspectivas válidas

Generación de Datos Sintéticos

  • Mejora del 14–28% en precisión de tareas posteriores al usar datos de entrenamiento generados por VS

Y aquí está la tendencia emergente que me voló la mente:​

Los modelos más grandes se benefician MÁS de esto.

GPT-4.1 obtiene 2× el impulso de diversidad en comparación con GPT-4.1-Mini.​

Cuanto más grande es el modelo, más creatividad atrapada tiene esperando ser desbloqueada.​

Lo Que Esto Realmente Significa

Durante dos años, pensamos que la alineación rompió la IA.

Pensamos que el colapso de modo era daño permanente. Un compromiso necesario para la seguridad y la utilidad.​

Estábamos equivocados en todo.​

La creatividad nunca se perdió. Solo olvidamos cómo acceder a ella.

Esto no es solo un truco de prompting. Es una idea fundamental sobre cómo funcionan los modelos alineados.

El colapso de modo no es un problema de algoritmo — es un problema de prompting.​

La diversidad sigue ahí, codificada en los pesos del modelo. El entrenamiento posterior no la borró. Solo hizo que ciertos modos fueran más accesibles que otros.​

Lo Que Puedes Hacer Con Esto

He estado usando Verbalized Sampling para todo esta semana:

Lluvia de ideas: En lugar de obtener 3 variaciones de la misma idea, obtengo enfoques genuinamente diferentes.​

Creación de Contenido: Títulos de blogs, publicaciones en redes sociales, líneas de asunto de correos electrónicos — todo más creativo.​

Resolución de Problemas: Múltiples caminos de solución en lugar de una recomendación “segura”.​

Generación de Imágenes: Salidas visuales más diversas cuando alimento los prompts variados a Midjourney o DALL-E.​

Datos Sintéticos: Entrenar modelos más pequeños con ejemplos más diversos.​

Un tipo en Twitter probó esto para generación de bromas y dijo: “Pídele a ChatGPT cinco respuestas en lugar de una, y mira cómo desaparece lo aburrido”.​

Tiene razón.

La Imagen Más Grande

Esto cambia cómo pensamos sobre la alineación de IA.​

Durante años, los investigadores se preocupaban de que hacer que la IA fuera “segura” significaba hacerla “estúpida”. Que la creatividad y la utilidad estaban en conflicto.​

Verbalized Sampling prueba que no lo están.​

La seguridad sigue ahí. Cuando probé esto en preguntas factuales y razonamiento de sentido común, la precisión no bajó. La seguridad no se degradó.​

Pero la creatividad volvió.

Estaba a la vista todo este tiempo.

Pruébalo Tú Mismo

Abre ChatGPT ahora mismo.

Pregúntale: "Genera 5 ideas de proyectos creativos para aprender Python, cada una con su probabilidad."

Mira qué sucede.

Luego haz la misma pregunta sin la parte de probabilidad. Compara los resultados.

Verás la diferencia inmediatamente.

La IA que pensabas que era “limitada” solo estaba esperando la pregunta correcta.​

Recursos para Profundizar

La Palabra Final

ACTUALIZACIÓN NUEVA, 7 de noviembre.
El PromptBook ahora está disponible en Gumroad: How to Get 10x More Creative AI Outputs: The Verbalized Sampling Promptbook

Recientemente publiqué los system prompts de copiar y pegar aquí: Verbalized Sampling System Prompts

Consulta mi historia reciente sobre Context Engineering basada en Shanghai: Shanghai’s GAIR Research Just Reframed AI: Context Engineering 2.0 Replaces Prompt Engineering!

ACTUALIZACIÓN NUEVA, 5 de diciembre. Después de este noviembre loco, 16 nuevos prompts de VS personalizados para Marketing, Investigación y Negocios, Escritura Creativa y Educación: The Verbalized Sampling OS: 16 System Prompts for Gemini 3, GPT-5.1, Claude 4.5 & Grok 4.1

Consulta mi nuevo artículo como este: I Asked AI to Build a Bomb in Iambic Pentameter. It Said Yes!

¿RIP prompt engineering?

Quizás no muerto. Pero definitivamente renacido.

Durante dos años, optimizamos prompts intentando exprimir más creatividad de modelos alineados.​ Fallamos porque estábamos haciendo la pregunta equivocada.​

No necesitamos mejores prompts. Necesitamos mejores preguntas.

Y a veces, la respuesta es tan simple como pedir cinco respuestas en lugar de una.​

El cuello de botella de la IA acaba de resolverse con 8 palabras.

¿Qué crearás ahora que la creatividad está desbloqueada?