De prompt suelto a proceso
Acá el prompt deja de ser tuyo y pasa a ser de la organización, y eso cambia el estándar. Un prompt que vas a repetir 200 veces es software. Y el software se prueba antes de ir a producción.
Qué vas a poder hacer
- Evaluar un prompt con un método, no a ojo.
- Decidir con criterio si una tarea está lista para automatizarse.
- Escribir una plantilla que otra persona pueda usar sin explicaciones.
La regla del 10
Prueba el prompt 10 veces con CONTENIDOS DISTINTOS(10 reportes distintos, 10 reuniones distintas, 10 tickets distintos) 10 de 10 usables sin tocar nada ... listo para automatizar 7 de 10 .......................... todavía no: arregla el prompt Varía muchísimo entre corridas ... baja la temperaturaOJO: varía el CONTENIDO, no repitas el mismo input 10 veces. Repetir el mismo input mide la aleatoriedad del modelo, no la robustez de tu prompt.Los 4 criterios de evaluación
| Criterio | La pregunta que te haces | Crítico en |
|---|---|---|
| Consistencia | ¿Las 10 salidas son del mismo tipo? | Todo lo que se automatiza |
| Precisión | ¿Los datos y afirmaciones son correctos? | Análisis, reportes, cualquier cosa con números |
| Relevancia | ¿Se enfoca en lo pedido o divaga? | Resúmenes y accionables |
| Claridad | ¿Respeta extensión, tono y voz? | Todo lo que sale hacia afuera |
Antes y después: una plantilla que otro puede usar
Escribe el correo de seguimiento de la reunión con el clienteFunciona cuando lo escribes tú, porque tienes el contexto en la cabeza. Se lo pasas a alguien del equipo y el resultado es irreconocible.
Actúa como asistente de redacción comercial. Escribe el correo de seguimiento de la reunión. <variables> Cliente: [nombre y cargo] Empresa: [empresa] Notas de la reunión: [pega tus notas crudas] Acuerdos: [lista] Próximos pasos y responsables: [lista] </variables> <limites> - Entre 150 y 200 palabras. - Estructura fija: asunto, saludo, resumen breve, acuerdos en bullets, próximos pasos con responsable y fecha, cierre. - Sin superlativos ni frases de relleno. - Devuelve ÚNICAMENTE el correo final. Sin notas, sin explicaciones, sin opciones alternativas. </limites>Todo lo que cambia entre usos está entre corchetes, y los límites incluyen qué no hacer. Cualquiera del equipo la usa igual.
El ciclo de vida
escribir -> evaluar (regla del 10) -> plantilla -> compartir -> REEVALUARReevalúa cada semana: los modelos cambian sin avisar y un prompt que andaba puede degradarse solo. Guarda un caso de prueba fijo para detectar cuándo pasó. Y antes de todo: ¿esta tarea realmente necesita IA?A veces la respuesta honesta es NO (un filtro de Excel, una regla, una plantilla de texto). Decirlo te da más credibilidad que cualquier demo.Checklist antes de automatizar
[ ] ¿Esta tarea realmente necesita IA? [ ] Probado 10 veces con contenidos DISTINTOS [ ] Consistencia · Precisión · Relevancia · Claridad, ok en las 10 [ ] Citas verificadas contra la fuente con Ctrl+F [ ] Definido qué hago cuando falla (fallback manual) [ ] Un caso de prueba fijo guardado para detectar degradaciónRepaso
¿Por qué hay que variar el contenido y no repetir el mismo input?
Porque repetir el mismo input mide cuánto varía el modelo por azar. Lo que quieres medir es si tu prompt aguanta casos distintos, que es lo que va a pasar en producción.
Ocho de diez salidas están bien. ¿Automatizas?
No. Dos de cada diez requiriendo intervención manual significa que alguien tiene que revisar las diez, y ahí se fue el ahorro.
¿Cómo detectas una alucinación cruzando modelos?
Reformulas la pregunta en otro modelo y pides citas exactas en ambos. Si ninguno puede mostrarte el texto literal de la fuente, casi seguro es alucinación.
¿Por qué reevaluar cada semana?
Porque los modelos se actualizan sin avisar. Un prompt calibrado puede degradarse sin que cambies nada.
¿Por qué falla una plantilla compartida sin contexto?
Porque la usan tal cual, sin entender qué ajustar. El resultado sale mediocre y concluyen que la IA no sirve.
¿Cuál es la primera pregunta de toda evaluación?
¿Esta tarea necesita IA? A veces se resuelve mejor con una fórmula, una regla o una plantilla de texto.
Los 4 errores más comunes
- Evaluar a ojo porque el primer resultado impresionó.
- Probar diez veces con el mismo input.
- Compartir la plantilla sin los fundamentos que la hacen funcionar.
- Dar por terminado el prompt y no volver a mirarlo nunca.
¿Quieres esto aplicado a tu equipo?
Doy talleres de IA aplicada para equipos que quieren dejar de usar la IA por curiosidad y empezar a usarla para producir.
Más guías
Deja de improvisar prompts
La fórmula de 4 piezas (Rol, Enfoque, Contexto, Límites) para que la IA deje de darte respuestas genéricas, con ejemplos reales y un diagnóstico por síntoma.
Haz que deje de inventar
Las cuatro técnicas de este bloque atacan la misma enfermedad desde ángulos distintos: el modelo rellenando huecos. Los ejemplos le llenan el hueco del criterio, las etiquetas el de "qué es qué", el contexto explica por qué se abren huecos nuevos, y el grounding le prohíbe rellenarlos.
Las perillas que nadie toca
Hasta acá, todo lo que cambiaste fue texto. Pero hay perillas fuera del prompt que cambian la respuesta sin que toques una sola palabra. Si no sabes que existen, vas a pasar horas culpando al prompt de un problema de temperatura.