Navegación principal

Aprendizaje de prompts del sistema: un nuevo paradigma para los sistemas de IA

El aprendizaje de prompts del sistema ayuda a los equipos a mejorar el comportamiento de la IA sin reentrenar modelos y facilita la comprensión de sus limitaciones.

¿Alguna vez descubriste que un prompt en particular funciona bien, pero de repente deja de funcionar?

¿Alguna vez quedaste atrapado en un ciclo en el que corriges constantemente el prompt del sistema para mejorar los resultados, pero nada funciona?

El aprendizaje de prompts del sistema puede ser justo lo que necesitas.

El aprendizaje de prompts del sistema (SPL) es un área que despierta cada vez más interés en la comunidad de IA y que Andrej Karpathy popularizó ampliamente en X en mayo.

El aprendizaje de prompts del sistema aborda las limitaciones de los sistemas de IA rígidos y frágiles que dependen de prompts estáticos del sistema o de configuraciones de ajuste fino difíciles de gestionar. Ofrece otra forma de facilitar el aprendizaje continuo en los sistemas de IA.

Antes de profundizar, repasemos brevemente algunos fundamentos de los prompts.

Al desarrollar un agente o modelo personalizado, primero debemos diseñar dos componentes clave:

  1. Un prompt del sistema

  2. Un prompt del usuario

Los prompts del sistema establecen las reglas básicas sobre cómo debe comportarse un modelo. Cuando se escriben para soluciones de IA personalizadas, suelen comenzar con algo como esto:

“Eres un asistente inteligente. Tu función es realizar <inserta aquí la tarea>.

No debes hacer (A), (B) ni (C)”.

En cambio, los prompts del usuario suelen contener la consulta de una persona y otra información relevante, como su zona horaria y sus preferencias. Un prompt del usuario podría verse así:

Captura de pantalla que ilustra la introducción.

Estoy en la capital de Portugal. ¿Puedes sugerirme algunas actividades para esta noche?

Las filtraciones de prompts del sistema se han vuelto comunes tras el lanzamiento de nuevos modelos de los principales laboratorios de IA, ya que los usuarios aplican jailbreaks a los chatbots para revelar sus instrucciones subyacentes. Un popular repositorio de GitHub ahora reúne muchos de estos prompts del sistema en un solo lugar. Estos revelan la “fórmula secreta” que los laboratorios de IA han desarrollado con el tiempo para fomentar un comportamiento adecuado de los modelos. Por ejemplo, el prompt del sistema de GPT-5 filtrado recientemente (expuesto dentro de ChatGPT) contiene aproximadamente 6 000 palabras, lo que ilustra cuánto conocimiento y orientación deben codificarse para moldear el comportamiento del sistema.

Estos prompts integrales del sistema suelen abarcar varias áreas clave, como:

  • Instrucciones de búsqueda

  • Definiciones de herramientas

  • Preferencias del usuario

  • Instrucciones para citar fuentes

  • Correcciones rápidas para problemas conocidos

En la práctica, los desarrolladores de sistemas de IA personalizados corrigen manualmente los prompts del sistema de forma iterativa mientras prueban y perfeccionan sus aplicaciones, principalmente mediante evaluaciones que orientan este proceso de mejora.

Otras formas de orientar el comportamiento de un modelo incluyen:

  • Ingeniería de prompts, incluida la generación aumentada por recuperación (RAG), que controla el contenido proporcionado a un modelo

  • Ajuste fino (modificación directa de los pesos subyacentes del modelo)

¿Y si hubiera otra forma de influir en el comportamiento del modelo? Imagina un sistema que aprende y perfecciona dinámicamente su propio prompt del sistema mediante pensamientos, planes y estrategias generados anteriormente. Podría aprovechar tanto los comentarios de los usuarios como las evaluaciones de tipo LLM como juez para valorar sus resultados.

¿Qué es el aprendizaje de prompts del sistema?

Piensa en un desafío empresarial persistente que quieras automatizar mediante un sistema de agentes. Las soluciones eficaces requieren capacidades de razonamiento que van más allá de la automatización básica de flujos de trabajo. En esos casos, es esencial incorporar a tu sistema de IA un componente que genere planes. Esto permite que el sistema trabaje de distintas maneras con varios agentes, según la tarea. Los pasos individuales pueden incluir instrucciones para acceder a otros agentes con el fin de completar subtareas o usar herramientas.

Captura de pantalla que ilustra qué es el aprendizaje de prompts del sistema.

Nota: una herramienta de un agente es cualquier función, API o recurso externo que un agente de IA puede invocar para ir más allá del texto y realizar acciones concretas.

Podrías optar por “sembrar” el prompt del sistema del modelo con un plan que siga los pasos lógicos que tomaría una persona, aunque los LLM suelen necesitar orientación más específica sobre el uso de herramientas, el formato de los resultados y otros requisitos relacionados. A veces, la estrategia óptima puede no estar clara o quizá abordes un problema que no se ha reevaluado porque antes se consideraba resuelto. Aquí es donde entra en juego el aprendizaje de prompts del sistema (SPL).

SPL mejora de forma iterativa un prompt del sistema al incorporar estrategias generadas anteriormente. A medida que surgen nuevos problemas, el sistema acumula conocimientos gradualmente y se vuelve más robusto. Puedes verlo como la creación de un manual para resolver problemas en tu área.

SPL incorpora gradualmente al prompt del sistema los conocimientos obtenidos de los comentarios de los usuarios. A medida que tu sistema madura, puedes descubrir problemas recurrentes que se pueden condensar en principios más generales y de mayor nivel.

Guía paso a paso

Veamos con más detalle cómo funciona el proceso, paso a paso:

  1. Comienza con la consulta del usuario y pídele al sistema que realice una tarea específica.

    1. Si tu sistema aborda un solo problema, podrías adoptar un enfoque “voraz” y seleccionar las estrategias con mayor puntuación de ejecuciones anteriores. Como alternativa, puedes fomentar la exploración al tomar muestras de una distribución que favorezca las estrategias con buenas calificaciones e incluya ocasionalmente algunas con calificaciones más bajas. Esto resulta especialmente útil cuando apenas comienzas a recopilar estrategias.

    2. Para los sistemas diseñados para abordar diversos conjuntos de problemas, considera agregar una capa de clasificación o usar embeddings y similitud de coseno —las mismas técnicas que suelen utilizarse en RAG— para identificar enfoques relevantes. Esto te ayuda a seleccionar estrategias adecuadas para el problema específico; por ejemplo, estrategias adaptadas a tareas de programación.

Nota: los embeddings utilizados con la similitud de coseno permiten medir qué tan estrecha es la relación entre dos elementos de información, lo que facilita asociar documentos, consultas o ideas, incluso cuando su redacción exacta es diferente.

Ejemplo de punto de partida para un repositorio simplificado de estrategias orientadas a resolver problemas de programación.

Nota: las “estrategias iniciales” que se muestran aquí son ilustrativas. En situaciones reales de programación, las perfeccionaríamos aún más. Los problemas empresariales especializados exigirían recopilar conocimientos adicionales con el tiempo.

Id_de_generación (orden inverso)

Tema

Puntuación

Texto_de_la_estrategia

Explicación

4

programación

1

Comprende el problema, las restricciones y los casos extremos. Diseña un algoritmo con las estructuras de datos adecuadas. Valida el plan con ejemplos e invariantes. Implementa código limpio y legible. Perfecciona el resultado mediante refactorización, optimización y formato final. Uso de herramientas: cuando uses una herramienta, explica brevemente por qué fue necesaria.

Incorpora y combina los elementos más sólidos de las tres estrategias siguientes.

3

programación

1

Comprende el problema, las restricciones y los casos extremos. Diseña un algoritmo con las estructuras de datos adecuadas. Valida el plan con ejemplos e invariantes. Implementa código limpio y legible. Perfecciona el resultado mediante refactorización, optimización y formato final.

Una estrategia más completa, pero no incluye orientación sobre el uso de herramientas.

2

programación

-1

Comprende el problema, las restricciones y los casos extremos. Diseña un algoritmo con los datos adecuados. Implementa código limpio y legible. Uso de herramientas: cuando accedas a ellas, incluye un breve resumen que explique por qué usaste esa herramienta.

Una estrategia mejor que menciona el uso de herramientas, pero que aún podría mejorar.

1

programación

-1

Revisa rápidamente el problema. Resuelve el problema. Crea pruebas mínimas. Entrega lo que logre ejecutarse.

Menciona pruebas, pero en general es una estrategia débil.

3. Después de tomar N muestras, incorpóralas al prompt del sistema. Esto fundamenta la generación de planes en comentarios previos de expertos, en lugar de dejar que el modelo cree planes con una orientación mínima. Anima al modelo a “pensar de manera innovadora” y agregar pasos cuando sea necesario, en vez de limitarse a copiar literalmente las estrategias de muestra.

Captura de pantalla que ilustra una guía paso a paso.

4. Con el prompt del sistema creado dinámicamente, genera una nueva estrategia para atender la solicitud del usuario. Este proceso debería producir tareas adicionales que mejoren el resultado final. El objetivo es la creatividad: combina los elementos más sólidos de las estrategias anteriores, integra los pasos que se superponen y agrega pasos nuevos que resulten útiles cuando sea necesario.

Nota: recuerda que la temperatura es un parámetro que puede ajustarse para producir resultados más variados y menos deterministas, lo cual resulta útil cuando se busca creatividad. Con una temperatura distinta de cero, cada plan generado puede ser diferente.

5. Después de recibir el resultado del modelo, evalúalo mediante una persona o un LLM que actúe como juez, según criterios específicos que definan una buena solución para tu problema. Para el ejemplo de actividades en Portugal mencionado antes, los criterios de evaluación podrían incluir:

  • Brevedad (una respuesta limitada a una oración)

  • Relevancia de la actividad sugerida

  • Precisión de la ubicación

6. A partir de esta evaluación, usa otro modelo para perfeccionar la estrategia. Un ciclo opcional de retroalimentación puede incorporar aportes humanos y facilitar mejoras colaborativas. Guarda la estrategia perfeccionada en tu base de datos con los metadatos adecuados para llevar un registro de las versiones y los cambios.

Captura de pantalla que ilustra una guía paso a paso.

Entonces, ¿por qué hacer todo este esfuerzo? Podrías revisar los resultados manualmente y ajustar el prompt del sistema según corresponda. Sin embargo, los modelos avanzados de razonamiento pueden perfeccionar estrategias mediante el contexto de los resultados y los comentarios humanos. Aunque las personas pueden detectar fácilmente las fallas de los enfoques simples, identificarlas se vuelve difícil y tedioso en sistemas complejos que abordan conjuntos de problemas más amplios.

Los LLM suelen necesitar instrucciones detalladas y pasos adicionales para recopilar el conocimiento contextual que las personas aportan naturalmente a un problema. La cantidad de tareas necesarias puede aumentar rápidamente a medida que un sistema se amplía para abordar conjuntos de problemas más diversos. Por ejemplo, quienes resuelven problemas de programación pueden comprender intuitivamente el código circundante, mientras que un LLM quizá deba “leer” primero varios archivos.

El impacto de implementar SPL en tus soluciones de IA

Descubrir nuevas formas de resolver problemas

  • Cuándo resulta útil: imagina que diriges un equipo de atención al cliente y un agente de IA se encarga de clasificar los tickets. Con el tiempo, SPL podría descubrir un método de categorización que tu equipo no había considerado y así reducir las tasas de escalamiento.

  • Cuándo no resulta útil: si los requisitos de cumplimiento o las regulaciones ya definen tus flujos de trabajo, como en los informes financieros, SPL puede aportar poco valor porque la creatividad se convierte en un riesgo en vez de una ventaja.

Mejorar la colaboración entre personas e IA

  • Cuándo resulta útil: en funciones que exigen mucha investigación, como inteligencia de mercado o estrategia de producto, puedes colaborar con la IA al perfeccionar sus planes, enriquecer sus resultados e incorporar estas mejoras para usarlas en el futuro. Cada interacción mejora la eficacia del sistema.

  • Cuándo no resulta útil: si tu equipo usa la IA principalmente para flujos de trabajo sencillos que requieren una intervención humana mínima (por ejemplo, procesar facturas), el esfuerzo de colaboración puede superar el beneficio.

Adaptación a nuevos problemas

  • Cuándo resulta útil: supón que te expandes a una nueva región y la IA debe atender de repente consultas sobre impuestos locales. SPL permite codificar rápidamente las nuevas reglas y heurísticas a medida que surgen, lo que evita errores repetidos.

  • Cuándo no resulta útil: si tu entorno es estático, como cuando conviertes transcripciones de reuniones en resúmenes estandarizados, la adaptación constante ofrece beneficios mínimos.

Desafíos y factores de riesgo

En teoría, todo esto parece prometedor, pero implementar SPL plantea desafíos reales. A continuación, analizamos algunos de los principales:

Falta de convergencia

En las primeras fases de generación de estrategias, el progreso suele estancarse: los nuevos resultados no aprovechan los anteriores y el impulso disminuye. Esto suele deberse a dos problemas principales:

    • Solución: codifica desde el principio todo el conocimiento empresarial disponible para que el sistema tenga una base sólida que aprovechar.

    • Solución: diseña una rúbrica detallada que puntúe varios aspectos de una respuesta, como la precisión, la claridad y la relevancia, y ajusta el muestreo para reflejar estas señales.

Proliferación de estrategias

Si tu sistema genera cientos de estrategias, pero recibe pocos comentarios para distinguir las buenas de las malas, el muestreo se vuelve rápidamente inmanejable. La respuesta es la depuración.

Al perfeccionar tu repositorio de estrategias, considera lo siguiente:

  • Vida útil: retira las estrategias cuando superen un plazo o una cantidad de generaciones definidos.

  • Puntuación: usa tu rúbrica de evaluación para descartar las estrategias que tengan un rendimiento bajo de forma constante. Combinar este criterio con la vida útil garantiza que solo conserves enfoques que demuestren su valor con el tiempo.

  • Evaluación mediante un LLM: evalúa periódicamente las estrategias para identificar las que ya no aportan perspectivas únicas, pues es probable que sus elementos útiles ya estén incorporados en versiones más recientes.

Solución: trata tu base de datos de estrategias como un sistema vivo: depúrala periódicamente para conservar solo el conocimiento relevante y de gran valor.

Conclusión

El aprendizaje de prompts del sistema aún está en sus primeras etapas, pero su potencial es enorme. Las empresas que dependan únicamente de prompts estáticos o de un ajuste fino interminable encontrarán limitaciones conocidas: sistemas frágiles, costos crecientes y esfuerzos desperdiciados. SPL ofrece una salida de ese ciclo mediante la creación de sistemas que mejoran con el tiempo y codifican principios de alto nivel en lugar de correcciones aisladas.

SPL aún está surgiendo, pero su trayectoria es clara: los sistemas capaces de aprender de sí mismos superarán a los que no puedan hacerlo. Este es el momento de experimentar, comenzar a pequeña escala, registrar lo aprendido y sentar las bases de sistemas de IA que mejoren con cada interacción.

Autor

George Williamson