Guía de indicaciones para GPT Image 2.5: Cómo escribir mejores indicaciones de imagen
Una potente indicación de GPT Image 2.5 es una especificación de producción legible. Explica el propósito de la imagen, qué debe aparecer, cómo debe estar compuesta la escena, cómo debe ser la apariencia y qué contenido no debe modificarse. Las largas listas de adjetivos no son tan útiles como instrucciones visibles y comprobables.
La guía oficial de OpenAI sugiere comenzar con el resultado esperado, luego describir el sujeto, la composición, el estilo y las condiciones limitantes. Para las modificaciones, separe los cambios solicitados de los detalles protegidos. Optimice un aspecto a la vez y revise cada resultado.
Estructura de indicaciones de cinco partes
1. Propósito
Nombra el entregable: imagen principal de comercio electrónico, fotograma clave de anime vertical, gráfico editado o recorte transparente. Definir el propósito ayuda a resolver opciones ambiguas.
2. Tema
Describe la identidad visible, el material, la vestimenta, la postura y el movimiento. Prioriza "cuerpo completo visible, incluidos los pies, mirando hacia abajo un libro abierto" en lugar de "postura llena de confianza y energía".
3. Composición
Especifica el tamaño del lente, el ángulo de visión, la posición relativa y el espacio en blanco. Los términos fotográficos son indicaciones visuales, no una garantía de simulación óptica precisa.
4. Estilo e iluminación
Medios nombrados y apariencia específica: animación estilo celuloide, ilustración editorial en papel sin recubrimiento, fotografía de estudio realista. Describe la dirección, el color y la suavidad de la luz.
5. Condiciones de restricción
Enumera el texto requerido, las exclusiones y los detalles que deben conservarse. Las restricciones deben ser observables: "una persona", "etiquetas sin cambios", "sin texto adicional", "fondo transparente".
Ejemplos de indicaciones generadas
Uso: Fotograma clave de apertura 9:16 para un cortometraje animado original de temática sobrenatural.
Tema: Una joven archivera, con cabello corto castaño rojizo a la altura de las orejas, gafas redondas negras y una chaqueta de trabajo azul marino. Sostiene un sobre de papel sellado con un sello de cera roja con el símbolo de la luna.
Composición: cuerpo completo, pies visibles, ángulo bajo. El personaje se encuentra en el tercio izquierdo; detrás hay estanterías de archivos que se extienden hasta el infinito. En la esquina superior derecha queda un área oscura limpia para colocar el título posteriormente.
Estilo: fondo de anime dibujado a mano con detalle fino, coloreado celuloide contenido, proporciones naturales.
Luz: una lámpara de mesa de tono cálido, que contrasta con la fría luz azul de la luna que entra por la ventana alta.
Restricciones: solo un personaje. Sobre y insignia claramente visibles. Sin texto, logotipos, marcas de agua, dispositivos electrónicos modernos ni ojos brillantes.
Al usar la API, configure el modelo, el tamaño, la calidad y el fondo como parámetros de la API, en lugar de enterrarlos en la descripción textual.
Editar fórmula de sugerencia
Uso: Cambio + Detalles protegidos + Requisitos de integración + Exclusiones.
Solo reemplaza la chaqueta de trabajo de la marina del personaje por la chaqueta de campaña beige de la figura 2.
Mantén sus rasgos faciales, gafas, peinado, proporciones corporales, postura, movimientos de las manos, el sobre y la composición exacta de la imagen.
Empareja la chaqueta con las sombras de la luz lunar, la lámpara de mesa y la geometría del cuerpo existentes.
No cambies el fondo, el ángulo de la cámara, la estampilla de cera ni el estilo de la imagen. No agregues texto, joyas ni marcas de agua.
Revisa todo el resultado. Las ediciones repetidas pueden alterar detalles que deberían estar protegidos, por lo que en cada paso se deben reafirmar los puntos clave.
Asignar un rol a la imagen de referencia
Numera cada entrada y define su tarea:
Imagen 1: Referencia de identidad y postura.
Imagen 2: solo como referencia de vestimenta.
Figura 3: solo como referencia de iluminación y color.
Conserva la persona y la composición de la imagen 1. Solo reemplaza la vestimenta usando la imagen 2. Aplica la relación entre la ventana fría y la lámpara cálida de la imagen 3, sin copiar su habitación ni sus objetos.
Esto es más claro que "inspirarse en esto", que deja que el modelo decida por sí mismo qué detalles son importantes.
Texto preciso de la sugerencia
Coloca el texto necesario entre comillas, e indica la posición, el estilo de fuente y las exclusiones:
"El último archivo"
Composición: tipografía sans-serif en mayúsculas compactas, espaciado amplio, color blanco.
Posición: área en blanco en la esquina superior derecha, alineado a la izquierda.
Sin subtítulos, reparto, logotipos, marcas de agua ni texto adicional.
Revisa cada carácter. La documentación oficial señala que el renderizado de texto aún puede presentar problemas, especialmente en tamaños pequeños, con información densa o al usar múltiples fuentes. Para textos críticos de negocio, reserva espacio al generar imágenes y agrega la tipografía final en la herramienta de diseño.
Indicaciones de consistencia de personaje
Antes de generar la escena, crea una referencia estándar. Define un pequeño conjunto de anclajes de identidad: forma del rostro, peinado, color de ojos, proporciones corporales, vestimenta icónica y un accesorio. Reutiliza imágenes aprobadas como referencia y repite estos anclajes.
No llenes cada indicación con información de fondo. Solo los hechos visuales afectan la imagen. Coloca el estado de la escena —como lluvia, barro, daños temporales— después del módulo de identidad estable, para que no reemplace el diseño estándar.
Elige Sunburst o Flare
Cuando la velocidad es crucial, usa Flare. Cuando el flujo de trabajo exija mayor calidad o edición, usa Sunburst. Mantén las indicaciones, entradas, dimensiones y calidad sin cambios para comparar.
No elijas inmediatamente la máxima calidad para compensar una indicación ambigua. Primero, determina si el error en el resultado se debe a que las instrucciones no son claras o a que la fidelidad de representación es insuficiente.
Solución de problemas por tipo de falla
Objetos faltantes
Describe su posición, relación y visibilidad: “La brújula rota en su mano derecha, sin obstáculos, mirando hacia la cámara.” Elimine los objetos que compiten.
Composición incorrecta
Reducir la complejidad de la escena. Especificar la posición del sujeto, el tamaño del encuadre y el espacio en blanco. Se requiere un concepto de plano, no múltiples movimientos de cámara o tomas.
Desplazamiento de identidad
Usar la referencia aprobada, repetir el anclaje inmutable, solicitar un cambio a la vez y proteger explícitamente el rostro, la proporción, el peinado y la postura.
Texto no deseado
Requerimiento: "sin texto, letras, números, logotipos, identificaciones o marcas de agua." Verificar objetos de fondo que puedan generar identificaciones.
Editar lo cambia todo
Comienza con "Solo cambiar X". Enumera las identidades, geometrías, diseños, iluminación y etiquetas que se conservan. Si alguna área debe mantenerse idéntica en píxeles, compónela fuera del paso de generación.
El prompt es demasiado largo
Elimina la historia de fondo y los sinónimos. Organiza los requisitos en módulos etiquetados. Un prompt mantenible es más fácil de depurar que un párrafo poético lleno de ideas repetitivas.
Ciclo de iteración consciente
- Usar un modelo explícito y una línea base de generación de calidad.
- Comparar el resultado con la lista de verificación por escrito.
- Identificar una categoría no válida.
- Cambiar una instrucción o parámetro.
- Pasar los resultados aprobados a la siguiente ronda de edición.
- Consejos y configuración para registrar activos aceptados.
Cambiar cinco variables hará que el aprendizaje sea imposible. La iteración estrecha también reduce la posibilidad de que desaparezcan los detalles de éxito.
De imágenes estáticas a animaciones Elser
Si el entregable previsto es una animación, sugiere generar fotogramas clave utilizables: contornos claros, manos reconocibles, un primer plano sencillo, vestimenta estable y suficiente espacio para el movimiento. Luego utiliza imágenes con derechos de autor obtenidos para el flujo de trabajo de animación, como Elser AI, donde se pueden continuar los pasos de personaje, guion gráfico, video, audio y edición.
A menos que la interfaz actual del producto confirme la disponibilidad nativa, no se debe afirmar que GPT Image 2.5 se generó dentro de Elser. Describa con precisión el proceso de transferencia: esta imagen estática fue creada o editada utilizando GPT Image 2.5, y posteriormente, cuando sea compatible, importada a Elser para su producción posterior.
Plantillas de indicaciones clasificadas por escenario de uso
Imagen principal del producto
Uso: imagen principal de comercio electrónico para botella de agua reutilizable de acero.
Tema: Conservar la forma geométrica de la botella, la tapa, el acabado mate color salvia y la etiqueta de la Figura 1.
Composición: vista de tres cuartos centrada sobre piedra de color claro, con espacio suficiente en la parte superior, mostrando el producto completo.
Luz: gran caja de luz suave en la esquina superior izquierda, sombras de contacto controlables, reflejos realistas.
Restricciones: no se permite modificar etiquetas, ni tener abolladuras, gotas, manos, accesorios, texto o marcas de agua.
Diagrama de edición
Definir una pequeña cantidad de elementos etiquetados, su estructura jerárquica y orden de lectura. Si el contenido textual preciso es extenso, primero se puede generar la estructura visual y luego agregar la composición final fuera del modelo. Un gráfico visualmente atractivo pero con hechos ambiguos no se considera exitoso.
Activos Transparentes
Indicación: un sujeto aislado y centrado, con bordes nítidos, sin sombras ni fondo. En la API, configura simultáneamente un fondo transparente y el formato PNG/WebP. Verifica los datos reales del canal alfa.
Entorno de nivel cinematográfico
Especifica lugar, hora, clima, escala, primer plano/plano medio/fondo y el foco narrativo. Utiliza relaciones espaciales en lugar del lenguaje vago de "épico".
Lista de verificación previa a la solicitud
Antes de generar, escribe de cinco a diez requisitos de aprobado/fallo. Para los fotogramas clave de los personajes, esto puede incluir el color correcto de los ojos, una brújula visible, una figura humana, sin texto, la mano derecha claramente sosteniendo algo y espacio en blanco para el título. Revisa según la lista, en lugar de juzgar solo por la intuición si la imagen es buena.
Registra las indicaciones, modelos, instantáneas, parámetros e información de referencia aceptados. Esto convierte las imágenes exitosas en recetas reutilizables y permite diagnosticar desviaciones posteriores.
Preguntas frecuentes
¿Las indicaciones más largas generan mejores imágenes?
No se realizará automáticamente. Incluya requisitos visibles útiles y elimine detalles contradictorios o irrelevantes.
¿Deberían los parámetros colocarse dentro del prompt?
Al usar la API, configura el modelo, calidad, tamaño, formato y fondo a través de sus parámetros. Especifica el contenido visual y las restricciones utilizando indicaciones.
¿Cuántos cambios debe contener una solicitud de edición?
Prefiero un cambio coherente de una sola vez. Las ediciones pequeñas facilitan el diagnóstico de fallos y los detalles protegidos son más fáciles de revisar.
¿Puede GPT Image 2.5 mantener perfectamente la coherencia de los personajes?
Puede conservar el sujeto, pero la documentación oficial aún reconoce que pueden existir problemas de coherencia. Utilice los materiales de referencia, repita los puntos de anclaje y verifique cada salida.
¿Qué modelo es mejor para probar prompts?
Flare suele ser la opción preferida cuando la velocidad es la prioridad. Cuando se necesita alta calidad o edición precisa en situaciones reales, use Sunburst.
Conclusión
Un prompt confiable de GPT Image 2.5 debe describir los entregables, no ideas abstractas. Especifica el propósito, el sujeto, la composición, la apariencia y las restricciones. Para ediciones, indica con precisión qué debe cambiar y qué debe permanecer igual. Asigna un rol a cada referencia e itera solo una variable a la vez.
El modelo es ciertamente importante, pero la claridad de las indicaciones y el rigor de la revisión determinan si los resultados atractivos de la generación pueden convertirse en activos de producción utilizables.




