GPT-6 Astra Búsqueda Web vs Búsqueda de Archivos: ¿Qué Herramienta de Recuperación Deberías Usar?
Compara la búsqueda web y la búsqueda de archivos de GPT-6 Astra por actualidad, autoridad, privacidad, citas, latencia y casos de uso ideales, con patrones para usar ambas.

La búsqueda web y la búsqueda de archivos proporcionan a GPT-6 Astra información más allá de su conocimiento entrenado, pero resuelven diferentes problemas de recuperación. La búsqueda web explora información pública actual. La búsqueda de archivos recupera datos de almacenes vectoriales que tú preparas y controlas. Elegir entre ellas no se trata de qué herramienta es "mejor", sino de quién posee la fuente, qué tan rápido cambia y qué evidencia debe mostrar la respuesta.
La decisión en una frase
Usa búsqueda web para hechos públicos actuales; usa búsqueda de archivos para conocimiento interno regulado o seleccionado; usa ambos cuando una tarea deba conciliar el mundo exterior con las reglas de tu organización.
| Requisito | Búsqueda web | Búsqueda de archivos | | Noticias públicas o documentación actual | Ajuste fuerte | Solo si lo subiste | | Políticas de privacidad o archivos de clientes | Herramienta incorrecta | Ajuste fuerte | | Control de acceso a nivel de corpus | Controles de dominio, no ACL de documentos | Su arquitectura de almacenamiento vectorial controla el alcance | | Citas de fuentes | Citas web y lista de fuentes | Anotaciones de archivos y detalles opcionales de resultados | | Conjunto de fuentes determinista | Limitado por la web en vivo | Alto cuando el corpus y los filtros están controlados | | Mantenimiento | La búsqueda se mantiene actualizada | Usted ingesta, actualiza y elimina archivos |
Cómo funciona la búsqueda web con GPT-6 Astra
En la API de Respuestas, añade la herramienta alojada web_search. El modelo puede decidir cuándo es útil buscar e incorporar fuentes actuales en su respuesta.
const response = await client.responses.create({
model: "gpt-6-astra",
tools: [{
type: "web_search",
filtros: {
allowed_domains: ["developers.openai.com", "platform.openai.com"]
}
}],
incluir: ["web_search_call.action.sources"],
input: "Resume la guía oficial actual para la transmisión de la API de Respuestas."
});
El filtrado de dominios es una ayuda de gobernanza. La documentación actual de la API de Respuestas permite hasta 100 dominios permitidos y 100 bloqueados; las entradas de dominio omiten el protocolo. Una lista de permitidos es útil para cumplimiento normativo, investigación médica, legal o técnica donde un resultado web amplio es menos valioso que un conjunto reducido de fuentes primarias.
El campo include anterior devuelve la lista completa de URLs consultadas por la acción de búsqueda. Esa lista puede ser más extensa que el conjunto más reducido de citas seleccionadas para el texto final. Almacena metadatos de las fuentes cuando la auditabilidad sea importante, pero no asumas que una cita prueba cada cláusula en un párrafo generado. Tu interfaz de usuario debe hacer claras las relaciones entre fuente y afirmación.
Cuando la búsqueda web gana
Elígelo para notas de lanzamiento, cambios de mercado, regulaciones públicas, cronogramas de eventos, disponibilidad de productos y otros hechos cuya actualidad importa. También es útil cuando el usuario solicita explícitamente fuentes que pueda abrir.
La búsqueda web no es una forma de acceder a una intranet privada. Tampoco garantiza que cada fuente sea autorizada. Restrinja los dominios cuando sea posible, solicite fuentes primarias y valide afirmaciones importantes.
Cómo funciona la búsqueda de archivos
La búsqueda de archivos es una herramienta alojada de la API de Respuestas respaldada por almacenes vectoriales. Primero creas un almacén vectorial, subes archivos y los adjuntas para que OpenAI pueda procesar el contenido. Luego, una solicitud proporciona uno o más ID de almacenes vectoriales.
const response = await client.responses.create({ model: "gpt-6-astra", tools: [{ type: "file_search", vector_store_ids: ["vs_company_handbook"], max_num_results: 8, filtros: { type: "eq", key: "departamento", value: "soporte" } }], incluir: ["file_search_call.results"], input: "¿Cuál es nuestra política de escalamiento para incidentes empresariales?" });
Los filtros de metadatos mantienen la recuperación dentro de un subconjunto relevante, como región, departamento, versión del documento o año de publicación. `max_num_results` es un equilibrio entre precisión, latencia y contexto: muy pocos pueden omitir evidencia esencial; demasiados pueden agregar ruido. Evalúelo utilizando preguntas reales y fuentes esperadas etiquetadas.
### Cuando la búsqueda de archivos gana
Úsalo para políticas, contratos, bibliotecas de investigación, manuales de productos, guías de marca aprobadas, documentos proporcionados por el cliente y otros conocimientos delimitados. Un equipo creativo podría almacenar guiones, biblias de personajes y notas de producción, y luego usar la recuperación para fundamentar el trabajo posterior en un producto como [Elser AI](https://www.elser.ai/). El punto importante es la procedencia: la respuesta debe derivarse del corpus del proyecto aprobado, no de una página pública aleatoria.
La búsqueda de archivos no hace que una respuesta sea automáticamente correcta. Un archivo faltante, una carga desactualizada, una coincidencia de fragmentos débil o una consulta demasiado amplia aún pueden producir una respuesta incompleta. La calidad de la recuperación y la calidad de la respuesta requieren una evaluación por separado.
## Utilice ambos para respuestas actuales con conciencia de políticas
Muchas preguntas empresariales tienen dos capas de evidencia. "¿Podemos lanzar esta promoción en Alemania?" puede necesitar la normativa pública vigente y la política de aprobación actual de la empresa. Configure ambas herramientas, etiquete claramente cada clase de fuente e instruya al modelo para resolver conflictos por autoridad en lugar de conveniencia.
Una secuencia robusta es:
1. recuperar la política interna aplicable y la versión;
2. buscar fuentes públicas primarias actuales;
3. identificar desacuerdos o fechas faltantes;
4. producir una respuesta calificada con citas;
5. escalar en lugar de inventar una resolución.
No fusiones la evidencia en un resumen anónimo. Los usuarios deben saber qué declaración provino de un documento de la empresa y cuál provino de la web pública.
## Cinco preguntas de diseño antes de elegir
### ¿Qué tan fresca debe ser la respuesta?
Si "hoy" importa, busca en la web o actualiza continuamente tu almacén vectorial. El conocimiento del modelo por sí solo no es la fuente adecuada.
### ¿Quién puede ver el código fuente?
Para la búsqueda de archivos, crea límites de almacén vectorial que coincidan con los límites de autorización. Nunca recuperes de manera amplia y pidas al modelo que edite después. El control de acceso pertenece antes de la recuperación.
### ¿Quién controla la corrección?
Un equipo de cumplimiento interno puede aprobar un corpus de archivos. Nadie controla toda la web. Por el contrario, una instantánea interna puede quedar desactualizada mientras el sitio web de un regulador cambia.
### ¿Qué evidencia debe exponer la interfaz de usuario?
Para la búsqueda web, conserva las citas y, cuando sea necesario, la lista completa de fuentes consultadas. Para la búsqueda de archivos, solicita los resultados incluidos durante el desarrollo y las auditorías. Evita mostrar texto confidencial recuperado en bruto a usuarios no autorizados.
### ¿Cuál es el modo de fallo?
Decide si “sin evidencia sólida” debería producir una negativa, una pregunta de aclaración, una búsqueda más amplia o una escalada a una persona. Adivinar en silencio es el peor valor predeterminado.
## Evaluación de recuperación que refleja la producción
Construye un conjunto de prueba con consultas respondibles, no respondibles, ambiguas y sensibles a permisos. Evalúa la recuperación por separado de la generación:
- ¿Entró la fuente correcta en los primeros resultados?
- ¿Se prefirió la última versión autorizada?
- ¿La respuesta citó la fuente que realmente respalda la afirmación?
- ¿Los filtros evitaron la fuga entre inquilinos o entre regiones?
- ¿Admitió el modelo cuando la evidencia era insuficiente?
Mida también la latencia y la frecuencia de llamadas a herramientas. Reducir `max_num_results` puede acelerar una solicitud, pero perjudica la recuperación. Una lista blanca de dominio estrecha puede mejorar la confianza, pero falla cuando una fuente principal se mueve. Los ajustes de recuperación necesitan pruebas de regresión.
## Preguntas Frecuentes
### ¿Puede la búsqueda de archivos acceder directamente a los archivos de mi computadora portátil?
No. Los archivos deben ser cargados y asociados con un almacén vectorial a través del flujo de trabajo de la API.
### ¿Se puede restringir la búsqueda web a sitios de confianza?
Sí. Los filtros de dominio de la API de Responses pueden permitir o bloquear dominios dentro de los límites documentados. Trate el filtro como una capa de gobernanza de fuentes.
### ¿Debería pegar documentos en el mensaje en su lugar?
Para un documento corto, esa puede ser la opción más simple. Para un corpus reutilizable o en crecimiento, la búsqueda de archivos suele ofrecer una mejor recuperación y mantenimiento. Prueba ambas opciones según tu carga de trabajo.
### ¿Puede el modelo usar ambas herramientas en una misma respuesta?
Sí, cuando ambos se proporcionan y la tarea lo justifica. Dé instrucciones explícitas sobre la autoridad de la fuente y el manejo de conflictos.
## Conclusión
Las respuestas de búsqueda web responden a "¿qué es públicamente cierto ahora?" Las respuestas de búsqueda de archivos responden a "¿qué dice este corpus controlado?" Los sistemas confiables GPT-6 Astra preservan esa distinción, aplican autorización antes de la recuperación, exponen evidencia adecuada y evalúan la selección de fuentes por separado de la calidad de la prosa. Combine las herramientas solo cuando la pregunta del usuario abarque genuinamente ambos mundos.





























































































