GPT-6 Astra 網路搜尋 vs 檔案搜尋:你該使用哪一種檢索工具?
比較GPT-6 Astra的網頁搜尋與檔案搜尋,依據時效性、權威性、隱私、引用、延遲及理想使用情境,並提供兩者併用的模式。

網路搜尋與檔案搜尋都能讓 GPT-6 Astra 獲取超越其訓練知識的資訊,但它們解決的是不同的檢索問題。網路搜尋探索當前的公開資訊,而檔案搜尋則從你準備並控制的向量儲存庫中進行檢索。兩者之間的選擇,與其說是哪個工具「更好」,不如說是取決於資料來源的擁有者、資訊更新的速度,以及答案需要呈現何種證據。
一句話決策
使用 網頁搜尋 查詢當前公開事實;使用 檔案搜尋 查詢受管轄的內部或精選知識;當任務需要調和外部世界與組織規則時,兩者並用。
| 需求 | 網頁搜尋 | 檔案搜尋 | | 當前公開新聞或文件 | 高度契合 | 僅在你上傳的情況下 | | 隱私政策或客戶檔案 | 錯誤工具 | 高度契合 | | 語料庫層級存取控制 | 領域控制,非文件 ACL | 您的向量儲存架構控制範圍 | | 來源引用 | 網路引用與來源列表 | 檔案註解與可選結果詳細資訊 | | 確定性來源集 | 受限於即時網路 | 當語料庫與篩選條件受控時為高 | | 維護 | 搜尋保持最新 | 您可攝入、更新及刪除檔案 |
GPT-6 Astra 的網路搜尋運作方式
在 Responses API 中,新增了託管的 web_search 工具。模型可以自行判斷何時需要搜尋,並將最新的來源資訊融入其回答中。
const response = await client.responses.create({
model: "gpt-6-astra",
工具:[{
type: "網頁搜尋",
filters: {
allowed_domains: ["developers.openai.com", "platform.openai.com"]
}
}],
包含: ["web_search_call.action.sources"],
input: "總結目前官方對 Responses API 串流的指引。"
});
網域篩選是一種治理輔助工具。目前的 Responses API 文件允許最多 100 個允許網域和 100 個封鎖網域;網域條目省略了協定。允許清單對於合規、醫療、法律或技術研究非常有用,在這些領域中,廣泛的網路結果不如一組狹義的主要來源有價值。
上面的 include 欄位會回傳搜尋動作所查閱的完整 URL 清單。該清單可能比最終文本中選用的較小引用集合還要大。當可稽核性重要時,請儲存來源元資料,但不要假設某個引用能證明生成段落中的每個子句。您的使用者介面應清楚呈現來源與主張之間的關聯。
當網路搜尋勝出時
選擇它用於發行說明、市場變動、公共法規、活動時程、產品供應情況以及其他時效性重要的事實。當使用者明確要求可開啟的來源時,此選項也相當實用。
網路搜尋並非存取私人內部網路的方式,也無法保證每個來源都具有權威性。請盡可能限制搜尋網域、要求提供原始來源,並驗證重大主張。
檔案搜尋的運作方式
檔案搜尋是一個由向量儲存庫支援的託管式 Responses API 工具。您首先建立一個向量儲存庫、上傳檔案,並將其附加,以便 OpenAI 能夠處理內容。接著,一個請求會提供一個或多個向量儲存庫 ID。
= await client.responses.create({
model: "gpt-6-astra",
tools: [{
type: "file_search",
vector_store_ids: ["vs_company_handbook"],
max_num_results: 8,
filters: {
type: "eq",
key: "部門",
value: "支援"
}
}],
include: ["file_search_call.results"],
input: "我們企業事件的升級政策是什麼?"
});
元數據篩選器可將檢索範圍限制在相關子集內,例如地區、部門、文件版本或出版年份。max_num_results 是在精確度、延遲與上下文之間的權衡:數量過少可能遺漏關鍵證據,過多則可能增加雜訊。請使用真實問題與標記的預期來源進行評估。
當檔案搜尋勝出時
適用於政策、合約、研究資料庫、產品手冊、核准的品牌指南、客戶提供的文件,以及其他有範圍限制的知識。創意團隊可以儲存腳本、角色設定集與製作筆記,然後透過檢索功能,在 Elser AI 等產品中為後續工作提供依據。重點在於來源出處:答案應來自核准的專案語料庫,而非隨機的公開網頁。
檔案搜尋不會自動讓答案正確。缺少檔案、上傳過時、區塊比對薄弱或查詢範圍過廣,仍可能產生不完整的答案。檢索品質與答案品質需要分別評估。
同時使用兩者以獲得符合政策的當前答案
許多商業問題涉及兩個證據層面。「我們能在德國推出這項促銷活動嗎?」可能需要現行公共法規與公司當前的核准政策。請配置這兩項工具,清楚標示每個來源類別,並指示模型依權威性而非便利性來解決衝突。
一個穩健的序列是:
- 取得適用的內部政策及版本;
- 搜尋目前主要公開來源;
- 找出不一致或缺失的日期;
- 提供附有引用的合格答案;
- 升級問題而非自行發明解決方案。
請勿將證據合併為單一匿名摘要。使用者應能知道哪些陳述來自公司文件,哪些來自公開網路。
選擇前需思考的五個設計問題
答案需要多新?
如果「今天」很重要,請搜尋網路或持續更新你的向量資料庫。僅靠模型知識並非正確的資訊來源。
誰可以查看原始碼?
針對檔案搜尋,建立與授權邊界相符的向量儲存庫邊界。切勿廣泛檢索後再要求模型進行刪減。存取控制應在檢索之前執行。
誰控制正確性?
內部合規團隊可以核准一個檔案語料庫。沒有人能控制整個網路。相反地,內部快照可能會過時,而監管機構的網站卻在變動。
UI 必須揭露哪些證據?
針對網頁搜尋,保留引用來源,並在必要時保留完整的查閱來源清單。針對檔案搜尋,在開發與稽核期間要求納入結果。避免向未經授權的使用者顯示原始檢索到的機密文字。
什麼是故障模式?
判斷「沒有強烈證據」時,應產生拒絕、釐清問題、更廣泛搜尋或升級至真人處理。沉默猜測是最糟的預設做法。
反映生產環境的檢索評估
建立一個包含可回答、不可回答、模糊及權限敏感查詢的測試集。將檢索與生成分開評分:
- 正確的來源是否進入了前幾名結果?
- 是否偏好最新的權威版本?
- 答案是否引用了實際支持該主張的來源?
- 篩選器是否防止了跨租戶或跨區域的資料外洩?
- 模型是否在證據不足時承認了?
也應測量延遲與工具呼叫頻率。減少 max_num_results 可能加快請求速度,但會損害召回率。狹窄的領域許可清單可能提升信任度,但當主要來源變更時會失效。檢索設定需要進行回歸測試。
常見問題
檔案搜尋可以直接存取我筆電上的檔案嗎?
不行。檔案必須透過 API 工作流程上傳並與向量儲存庫關聯。
網頁搜尋能否限制在信任的網站?
是的。Responses API 的網域篩選器可以在文件規範的範圍內允許或封鎖網域。請將此篩選器視為來源治理的一層。
我應該把文件貼到提示中嗎?
對於一份簡短的文件,這可能是最簡單的方式。但對於可重複使用或持續擴充的語料庫,檔案搜尋通常能提供更好的檢索與維護效果。請根據您的工作負載測試這兩種方法。
模型能否在一個回應中使用兩種工具?
是的,當兩者都提供且任務需要時。請明確說明來源權威性及衝突處理方式。
結論
網路搜尋回答「現在公開的事實是什麼?」;檔案搜尋回答「這個受控語料庫說了什麼?」。可靠的 GPT-6 Astra 系統會保留此區別,在檢索前套用授權,揭露適當的證據,並將來源選擇與文筆品質分開評估。僅在使用者的問題確實橫跨兩個世界時,才結合這些工具。






























































































