結論先講
選搜尋 API 時,看官方文件和別人的評測都不準——因為你的題目跟他們的不一樣。
尤其在繁體中文的在地產業題目上,差異極大:一個在英文科技題表現最好的工具,可能完全找不到台灣的政府或公協會資料。
唯一可靠的方法是自己跑一次公平測試。 三個要素:
- 同一題——所有工具用完全相同的研究題目
- 同一份輸出規格——強制每筆結果回報相同欄位
- 七個量化指標——把「感覺比較好」變成可比較的數字
第一步:先把題目縮小到可以驗收
模糊的題目測不出差異。「請幫我研究台灣的咖啡市場」——每個工具都會給你一堆東西,你無法判斷誰比較好。
可驗收的題目長這樣:明確的主題、地區、時間範圍、結果數量與來源類型要求。
第二步:所有工具用同一份提示
把下面這段完整貼給每一個要測的工具,只換題目:
研究題目:{填入}
地區:台灣
時間範圍:最近 12 個月
結果上限:10 筆
至少包含:
- 2 個政府/公協會來源
- 2 個公司官方來源
- 2 個原始研究或可信媒體
每筆只輸出:
- 標題、網址、發布者、發布日期
- 來源類型
- 與題目的關聯
- 是否含可引用數據
- 擷取日期
這一輪不要寫市場結論,只收集搜尋結果。
最後那句是整套方法的關鍵
「這一輪不要寫市場結論。」
因為結論會掩蓋來源品質。工具寫得頭頭是道時,你很容易忽略它其實只找到三個新聞轉載。
限制成「只收集結果」,你才能公平比較各工具實際找到了什麼。分析能力可以之後另外評估——兩件事不要混在一起測。
第三步:七個指標
| 指標 | 怎麼算 | 驗收問題 |
|---|---|---|
| 相關性 | 真正可用結果 ÷ 10 | 是否直接回答研究問題? |
| 新鮮度 | 期間內結果 ÷ 10 | 發布日期能否確認? |
| 台灣覆蓋 | 在地來源 ÷ 10 | 是否找到政府與產業資料? |
| 多樣性 | 來源類型數 | 是否只找到新聞轉載? |
| 可追溯 | 可開啟且支持內容 ÷ 10 | 引用是否真的對應? |
| 重複率 | 重複事件 ÷ 10 | 十個網址其實有幾件事? |
| 成本/延遲 | 記錄請求數、額度、費用、秒數 | 品質提升是否值得? |
三個最該優先算的
資源有限時,至少算這三個:
- 相關性——決定它有沒有用
- 台灣覆蓋——決定它適不適合在地題目
- 可追溯——決定你敢不敢把結果放進報告
重複率為什麼要單獨算
十個網址常常其實只有三件事。
新聞轉載會讓同一則消息以不同網址出現多次,看起來結果很豐富,實際資訊量很少。
不算重複率的話,你會誤判某個工具「找到很多資料」,直到真的開始讀才發現大半是同一篇。
可追溯是最容易被忽略的一項
逐一點開每個網址,確認它真的支持工具所說的內容。
這一步很花時間,但它會篩掉一整類問題:有些工具會給出真實存在的網址,但那個頁面其實沒有它引用的那個數字。
一旦這種結果進了你的報告,出錯的是你,不是工具。
五類工具不要互相假裝
測試之前先搞清楚你在比什麼。這些是不同類別的東西:
| 類別 | 做什麼 | 適合 |
|---|---|---|
| AI 搜尋/研究 | 邊搜邊整理成答案 | 快速掌握全貌 |
| 獨立搜尋索引 | 自建索引的搜尋結果 | 不想依賴單一大廠 |
| 語意/專業搜尋 | 依語意而非關鍵字匹配 | 學術與技術題目 |
| 爬取/擷取 | 給網址,回傳乾淨內容 | 已知來源要取全文 |
| 搜尋結果頁抓取 | 回傳搜尋引擎的結果頁 | 要看排名或特定站內結果 |
| 影音內容資料 | 影片與播客的字幕與後設資料 | 訪談與演講類情報 |
拿「爬取工具」去比「AI 研究工具」的相關性,是沒有意義的。 前者的工作是把你給的網址抓乾淨,它本來就不負責找網址。
先確認同類,再比指標。
第四步:把失敗情境也測一次
只測順利情況,上線後才會發現問題。四個必測的失敗場景:
| 場景 | 測什麼 | 合格的行為 |
|---|---|---|
| 來源失效 | 給一個已下架的網址 | 明確回報失效,不要憑印象編內容 |
| 額度用完 | 刻意跑到額度上限 | 明確報錯,不要靜默回空結果 |
| 零結果 | 問一個極冷門的題目 | 回報「找不到」,不要硬湊 |
| 來源衝突 | 兩個來源數字不同 | 並列兩者並標註差異,不要選一個當定論 |
第四項最能區分工具品質。 遇到衝突就自己挑一個講的工具,不能拿來做研究——因為你不知道它挑掉了什麼。
一張填完就知道答案的表
跑完之後,你的表會長這樣:
| 指標 | 工具 A | 工具 B | 工具 C |
|---|---|---|---|
| 相關性 | 7/10 | 9/10 | 5/10 |
| 台灣覆蓋 | 2/10 | 6/10 | 8/10 |
| 可追溯 | 9/10 | 7/10 | 9/10 |
| 重複率 | 4/10 | 1/10 | 3/10 |
| 成本(每次) | — | — | — |
這張表通常不會有一個工具全部最高。 而那正是它的價值——你會發現「相關性最好的那個,台灣資料最少」,於是知道該用組合而不是選一個。
多久重測一次
換模型、換方案,或發現結果品質下滑時。
這類工具的索引範圍與底層模型會持續變動,半年前的測試結果不一定還成立。
務實做法:把測試題與這張計算表存成一份可複用的文件。重測的成本就只剩跑一輪的時間,而不是重新設計一套方法。
常見問題
為什麼不能直接看別人的評測結果?
因為搜尋品質高度依賴題目與語言。一個在英文科技題目上表現最好的工具,在繁體中文的在地產業題目上可能找不到任何政府或公協會資料。別人的評測告訴你的是「它在他的場景好用」,你需要知道的是「它在我的場景好不好用」——而那只能自己跑一次。
七個指標一定要全部算嗎?
至少要算相關性、台灣覆蓋與可追溯這三個。相關性決定它有沒有用,台灣覆蓋決定它適不適合在地題目,可追溯決定你敢不敢把結果放進報告。其餘四項在需要控制成本或發現結果重複太多時再補。
重複率為什麼要單獨算?
因為十個網址常常其實只有三件事。新聞轉載會讓同一則消息以不同網址出現多次,看起來結果很豐富,實際資訊量很少。不算重複率的話,你會誤判某個工具「找到很多資料」,直到真的開始讀才發現大半是同一篇。
測試時為什麼要禁止工具寫結論?
因為結論會掩蓋來源品質。工具寫得頭頭是道時,你很容易忽略它其實只找到三個新聞轉載。把這一輪限制成「只收集搜尋結果」,你才能公平比較各工具實際找到了什麼——分析能力可以之後另外評估,兩件事不要混在一起測。
測完之後多久要重測一次?
換模型、換方案或發現結果品質下滑時就重測。這類工具的索引範圍與模型會持續變動,半年前的測試結果不一定還成立。務實做法是把測試題與計算表存成一份可複用的文件,重測的成本就只剩跑一輪的時間。