AI 產業正蓬勃發展,新的應用案例每天都在湧現。為了充分利用這項技術的潛力,企業需要大規模的資料。然而,在許多情況下,相關資訊被阻擋或缺乏結構,這限制了 AI 模型對其的利用。
要理解這項挑戰,請思考網路本身的基礎。網路最初並非為 AI 應用所需的自動化發現和檢索而設計。克服這種固有的設計限制,需要專門的基礎設施。
AI 的下一個前沿可能取決於一個全新的網路資料基礎設施層,它能讓模型發現並繪製這個不斷擴展的數位領域。這個層級必須能夠導航數億個現有網域,以及每週新增的數十億個 URL,提供即時資訊並克服技術障礙。
網路資料收集平台 Bright Data 的執行長 Or Lenchner 表示:「資料顯示,還有遠超乎想像的資料存在。想像一下宇宙:它就在那裡,但你不知道你不知道什麼。」
早期 AI 的突破是由訓練資料和模型規模的擴大所推動,但現在組織面臨一個根本性的瓶頸:他們需要跟上網路資料動態、非結構化和不斷演變的特性,才能讓輸出基於最新且可驗證的資訊。AI 效能越來越不只取決於模型架構,還取決於系統的運算、網路、檢索和資料工程能力,也就是說,系統快速可靠地檢索新鮮、相關且可信賴資料的能力。
傳統模型訓練依賴於在特定時間點收集的資訊快照。用這種靜態資料訓練 AI 已不再足夠。為了追蹤競爭對手定價、消費者情緒和市場趨勢等波動,公司需要持續不斷的新資訊流,即時提取資料並附帶相關上下文。因此,他們的基礎設施必須能夠處理跨越地理、語言、格式和存取規則各異的數百萬個網站的同時互動。
Lenchner 表示:「如果無法檢索即時資訊,它就缺乏上下文。在商業環境中,這已不再可接受。過時的答案會導致錯誤的決策和失望的消費者。」
速度不僅僅是便利性的問題,更是必要性。如今的組織在價格、庫存、市場、安全威脅和客戶行為不斷變化的環境中運作。資料檢索的延遲會降低一個原本複雜模型的實用性。
使用即時、高品質的網路資料還可以減少 AI 幻覺,因為模型擁有更相關的知識庫,這能建立使用者信任。事實上,一項調查發現,56% 的 AI 從業者表示,企業需要存取即時網路資料來提高對 AI 輸出的信任。為了確保模型高效運作,資訊也必須精簡到必要的要素。
儘管檢索增強生成 (RAG) 技術已問世,模型可以在查詢時提取外部資料,但許多 AI 系統在實際操作中仍難以提供最新、具上下文相關性且可信賴的輸出。根據 Gartner 的數據,到今年底,60% 未獲 AI 就緒資料(準確、結構化、組織化且具上下文的資料)支持的 AI 專案將被放棄。
這是因為單純的大規模檢索並不能解決問題。正如 Lenchner 所說:「你需要大規模檢索資料,但也要即時。由於終端使用者正在等待輸出,延遲就成為一個問題。」
大規模存取新鮮的 AI 就緒資料帶來了技術和結構上的挑戰。實際上,許多企業系統在他們的 AI 應用中結合了公開網路檢索、API、授權資料集和專有內部資料。將這些零散的來源整合到一個及時且可用的知識層,需要專業能力。一些研究發現,97% 的 AI 組織依賴即時網路資料基礎設施,但 90% 感到受到各種限制。公司正日益開發技術方法來應對這些限制。
Lenchner 打了個比方:「把訓練好的模型想像成智慧,相關資料想像成知識。一個強大的智慧層建立在空洞的知識層之上,就像一個什麼都不知道的天才,在實踐中毫無用處。智慧和知識必須結合在一起。」
新的基礎設施承諾:一個新的網路資料基礎設施層可以透過實現資料發現、即時存取和針對特定上下文的客製化,來解決這種對更強大 AI 輸入日益增長的需求。正如 Lenchner 所描述的:「這一切都關乎於大規模收集資料,超低延遲,且不被阻擋。」
這類平台不依賴增加運算能力,而是模仿人類瀏覽行為來存取可用內容,並將原始程式碼轉換為結構化資料流。它能與傳統抓取工具可能無法互動的網站協同工作,例如那些大量使用 JavaScript 或具有強大反機器人軟體的網站。
正如 Lenchner 解釋的:「這基本上是擁有一個基礎設施,能夠模仿一個帶有識別資訊(IP 位址、位置和 1,000 多個其他參數)的網路使用者。而且是大規模的。想像一下每天為數百萬個網站執行 800 億次這樣的操作。而且每一次,你都看起來完全符合網站的預期。」
當然,持續檢索會帶來新的資料治理挑戰。為了解決這些問題,平台可以執行符合全球隱私框架的嚴格合規協議,例如歐盟的通用資料保護條例 (GDPR) 和加州消費者隱私法 (CCPA)。它們也可以僅限於公開可存取的公共資訊,避免付費牆或私人登入。任何使用的網路都可以經過審查並基於同意,並向 IP 位址所有者提供激勵。透過這種方式,系統可以設計成符合日益嚴格的法規。
如此複雜的功能並不容易實現。Lenchner 表示:「當這對一家公司來說是關鍵基礎設施時,內部開發就變成了一個全職的工程問題,與實際的 AI 工作競爭資源。」解決這種複雜性需要組織投入大量資源,導致許多公司尋求專門為資料檢索、編排和可觀察性設計的平台。
真實世界的基礎設施:即時資料檢索正在改變 AI 系統在組織內部能做什麼。例如,一家零售公司可以利用公開資訊來啟用動態定價引擎,而全球品牌可以追蹤商標侵權行為。
隨著生態系統的成熟,投資於這個新興資料基礎設施層的組織將能更好地建立更具響應性、可靠且符合實際條件的 AI 系統,這些 AI 系統能夠利用當前網路資料持續適應。隨著時間的推移,AI 模型與為其提供資料的基礎設施之間的區別甚至可能開始消失。
正如 Lenchner 所說:「世界正在改變。世界上發生的一切都被上傳到公共網路。新資料的產生量正在增長並加速。」
要了解更多 Bright Data 的資訊,請閱讀《Data for AI 2026》報告。
此內容由 MIT Technology Review 的客製化內容部門 Insights 製作。它並非由 MIT Technology Review 的編輯人員撰寫。它由人類作家、編輯、分析師和插畫師進行研究、設計和撰寫。這包括調查的撰寫和資料收集。可能使用的 AI 工具僅限於經過徹底人工審查的次要生產流程。

