網(wǎng)絡(luò)環(huán)境的網(wǎng)頁瀏覽智能體評測基準(zhǔn))
1. 項(xiàng)目緣起為什么需要一個“韓語語境”的網(wǎng)頁瀏覽智能體評測基準(zhǔn)最近和幾個做AI智能體Agent的朋友聊天大家普遍有個感覺現(xiàn)在各種“網(wǎng)頁瀏覽智能體”的評測基準(zhǔn)Benchmark層出不窮但仔細(xì)一看絕大多數(shù)都是基于英語世界構(gòu)建的。無論是任務(wù)指令、評測網(wǎng)站還是背后的知識庫都默認(rèn)用戶在一個英語的、或者說全球化的互聯(lián)網(wǎng)環(huán)境中操作。這當(dāng)然有它的道理英語互聯(lián)網(wǎng)內(nèi)容最豐富技術(shù)生態(tài)也最成熟。但問題也隨之而來當(dāng)我們把這些在英語基準(zhǔn)上表現(xiàn)優(yōu)異的智能體直接丟到一個韓語網(wǎng)站或者一個需要理解韓國本地文化、社會規(guī)則、商業(yè)習(xí)慣的場景里它們還能那么“智能”嗎答案往往是否定的。我親眼見過一個在英文電商網(wǎng)站能流暢比價的智能體面對韓國Gmarket或Coupang時連基本的商品分類導(dǎo)航都搞不定更別提理解那些復(fù)雜的會員積分、限時折扣、地區(qū)配送規(guī)則了。這不僅僅是語言翻譯的問題。一個“韓語語境”意味著獨(dú)特的網(wǎng)絡(luò)生態(tài)如Naver、Daum等門戶網(wǎng)站的主導(dǎo)地位、特定的信息呈現(xiàn)方式如實(shí)名制評論文化、社區(qū)論壇的獨(dú)特用語、以及深植于本地生活場景的任務(wù)如查找韓國本地的外賣優(yōu)惠、預(yù)約公立醫(yī)院掛號、理解公寓??/??租賃合同條款。這些都是通用英語基準(zhǔn)無法覆蓋的“暗礁”。K-BrowseComp這個項(xiàng)目正是瞄準(zhǔn)了這個空白。它不是一個簡單的語言翻譯任務(wù)集而是一個扎根于韓國真實(shí)網(wǎng)絡(luò)環(huán)境與文化背景的網(wǎng)頁瀏覽智能體能力評測基準(zhǔn)。它的核心價值在于逼迫我們?nèi)ニ伎家粋€真正“智能”的網(wǎng)頁瀏覽助手除了能解析HTML、點(diǎn)擊鏈接、填寫表單這些基礎(chǔ)操作是否還需要理解特定社會的“潛規(guī)則”benchmark這個詞最近很熱但benchmark-as-sweep基準(zhǔn)即橫掃的思維要不得。我們不能用一個尺子量天下尤其是在AI應(yīng)用落地越來越講究場景深度的今天。K-BrowseComp的出現(xiàn)正是為了提供那把測量“韓語場景適配度”的專用尺子。2. K-BrowseComp基準(zhǔn)的核心構(gòu)成任務(wù)、環(huán)境與評估維度要構(gòu)建一個可靠的基準(zhǔn)光有想法不夠必須有扎實(shí)的、可復(fù)現(xiàn)的架構(gòu)。K-BrowseComp的設(shè)計(jì)我認(rèn)為主要圍繞三個核心支柱展開任務(wù)定義、仿真環(huán)境、以及多維度的評估體系。2.1 任務(wù)設(shè)計(jì)從“信息查找”到“復(fù)雜事務(wù)辦理”一個好的基準(zhǔn)其任務(wù)必須具有代表性和層次性。K-BrowseComp的任務(wù)庫絕非簡單的“翻譯”現(xiàn)有英文任務(wù)而是深度結(jié)合韓國本土化需求進(jìn)行原創(chuàng)設(shè)計(jì)。我們可以將其任務(wù)大致分為幾個難度階梯第一層基礎(chǔ)信息檢索與驗(yàn)證。這類任務(wù)考驗(yàn)智能體在韓語信息海洋中的導(dǎo)航與甄別能力。例如“在Naver地圖上找出首爾麻浦區(qū)合井洞附近評分高于4.0、且提供‘打包’服務(wù)的韓式炸雞店并列出前三家的店名、電話和最新的一條用戶評論?!薄霸L問韓國金融監(jiān)督院的公告頁面找到過去一周內(nèi)關(guān)于‘虛擬資產(chǎn)????’交易所的最新監(jiān)管通知并提取通知的發(fā)布日期和核心要求?!边@類任務(wù)的難點(diǎn)在于智能體需要理解韓國網(wǎng)站的信息架構(gòu)如Naver的“???”和“??”內(nèi)容權(quán)重很高、熟悉本地化的篩選條件如餐廳的“??”服務(wù)并能從非結(jié)構(gòu)化的文本如韓語評論中提取關(guān)鍵信息。第二層多步驟表單交互與流程理解。這模擬了真實(shí)的線上辦事流程。例如“在韓國鐵路公司Korail的網(wǎng)站上查詢從首爾站到釜山站明天下午2點(diǎn)以后出發(fā)的KTX列車班次。選擇一班模擬填寫乘客信息需生成符合韓國格式的姓名和電話號碼并進(jìn)入到支付預(yù)覽頁面無需真實(shí)支付?!薄霸陧n國就業(yè)門戶網(wǎng)站‘???’上搜索位于板橋科技谷???????、要求3年以上經(jīng)驗(yàn)的‘后端開發(fā)工程師??? ???’職位并按照‘最新發(fā)布’排序獲取前五個職位的公司名、職位鏈接和核心技術(shù)要求?!边@里的關(guān)鍵是理解韓國網(wǎng)站的表單邏輯、輸入驗(yàn)證規(guī)則如手機(jī)號格式010-XXXX-XXXX、以及業(yè)務(wù)流程中的潛在步驟如Korail的會員登錄彈窗、???上的詳細(xì)篩選面板。第三層文化與社會語境理解。這是最具挑戰(zhàn)性的一類智能體需要具備一定的“社會常識”。例如“近期韓國‘???’公休日期間很多博物館免費(fèi)開放。請查找國立中央博物館在下一個公休日的特別開放計(jì)劃和需要提前預(yù)約的展覽?!薄耙晃煌鈬笥严朐陧n國租房需要了解‘??’和‘??’的根本區(qū)別、各自的優(yōu)缺點(diǎn)以及通過‘??’或‘??’找房時需要注意哪些合同條款陷阱。”完成這類任務(wù)要求智能體不僅能爬取信息更要能理解信息背后的社會制度、商業(yè)慣例和法律常識甚至需要整合多個信息源進(jìn)行交叉驗(yàn)證和總結(jié)。2.2 仿真環(huán)境構(gòu)建真實(shí)網(wǎng)站與安全沙盒的平衡直接在真實(shí)網(wǎng)站上運(yùn)行自動化智能體進(jìn)行大規(guī)模測試是不道德且不穩(wěn)定的可能觸發(fā)反爬機(jī)制干擾網(wǎng)站運(yùn)營。因此K-BrowseComp需要一個高質(zhì)量的仿真環(huán)境。理想方案是構(gòu)建一個韓語網(wǎng)站的鏡像沙盒。這個沙盒會抓取一批具有代表性的韓國網(wǎng)站如Naver, Daum, 各大銀行、政府門戶、電商平臺、社區(qū)論壇等的靜態(tài)頁面并剝離掉敏感的個人數(shù)據(jù)形成一個本地的、可交互的網(wǎng)頁副本集。智能體在這個沙盒中操作其所有行為點(diǎn)擊、輸入、滾動都被限制在本地不會對真實(shí)互聯(lián)網(wǎng)造成影響。技術(shù)實(shí)現(xiàn)上這可能基于已有的網(wǎng)頁仿真框架如WebShop、MiniWoB的擴(kuò)展但需要針對韓語網(wǎng)頁的特點(diǎn)進(jìn)行深度定制DOM樹解析與韓語文本處理需要集成優(yōu)秀的韓語分詞器如KoNLPy和命名實(shí)體識別工具以便智能體能準(zhǔn)確理解頁面中的韓文實(shí)體如人名、地名、機(jī)構(gòu)名、日期格式。交互元素標(biāo)注除了標(biāo)準(zhǔn)的按鈕、輸入框還需要識別韓國網(wǎng)站特有的交互組件如“????”認(rèn)證按鈕、“???”查看更多折疊區(qū)域、以及復(fù)雜的日歷選擇器。會話狀態(tài)管理很多韓國網(wǎng)站流程依賴會話Session和Cookie如登錄狀態(tài)、購物車。仿真環(huán)境需要能模擬這些狀態(tài)的管理和傳遞讓智能體可以完成需要登錄的多步驟任務(wù)。構(gòu)建這樣一個高質(zhì)量、高覆蓋度的韓語網(wǎng)站沙盒是K-BrowseComp項(xiàng)目最大的工程挑戰(zhàn)之一也是其價值所在——它本身就是一個珍貴的韓語網(wǎng)頁交互研究數(shù)據(jù)集。2.3 評估體系超越“任務(wù)完成率”的精細(xì)度量傳統(tǒng)的智能體評測可能只關(guān)心“任務(wù)最終成功了嗎”任務(wù)完成率。但K-BrowseComp作為一個深度基準(zhǔn)必須提供更細(xì)致的評估維度以診斷智能體究竟“卡”在了哪里。1. 過程合規(guī)性評估智能體是否遵循了高效、合理的瀏覽路徑它有沒有在無關(guān)頁面上浪費(fèi)時間有沒有進(jìn)行不必要的重復(fù)操作這可以通過記錄智能體的行動序列Action Sequence并與專家標(biāo)注的“最優(yōu)路徑”或“可接受路徑”進(jìn)行比較來衡量。例如一個智能體如果直接去搜索框輸入關(guān)鍵詞而不是先點(diǎn)開正確的分類導(dǎo)航可能會被扣分。2. 信息提取準(zhǔn)確性評估對于需要提取特定信息的任務(wù)需要精確評估提取內(nèi)容的正確性和完整性。這不僅包括文本內(nèi)容是否匹配還包括提取的格式是否符合要求如日期是否為YYYY-MM-DD格式電話號碼是否帶連接符。可以采用基于語義相似度的評分如使用Ko-SBERT計(jì)算向量相似度并結(jié)合精確匹配進(jìn)行綜合判斷。3. 交互魯棒性評估智能體如何處理異常情況例如當(dāng)它點(diǎn)擊一個按鈕后頁面沒有立即跳轉(zhuǎn)可能是網(wǎng)絡(luò)延遲它會耐心等待還是錯誤地重復(fù)點(diǎn)擊當(dāng)它遇到“???? ?? ? ????”頁面未找到的404錯誤時是否會嘗試退回上一步或重新導(dǎo)航這些邊緣情況的處理能力是智能體能否在真實(shí)復(fù)雜網(wǎng)絡(luò)中穩(wěn)定運(yùn)行的關(guān)鍵。4. 文化適配度評估高階這是K-BrowseComp的特色??梢栽O(shè)計(jì)一些主觀評分項(xiàng)由熟悉韓國文化的評估者對智能體的“行為恰當(dāng)性”進(jìn)行打分。例如在一個韓國社區(qū)論壇發(fā)帖時智能體生成的標(biāo)題和內(nèi)容是否符合當(dāng)?shù)厣鐓^(qū)的用語習(xí)慣和禮儀在查詢政府服務(wù)時是否使用了恰當(dāng)、正式的敬語表達(dá)雖然這部分主觀性強(qiáng)但對于衡量智能體的“社會智能”至關(guān)重要。通過這套多維度的評估體系我們不僅能給智能體打一個總分更能得到一份詳細(xì)的“能力診斷報告”明確指出它在語言理解、流程導(dǎo)航、異常處理或文化認(rèn)知方面的具體短板。3. 對現(xiàn)有智能體技術(shù)的挑戰(zhàn)與啟示當(dāng)我們將現(xiàn)有的主流網(wǎng)頁瀏覽智能體無論是基于純文本的模型如GPT-4還是多模態(tài)模型如GPT-4V或是專門的Agent框架如AutoGPT、WebGPT的變體放到K-BrowseComp上進(jìn)行測試時預(yù)計(jì)會暴露出一些共性問題這也為未來的技術(shù)發(fā)展指明了方向。挑戰(zhàn)一韓語語言模型的“幻覺”與知識滯后。許多智能體依賴的大語言模型LLM其韓語訓(xùn)練數(shù)據(jù)可能質(zhì)量不均或存在滯后。這會導(dǎo)致兩個問題一是對韓國當(dāng)下流行的新詞、縮略語、網(wǎng)絡(luò)用語理解偏差產(chǎn)生“幻覺”二是對快速變化的本地信息如最新政策、熱門活動一無所知。例如模型可能不知道“???”脫發(fā)者社區(qū)最近熱議的某款新藥或者不理解“N???”具體指代哪幾項(xiàng)“放棄”。智能體需要更強(qiáng)的實(shí)時信息檢索與驗(yàn)證能力而不能完全依賴模型的內(nèi)置知識。挑戰(zhàn)二對韓國網(wǎng)站特有交互模式的不適應(yīng)。韓國網(wǎng)站前端設(shè)計(jì)有其獨(dú)特風(fēng)格比如大量使用Flash或復(fù)雜JavaScript實(shí)現(xiàn)的動態(tài)內(nèi)容雖然近年減少、密集的信息排版、以及深度嵌套的導(dǎo)航菜單。許多為西方網(wǎng)站設(shè)計(jì)的網(wǎng)頁解析工具如基于視覺的定位可能在這里失效。智能體需要更魯棒的視覺理解與DOM結(jié)構(gòu)分析相結(jié)合的策略。例如它需要能識別一個圖片按鈕上的韓文并將其與功能關(guān)聯(lián)起來。挑戰(zhàn)三跨頁面狀態(tài)跟蹤與流程理解的薄弱。完成一個復(fù)雜的韓國在線業(yè)務(wù)如申請電子政府?dāng)?shù)字證書“?????”雖然正在被簡化但流程依然復(fù)雜往往需要跨越十幾個頁面中間涉及多次信息確認(rèn)、彈窗處理和短信驗(yàn)證。當(dāng)前的智能體在長流程、多狀態(tài)的會話管理上普遍較弱容易在某個步驟丟失上下文或忘記最終目標(biāo)。K-BrowseComp中的多步驟任務(wù)將充分考驗(yàn)智能體的“工作記憶”和流程規(guī)劃能力。給開發(fā)者的啟示領(lǐng)域微調(diào)與檢索增強(qiáng)考慮使用高質(zhì)量的韓語文本和代碼數(shù)據(jù)對基礎(chǔ)LLM進(jìn)行微調(diào)并強(qiáng)制智能體在行動前優(yōu)先從當(dāng)前頁面或外部知識庫中檢索相關(guān)證據(jù)減少幻覺?;旌辖换ゲ呗圆灰灰蕾囈环N頁面解析方式。結(jié)合視覺特征截圖、DOM結(jié)構(gòu)、可訪問性樹Accessibility Tree以及經(jīng)過翻譯和語義理解的文本綜合判斷可交互元素及其含義。顯式狀態(tài)管理為智能體設(shè)計(jì)顯式的狀態(tài)跟蹤模塊記錄當(dāng)前任務(wù)目標(biāo)、已完成步驟、已獲取的關(guān)鍵信息如訂單號、驗(yàn)證碼、以及當(dāng)前的頁面上下文。這類似于給智能體一個“記事本”。4. 構(gòu)建與使用K-BrowseComp基準(zhǔn)的實(shí)踐思考如果你是一個研究者或開發(fā)者想要基于K-BrowseComp開展工作或者受其啟發(fā)構(gòu)建其他語種的基準(zhǔn)這里有一些從工程實(shí)踐角度出發(fā)的思考。4.1 任務(wù)收集與標(biāo)注的可持續(xù)性構(gòu)建基準(zhǔn)最大的成本是高質(zhì)量數(shù)據(jù)的收集與標(biāo)注。對于K-BrowseComp任務(wù)不能只靠項(xiàng)目組閉門造車。一個可行的策略是眾包與專家結(jié)合通過眾包平臺如Amazon Mechanical Turk的韓國版或本地平臺征集大量基礎(chǔ)任務(wù)想法和初始指令然后由熟悉韓國網(wǎng)絡(luò)生態(tài)的專家進(jìn)行篩選、修正和豐富確保任務(wù)的真實(shí)性和復(fù)雜性。模板化與程序化生成對于某些類型的任務(wù)如商品查詢、航班搜索可以設(shè)計(jì)任務(wù)模板然后通過程序替換其中的實(shí)體如商品類別、出發(fā)地、目的地來批量生成大量同構(gòu)但內(nèi)容不同的任務(wù)提高數(shù)據(jù)集的規(guī)模。4.2 仿真環(huán)境的維護(hù)與更新互聯(lián)網(wǎng)是動態(tài)的網(wǎng)站改版是常態(tài)。K-BrowseComp的仿真環(huán)境面臨“過期”的風(fēng)險。版本化與快照基準(zhǔn)發(fā)布時應(yīng)明確標(biāo)注其仿真環(huán)境所基于的網(wǎng)站快照日期。后續(xù)可以定期如每半年或一年更新主要網(wǎng)站的鏡像發(fā)布新版本基準(zhǔn)并記錄不同版本上智能體性能的變化這本身也是一個有趣的研究點(diǎn)智能體對網(wǎng)站變化的適應(yīng)力。輕量級實(shí)時補(bǔ)丁對于核心評測網(wǎng)站的重大改版可以考慮提供輕量級的“補(bǔ)丁包”只更新變化部分的頁面結(jié)構(gòu)和交互邏輯而不是重新抓取整個網(wǎng)站。4.3 在本地復(fù)現(xiàn)與評估智能體對于大多數(shù)團(tuán)隊(duì)可能沒有資源運(yùn)行完整的K-BrowseComp仿真環(huán)境。這時可以考慮抽取核心任務(wù)子集從K-BrowseComp中挑選一批最具代表性的任務(wù)覆蓋不同難度和類型在本地搭建一個小型測試環(huán)境進(jìn)行快速迭代和驗(yàn)證。關(guān)注評估腳本即使無法運(yùn)行全部任務(wù)仔細(xì)研究K-BrowseComp開源的評估腳本和指標(biāo)計(jì)算方法將其思想借鑒到自己的評測體系中提升評估的科學(xué)性。使用公開排行榜如果K-BrowseComp項(xiàng)目維護(hù)一個公開的排行榜可以將自己的智能體提交到其在線評估系統(tǒng)如果有的話進(jìn)行測試獲取客觀分?jǐn)?shù)和排名。一個重要的實(shí)操心得是不要等到智能體完全成熟才去跑完整的基準(zhǔn)。在開發(fā)早期就選取K-BrowseComp中的幾個典型任務(wù)作為“試金石”能快速暴露智能體在韓語場景下的架構(gòu)缺陷。例如你可以先讓智能體嘗試完成一個“在Naver新聞中查找關(guān)于特定關(guān)鍵詞的今日報道”的任務(wù)這能立刻測試其基礎(chǔ)導(dǎo)航和信息提取能力再嘗試一個“在韓國電商平臺完成商品比價”的任務(wù)測試其表單交互和流程理解。這種小步快跑、持續(xù)驗(yàn)證的方式遠(yuǎn)比埋頭開發(fā)數(shù)月然后被基準(zhǔn)“一擊斃命”要高效得多。K-BrowseComp這類扎根于具體文化語境基準(zhǔn)的價值在于它把AI智能體從“炫技”的實(shí)驗(yàn)室拉回到了“解決實(shí)際問題”的現(xiàn)場。它提醒我們技術(shù)的通用性固然重要但技術(shù)的“在地化”深度才是其真正產(chǎn)生價值的土壤。下一次當(dāng)你設(shè)計(jì)或評估一個網(wǎng)頁瀏覽智能體時不妨問自己一個問題如果它的用戶主要生活在首爾、釜山或光州它還能如此優(yōu)雅地完成任務(wù)嗎K-BrowseComp正是幫助我們回答這個問題的第一塊也是至關(guān)重要的一塊拼圖。