![](https://static.zsdocx.com/FlexPaper/FileRoot/2019-3/14/18/e85ce715-a648-41db-a28e-30c8414ff7c4/e85ce715-a648-41db-a28e-30c8414ff7c4pic.jpg)
![萬(wàn)維網(wǎng)信息檢索的評(píng)價(jià)體系研究.pdf_第1頁(yè)](https://static.zsdocx.com/FlexPaper/FileRoot/2019-3/14/18/e85ce715-a648-41db-a28e-30c8414ff7c4/e85ce715-a648-41db-a28e-30c8414ff7c41.gif)
版權(quán)說(shuō)明:本文檔由用戶(hù)提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請(qǐng)進(jìn)行舉報(bào)或認(rèn)領(lǐng)
文檔簡(jiǎn)介
1、隨著萬(wàn)維網(wǎng)的發(fā)展,越來(lái)越多的信息被數(shù)字化,信息檢索成為最廣泛使用的計(jì)算機(jī)應(yīng)用技術(shù)之一。每一秒,都有成千上萬(wàn)的人在搜索萬(wàn)維網(wǎng)上的信息,期望找到滿(mǎn)意的結(jié)果。評(píng)價(jià)是信息檢索的基石,因?yàn)樾畔z索技術(shù)的進(jìn)步有賴(lài)于對(duì)新想法的實(shí)驗(yàn)和檢索效果的度量。無(wú)法反映用戶(hù)感受的評(píng)價(jià)會(huì)阻礙甚至誤導(dǎo)信息檢索技術(shù)的發(fā)展。
廣義的信息檢索評(píng)價(jià)不僅僅是指對(duì)評(píng)價(jià)指標(biāo)的研究,而是一個(gè)體系,它涵蓋了查詢(xún)?cè)~集合、待標(biāo)注文檔集合、標(biāo)注環(huán)節(jié)和評(píng)價(jià)環(huán)節(jié)。在對(duì)大規(guī)模萬(wàn)維網(wǎng)檢
2、索系統(tǒng)的評(píng)價(jià)實(shí)踐中,發(fā)現(xiàn)評(píng)價(jià)是否能夠反映用戶(hù)的真實(shí)感受,很大程度上依賴(lài)于標(biāo)注的方法、查詢(xún)?cè)~的選取、和評(píng)價(jià)的側(cè)重點(diǎn)。針對(duì)萬(wàn)維網(wǎng)對(duì)評(píng)價(jià)體系提出的新挑戰(zhàn),本文做出了以下貢獻(xiàn):
一、對(duì)標(biāo)注環(huán)節(jié)的研究:對(duì)于意圖明確的查詢(xún)?cè)~,研究了基于文檔間相對(duì)相關(guān)性的標(biāo)注方法。在資源有限的情況下,如何能獲取區(qū)別力更強(qiáng)、質(zhì)量更高的標(biāo)注是做大規(guī)模信息檢索評(píng)價(jià)的關(guān)鍵。傳統(tǒng)的方法通常是讓標(biāo)注者事先熟悉預(yù)定義的相關(guān)性級(jí)別,然后根據(jù)查詢(xún)?cè)~和一篇文檔的內(nèi)容來(lái)分配
3、一個(gè)合適的級(jí)別。這一過(guò)程和其他文檔沒(méi)有直接關(guān)系,把它稱(chēng)為絕對(duì)標(biāo)注。當(dāng)搜索引擎需要大規(guī)模的標(biāo)注數(shù)據(jù)來(lái)訓(xùn)練排序模型或是評(píng)價(jià)算法時(shí),這種傳統(tǒng)的標(biāo)注方法的一些問(wèn)題就凸現(xiàn)出來(lái)。對(duì)某些查詢(xún)?cè)~來(lái)說(shuō),預(yù)定義的級(jí)別還不足夠區(qū)分一些有差別的文檔。另外,處于級(jí)別邊緣的文檔,標(biāo)注者有時(shí)很難僅憑該文檔獨(dú)立做出判斷。相反,以往的工作發(fā)現(xiàn)人們比較容易在兩篇文檔之間做出相對(duì)相關(guān)性的判斷。因此,工作擴(kuò)展了以往基于文檔對(duì)的標(biāo)注方法,形式化了相對(duì)相關(guān)性標(biāo)注的問(wèn)題,并提出了一
4、個(gè)基于多篇文檔的相對(duì)標(biāo)注方法。該方法能顯著的增加標(biāo)注的區(qū)分度和標(biāo)注者之間的一致性,并且比基于文檔對(duì)的相對(duì)標(biāo)注方法的效率快一倍。
二、對(duì)查詢(xún)?cè)~的研究:打破了以往公共評(píng)測(cè)數(shù)據(jù)集對(duì)查詢(xún)意圖明確的假設(shè),研究了萬(wàn)維網(wǎng)搜索日志中真實(shí)存在的多義查詢(xún)?cè)~及其比例。雖然人們發(fā)現(xiàn)提交到搜索引擎的部分查詢(xún)?cè)~有歧義(如,java和apple),但以往的評(píng)價(jià)集合很少包含這類(lèi)查詢(xún)?cè)~,也很少有工作根據(jù)模糊性對(duì)查詢(xún)?cè)~進(jìn)行分類(lèi)。本文將首次探討這些問(wèn)題。依據(jù)查
5、詢(xún)?cè)~的語(yǔ)義模糊性,提出一個(gè)查詢(xún)?cè)~的分類(lèi)法;接著,請(qǐng)標(biāo)注員利用多種資源對(duì)查詢(xún)?cè)~進(jìn)行人工分類(lèi),從結(jié)果中觀察到多義查詢(xún)?cè)~在某種程度上是可以預(yù)測(cè)的;于是,提出了兩種方法來(lái)有監(jiān)督的學(xué)習(xí)查詢(xún)?cè)~二義性模型:基于搜索結(jié)果的方法和基于搜索日志的方法。實(shí)驗(yàn)結(jié)果表明,基于搜索結(jié)果的方法在隨機(jī)選取的查詢(xún)?cè)~上能夠達(dá)到87%的準(zhǔn)確率,而基于日志的方法在有日志的查詢(xún)?cè)~上可以達(dá)到86%的準(zhǔn)確率。利用基于搜索結(jié)果的方法,估計(jì)實(shí)際搜索中大約有16%的查詢(xún)?cè)~是多義詞。
6、> 三、對(duì)評(píng)價(jià)環(huán)節(jié)的研究:對(duì)于多義查詢(xún)?cè)~,好的檢索結(jié)果需要兼顧相關(guān)性和多樣性,本文中研究了多樣性的評(píng)價(jià)問(wèn)題。對(duì)于多義查詢(xún)?cè)~來(lái)說(shuō),如果無(wú)法知道用戶(hù)的真實(shí)意圖,一個(gè)自然的做法是對(duì)檢索結(jié)果進(jìn)行多樣化。已經(jīng)有一些工作研究多樣化的算法,但是對(duì)于如何評(píng)價(jià)多樣性還缺乏系統(tǒng)的研究。本文將探討兩個(gè)與評(píng)價(jià)多樣性密切相關(guān)的問(wèn)題:1)一般很難窮舉多義查詢(xún)?cè)~的所有可能意圖,那么不完整的意圖集合會(huì)對(duì)評(píng)價(jià)結(jié)果有何影響?2)不同意圖的流行程度是不同的,那么如何估
7、計(jì)每種意圖可能被查詢(xún)的概率?嘗試為多義查詢(xún)?cè)~構(gòu)建了一個(gè)測(cè)試集,并允許標(biāo)注者在做相關(guān)性標(biāo)注時(shí)增添新意圖。另外,提出了兩種模型來(lái)估計(jì)每個(gè)意圖的概率。通過(guò)實(shí)驗(yàn),研究了意圖的不完整性和概率估計(jì)對(duì)評(píng)價(jià)多樣性的影響。
本文圍繞著萬(wàn)維網(wǎng)信息檢索的評(píng)價(jià)體系中的實(shí)際問(wèn)題,著重研究了相關(guān)性標(biāo)注方法,查詢(xún)?cè)~的模糊性和檢索結(jié)果多樣性的評(píng)價(jià)。富于創(chuàng)新性的方法和詳實(shí)的實(shí)驗(yàn)結(jié)論對(duì)大規(guī)模信息檢索的評(píng)價(jià)有著重要的參考價(jià)值。本文提出的標(biāo)注方法已經(jīng)被應(yīng)用于商用
溫馨提示
- 1. 本站所有資源如無(wú)特殊說(shuō)明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請(qǐng)下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請(qǐng)聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶(hù)所有。
- 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁(yè)內(nèi)容里面會(huì)有圖紙預(yù)覽,若沒(méi)有圖紙預(yù)覽就沒(méi)有圖紙。
- 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
- 5. 眾賞文庫(kù)僅提供信息存儲(chǔ)空間,僅對(duì)用戶(hù)上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對(duì)用戶(hù)上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對(duì)任何下載內(nèi)容負(fù)責(zé)。
- 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請(qǐng)與我們聯(lián)系,我們立即糾正。
- 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶(hù)因使用這些下載資源對(duì)自己和他人造成任何形式的傷害或損失。
最新文檔
- 萬(wàn)維網(wǎng)信息聚類(lèi)研究.pdf
- 語(yǔ)義萬(wàn)維網(wǎng)在智能信息檢索中的應(yīng)用研究.pdf
- 基于語(yǔ)義萬(wàn)維網(wǎng)的智能化檢索的研究.pdf
- 中文語(yǔ)義萬(wàn)維網(wǎng)本體匹配.pdf
- 數(shù)據(jù)萬(wàn)維網(wǎng)自動(dòng)實(shí)體匹配.pdf
- 語(yǔ)義萬(wàn)維網(wǎng)中本體映射的研究.pdf
- 基于萬(wàn)維網(wǎng)服務(wù)的Parlay框架實(shí)現(xiàn).pdf
- 關(guān)于現(xiàn)代萬(wàn)維網(wǎng)搜索算法的研究.pdf
- 語(yǔ)義萬(wàn)維網(wǎng)環(huán)境下的基于Agent的智能檢索框架研究與實(shí)現(xiàn).pdf
- 語(yǔ)義萬(wàn)維網(wǎng)服務(wù)若干關(guān)鍵技術(shù)的研究.pdf
- 萬(wàn)維網(wǎng)服務(wù)中的若干安全問(wèn)題研究.pdf
- 萬(wàn)維網(wǎng)服務(wù)事務(wù)并發(fā)控制的研究與實(shí)現(xiàn).pdf
- 基于關(guān)鍵詞的深度萬(wàn)維網(wǎng)查詢(xún).pdf
- 基于萬(wàn)維網(wǎng)的地理信息查詢(xún)系統(tǒng)研究與實(shí)現(xiàn).pdf
- 基于萬(wàn)維網(wǎng)的地理信息查詢(xún)系統(tǒng)設(shè)計(jì)與應(yīng)用研究.pdf
- 移動(dòng)萬(wàn)維網(wǎng)中廣告點(diǎn)擊欺詐檢測(cè)技術(shù)的研究.pdf
- 語(yǔ)義萬(wàn)維網(wǎng)中RDF數(shù)據(jù)的存儲(chǔ)和管理.pdf
- 基于萬(wàn)維網(wǎng)服務(wù)的事務(wù)處理模型研究.pdf
- 萬(wàn)維網(wǎng)服務(wù)組合動(dòng)態(tài)模型的研究與實(shí)現(xiàn).pdf
- 萬(wàn)維網(wǎng)服務(wù)環(huán)境下單點(diǎn)登錄技術(shù)的研究與實(shí)現(xiàn).pdf
評(píng)論
0/150
提交評(píng)論