- 相關推薦
自然語言理解
自然語言理解
自然語言理解(自然語言理解)
自然語言處理是計算機科學領域與人工智能領域中的一個重要方向。它研究能實現(xiàn)人與計算機之間用自然語言進行有效通信的各種理論和方法。
目錄 簡介 特征 初始研究 發(fā)展 收縮展開 簡介Natural Language Understanding 俗稱人機對話。人工智能的分支學科。研究用電子計算機模擬人的語言交際過程,使計算機能理解和運用人類社會的自然語言如漢語、英語等,實現(xiàn)人機之間的自然語言通信,以代替人的部分腦力勞動,包括查詢資料、解答問題、摘錄文獻、匯編資料以及一切有關自然語言信息的加工處理。這在當前新技術革命的浪潮中占有十分重要的地位。研制第 5代計算機的主要目標之一,就是要使計算機具有理解和運用自然語言的功能。 自然語言理解是一門新興的邊緣學科,內(nèi)容涉及語言學、心理學、邏輯學、聲學、數(shù)學和計算機科學,而以語言學為基礎。自然語言理解的研究,綜合應用了現(xiàn)代語音學、音系學語法學、語義學、語用學的知識,同時也向現(xiàn)代語言學提出了一系列的問題和要求。本學科需要解決的中心問題是:語言究竟是怎樣組織起來傳輸信息的?人又是怎樣從一連串的語言符號中獲取信息的? 這一領域的研究將涉及自然語言,即人們?nèi)粘J褂玫恼Z言,包括中文、英文、俄文、日文、德文、法文等等,所以它與語言學的研究有著密切的聯(lián)系,但又有重要的區(qū)別。自然語言處理并不是一般地研究自然語言,而在于研制能有效地實現(xiàn)自然語言通信的計算機系統(tǒng),特別是其中的軟件系統(tǒng)。因而它是計算機科學的一部分。
特征語言是人類區(qū)別其他動物的本質特性。在所有生物中,只有人類才具有語言能力。人類的多種智能都與語言有著密切的關系。人類的邏輯思維以語言為形式,人類的絕大部分知識也是以語言文字的形式記載和流傳下來的。因而,它也是人工智能的一個重要,甚至核心部分。 用自然語言與計算機進行通信,這是人們長期以來所追求的。因為它既有明顯的實際意義,同時也有重要的理論意義:人們可以用自己最習慣的語言來使用計算機,而無需再花大量的時間和精力去學習不很自然和習慣的各種計算機語言;人們也可通過它進一步了解人類的語言能力和智能的機制。 實現(xiàn)人機間自然語言通信意味著要使計算機既能理解自然語言文本的意義,也能以自然語言文本來表達給定的意圖、思想等。前者稱為自然語言理解,后者稱為自然語言生成。因此,自然語言處理大體包括了自然語言理解和自然語言生成兩個部分。歷史上對自然語言理解研究得較多,而對自然語言生成研究得較少。但這種狀況近年來已有所改變。 無論實現(xiàn)自然語言理解,還是自然語言生成,都遠不如人們原來想象的那么簡單,而是十分困難的。從目前的理論和技術現(xiàn)狀看,通用的、高質量的自然語言處理系統(tǒng),仍然是較長期的努力目標,但是針對一定應用,具有相當自然語言處理能力的實用系統(tǒng)已經(jīng)出現(xiàn),有些已商品化,甚至開始產(chǎn)業(yè)化。典型的例子有:種數(shù)據(jù)庫和專家系統(tǒng)的自然語言接口、各種機器翻譯系統(tǒng)、全文信息檢索系統(tǒng)、自動文摘系統(tǒng)等。 自然語言處理,即實現(xiàn)人機間自然語言通信,或實現(xiàn)自然語言理解和自然語言生成是十分困難的。造成困難的根本原因是自然語言文本和對話的各個層次上廣泛存在的各種各樣的歧義性或多義性(ambiguity)。 一個中文文本從形式上看是由漢字(包括標點符號等)組成的一個字符串。由字可組成詞,由詞可組成詞組,由詞組可組成句子,進而由一些句子組成段、節(jié)、章、篇。無論在上述的`各種層次:字(符)、詞、詞組、句子、段,……還是在下一層次向上一層次轉變中都存在著歧義和多義現(xiàn)象,即形式上一樣的一段字符串,在不同的場景或不同的語境下,可以理解成不同的詞串、詞組串等,并有不同的意義。一般情況下,它們中的大多數(shù)都是可以根據(jù)相應的語境和場景的規(guī)定而得到解決的。也就是說,從總體上說,并不存在歧義。這也就是我們平時并不感到自然語言歧義,和能用自然語言進行正確交流的原因。但是一方面,我們也看到,為了消解歧義,是需要極其大量的知識和進行推理的。如何將這些知識較完整地加以收集和整理出來;又如何找到合適的形式,將它們存入計算機系統(tǒng)中去;以及如何有效地利用它們來消除歧義,都是工作量極大且十分困難的工作。這不是少數(shù)人短時期內(nèi)可以完成的,還有待長期的、系統(tǒng)的工作。 以上說的是,一個中文文本或一個漢字(含標點符號等)串可能有多個含義。它是自然語言理解中的主要困難和障礙。反過來,一個相同或相近的意義同樣可以用多個中文文本或多個漢字串來表示。 因此,自然語言的形式(字符串)與其意義之間是一種多對多的關系。其實這也正是自然語言的魅力所在。但從計算機處理的角度看,我們必須消除歧義,而且有人認為它正是自然語言理解中的中心問題,即要把帶有潛在歧義的自然語言輸入轉換成某種無歧義的計算機內(nèi)部表示。 歧義現(xiàn)象的廣泛存在使得消除它們需要大量的知識和推理,這就給基于語言學的方法、基于知識的方法帶來了巨大的困難,因而以這些方法為主流的自然語言處理研究幾十年來一方面在理論和方法方面取得了很多成就,但在能處理大規(guī)模真實文本的系統(tǒng)研制方面,成績并不顯著。研制的一些系統(tǒng)大多數(shù)是小規(guī)模的、研究性的演示系統(tǒng)。
初始研究自然語言理解從 20世紀 60年代初開始研究,由于 N.喬姆斯基在語言學理論上的突破和此后各家理論的發(fā)展,以及計算機功能的不斷提高,目前已經(jīng)取得了一定的成果,分為語音理解和書面理解兩個方面。 語音理解 用口語語音輸入,使計算機"聽懂"語音信號,用文字或語音合成輸出應答。方法是先在計算機里貯存某些單詞的聲學模式,用它來匹配輸入的語音信號,稱為語音識別。這只是一個初步的基礎,還不能達到語音理解的目的。因為單憑聲學模式無法辨認人和人之間、同一個人先后發(fā)音之間的語音差別,也無法辯認連續(xù)語流中的語音變化;必須綜合應用語言學知識,以切分音節(jié)和單詞,分析句法和語義,才能理解內(nèi)容,獲取信息。
發(fā)展60年代至70年代初期,研究工作一直停留在單詞的語音識別上,進展不大。直到70年代中期才有所突破,建立了一些實驗系統(tǒng),能夠理解連續(xù)語音的內(nèi)容,但是還限于少數(shù)簡單的語句(見自然語言語音理解系統(tǒng))。 書面理解 用文字輸入,使計算機"看懂"文字符號,也用文字輸出應答。這方面的進展較快,70年代初期取得突破,中期以后又有所發(fā)展。目前已能在一定的詞匯、句型和主題范圍內(nèi)查詢資料,解答問題,閱讀故事,解釋語句等,有的系統(tǒng)已付諸應用。 由于絕大多數(shù)語種使用的是拼音文字,計算機識別拼音字母已無問題,而輸入又是按單詞分別拼寫,因此書面理解一般沒有切分音節(jié)和單詞的問題,只需直接分析詞匯、句法和語義。但是漢語用的是漢字,無論是用漢字編碼輸入還是將來計算機能直接認識漢字,都要首先解決切分單詞的問題,因為輸入就是一連串漢字,詞和詞之間沒有空隔。 書面理解的基本方法是:在計算機里貯存一定的詞匯、句法規(guī)則、語義規(guī)則、推理規(guī)則和主題知識。語句輸入后,計算機自左至右逐詞掃描,根據(jù)詞典辨認每個單詞的詞義和用法;根據(jù)句法規(guī)則確定短語和句子的組合;根據(jù)語義規(guī)則和推理規(guī)則獲取輸入句的含義;查詢知識庫,根據(jù)主題知識和語句生成規(guī)則組織應答輸出。目前已建成的書面理解系統(tǒng)應用了各種不同的語法理論和分析方法,如生成語法、系統(tǒng)語法、格語法、語義語法等等,都取得了一定的成效。
【自然語言理解】相關文章:
自然語言理解中的回指解析研究概述04-30
自然語言處理中的概率語法04-28
理解“理解”作文12-15
信息時代的自然語言邏輯研究特色05-01
移動GIS中語音與自然語言的應用模式探討05-02
基于提高自然語言文本水印嵌入量的算法05-02
自然語言中選言肢相容與否的判定問題05-02
理解04-28
理解11-08