最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

詳解提升場(chǎng)景文本識(shí)別中的語(yǔ)言模型

 更新時(shí)間:2021年05月19日 09:35:43   作者:華為云開(kāi)發(fā)者社區(qū)  
語(yǔ)言模型即根據(jù)當(dāng)前語(yǔ)境的上下文推斷當(dāng)前句子的意思。文本圖像中包含兩層信息:視覺(jué)紋理信息和語(yǔ)言信息。由于單純根據(jù)視覺(jué)紋理信息進(jìn)行文字識(shí)別缺少了對(duì)上下文的字符語(yǔ)義信息的挖掘,時(shí)常會(huì)導(dǎo)致錯(cuò)誤的文本識(shí)別結(jié)果(之后會(huì)詳細(xì)說(shuō)明)。

一、語(yǔ)言模型定義

1. 什么是語(yǔ)言模型?

如圖1所示,顧名思義,語(yǔ)言模型即根據(jù)當(dāng)前語(yǔ)境的上下文推斷當(dāng)前句子的意思。具體的標(biāo)準(zhǔn)定義為:對(duì)于語(yǔ)言序列w1,w2,…wn,語(yǔ)言模型就是計(jì)算該序列的概率即P(w1,w2,…wn)。

2. 為什么需要語(yǔ)言模型?

文本圖像中包含兩層信息:視覺(jué)紋理信息和語(yǔ)言信息。由于單純根據(jù)視覺(jué)紋理信息進(jìn)行文字識(shí)別缺少了對(duì)上下文的字符語(yǔ)義信息的挖掘,時(shí)常會(huì)導(dǎo)致錯(cuò)誤的文本識(shí)別結(jié)果(之后會(huì)詳細(xì)說(shuō)明)。因此如何獲得魯棒的語(yǔ)言信息來(lái)提升識(shí)別性能成為了最近場(chǎng)景文本識(shí)別任務(wù)中比較受歡迎的思路。

3. 統(tǒng)計(jì)語(yǔ)言模型(n-gram)

由鏈?zhǔn)椒▌t可以得到:

可以通過(guò)采用極大似然估計(jì)來(lái)計(jì)算每個(gè)詞出現(xiàn)的條件概率,但是對(duì)于任意長(zhǎng)的自然語(yǔ)言語(yǔ)句,根據(jù)極大似然估計(jì)直接計(jì)算P(wn|w1,w2,…wn-1)顯然不現(xiàn)實(shí)(計(jì)算量太大)。因此為了解決這個(gè)問(wèn)題,n-gram語(yǔ)言模型引入馬爾可夫假設(shè)(Markov assumption),即假設(shè)當(dāng)前詞出現(xiàn)的概率只依賴(lài)于前 n-1 個(gè)詞,可以得到:

n=1 unigram:

n=2 bigram:

因此,綜上可以看出,基于n-gram的語(yǔ)言模型有如下優(yōu)點(diǎn):1)完全包含了前n-1個(gè)詞的全部信息。2)可解釋性強(qiáng)。對(duì)應(yīng)也有缺點(diǎn):1)缺乏長(zhǎng)期依賴(lài)關(guān)系。2)參數(shù)空間隨著n增大指數(shù)型增長(zhǎng)。3)單純的基于統(tǒng)計(jì)頻次,泛化能力差。

二、基于深度學(xué)習(xí)的解決思路

在目前基于深度學(xué)習(xí)的語(yǔ)言模型結(jié)構(gòu)主要包括三個(gè)類(lèi)別:基于RNN的語(yǔ)言模型,基于CNN的語(yǔ)言模型和基于Transformer的語(yǔ)言模型。接下來(lái)我會(huì)對(duì)它們進(jìn)行依次介紹,并且逐一分析他們的優(yōu)缺點(diǎn)。

1.通過(guò)RNN的語(yǔ)言模型結(jié)構(gòu)

圖2基于RNN的語(yǔ)言模型結(jié)構(gòu)

隨著深度學(xué)習(xí)的發(fā)展,在受到NLP(Natural Language Processing)等任務(wù)的啟發(fā),Lee等人[1]在視覺(jué)特征建模之后,通過(guò)引入RNN(Recurrent Neural Networks)代替?zhèn)鹘y(tǒng)的n-gram進(jìn)行語(yǔ)言模型建模(圖2所示)。RNN通過(guò)自回歸的方式(Auto Regression),在t時(shí)間步讀取的是t-1步的狀態(tài),即預(yù)測(cè)當(dāng)前時(shí)間步時(shí)會(huì)考慮上一時(shí)間步的信息,同時(shí)通過(guò)注意力的方式在glimpse向量中關(guān)注對(duì)應(yīng)位置字符的視覺(jué)信息。該方法省去了繁瑣的n-gram計(jì)算過(guò)程,在目前的場(chǎng)景文本識(shí)別框架中占據(jù)了主導(dǎo)的地位。

但是基于RNN的語(yǔ)言模型結(jié)構(gòu)存在2個(gè)問(wèn)題:1)梯度消失/爆炸的問(wèn)題。2)串行計(jì)算效率慢。因此,最近的方法對(duì)RNN的語(yǔ)言建模方式進(jìn)行了改進(jìn)(上下文記憶力差的問(wèn)題,因?yàn)樵诓糠肿罱墓ぷ髦凶C明對(duì)中/短文本影響不大,所以在這里沒(méi)有考慮)。

2. 通過(guò)CNN的語(yǔ)言模型結(jié)構(gòu)

圖3 視覺(jué)和語(yǔ)言模型集成的網(wǎng)路框架

圖4 基于CNN的語(yǔ)言模型結(jié)構(gòu)

為了避免了由RNN造成的梯度消失/爆炸的問(wèn)題,F(xiàn)ang等人[2]采用了全卷積神經(jīng)網(wǎng)絡(luò)的結(jié)構(gòu),并通過(guò)一個(gè)并行的分支單獨(dú)學(xué)習(xí)語(yǔ)言信息(圖3),通過(guò)將視覺(jué)和語(yǔ)言信息集成的方法提升了識(shí)別結(jié)果。

基于CNN的語(yǔ)言模型如圖4所示,給定 ,輸出向量 由下式獲得:

sk-2和 sk-1是之前時(shí)間步對(duì)應(yīng)的向量,因此,該結(jié)構(gòu)可以看成一個(gè)近似的bigram語(yǔ)言模型。但是由于該語(yǔ)言模型也是串行的操作過(guò)程,導(dǎo)致其計(jì)算效率也較慢。

3. 通過(guò)Transformer的語(yǔ)言模型結(jié)構(gòu)

圖5 視覺(jué)語(yǔ)言模型解耦的網(wǎng)絡(luò)結(jié)構(gòu)

圖6 基于transformer的語(yǔ)言模型結(jié)構(gòu)

Yu等人[3]將語(yǔ)言模型從視覺(jué)部分解耦,然后在兩個(gè)獨(dú)立的結(jié)構(gòu)中分別進(jìn)行進(jìn)行視覺(jué)和語(yǔ)言模型的建模,最后通過(guò)融合視覺(jué)和語(yǔ)言信息進(jìn)行文本預(yù)測(cè)(圖5所示)。在語(yǔ)言模型部分,該方法采用了Transformer的結(jié)構(gòu)(圖6所示),通過(guò)Transformer中的mask來(lái)模擬語(yǔ)言結(jié)構(gòu)中的順序和逆序的建模過(guò)程,最終自適應(yīng)地融合視覺(jué)和語(yǔ)言信息進(jìn)行識(shí)別。由于Transformer的結(jié)構(gòu)特點(diǎn),識(shí)別過(guò)程不同的時(shí)間步并行操作,提升了識(shí)別效率。

三、語(yǔ)言模型的問(wèn)題

圖7 語(yǔ)言信息幫助提升識(shí)別結(jié)果的效果圖(上:沒(méi)有語(yǔ)言模型。下:加入語(yǔ)言模型。)

語(yǔ)言模型能夠幫助在視覺(jué)信息不充足的情況下,提升識(shí)別的結(jié)果。如圖7所示,語(yǔ)言模型提取的語(yǔ)言信息能夠有效地幫助在視覺(jué)缺失,模糊,噪聲的情況下實(shí)現(xiàn)準(zhǔn)確的識(shí)別結(jié)果。雖然語(yǔ)言模型提升效果顯著,但是也存在著以下幾個(gè)問(wèn)題:1)OC(outside vocabulary)問(wèn)題。2)計(jì)算復(fù)雜度高。

針對(duì)OC問(wèn)題,Wan等人[4]指出了目前基于注意力的方法容易在訓(xùn)練集中沒(méi)有出現(xiàn)過(guò)的詞匯中識(shí)別錯(cuò)誤,且精度和在測(cè)試過(guò)程中使用訓(xùn)練集中出現(xiàn)過(guò)的詞匯的效果之間gap遠(yuǎn)大于基于分割的識(shí)別方法,因此如何獲得一個(gè)魯棒的語(yǔ)言模型是一種挑戰(zhàn)。對(duì)于計(jì)算量問(wèn)題,雖然目前Transformer應(yīng)用于識(shí)別是一種趨勢(shì),且能夠通過(guò)并行計(jì)算提升識(shí)別效率,但是對(duì)于長(zhǎng)文本的識(shí)別,其計(jì)算量增加明顯(RNN為線性增長(zhǎng),Transformer為平方增長(zhǎng))。

四、未來(lái)展望

語(yǔ)言模型最近是場(chǎng)景文本識(shí)別領(lǐng)域比較熱門(mén)的研究方向,在我看來(lái)語(yǔ)言模型部分以后的研究大致會(huì)分為兩個(gè)方向:1)結(jié)構(gòu)。即如何通過(guò)搭建更強(qiáng)壯的語(yǔ)言模型捕捉更魯邦的語(yǔ)言信息。2)能力。如何降低OC問(wèn)題的影響。3)計(jì)算量。如何在低計(jì)算量的前提下提取有效的語(yǔ)言信息。

最近的方法中,僅通過(guò)捕捉視覺(jué)特征也能取得不錯(cuò)的效果(基于視覺(jué)特征匹配[5])。對(duì)于無(wú)序的識(shí)別(車(chē)牌識(shí)別),Yue等人[6]引入了位置信息增強(qiáng)視覺(jué)特征進(jìn)行識(shí)別。因此,在作者看來(lái),未來(lái)的文本識(shí)別發(fā)展一定是多元化的,即視覺(jué)和語(yǔ)言模型并行發(fā)展,針對(duì)不同的具體任務(wù)會(huì)有不同的改進(jìn)。

以上就是詳解提升場(chǎng)景文本識(shí)別中的語(yǔ)言模型的詳細(xì)內(nèi)容,更多關(guān)于提升場(chǎng)景文本識(shí)別中的語(yǔ)言模型的資料請(qǐng)關(guān)注腳本之家其它相關(guān)文章!

相關(guān)文章

  • 詳解敏捷過(guò)程中的需求管理

    詳解敏捷過(guò)程中的需求管理

    企業(yè)在做敏捷轉(zhuǎn)型中,需求無(wú)法按時(shí)交付的困擾你是否也遇到過(guò)呢?
    2021-05-05
  • PyCharm2022激活碼破解補(bǔ)丁一鍵安裝免費(fèi)分享(2022年持續(xù)更新)

    PyCharm2022激活碼破解補(bǔ)丁一鍵安裝免費(fèi)分享(2022年持續(xù)更新)

    PyCharm2022最新激活碼分享(持續(xù)更新),PyCharm激活補(bǔ)丁一鍵安裝簡(jiǎn)單方便,無(wú)需手動(dòng)修改文件,MAC,linux,Windows系統(tǒng)都可使用
    2022-07-07
  • 深入理解Scala函數(shù)式編程過(guò)程

    深入理解Scala函數(shù)式編程過(guò)程

    這篇文章主要介紹了深入理解Scala函數(shù)式編程過(guò)程的相關(guān)資料,希望通過(guò)本文能幫助到大家,讓大家學(xué)習(xí)理解這部分內(nèi)容,需要的朋友可以參考下
    2017-10-10
  • 匯編語(yǔ)言超濃縮教程

    匯編語(yǔ)言超濃縮教程

    對(duì)初學(xué)者而言,匯編的許多命令太復(fù)雜,往往學(xué)習(xí)很長(zhǎng)時(shí)間也寫(xiě)不出一個(gè)漂漂亮亮的程序,以致妨礙了我們學(xué)習(xí)匯編的興趣,不少人就此放棄
    2013-05-05
  • 詳解windows 環(huán)境下搭建electricSearch+kibana

    詳解windows 環(huán)境下搭建electricSearch+kibana

    這篇文章主要介紹了windows 環(huán)境下搭建electricSearch+kibana,本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2021-05-05
  • 詳解提升場(chǎng)景文本識(shí)別中的語(yǔ)言模型

    詳解提升場(chǎng)景文本識(shí)別中的語(yǔ)言模型

    語(yǔ)言模型即根據(jù)當(dāng)前語(yǔ)境的上下文推斷當(dāng)前句子的意思。文本圖像中包含兩層信息:視覺(jué)紋理信息和語(yǔ)言信息。由于單純根據(jù)視覺(jué)紋理信息進(jìn)行文字識(shí)別缺少了對(duì)上下文的字符語(yǔ)義信息的挖掘,時(shí)常會(huì)導(dǎo)致錯(cuò)誤的文本識(shí)別結(jié)果(之后會(huì)詳細(xì)說(shuō)明)。
    2021-05-05
  • 淺談如何降低軟件復(fù)雜性

    淺談如何降低軟件復(fù)雜性

    軟件的復(fù)雜性是我們程序員在日常開(kāi)發(fā)中所必須面對(duì)的東西,學(xué)會(huì)如何 “弄清楚什么是軟件復(fù)雜性,找到導(dǎo)致軟件復(fù)雜的原因,并利用各種手法去戰(zhàn)勝軟件的復(fù)雜性” 是一門(mén)必備的能力。
    2021-05-05
  • uniapp語(yǔ)音識(shí)別(訊飛語(yǔ)音)轉(zhuǎn)文字

    uniapp語(yǔ)音識(shí)別(訊飛語(yǔ)音)轉(zhuǎn)文字

    這篇文章主要介紹了uniapp語(yǔ)音識(shí)別(訊飛語(yǔ)音)轉(zhuǎn)文字,需要的朋友可以參考下
    2022-12-12
  • Spark在Win10下的環(huán)境搭建過(guò)程

    Spark在Win10下的環(huán)境搭建過(guò)程

    這篇文章主要介紹了Spark在Win10下的環(huán)境搭建過(guò)程,本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2021-04-04
  • 10 款珍藏已久的 Chrome 瀏覽器插件(程序員必裝)

    10 款珍藏已久的 Chrome 瀏覽器插件(程序員必裝)

    Chrome 瀏覽器有一個(gè)好處,就是插件極其豐富,只有你想不到的,沒(méi)有你找不到的,這恐怕是 Chrome 瀏覽器被眾多愛(ài)好者鐘愛(ài)的原因吧。今天給大家分享這些插件太強(qiáng)了,Chrome 必裝!尤其程序員
    2021-03-03

最新評(píng)論

伊通| 定襄县| 岢岚县| 赫章县| 施甸县| 六枝特区| 墨玉县| 连州市| 千阳县| 大埔县| 太白县| 吐鲁番市| 康马县| 新宾| 嘉义县| 方正县| 安国市| 中阳县| 宣城市| 甘德县| 宜宾县| 化德县| 大兴区| 会东县| 阿拉善右旗| 来安县| 汾西县| 迁西县| 萝北县| 衡阳市| 潜山县| 大田县| 罗甸县| 高唐县| 屯昌县| 嘉义市| 鹤山市| 罗定市| 清流县| 和平区| 拉萨市|