日B视频 亚洲,啪啪啪网站一区二区,91色情精品久久,日日噜狠狠色综合久,超碰人妻少妇97在线,999青青视频,亚洲一区二卡,让本一区二区视频,日韩网站推荐

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認識你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

一種無監(jiān)督下利用多模態(tài)文檔結(jié)構(gòu)信息幫助圖片-句子匹配的采樣方法

深度學習自然語言處理 ? 來源:深度學習自然語言處理 ? 作者:深度學習自然語言 ? 2020-12-26 10:26 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

引 言

本文介紹了復(fù)旦大學數(shù)據(jù)智能與社會計算實驗室 (Fudan DISC) 在AAAI 2021上錄用的一篇關(guān)于多模態(tài)匹配的工作:An Unsupervised Sampling Approach for Image-Sentence Matching UsingDocument-Level Structural Information,提出了一種無監(jiān)督設(shè)定下,更有效地利用多模態(tài)文檔的共現(xiàn)結(jié)構(gòu)信息幫助采樣完成句子-圖片匹配的方法。本文的合作單位是杭州之江實驗室。

文章摘要

文章針對無監(jiān)督的句子圖片匹配任務(wù)?,F(xiàn)存的方法主要通過利用多模態(tài)文檔的圖片句子共現(xiàn)信息來無監(jiān)督地采樣正負樣本對,但是其在獲得負樣本時只考慮了跨文檔的圖片句子對,在一定程度上引入了采樣的偏差,使得模型無法分辨同一文檔內(nèi)語義較為近似的圖片和句子。

在本文中,我們提出了一種新的采樣的方法,通過引入同一文檔內(nèi)的圖片句子對作為額外的正負樣本來減小采樣的偏差;進一步,我們提出了一個基于Transformer的模型來識別更為復(fù)雜的語義關(guān)聯(lián),該模型為每個多模態(tài)文檔隱式地構(gòu)建了一個圖的結(jié)構(gòu),構(gòu)建了同一篇文檔內(nèi)句子和圖片的表征學習間的橋梁。實驗的結(jié)果證明了我們提出的方法有效的減小偏差并且進一步獲得了更好的跨模態(tài)表征。

研究背景

dfab07a2-4692-11eb-8b86-12bb97331649.png

圖1. 句子-圖片匹配任務(wù)說明

(綠色/藍色點代表圖片/句子,紅色實線代表匹配關(guān)系的標簽,紅色/藍色虛線代表無監(jiān)督方法選出的(偽)正/負樣本對)

圖片-句子的匹配一直是跨模態(tài)領(lǐng)域的基礎(chǔ)任務(wù),其根本的目的是對其視覺和文本的語義空間。如(a)所示,兩個模態(tài)之間本身存在著語義空間上的差異,對其的常見方法是通過有監(jiān)督的標簽拉近匹配的樣本對,如(b)所示。在無監(jiān)督的環(huán)境下,最大的挑戰(zhàn)即為如何選擇出想要拉近的正樣本對和遠離的負樣本對。

如(c)所示,最近的無監(jiān)督的方法通過文檔的圖片句子共現(xiàn)信息,通過拉近句子集合和圖片集合的方式來進行訓練,其中,同文檔內(nèi)語義近似的句子-圖片對被看作正樣本,而跨文檔間的句子-圖片對被看作負樣本,如(c)所示,這樣的方法沒有考慮到文檔內(nèi)部語義相似度更高的負樣本,其選出的負樣本與真實的負樣本分布存在著偏差。

于是本文提出了新的采樣策略,如(d)所示,我們引入了更多同一文檔內(nèi)部的正負樣本對來幫助訓練。進一步,為了更好地識別同一文檔內(nèi)更加復(fù)雜的句子圖片語義匹配模式,我們考慮使用更加細粒度的表征學習方法,提出了一個新的基于Transformer的模型,在其中為每個文檔的句子圖片間隱性建模了一個圖,來幫助獲得更好的跨模態(tài)表征。

方法描述

采樣方法

本文的方法基于三個部分的采樣,通過3個訓練目標實現(xiàn),如圖2所示。

圖2. 三個部分的采樣和訓練目標示意

第一個部分為之前的工作提出的跨文檔訓練目標(cross-document objective)。其假設(shè)為同一文檔內(nèi)的句子集合和圖片集合間的相似度要整體高于來自兩個不同文檔的句子集合和圖片集合間的相似度,背后通過一定的方式來選出幾個句子圖片對之間的相似度來代表句子集合和圖片集合間的相似度。其采樣得到的正樣本為來自同一文檔的語義較為近似的句子-圖片對;負樣本為來自不同文檔的語義較為近似的圖片句子對。

第二個部分為文檔內(nèi)部的訓練目標(intra-document objective)。其假設(shè)為同一篇文檔內(nèi)部的語義近似的圖片句子對之間的相似度也要高于內(nèi)部語義相差較遠的圖片句子對間的相似度,高于一定的值,在此目標下采樣出的正樣本為來自同一文檔的語義較為近似的句子-圖片對;負樣本為來自同一文檔的語義相差較遠的圖片句子對。

第三個部分為次跨文檔訓練目標(dropout sub-document objective)。其假設(shè)為即使一篇文檔我們將其隨機的遮蓋住部分的句子/圖片,剩下的殘缺文檔內(nèi)的句子集合和圖片集合間的相似度也要高于跨文檔間的圖片集合-句子集合間的相似度。在此目標下采樣出的正樣本為來自同一“殘次”文檔的語義較為近似的句子-圖片對;負樣本為來自不同文檔的語義近似的圖片句子對。

跨模態(tài)表征模型

圖3. 總的模型結(jié)構(gòu)示意

由于引入了更多的同一文檔內(nèi)的圖片句子對,我們需要得到包含更細粒度信息的多模態(tài)表征,所以我們將圖片分割為區(qū)域,將句子分割為token,Transformer可以看作是帶有attention機制的圖網(wǎng)絡(luò),我們通過兩個視覺/文本的Transformer對各模態(tài)內(nèi)的(區(qū)域/token)節(jié)點進行編碼,與此同時我們引入了視覺的概念,這里我們將圖片區(qū)域預(yù)測出的標簽作為圖片包括的概念,將它們作為中間的橋梁將兩個模態(tài)的圖橋接起來。概念會直接加入到視覺的圖中,作為節(jié)點存在,而概念和文本端的關(guān)系通過共享的embedding層來實現(xiàn)。這樣的模型里,當句子里直接提到了區(qū)域里對應(yīng)的概念時,我們的模型就能很快地捕捉到這樣的匹配關(guān)系。

實驗

我們在無監(jiān)督的多句子多圖片文檔內(nèi)的跨模態(tài)鏈接預(yù)測任務(wù)上進行了實驗,其中包括了基于MSCOCO, VIST構(gòu)建出的三個文檔數(shù)據(jù)集。對于每一個文檔,其內(nèi)部有多個句子和多個圖片,需要去預(yù)測其中句子和圖片間是否存在著鏈接的邊(匹配關(guān)系),使用AUC/P@1/P@5進行評估。相較于之前只使用cross-document objective的方法(表內(nèi)MulLink),我們的方法有了明顯的提高。

e1927e92-4692-11eb-8b86-12bb97331649.png

表1. 總的實驗結(jié)果

同時我們對我們提出的模型的結(jié)構(gòu),和三個部分的訓練目標進行了消融實驗:

e212875e-4692-11eb-8b86-12bb97331649.png

表2. 部分消融實驗的結(jié)果

(S列代表采樣方法,T代表同時使用三種目標訓練,O代表只使用跨文檔訓練目標,w/o代表without,w/o Transformer的方法里我們使用GRU對句子進行表征,對圖片的各個區(qū)域進行softmax pooling進行表征。)

可以看到整體上同時使用三種目標可以采樣到更多的信息,幫助訓練,我們也對三個目標進行了更加細致的消融實驗,詳情可以參考原文。同時我們提出的模型更好地利用了細粒度的信息,也獲得了更好地跨模態(tài)表征。

同時,我們進行了有監(jiān)督、無監(jiān)督和遷移學習的比較。有監(jiān)督的方法直接使用文檔內(nèi)的匹配的圖片句子對作為訓練,如圖4,遷移學習則嘗試遷移從MSCOCO上進行有監(jiān)督訓練的信息到DII測試集上,如表3。

e2a01a74-4692-11eb-8b86-12bb97331649.png

圖4. 有監(jiān)督-無監(jiān)督比較

藍色代表有監(jiān)督學習下,隨著使用的數(shù)據(jù)增加在測試集上的表現(xiàn)

e31ba77a-4692-11eb-8b86-12bb97331649.png

表3. 遷移學習和無監(jiān)督學習的比較

可以看到相較于只使用跨文檔訓練目標,同時使用三種目標得到的更多樣本對里包括了更多的信息,我們無監(jiān)督的方法可以利用訓練集內(nèi)更多的信息(~40%),相較于遷移自其他數(shù)據(jù)集的信息,也更加有效。

除此之外,我們通過錯誤分析的方法驗證我們的方法對于偏差的修正效果。該偏差的表現(xiàn)為同一文檔內(nèi)的句子和圖片更加近似,跨文檔內(nèi)的圖片和句子差異更大,所以我們使用文檔內(nèi)的句子/圖片表征的發(fā)散程度來代表這個差異,同一文檔內(nèi)越發(fā)散,訓練和測試之間的差異越小。在DII上,我們使用每個文檔內(nèi)句子/圖片的發(fā)散程度來擬合該文檔鏈接預(yù)測的AUC,原來的方法得到的線性模型的R方為42%,也就是說差異能很大程度解釋錯誤的原因,而我們的方法得到的R方為23%,這意味著該差異對于結(jié)果的作用減弱了,加上我們模型整體上更好地表現(xiàn),我們可以認為我們減弱了采樣的偏差,使得偏差引起的錯誤減少了。

結(jié)論

在本文里,我們對于無監(jiān)督的句子-圖片匹配任務(wù),針對之前方法存在的采樣偏差問題提出了新的采樣策略,希望更高效地利用多模態(tài)文檔內(nèi)句子和圖片共現(xiàn)的結(jié)構(gòu)信息,引入了更多的來自同一文檔內(nèi)的正/負圖片-句子對。同時提出了可以利用更細粒度信息的模型,建立了跨模態(tài)表征學習的關(guān)系橋梁。最終的實驗證明了我們方法的有效性。

責任編輯:xj

原文標題:【Fudan DISC】一種無監(jiān)督下利用多模態(tài)文檔結(jié)構(gòu)信息幫助圖片-句子匹配的采樣方法

文章出處:【微信公眾號:深度學習自然語言處理】歡迎添加關(guān)注!文章轉(zhuǎn)載請注明出處。

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學習之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • 語義
    +關(guān)注

    關(guān)注

    0

    文章

    22

    瀏覽量

    8814
  • 自然語言
    +關(guān)注

    關(guān)注

    1

    文章

    292

    瀏覽量

    14027

原文標題:【Fudan DISC】一種無監(jiān)督下利用多模態(tài)文檔結(jié)構(gòu)信息幫助圖片-句子匹配的采樣方法

文章出處:【微信號:zenRRan,微信公眾號:深度學習自然語言處理】歡迎添加關(guān)注!文章轉(zhuǎn)載請注明出處。

收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評論

    相關(guān)推薦
    熱點推薦

    模態(tài)大模型 前沿算法與實戰(zhàn)應(yīng)用 第季》精品課程簡介

    標注的圖文對(如網(wǎng)頁中的圖片和alt文本)進行自監(jiān)督訓練。 實例學習 :將同場景的模態(tài)數(shù)據(jù)
    發(fā)表于 05-01 17:46

    [VirtualLab] 真實結(jié)構(gòu)的目鏡混合衍射透鏡的效果建模

    )電磁場求解器處理衍射光柵結(jié)構(gòu)的傳播,并結(jié)合薄透鏡組元近似(TEA)和傅里葉模態(tài)法(FMM)作為基礎(chǔ)局部求解器。內(nèi)部精度準則控制兩算法中哪一種使用在哪個橫向位置。 **設(shè)計和建模任
    發(fā)表于 04-29 08:25

    [VirtualLab] 薄元近似(TEA)與傅里葉模態(tài)法(FMM)的光柵建模

    摘要 對于背光系統(tǒng)、光內(nèi)連器和近眼顯示器等許多應(yīng)用來說,將光高效地耦合到引導結(jié)構(gòu)中是個重要的問題。對于這種應(yīng)用,傾斜光柵以能夠高效地耦合單色光而聞名。在本例中,提出了利用嚴格傅里葉模態(tài)
    發(fā)表于 04-22 08:21

    亞馬遜云科技上線Amazon Nova模態(tài)嵌入模型

    Embeddings模態(tài)嵌入模型現(xiàn)已在Amazon Bedrock上線,這是款專為Agentic RAG與語義搜索應(yīng)用打造的頂尖模態(tài)
    的頭像 發(fā)表于 10-29 17:15 ?387次閱讀
    亞馬遜云科技上線Amazon Nova<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>嵌入模型

    米爾RK3576部署端側(cè)模態(tài)輪對話,6TOPS算力驅(qū)動30億參數(shù)LLM

    可以更快。輪對話1:這張圖片上有哪些文字信息 感受一下第一次出詞的耗時 輪對話1:這張圖片
    發(fā)表于 09-05 17:25

    基于米爾瑞芯微RK3576開發(fā)板的Qwen2-VL-3B模型NPU模態(tài)部署評測

    結(jié)果 下面我們再換圖片試試效果!測試圖片2:圖片背景是賽博風格 測試圖片2:描述圖片 測試
    發(fā)表于 08-29 18:08

    一種新的刷直流電機反電動勢檢測方法

    位置傳感器刷直流電機的控制算法是近年來研究的熱點之,有霍爾位置信號直流電機根據(jù)霍爾狀態(tài)來確定通斷功率器件。利用刷直流電機的數(shù)學模型,
    發(fā)表于 08-07 14:29

    基于硬件的位置傳感器刷直流電機啟動新方法

    針對傳統(tǒng)的位置傳感器刷直流電機控制的起動需采用復(fù)雜的軟件、成本高、定位不準確、容易堵轉(zhuǎn)的缺陷,提出了一種通過檢測線電壓差獲得轉(zhuǎn)子位置的方法。提出的
    發(fā)表于 08-07 13:30

    一種新的刷直流電機反電動勢檢測方法

    位置傳感器刷直流電機的控制算法是近年來研究的熱點之,有霍爾位置信號直流電機根據(jù)霍爾狀態(tài)來確定通斷功率器件。利用刷直流電機的數(shù)學模型,
    發(fā)表于 08-04 14:59

    一種帶通濾波器在位置傳感器轉(zhuǎn)子檢測中的應(yīng)用

    摘 要:論文研究了一種直流無刷電機的位置傳感器的轉(zhuǎn)子位置的硬件電路檢測方法。結(jié)合傳統(tǒng)“反電動勢\"方法,分析并設(shè)計了一種新的帶通濾波器延時
    發(fā)表于 08-04 14:56

    基于刷直流電機的積分變結(jié)構(gòu)控制器抑制轉(zhuǎn)矩脈動

    摘 要:文章基于刷直流電機設(shè)計了一種積分變結(jié)構(gòu)(IVSC)控制器,以抑制轉(zhuǎn)矩脈動。在利用傳統(tǒng)電流控制技術(shù)中,如果反電動勢(EMF)是一種
    發(fā)表于 07-29 16:24

    基于電感法刷直流電機起動方法的優(yōu)化設(shè)計

    摘要:針對位置傳感器刷直流電機在靜止和低速狀態(tài)檢測轉(zhuǎn)子位置較為困難的問題,提出了一種新的位置傳感器
    發(fā)表于 07-28 15:04

    斜齒式超聲電機定子振動模態(tài)的有限元分析

    超聲電機是一種利用壓電陶瓷逆壓電效應(yīng)制成的全新概念的電機,主要由定子、轉(zhuǎn)子以及施加預(yù)壓力的機構(gòu)等部件構(gòu)成。其中,斜齒式模態(tài)轉(zhuǎn)換型超聲電機是一種針對大力矩、單
    發(fā)表于 07-16 19:04

    刷直流電機非換相相電流采樣的逆變器結(jié)構(gòu)

    摘要:提出了一種新型的逆變器結(jié)構(gòu),將傳統(tǒng)的三相橋逆變器中與功率開關(guān)管反并聯(lián)安裝的續(xù)流二極管獨立開,通過采用磁感應(yīng)式電流傳感器,實現(xiàn)刷直流電機的非換相相電流的采樣,從而使得電磁轉(zhuǎn)矩的精
    發(fā)表于 06-27 16:42

    使用MATLAB進行監(jiān)督學習

    監(jiān)督學習是一種根據(jù)未標注數(shù)據(jù)進行推斷的機器學習方法。監(jiān)督學習旨在識別數(shù)據(jù)中隱藏的模式和關(guān)系,
    的頭像 發(fā)表于 05-16 14:48 ?1635次閱讀
    使用MATLAB進行<b class='flag-5'>無</b><b class='flag-5'>監(jiān)督</b>學習
    周宁县| 安平县| 乌拉特后旗| 民乐县| 阳朔县| 河池市| 武义县| 色达县| 海原县| 张家港市| 承德县| 抚顺县| 岳西县| 共和县| 祁门县| 鄄城县| 社会| 客服| 香河县| 白水县| 西乌珠穆沁旗| 葫芦岛市| 长岭县| 宾阳县| 绥化市| 余江县| 浑源县| 江津市| 凌源市| 深泽县| 榆社县| 古田县| 政和县| 蓬莱市| 平舆县| 襄城县| 沁阳市| 彩票| 娱乐| 达拉特旗| 临沂市|