日B视频 亚洲,啪啪啪网站一区二区,91色情精品久久,日日噜狠狠色综合久,超碰人妻少妇97在线,999青青视频,亚洲一区二卡,让本一区二区视频,日韩网站推荐

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評(píng)論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫(xiě)文章/發(fā)帖/加入社區(qū)
會(huì)員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識(shí)你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

人工智能的強(qiáng)化學(xué)習(xí)要點(diǎn)

汽車(chē)玩家 ? 來(lái)源:今日頭條 ? 作者:聞數(shù)起舞 ? 2020-05-04 18:14 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

了解強(qiáng)化學(xué)習(xí)的要點(diǎn)!

強(qiáng)化學(xué)習(xí)(RL)是現(xiàn)代人工智能領(lǐng)域中最熱門(mén)的研究主題之一,其普及度還在不斷增長(zhǎng)。 讓我們看一下開(kāi)始學(xué)習(xí)RL需要了解的5件事。

1.什么是強(qiáng)化學(xué)習(xí)? 與其他機(jī)器學(xué)習(xí)技術(shù)相比有何不同?

強(qiáng)化學(xué)習(xí)(RL)是一種機(jī)器學(xué)習(xí)技術(shù),使代理能夠使用自身行為和經(jīng)驗(yàn)的反饋,通過(guò)反復(fù)試驗(yàn),在交互式環(huán)境中學(xué)習(xí)。

人工智能的強(qiáng)化學(xué)習(xí)要點(diǎn)

盡管監(jiān)督學(xué)習(xí)和強(qiáng)化學(xué)習(xí)都使用輸入和輸出之間的映射,但不同于監(jiān)督學(xué)習(xí),后者提供給代理的反饋是執(zhí)行任務(wù)的正確動(dòng)作集,而強(qiáng)化學(xué)習(xí)則將獎(jiǎng)懲作為正面和負(fù)面行為的信號(hào)

與無(wú)監(jiān)督學(xué)習(xí)相比,強(qiáng)化學(xué)習(xí)在目標(biāo)方面有所不同。 無(wú)監(jiān)督學(xué)習(xí)的目標(biāo)是發(fā)現(xiàn)數(shù)據(jù)點(diǎn)之間的相似點(diǎn)和差異,而在強(qiáng)化學(xué)習(xí)的情況下,目標(biāo)是找到合適的行為模型,以最大化代理的總累積獎(jiǎng)勵(lì)。 下圖說(shuō)明了通用RL模型的動(dòng)作獎(jiǎng)勵(lì)反饋回路。

人工智能的強(qiáng)化學(xué)習(xí)要點(diǎn)

2.如何制定基本的強(qiáng)化學(xué)習(xí)問(wèn)題?

描述RL問(wèn)題基本要素的一些關(guān)鍵術(shù)語(yǔ)是:

環(huán)境-代理在其中運(yùn)行的物理世界

狀態(tài)—代理的現(xiàn)狀

獎(jiǎng)勵(lì)-來(lái)自環(huán)境的反饋

策略-將代理狀態(tài)映射到操作的方法

價(jià)值-代理在特定狀態(tài)下采取的行動(dòng)將獲得的未來(lái)獎(jiǎng)勵(lì)

RL問(wèn)題可以通過(guò)游戲來(lái)最好地解釋。 讓我們以吃豆人的游戲?yàn)槔?,代理人(PacMan)的目標(biāo)是在網(wǎng)格中吃食物,同時(shí)避免途中出現(xiàn)鬼魂。 在這種情況下,網(wǎng)格世界是代理所作用的交互式環(huán)境。 如果特工被幽靈殺死(輸?shù)袅擞螒颍?,代理?huì)得到食物和懲罰的獎(jiǎng)勵(lì)。 狀態(tài)是代理在網(wǎng)格世界中的位置,總累積獎(jiǎng)勵(lì)是贏得比賽的代理。

人工智能的強(qiáng)化學(xué)習(xí)要點(diǎn)

為了建立最佳政策,代理面臨探索新?tīng)顟B(tài)的困境,同時(shí)又要最大化其整體回報(bào)。 這稱為"探索與利用"的權(quán)衡。 為了平衡兩者,最佳的整體策略可能涉及短期犧牲。 因此,代理應(yīng)收集足夠的信息,以便將來(lái)做出最佳的總體決策。

馬爾可夫決策過(guò)程(MDP)是描述RL環(huán)境的數(shù)學(xué)框架,幾乎所有RL問(wèn)題都可以使用MDP來(lái)表述。 一個(gè)MDP由一組有限的環(huán)境狀態(tài)S,在每個(gè)狀態(tài)下的一組可能的動(dòng)作A,一個(gè)實(shí)值獎(jiǎng)勵(lì)函數(shù)R和一個(gè)過(guò)渡模型P(s',s | a)組成。 但是,現(xiàn)實(shí)環(huán)境更可能缺少任何有關(guān)環(huán)境動(dòng)力學(xué)的先驗(yàn)知識(shí)。 在這種情況下,無(wú)模型RL方法非常方便。

Q學(xué)習(xí)是一種常用的無(wú)模型方法,可用于構(gòu)建自播放的PacMan代理。 它圍繞更新Q值的概念展開(kāi),Q值表示在狀態(tài)s中執(zhí)行動(dòng)作a的值。 以下值更新規(guī)則是Q學(xué)習(xí)算法的核心。

人工智能的強(qiáng)化學(xué)習(xí)要點(diǎn)

3.什么是最常用的強(qiáng)化學(xué)習(xí)算法?

Q學(xué)習(xí)和SARSA(狀態(tài)行動(dòng)-獎(jiǎng)勵(lì)狀態(tài)行動(dòng))是兩種常用的無(wú)模型RL算法。 它們的探索策略不同,而利用策略卻相似。 Q學(xué)習(xí)是一種非策略方法,其中代理根據(jù)從另一個(gè)策略得出的操作a *學(xué)習(xí)值,而SARSA是一種策略上方法,在其中根據(jù)其當(dāng)前操作a從當(dāng)前策略得出的值來(lái)學(xué)習(xí)值。 政策。 這兩種方法易于實(shí)現(xiàn),但缺乏通用性,因?yàn)樗鼈儫o(wú)法估計(jì)未見(jiàn)狀態(tài)的值。

可以通過(guò)更高級(jí)的算法(例如使用神經(jīng)網(wǎng)絡(luò)來(lái)估計(jì)Q值的深度Q網(wǎng)絡(luò)(DQN))來(lái)克服這一問(wèn)題。 但是DQN只能處理離散的低維動(dòng)作空間。

深度確定性策略梯度(DDPG)是一種無(wú)模型,脫離策略,對(duì)執(zhí)行者敏感的算法,它通過(guò)在高維連續(xù)動(dòng)作空間中學(xué)習(xí)策略來(lái)解決此問(wèn)題。 下圖是評(píng)論體系結(jié)構(gòu)的表示。

人工智能的強(qiáng)化學(xué)習(xí)要點(diǎn)

4.強(qiáng)化學(xué)習(xí)的實(shí)際應(yīng)用是什么?

由于RL需要大量數(shù)據(jù),因此最適用于容易獲得模擬數(shù)據(jù)(例如游戲性,機(jī)器人技術(shù))的領(lǐng)域。

RL被廣泛用于構(gòu)建用于玩計(jì)算機(jī)游戲的AI。 AlphaGo Zero是第一個(gè)在古代中國(guó)的圍棋游戲中擊敗世界冠軍的計(jì)算機(jī)程序。 其他包括ATARI游戲,西洋雙陸棋等

在機(jī)器人技術(shù)和工業(yè)自動(dòng)化中,RL用于使機(jī)器人能夠?yàn)槠渥陨韯?chuàng)建高效的自適應(yīng)控制系統(tǒng),該系統(tǒng)可以從自身的經(jīng)驗(yàn)和行為中學(xué)習(xí)。 DeepMind的"通過(guò)異步策略更新進(jìn)行機(jī)器人操縱的深度強(qiáng)化學(xué)習(xí)"就是一個(gè)很好的例子。 觀看這個(gè)有趣的演示視頻。

RL的其他應(yīng)用包括抽象文本摘要引擎,對(duì)話代理(文本,語(yǔ)音),這些代理可以從用戶的交互中學(xué)習(xí)并隨著時(shí)間的流逝而改善,學(xué)習(xí)醫(yī)療保健中的最佳治療策略,以及用于在線股票交易的基于RL的代理。

5.我如何開(kāi)始進(jìn)行強(qiáng)化學(xué)習(xí)?

為了理解RL的基本概念,可以參考以下資源。

《強(qiáng)化學(xué)習(xí)-入門(mén)》,是強(qiáng)化學(xué)習(xí)之父的一本書(shū)-理查德·薩頓(Richard Sutton)和他的博士生導(dǎo)師安德魯·巴托(Andrew Barto)。 這本書(shū)的在線草稿可以在這里找到。

David Silver的教學(xué)材料(包括視頻講座)是有關(guān)RL的入門(mén)課程。

Pieter Abbeel和John Schulman(開(kāi)放式AI /伯克利AI研究實(shí)驗(yàn)室)的另一本有關(guān)RL的技術(shù)教程。

對(duì)于開(kāi)始構(gòu)建和測(cè)試RL代理,以下資源可能會(huì)有所幫助。

博客介紹了如何使用來(lái)自原始像素的Policy Gradients訓(xùn)練神經(jīng)網(wǎng)絡(luò)ATARI Pong代理,Andrej Karpathy將幫助您在130行Python代碼中啟動(dòng)并運(yùn)行您的第一個(gè)Deep Reinforcement Learning代理。

·DeepMind Lab是一個(gè)類(lèi)似于開(kāi)放源代碼的3D游戲平臺(tái),用于具有豐富模擬環(huán)境的基于代理的AI研究。

馬爾默項(xiàng)目是另一個(gè)支持AI基礎(chǔ)研究的AI實(shí)驗(yàn)平臺(tái)。

OpenAI Gym是用于構(gòu)建和比較強(qiáng)化學(xué)習(xí)算法的工具包。

聲明:本文內(nèi)容及配圖由入駐作者撰寫(xiě)或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問(wèn)題,請(qǐng)聯(lián)系本站處理。 舉報(bào)投訴
收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評(píng)論

    相關(guān)推薦
    熱點(diǎn)推薦

    IT愛(ài)學(xué)堂-人工智能深度學(xué)習(xí)系統(tǒng)班(13期)

    人工智能技術(shù)迭代日趨白熱化的今天,“人工智能深度學(xué)習(xí)系統(tǒng)班第13期”的開(kāi)課,折射出一個(gè)行業(yè)變局:硬核技術(shù)培訓(xùn)正在經(jīng)歷一場(chǎng)深刻的經(jīng)濟(jì)學(xué)轉(zhuǎn)型。本期的核心理念——“從用戶需求出發(fā)規(guī)劃深度學(xué)習(xí)
    發(fā)表于 05-05 18:03

    Momenta R7強(qiáng)化學(xué)習(xí)世界模型助力上汽大眾ID. ERA 9X正式上市

    2026年4月25日,上汽大眾全新旗艦SUV ID. ERA 9X于2026北京國(guó)際汽車(chē)展覽會(huì)期間正式上市,并將全球首發(fā)搭載Momenta R7強(qiáng)化學(xué)習(xí)世界模型。這意味著Momenta R7率先在全球強(qiáng)化學(xué)習(xí)+世界模型方向上取得量產(chǎn)突破——標(biāo)志著物理AI上車(chē)。
    的頭像 發(fā)表于 04-29 15:42 ?664次閱讀

    上汽奧迪E5 Sportback車(chē)型升級(jí)搭載全新Momenta強(qiáng)化學(xué)習(xí)大模型

    近日,上汽奧迪宣布旗下 E5 Sportback 車(chē)型升級(jí)搭載 全新Momenta 強(qiáng)化學(xué)習(xí)大模型。
    的頭像 發(fā)表于 04-09 09:33 ?254次閱讀

    上汽大眾ID. ERA 9X全球首發(fā)搭載Momenta R7強(qiáng)化學(xué)習(xí)世界模型

    3月30日,Momenta R7強(qiáng)化學(xué)習(xí)世界模型全球首發(fā)搭載車(chē)型——上汽大眾ID. ERA 9X正式開(kāi)啟預(yù)售。
    的頭像 發(fā)表于 03-31 13:48 ?431次閱讀

    Momenta R6強(qiáng)化學(xué)習(xí)大模型上車(chē)東風(fēng)日產(chǎn)NX8

    3月20日,東風(fēng)日產(chǎn)NX8技術(shù)暨預(yù)售發(fā)布會(huì)在廣州舉辦,官宣Momenta R6強(qiáng)化學(xué)習(xí)大模型正式上車(chē)東風(fēng)日產(chǎn)新能源SUV——NX8。以全球頂級(jí)大廠合力,融合先鋒科技力量,打造更適配全家出行的智能SUV,開(kāi)啟合資品牌智能化全新賽道
    的頭像 發(fā)表于 03-24 09:08 ?896次閱讀

    自動(dòng)駕駛中常提的離線強(qiáng)化學(xué)習(xí)是什么?

    [首發(fā)于智駕最前沿微信公眾號(hào)]在之前談及自動(dòng)駕駛模型學(xué)習(xí)時(shí),詳細(xì)聊過(guò)強(qiáng)化學(xué)習(xí)的作用,由于強(qiáng)化學(xué)習(xí)能讓大模型通過(guò)交互學(xué)到策略,不需要固定的規(guī)則,從而給自動(dòng)駕駛的落地創(chuàng)造了更多可能。 強(qiáng)化學(xué)習(xí)
    的頭像 發(fā)表于 02-07 09:21 ?380次閱讀
    自動(dòng)駕駛中常提的離線<b class='flag-5'>強(qiáng)化學(xué)習(xí)</b>是什么?

    人工智能與機(jī)器學(xué)習(xí)在這些行業(yè)的深度應(yīng)用

    人工智能和機(jī)器學(xué)習(xí)問(wèn)世以來(lái),多個(gè)在線領(lǐng)域的數(shù)字化格局迎來(lái)了翻天覆地的變化。這些技術(shù)從誕生之初就為企業(yè)賦予了競(jìng)爭(zhēng)優(yōu)勢(shì),而在線行業(yè)正是受其影響最為顯著的領(lǐng)域。人工智能(AI)與機(jī)器學(xué)習(xí)
    的頭像 發(fā)表于 02-04 14:44 ?711次閱讀

    強(qiáng)化學(xué)習(xí)會(huì)讓自動(dòng)駕駛模型學(xué)習(xí)更快嗎?

    [首發(fā)于智駕最前沿微信公眾號(hào)]在談及自動(dòng)駕駛大模型訓(xùn)練時(shí),有的技術(shù)方案會(huì)采用模仿學(xué)習(xí),而有些會(huì)采用強(qiáng)化學(xué)習(xí)。同樣作為大模型的訓(xùn)練方式,強(qiáng)化學(xué)習(xí)有何不同?又有什么特點(diǎn)呢? 什么是強(qiáng)化學(xué)習(xí)
    的頭像 發(fā)表于 01-31 09:34 ?860次閱讀
    <b class='flag-5'>強(qiáng)化學(xué)習(xí)</b>會(huì)讓自動(dòng)駕駛模型<b class='flag-5'>學(xué)習(xí)</b>更快嗎?

    智能強(qiáng)化學(xué)習(xí)(MARL)核心概念與算法概覽

    訓(xùn)練單個(gè)RL智能體的過(guò)程非常簡(jiǎn)單,那么我們現(xiàn)在換一個(gè)場(chǎng)景,同時(shí)訓(xùn)練五個(gè)智能體,而且每個(gè)都有自己的目標(biāo)、只能看到部分信息,還能互相幫忙。這就是多智能強(qiáng)化學(xué)習(xí)
    的頭像 發(fā)表于 01-21 16:21 ?354次閱讀
    多<b class='flag-5'>智能</b>體<b class='flag-5'>強(qiáng)化學(xué)習(xí)</b>(MARL)核心概念與算法概覽

    上汽別克至境E7首發(fā)搭載Momenta R6強(qiáng)化學(xué)習(xí)大模型

    別克至境家族迎來(lái)新成員——大五座智能SUV別克至境E7首發(fā)。新車(chē)將搭載Momenta R6強(qiáng)化學(xué)習(xí)大模型,帶來(lái)全場(chǎng)景的智能出行體驗(yàn)。
    的頭像 發(fā)表于 01-12 16:23 ?533次閱讀

    自動(dòng)駕駛中常提的“強(qiáng)化學(xué)習(xí)”是個(gè)啥?

    下,就是一個(gè)智能體在環(huán)境里行動(dòng),它能觀察到環(huán)境的一些信息,并做出一個(gè)動(dòng)作,然后環(huán)境會(huì)給出一個(gè)反饋(獎(jiǎng)勵(lì)或懲罰),智能體的目標(biāo)是把長(zhǎng)期得到的獎(jiǎng)勵(lì)累積到最大。和監(jiān)督學(xué)習(xí)不同,強(qiáng)化學(xué)習(xí)沒(méi)有一
    的頭像 發(fā)表于 10-23 09:00 ?936次閱讀
    自動(dòng)駕駛中常提的“<b class='flag-5'>強(qiáng)化學(xué)習(xí)</b>”是個(gè)啥?

    挖到寶了!人工智能綜合實(shí)驗(yàn)箱,高校新工科的寶藏神器

    和生態(tài)體系帶到使用者身邊 ,讓我們?cè)诩夹g(shù)學(xué)習(xí)和使用上不再受制于人。 三、多模態(tài)實(shí)驗(yàn),解鎖AI全流程 它嵌入了2D視覺(jué)、深度視覺(jué)、機(jī)械手臂、語(yǔ)音識(shí)別、嵌入式傳感器等多種類(lèi)AI模塊,涵蓋人工智能領(lǐng)域主要
    發(fā)表于 08-07 14:30

    挖到寶了!比鄰星人工智能綜合實(shí)驗(yàn)箱,高校新工科的寶藏神器!

    和生態(tài)體系帶到使用者身邊 ,讓我們?cè)诩夹g(shù)學(xué)習(xí)和使用上不再受制于人。 三、多模態(tài)實(shí)驗(yàn),解鎖AI全流程 它嵌入了2D視覺(jué)、深度視覺(jué)、機(jī)械手臂、語(yǔ)音識(shí)別、嵌入式傳感器等多種類(lèi)AI模塊,涵蓋人工智能領(lǐng)域主要
    發(fā)表于 08-07 14:23

    超小型Neuton機(jī)器學(xué)習(xí)模型, 在任何系統(tǒng)級(jí)芯片(SoC)上解鎖邊緣人工智能應(yīng)用.

    Neuton 是一家邊緣AI 公司,致力于讓機(jī)器 學(xué)習(xí)模型更易于使用。它創(chuàng)建的模型比競(jìng)爭(zhēng)對(duì)手的框架小10 倍,速度也快10 倍,甚至可以在最先進(jìn)的邊緣設(shè)備上進(jìn)行人工智能處理。在這篇博文中,我們將介紹
    發(fā)表于 07-31 11:38

    最新人工智能硬件培訓(xùn)AI 基礎(chǔ)入門(mén)學(xué)習(xí)課程參考2025版(大模型篇)

    人工智能大模型重塑教育與社會(huì)發(fā)展的當(dāng)下,無(wú)論是探索未來(lái)職業(yè)方向,還是更新技術(shù)儲(chǔ)備,掌握大模型知識(shí)都已成為新時(shí)代的必修課。從職場(chǎng)上輔助工作的智能助手,到課堂用于學(xué)術(shù)研究的智能工具,大模型正在工作生活
    發(fā)表于 07-04 11:10
    双城市| 文安县| 东莞市| 河北省| 玉环县| 北票市| 济宁市| 大悟县| 会泽县| 彰化市| 石河子市| 玛沁县| 南部县| 安远县| 通州区| 北川| 大石桥市| 温泉县| 卢湾区| 独山县| 虹口区| 浦北县| 宁都县| 上蔡县| 西青区| 始兴县| 蒲江县| 西安市| 哈巴河县| 西青区| 佛坪县| 南郑县| 柞水县| 米泉市| 新乐市| 荔波县| 上林县| 富锦市| 武功县| 临沂市| 松原市|