化學(xué)習(xí)獎(jiǎng)勵(lì)函數(shù)設(shè)計(jì)與仿真驗(yàn)證)
1. 項(xiàng)目概述當(dāng)“天眼”需要學(xué)會(huì)自己決策在軌巡檢聽(tīng)起來(lái)是個(gè)充滿科幻感的詞。簡(jiǎn)單來(lái)說(shuō)就是讓一個(gè)或多個(gè)航天器我們稱(chēng)之為“服務(wù)星”或“巡檢星”去近距離觀察、檢查另一個(gè)在軌運(yùn)行的航天器“目標(biāo)星”看看它的太陽(yáng)帆板是否展開(kāi)正常表面有沒(méi)有被空間碎片撞擊的損傷或者天線指向是否正確。這活兒以前主要靠地面遙控或者依賴(lài)目標(biāo)星自帶的傳感器但前者延遲高、不靈活后者成本高昂且視角有限。于是多智能體協(xié)同在軌巡檢的概念應(yīng)運(yùn)而生。想象一下不是派一個(gè)“獨(dú)行俠”而是派出一小隊(duì)“蜂群”衛(wèi)星它們從不同角度、不同距離同時(shí)對(duì)目標(biāo)進(jìn)行觀測(cè)效率和信息豐富度會(huì)呈指數(shù)級(jí)提升。但問(wèn)題來(lái)了如何指揮這一群自主運(yùn)行的智能體讓它們像訓(xùn)練有素的偵察兵一樣既能完成全局任務(wù)又不會(huì)互相撞上或浪費(fèi)燃料這就是強(qiáng)化學(xué)習(xí)大顯身手的地方。強(qiáng)化學(xué)習(xí)的核心是“試錯(cuò)學(xué)習(xí)”智能體通過(guò)與環(huán)境互動(dòng)獲得獎(jiǎng)勵(lì)或懲罰從而學(xué)會(huì)達(dá)成目標(biāo)的最佳策略。而獎(jiǎng)勵(lì)函數(shù)就是這個(gè)學(xué)習(xí)過(guò)程中的“指揮棒”和“評(píng)分標(biāo)準(zhǔn)”。它告訴智能體“靠近目標(biāo)觀察”是好的分“燃料耗盡”是壞的-分“與其他智能體碰撞”是極其糟糕的大扣分。設(shè)計(jì)一個(gè)好的獎(jiǎng)勵(lì)函數(shù)直接決定了智能體最終能否學(xué)會(huì)我們期望的、安全高效的巡檢行為。然而在太空這種高成本、高風(fēng)險(xiǎn)、無(wú)法實(shí)地反復(fù)試驗(yàn)的環(huán)境下我們絕不可能把一套沒(méi)經(jīng)過(guò)充分驗(yàn)證的獎(jiǎng)勵(lì)函數(shù)直接上傳到真實(shí)的衛(wèi)星上。這就引出了本項(xiàng)目的核心基于仿真的獎(jiǎng)勵(lì)函數(shù)驗(yàn)證。它的本質(zhì)是在高度逼真的數(shù)字世界里對(duì)為多智能體在軌巡檢任務(wù)設(shè)計(jì)的獎(jiǎng)勵(lì)函數(shù)進(jìn)行“壓力測(cè)試”和“畢業(yè)考試”。我們通過(guò)構(gòu)建一個(gè)包含軌道動(dòng)力學(xué)、相對(duì)運(yùn)動(dòng)、傳感器模型、通信約束的仿真環(huán)境讓搭載了待驗(yàn)證獎(jiǎng)勵(lì)函數(shù)的智能體在里面瘋狂訓(xùn)練、反復(fù)試錯(cuò)。我們要看的不是它最終得了多少分而是要看它學(xué)到的行為是否安全、可靠、高效并且沒(méi)有我們未曾預(yù)料到的“作弊”行為或危險(xiǎn)傾向。這個(gè)驗(yàn)證過(guò)程是連接算法設(shè)計(jì)與工程應(yīng)用的生死橋梁。一個(gè)在簡(jiǎn)單網(wǎng)格世界里表現(xiàn)優(yōu)異的獎(jiǎng)勵(lì)函數(shù)在復(fù)雜的六自由度軌道動(dòng)力學(xué)中可能會(huì)引導(dǎo)智能體做出自殺式撞擊行為。因此這個(gè)項(xiàng)目不是簡(jiǎn)單的算法跑通而是一套嚴(yán)謹(jǐn)?shù)?、系統(tǒng)化的驗(yàn)證方法論與實(shí)踐。2. 仿真環(huán)境構(gòu)建打造高保真的數(shù)字太空實(shí)驗(yàn)室驗(yàn)證的可靠性首先建立在仿真環(huán)境的可信度上。一個(gè)“玩具級(jí)”的仿真無(wú)法提供任何有意義的驗(yàn)證結(jié)論。我們需要構(gòu)建一個(gè)能反映真實(shí)太空物理與工程約束的數(shù)字實(shí)驗(yàn)室。2.1 核心動(dòng)力學(xué)模型從二體問(wèn)題到相對(duì)運(yùn)動(dòng)軌道動(dòng)力學(xué)是基石。對(duì)于近地軌道巡檢通常采用開(kāi)普勒軌道模型作為一階近似考慮地球中心引力場(chǎng)的二體問(wèn)題。每個(gè)智能體和目標(biāo)星的運(yùn)動(dòng)都遵循牛頓萬(wàn)有引力定律。在仿真中我們通常用位置矢量 (\mathbf{r}) 和速度矢量 (\mathbf{v}) 來(lái)描述一個(gè)航天器的軌道狀態(tài)。其運(yùn)動(dòng)方程由常微分方程描述 [ \ddot{\mathbf{r}} -\frac{\mu}{r^3} \mathbf{r} \mathbf{a}{\text{pert}} ] 其中 (\mu) 是地球引力常數(shù)(r |\mathbf{r}|)(\mathbf{a}{\text{pert}}) 是攝動(dòng)加速度。但對(duì)于近距離巡檢我們更關(guān)心的是巡檢星相對(duì)于目標(biāo)星的運(yùn)動(dòng)。這時(shí)使用相對(duì)軌道動(dòng)力學(xué)模型更為高效例如著名的C-W方程Clohessy-Wiltshire equations或T-H方程Tschauner-Hempel equations。C-W方程假設(shè)目標(biāo)星運(yùn)行在圓軌道上且兩者距離遠(yuǎn)小于軌道半徑它將相對(duì)運(yùn)動(dòng)解耦為在軌道平面內(nèi)和平面外的簡(jiǎn)諧振動(dòng)[ \begin{aligned} \ddot{x} - 2n\dot{y} - 3n^2x a_x \ \ddot{y} 2n\dot{x} a_y \ \ddot{z} n^2z a_z \end{aligned} ] 其中(x) 是徑向方向地心指向目標(biāo)星(y) 是沿飛行方向(z) 是軌道面法向(n) 是目標(biāo)星的軌道角速度(a_x, a_y, a_z) 是控制加速度。注意C-W方程是線性模型計(jì)算高效非常適合作為強(qiáng)化學(xué)習(xí)智能體的狀態(tài)輸入和訓(xùn)練環(huán)境。但在驗(yàn)證的后期尤其是進(jìn)行高精度行為評(píng)估時(shí)必須切換到包含J2攝動(dòng)地球扁率、大氣阻力等更精確的非線性模型中進(jìn)行“最終測(cè)試”以確保智能體在真實(shí)復(fù)雜攝動(dòng)下的魯棒性。2.2 多智能體交互與感知模型多智能體系統(tǒng)的核心是交互。在仿真中我們需要明確建模觀測(cè)空間每個(gè)智能體能“看”到什么這通常包括相對(duì)于目標(biāo)星的位置、速度、姿態(tài)自身燃料剩余可能還包括對(duì)其他智能體的相對(duì)狀態(tài)如果傳感器支持。為了模擬真實(shí)光學(xué)導(dǎo)航相機(jī)的限制我們可能需要加入視場(chǎng)角FOV限制、測(cè)量噪聲高斯白噪聲和更新頻率。動(dòng)作空間智能體能做什么通常是施加在三軸上的脈沖推力或連續(xù)小推力。動(dòng)作需要被限制在衛(wèi)星推進(jìn)器的實(shí)際能力范圍內(nèi)如最大推力、最小脈沖比特、推力方向。智能體間通信它們能交換信息嗎假設(shè)使用星間鏈路需要建模通信距離、帶寬限制、時(shí)延甚至丟包。一種常見(jiàn)的簡(jiǎn)化是設(shè)定一個(gè)固定的通信拓?fù)淙缛B接或最近鄰或者假設(shè)在特定距離內(nèi)可以無(wú)延遲共享部分觀測(cè)信息。通信約束會(huì)極大影響協(xié)同策略的學(xué)習(xí)。2.3 獎(jiǎng)勵(lì)函數(shù)接口與實(shí)時(shí)計(jì)算仿真環(huán)境需要提供一個(gè)靈活的接口能夠?qū)崟r(shí)計(jì)算并返回我們待驗(yàn)證的獎(jiǎng)勵(lì)函數(shù)值。這個(gè)獎(jiǎng)勵(lì)函數(shù) (R_t) 通常在每一步或每個(gè)決策周期計(jì)算是多個(gè)子獎(jiǎng)勵(lì)項(xiàng)的加權(quán)和 [ R_t w_1 \cdot r_{\text{tracking}} w_2 \cdot r_{\text{fuel}} w_3 \cdot r_{\text{collision}} w_4 \cdot r_{\text{coordination}} ... ] 仿真環(huán)境需要能根據(jù)當(dāng)前所有智能體的狀態(tài)、動(dòng)作快速計(jì)算出這些子項(xiàng)。例如(r_{\text{tracking}}) 可能基于與目標(biāo)期望相對(duì)位置的誤差(r_{\text{collision}}) 會(huì)在智能體間距離小于安全閾值時(shí)給出一個(gè)極大的負(fù)獎(jiǎng)勵(lì)。環(huán)境的保真度選擇需要權(quán)衡。訓(xùn)練初期可以在簡(jiǎn)化的C-W方程理想感知模型中進(jìn)行以加速學(xué)習(xí)收斂但在驗(yàn)證階段尤其是對(duì)學(xué)習(xí)策略進(jìn)行性能評(píng)估時(shí)必須切換到高保真模型。3. 獎(jiǎng)勵(lì)函數(shù)設(shè)計(jì)剖析拆解“指揮棒”的每一個(gè)音符一個(gè)糟糕的獎(jiǎng)勵(lì)函數(shù)會(huì)讓智能體學(xué)會(huì)“作弊”而一個(gè)優(yōu)秀的獎(jiǎng)勵(lì)函數(shù)能引導(dǎo)出穩(wěn)健、高效且安全的行為。我們以多智能體在軌巡檢為例拆解獎(jiǎng)勵(lì)函數(shù)的典型構(gòu)成。3.1 基礎(chǔ)任務(wù)獎(jiǎng)勵(lì)引導(dǎo)核心行為這是驅(qū)動(dòng)智能體完成主要任務(wù)的動(dòng)力。跟蹤獎(jiǎng)勵(lì)鼓勵(lì)智能體到達(dá)并保持在理想的觀測(cè)位置如目標(biāo)星后方一定距離的繞飛軌道上。常用的是基于誤差的負(fù)獎(jiǎng)勵(lì)例如 (r_{\text{track}} - ( | \mathbf{r} - \mathbf{r}{\text{desired}} |^2 k \cdot | \mathbf{v} - \mathbf{v}{\text{desired}} |^2 ))。這里的關(guān)鍵是權(quán)重 (k) 的設(shè)定它決定了智能體更看重位置還是速度匹配。過(guò)大的位置權(quán)重可能導(dǎo)致智能體以不合理的速度“猛沖”到目標(biāo)點(diǎn)造成燃料浪費(fèi)或控制不穩(wěn)定。觀測(cè)質(zhì)量獎(jiǎng)勵(lì)如果巡檢任務(wù)對(duì)觀測(cè)角度有要求如需要對(duì)目標(biāo)特定面進(jìn)行持續(xù)成像則可以加入基于視線方向、光照條件是否在陰影區(qū)、相對(duì)姿態(tài)的獎(jiǎng)勵(lì)項(xiàng)。3.2 安全與成本約束獎(jiǎng)勵(lì)設(shè)立不可逾越的紅線這部分獎(jiǎng)勵(lì)通常是負(fù)獎(jiǎng)勵(lì)即懲罰用于防止災(zāi)難性行為和約束資源使用。碰撞避免懲罰這是重中之重。必須為智能體與目標(biāo)星之間、智能體與智能體之間設(shè)置硬性懲罰。一種常見(jiàn)做法是設(shè)定一個(gè)安全距離 (d_{\text{safe}})當(dāng)距離 (d d_{\text{safe}}) 時(shí)施加一個(gè)與 ((1/d - 1/d_{\text{safe}})) 成正比的巨大負(fù)獎(jiǎng)勵(lì)距離越近懲罰呈非線性急劇增大確保智能體產(chǎn)生強(qiáng)烈的遠(yuǎn)離動(dòng)機(jī)。燃料消耗懲罰為了任務(wù)長(zhǎng)壽需要節(jié)約推進(jìn)劑。懲罰項(xiàng)通常與本次動(dòng)作所消耗的速度增量 (\Delta v) 的平方或絕對(duì)值成正比即 (r_{\text{fuel}} -\alpha \cdot |\Delta v|)。權(quán)重 (\alpha) 需要仔細(xì)調(diào)節(jié)太小智能體會(huì)揮霍燃料太大智能體會(huì)過(guò)于“吝嗇”導(dǎo)致機(jī)動(dòng)緩慢甚至無(wú)法到達(dá)指定位置。邊界約束懲罰確保智能體不飛離任務(wù)允許的空域范圍例如相對(duì)距離不能超過(guò)通信鏈路有效距離。3.3 多智能體協(xié)同獎(jiǎng)勵(lì)從獨(dú)奏到交響樂(lè)這是多智能體任務(wù)特有的挑戰(zhàn)目的是促進(jìn)行為協(xié)同而非簡(jiǎn)單競(jìng)爭(zhēng)。區(qū)域覆蓋獎(jiǎng)勵(lì)鼓勵(lì)多個(gè)智能體分散在目標(biāo)周?chē)牟煌轿灰垣@取全面的觀測(cè)信息??梢杂?jì)算智能體之間相對(duì)于目標(biāo)的角度分布熵熵值越大分布越均勻獎(jiǎng)勵(lì)越高。角色差異化獎(jiǎng)勵(lì)如果設(shè)計(jì)了不同角色的智能體如一個(gè)近距離詳查一個(gè)遠(yuǎn)距離廣域監(jiān)視則需要通過(guò)獎(jiǎng)勵(lì)函數(shù)強(qiáng)化這種角色行為。例如為“詳查智能體”賦予更高的位置跟蹤精度權(quán)重為“監(jiān)視智能體”賦予更高的保持全局視角的獎(jiǎng)勵(lì)。通信協(xié)同獎(jiǎng)勵(lì)在部分可觀測(cè)場(chǎng)景下可以獎(jiǎng)勵(lì)智能體之間共享了有價(jià)值的信息如某個(gè)智能體發(fā)現(xiàn)了目標(biāo)異常點(diǎn)從而促進(jìn)了聯(lián)合決策。實(shí)操心得獎(jiǎng)勵(lì)塑形與稀疏獎(jiǎng)勵(lì)問(wèn)題初始設(shè)計(jì)的獎(jiǎng)勵(lì)函數(shù)往往會(huì)導(dǎo)致“稀疏獎(jiǎng)勵(lì)”問(wèn)題——在智能體偶然達(dá)成目標(biāo)前它幾乎收不到任何正向反饋學(xué)習(xí)效率極低。這時(shí)需要引入“獎(jiǎng)勵(lì)塑形”即增加一些中間獎(jiǎng)勵(lì)來(lái)引導(dǎo)學(xué)習(xí)。例如在最終到達(dá)目標(biāo)點(diǎn)之前可以設(shè)置一系列逐漸收緊的“虛擬航點(diǎn)”每接近一個(gè)航點(diǎn)就給一點(diǎn)小獎(jiǎng)勵(lì)。但這里有個(gè)著名的陷阱如果塑形獎(jiǎng)勵(lì)設(shè)計(jì)不當(dāng)可能會(huì)改變?cè)既蝿?wù)的最優(yōu)策略導(dǎo)致智能體學(xué)會(huì)“刷分”而不是真正完成任務(wù)。在驗(yàn)證時(shí)必須檢查智能體在移除塑形獎(jiǎng)勵(lì)后是否依然能完成任務(wù)。4. 驗(yàn)證流程與實(shí)驗(yàn)設(shè)計(jì)系統(tǒng)性“拷問(wèn)”獎(jiǎng)勵(lì)函數(shù)驗(yàn)證不是跑一次訓(xùn)練看看結(jié)果那么簡(jiǎn)單而是一個(gè)多層次、多角度的系統(tǒng)性測(cè)試過(guò)程。4.1 訓(xùn)練階段監(jiān)控洞察學(xué)習(xí)過(guò)程在仿真訓(xùn)練過(guò)程中我們需要監(jiān)控一系列指標(biāo)而不僅僅是總獎(jiǎng)勵(lì)曲線的上升。各子獎(jiǎng)勵(lì)項(xiàng)曲線分別繪制跟蹤獎(jiǎng)勵(lì)、燃料懲罰、碰撞懲罰等子項(xiàng)的隨時(shí)間變化曲線。這能幫助我們?cè)\斷問(wèn)題是總獎(jiǎng)勵(lì)上不去還是某個(gè)懲罰項(xiàng)始終居高不下例如如果碰撞懲罰曲線頻繁出現(xiàn)尖峰說(shuō)明智能體尚未學(xué)會(huì)避撞。關(guān)鍵狀態(tài)量統(tǒng)計(jì)記錄所有智能體與目標(biāo)的最小距離、平均燃料消耗、位置控制誤差的分布情況。這些統(tǒng)計(jì)量能直觀反映智能體群體的安全性與效率。策略熵在基于策略梯度的算法中策略熵反映了智能體探索的隨機(jī)性。熵值過(guò)早降至極低可能意味著策略快速收斂到一個(gè)可能并不優(yōu)秀的局部最優(yōu)解。4.2 策略評(píng)估與測(cè)試畢業(yè)大考在訓(xùn)練結(jié)束后我們需要在獨(dú)立于訓(xùn)練環(huán)境的測(cè)試集如不同的初始狀態(tài)、加入更多擾動(dòng)中對(duì)訓(xùn)練好的策略進(jìn)行確定性評(píng)估。蒙特卡洛滾動(dòng)測(cè)試從大量隨機(jī)初始狀態(tài)如智能體起始位置在一定范圍內(nèi)隨機(jī)分布出發(fā)運(yùn)行策略一定時(shí)長(zhǎng)收集大量回合episode的數(shù)據(jù)。計(jì)算核心性能指標(biāo)任務(wù)成功率在指定時(shí)間內(nèi)到達(dá)并穩(wěn)定在期望觀測(cè)區(qū)域的比例。安全違規(guī)率發(fā)生碰撞距離小于硬性閾值的回合比例。平均燃料消耗每個(gè)智能體平均消耗的 (\Delta v)。收斂時(shí)間從初始狀態(tài)到首次滿足任務(wù)要求所需的時(shí)間。協(xié)同指標(biāo)如觀測(cè)覆蓋度的平均值。我們需要為這些指標(biāo)設(shè)定驗(yàn)收閾值。例如“任務(wù)成功率 95%安全違規(guī)率 0.1%平均燃料消耗低于 X m/s”。只有全部滿足閾值該獎(jiǎng)勵(lì)函數(shù)才能通過(guò)本輪驗(yàn)證。4.3 魯棒性與泛化性測(cè)試應(yīng)對(duì)未知挑戰(zhàn)這是驗(yàn)證的高級(jí)階段檢驗(yàn)獎(jiǎng)勵(lì)函數(shù)引導(dǎo)出的策略是否“聰明”且“穩(wěn)健”。擾動(dòng)測(cè)試在仿真中引入未在訓(xùn)練中出現(xiàn)過(guò)的擾動(dòng)如更強(qiáng)的J2攝動(dòng)、模擬推進(jìn)器故障推力下降或偏差、或傳感器測(cè)量偏差增大。觀察策略性能的下降是否在可接受范圍內(nèi)。對(duì)抗性測(cè)試這是發(fā)現(xiàn)“獎(jiǎng)勵(lì)黑客”行為的關(guān)鍵??梢怨室庠O(shè)置一些極端或詭異的初始條件比如將一個(gè)智能體直接放在非??拷繕?biāo)危險(xiǎn)區(qū)的位置看它是否能緊急避讓而非機(jī)械地執(zhí)行原定跟蹤任務(wù)。智能體數(shù)量伸縮測(cè)試如果獎(jiǎng)勵(lì)函數(shù)設(shè)計(jì)時(shí)考慮了智能體數(shù)量可變則需要測(cè)試在多于或少于訓(xùn)練時(shí)智能體數(shù)量的情況下策略是否依然有效。這考驗(yàn)了獎(jiǎng)勵(lì)函數(shù)中協(xié)同項(xiàng)設(shè)計(jì)的通用性。常見(jiàn)問(wèn)題與排查技巧實(shí)錄問(wèn)題1訓(xùn)練后期總獎(jiǎng)勵(lì)曲線震蕩劇烈無(wú)法平穩(wěn)。排查首先檢查學(xué)習(xí)率是否過(guò)高。然后分析各子獎(jiǎng)勵(lì)曲線看是否是碰撞懲罰項(xiàng)間歇性出現(xiàn)巨大負(fù)值導(dǎo)致。如果是可能需要強(qiáng)化避撞獎(jiǎng)勵(lì)的“預(yù)警”機(jī)制例如在距離小于安全距離的1.5倍時(shí)就開(kāi)始施加一個(gè)較小的懲罰讓智能體提前感知風(fēng)險(xiǎn)。問(wèn)題2任務(wù)成功率尚可但平均燃料消耗遠(yuǎn)超預(yù)期。排查檢查燃料消耗懲罰的權(quán)重 (\alpha) 是否太小。同時(shí)觀察智能體的軌跡是否出現(xiàn)高頻的、小幅度的來(lái)回調(diào)整“抖動(dòng)”。這可能是跟蹤獎(jiǎng)勵(lì)權(quán)重過(guò)大驅(qū)使智能體不惜燃料追求極致精度。需要調(diào)整跟蹤獎(jiǎng)勵(lì)與燃料懲罰的平衡或者為控制量加速度本身增加一個(gè)小的平滑性懲罰。問(wèn)題3多智能體表現(xiàn)出“聚集”行為全部擠在同一個(gè)觀測(cè)點(diǎn)而不是分散開(kāi)。排查這是典型的協(xié)同獎(jiǎng)勵(lì)失效。區(qū)域覆蓋獎(jiǎng)勵(lì)可能權(quán)重不足或者設(shè)計(jì)不合理例如只獎(jiǎng)勵(lì)靠近目標(biāo)未懲罰彼此靠近??梢試L試引入明確的排斥項(xiàng)當(dāng)智能體彼此距離過(guò)近時(shí)給予懲罰或者強(qiáng)化基于角度分布的覆蓋獎(jiǎng)勵(lì)。5. 工具鏈與實(shí)現(xiàn)考量從理論到代碼的橋梁實(shí)現(xiàn)這套驗(yàn)證系統(tǒng)需要選擇合適的軟件工具并搭建高效的流水線。5.1 仿真引擎選擇高保真專(zhuān)業(yè)工具對(duì)于最終階段的驗(yàn)證可能需要集成或調(diào)用像STK、GMAT這樣的高精度軌道動(dòng)力學(xué)仿真軟件。它們能提供最接近真實(shí)的物理環(huán)境。靈活的自研環(huán)境對(duì)于日常訓(xùn)練和快速迭代使用 Python 庫(kù)如numpy,scipy自行實(shí)現(xiàn)基于C-W方程或簡(jiǎn)化攝動(dòng)模型的仿真環(huán)境更為常見(jiàn)。深度學(xué)習(xí)框架如PyTorch或TensorFlow可以方便地將環(huán)境構(gòu)建為可微分模塊這對(duì)某些高級(jí)優(yōu)化算法有益。多智能體仿真框架OpenAI Gym風(fēng)格的環(huán)境定義是主流??梢詾槠鋽U(kuò)展多智能體接口例如使用PettingZoo或SMAC這類(lèi)多智能體強(qiáng)化學(xué)習(xí)庫(kù)的標(biāo)準(zhǔn)它們提供了清晰的多智能體環(huán)境循環(huán)框架。5.2 強(qiáng)化學(xué)習(xí)算法選型多智能體強(qiáng)化學(xué)習(xí)算法大致分為兩類(lèi)集中式訓(xùn)練分布式執(zhí)行訓(xùn)練時(shí)有一個(gè)中央控制器能看到全局信息并指導(dǎo)所有智能體但執(zhí)行時(shí)每個(gè)智能體只用自己的局部觀測(cè)做決策。MADDPG、MAPPO是這類(lèi)算法的代表。它們通常能學(xué)到更協(xié)同的策略適合我們這種需要緊密配合的巡檢任務(wù)。完全分布式每個(gè)智能體獨(dú)立學(xué)習(xí)將其他智能體視為環(huán)境的一部分。這種方法更簡(jiǎn)單但容易導(dǎo)致環(huán)境非平穩(wěn)、難以收斂的問(wèn)題。對(duì)于在軌巡檢驗(yàn)證我個(gè)人的經(jīng)驗(yàn)是優(yōu)先嘗試MAPPO。它是一種基于策略梯度的算法在合作性任務(wù)中表現(xiàn)穩(wěn)定且對(duì)超參數(shù)相對(duì)不那么敏感。PPO算法本身具有較好的采樣效率和訓(xùn)練穩(wěn)定性適合在計(jì)算成本較高的仿真環(huán)境中進(jìn)行迭代。5.3 實(shí)驗(yàn)管理與人機(jī)交互驗(yàn)證會(huì)產(chǎn)生海量實(shí)驗(yàn)數(shù)據(jù)不同獎(jiǎng)勵(lì)函數(shù)權(quán)重組合、不同隨機(jī)種子、不同測(cè)試場(chǎng)景。必須有一套系統(tǒng)化的管理方法。參數(shù)化配置將獎(jiǎng)勵(lì)函數(shù)權(quán)重、環(huán)境參數(shù)、算法超參數(shù)全部寫(xiě)入配置文件如YAML文件。每次實(shí)驗(yàn)對(duì)應(yīng)一個(gè)唯一的配置文件和隨機(jī)種子。實(shí)驗(yàn)跟蹤使用像Weights Biases、MLflow或TensorBoard這樣的工具自動(dòng)記錄每次實(shí)驗(yàn)的配置、訓(xùn)練曲線、評(píng)估指標(biāo)和模型快照。這對(duì)于對(duì)比分析至關(guān)重要??梢暬胤砰_(kāi)發(fā)一個(gè)簡(jiǎn)單的可視化工具能夠讀取仿真日志回放智能體的運(yùn)動(dòng)軌跡。肉眼觀察往往能發(fā)現(xiàn)自動(dòng)化指標(biāo)無(wú)法揭示的詭異行為模式比如智能體在繞飛時(shí)出現(xiàn)的非必要“繞圈”等。踩坑記錄仿真與現(xiàn)實(shí)的差距即使通過(guò)了高保真仿真驗(yàn)證也只是萬(wàn)里長(zhǎng)征第一步。仿真無(wú)法完全模擬所有真實(shí)世界的意外比如星上計(jì)算機(jī)的時(shí)序抖動(dòng)、敏感器的奇異噪聲模式、熱變形導(dǎo)致的微小推力偏置等。因此基于仿真的獎(jiǎng)勵(lì)函數(shù)驗(yàn)證其結(jié)論應(yīng)表述為“在仿真所建模的約束條件下該獎(jiǎng)勵(lì)函數(shù)能引導(dǎo)出安全、高效、協(xié)同的策略”。它為地面實(shí)驗(yàn)和星載算法固化提供了強(qiáng)有力的信心和支持但絕非一勞永逸的保證。在可能的條件下應(yīng)結(jié)合硬件在環(huán)仿真進(jìn)行進(jìn)一步驗(yàn)證。