99精品久久精品一区二区-亚洲熟妇无码?v在线播放-日本国产精品无码字幕在线观看-久久久亚洲永夜AV-亚洲一级无码一区二区一-免费国产成高清人在线视频-中文字幕乱码免费观看-国产毛片精品妇女久久久

ARTICLE DETAIL

資訊詳情

深耕商務(wù)建站與企業(yè)官網(wǎng)運(yùn)營(yíng)的一線實(shí)戰(zhàn)洞察。

OpenClaw-RL實(shí)戰(zhàn):基于OPD教師模型的強(qiáng)化學(xué)習(xí)策略優(yōu)化

OpenClaw-RL實(shí)戰(zhàn):基于OPD教師模型的強(qiáng)化學(xué)習(xí)策略優(yōu)化 1. 項(xiàng)目概述從“后悔”到“聰明”的AI進(jìn)化之路最近在搞強(qiáng)化學(xué)習(xí)項(xiàng)目特別是基于OpenClaw-RL框架的探索發(fā)現(xiàn)一個(gè)特別有意思的課題如何讓AI學(xué)會(huì)“聰明”地做決策而不是像個(gè)莽夫一樣亂撞。這聽(tīng)起來(lái)有點(diǎn)玄乎但核心其實(shí)就一個(gè)詞——“后悔”。我們?nèi)祟愖鲥e(cuò)事會(huì)后悔然后下次就知道怎么做了AI能不能也這樣當(dāng)然能這就是OPDOptimal Policy Distillation最優(yōu)策略蒸餾教師模型訓(xùn)練的核心思想。簡(jiǎn)單來(lái)說(shuō)它不是讓AI從零開(kāi)始瞎摸索而是先給它看一個(gè)“笨老師”是怎么做的然后讓AI去分析這個(gè)“笨老師”哪里做錯(cuò)了、哪里可以做得更好最后自己總結(jié)出一套更“聰明”的策略。這個(gè)過(guò)程本質(zhì)上就是讓AI學(xué)會(huì)從“后悔”對(duì)次優(yōu)行為的反思中學(xué)習(xí)。這個(gè)項(xiàng)目標(biāo)題“OpenClaw-RL 實(shí)戰(zhàn) 09OPD教師模型訓(xùn)練”點(diǎn)明了幾個(gè)關(guān)鍵信息首先它是一個(gè)實(shí)戰(zhàn)系列的一部分意味著我們要?jiǎng)邮肿霾皇强照劺碚撈浯嗡贠penClaw-RL這個(gè)框架這是一個(gè)用于機(jī)器人操作或復(fù)雜決策任務(wù)的強(qiáng)化學(xué)習(xí)庫(kù)最后核心是OPD教師模型訓(xùn)練。這里的“教師模型”不是指一個(gè)已經(jīng)完美無(wú)缺的專家而更像是一個(gè)“先行者”或“示范者”它可能策略不完美但它的經(jīng)驗(yàn)包括成功和失敗是學(xué)生模型學(xué)習(xí)的寶貴素材。我們最終的目標(biāo)是訓(xùn)練出一個(gè)能超越這位“教師”的、更“聰明”的學(xué)生模型。那么這適合誰(shuí)呢如果你正在研究強(qiáng)化學(xué)習(xí)特別是模仿學(xué)習(xí)、離線強(qiáng)化學(xué)習(xí)或者策略蒸餾想提升智能體在稀疏獎(jiǎng)勵(lì)或復(fù)雜環(huán)境下的表現(xiàn)那這個(gè)內(nèi)容就是為你準(zhǔn)備的。即使你對(duì)OpenClaw-RL不熟但理解OPD的思想和實(shí)現(xiàn)流程也能輕松遷移到其他RL框架中。接下來(lái)我們就拆開(kāi)揉碎了看看怎么一步步讓AI學(xué)會(huì)“吃一塹長(zhǎng)一智”。2. OPD核心思想與為什么需要“后悔”在深入代碼之前我們必須先搞清楚OPD到底在解決什么問(wèn)題以及“后悔”這個(gè)概念是如何被量化和利用的。傳統(tǒng)的強(qiáng)化學(xué)習(xí)比如DQN、PPO是讓智能體通過(guò)與環(huán)境交互根據(jù)獲得的獎(jiǎng)勵(lì)或懲罰來(lái)調(diào)整自己的行為。這就像教小孩走路摔一跤負(fù)獎(jiǎng)勵(lì)就知道下次要小心。但在很多現(xiàn)實(shí)任務(wù)中比如機(jī)器人抓取、游戲?qū)墨@取高質(zhì)量、稠密的獎(jiǎng)勵(lì)信號(hào)非常困難或者交互成本極高。智能體很容易陷入局部最優(yōu)或者探索效率極低。模仿學(xué)習(xí)Imitation Learning是一種思路直接給智能體看專家演示專家軌跡讓它照著學(xué)。但這要求專家數(shù)據(jù)必須高質(zhì)量且充足成本很高。而且如果專家也不是完美的呢學(xué)生最多只能達(dá)到老師的水平無(wú)法青出于藍(lán)。OPD提供了一條中間道路。它不要求教師模型是最優(yōu)策略甚至允許教師策略是次優(yōu)的。它的核心是利用教師模型產(chǎn)生的軌跡狀態(tài)-動(dòng)作序列通過(guò)離線策略評(píng)估的方法比如重要性采樣、Fitted Q Evaluation來(lái)估計(jì)這些軌跡中每個(gè)決策的“優(yōu)勢(shì)”Advantage或“后悔值”Regret。這個(gè)“后悔值”衡量的是在某個(gè)狀態(tài)下教師采取的動(dòng)作相比于可能的最佳動(dòng)作差了多少。2.1 “后悔”的數(shù)學(xué)化優(yōu)勢(shì)函數(shù)與Q值怎么計(jì)算這個(gè)“后悔”呢這里就需要引入強(qiáng)化學(xué)習(xí)里的兩個(gè)核心函數(shù)狀態(tài)價(jià)值函數(shù)V(s)和動(dòng)作價(jià)值函數(shù)Q(s, a)。V(s)表示從狀態(tài)s開(kāi)始遵循當(dāng)前策略能獲得的期望累積回報(bào)。它評(píng)價(jià)一個(gè)狀態(tài)“好不好”。Q(s, a)表示在狀態(tài)s下采取動(dòng)作a然后遵循當(dāng)前策略能獲得的期望累積回報(bào)。它評(píng)價(jià)一個(gè)狀態(tài)-動(dòng)作對(duì)“好不好”。那么優(yōu)勢(shì)函數(shù)A(s, a) Q(s, a) - V(s)。它的含義非常直觀在狀態(tài)s下采取動(dòng)作a比遵循當(dāng)前策略的平均水平好或差多少。如果A(s, a) 0說(shuō)明這個(gè)動(dòng)作比“平常表現(xiàn)”要好是值得鼓勵(lì)的如果A(s, a) 0說(shuō)明這個(gè)動(dòng)作拖了后腿相當(dāng)于一次“后悔”。在OPD中我們使用教師策略π_teacher與環(huán)境交互收集到一批軌跡數(shù)據(jù)D {(s_t, a_t, s_{t1}, r_t)}。然后我們利用這批數(shù)據(jù)通過(guò)離線評(píng)估算法例如訓(xùn)練一個(gè)Q網(wǎng)絡(luò)來(lái)擬合教師數(shù)據(jù)中的回報(bào)估算出教師軌跡中每個(gè)(s_t, a_t)對(duì)應(yīng)的Q_teacher(s_t, a_t)。同時(shí)我們也能估算出V_teacher(s_t)例如通過(guò)對(duì)所有可能動(dòng)作的Q值按教師策略概率加權(quán)平均或者直接用另一個(gè)網(wǎng)絡(luò)擬合狀態(tài)價(jià)值。這樣一來(lái)我們就能計(jì)算出每個(gè)教師動(dòng)作的優(yōu)勢(shì)值A(chǔ)_teacher(s_t, a_t) Q_teacher(s_t, a_t) - V_teacher(s_t)。這個(gè)A_teacher(s_t, a_t)就是我們量化后的“后悔”當(dāng)它為負(fù)時(shí)或“驚喜”當(dāng)它為正時(shí)。學(xué)生模型的學(xué)習(xí)目標(biāo)就是要去模仿那些優(yōu)勢(shì)值為正表現(xiàn)好的動(dòng)作同時(shí)避免或糾正那些優(yōu)勢(shì)值為負(fù)表現(xiàn)差即令人“后悔”的動(dòng)作。它不僅僅模仿行為更模仿行為背后的“價(jià)值判斷”。2.2 OPD與行為克隆、DQN的區(qū)別為了更清楚理解OPD的定位我們把它和常見(jiàn)方法做個(gè)對(duì)比方法數(shù)據(jù)來(lái)源學(xué)習(xí)目標(biāo)優(yōu)點(diǎn)缺點(diǎn)行為克隆專家軌跡 (s, a)最小化動(dòng)作預(yù)測(cè)誤差簡(jiǎn)單直接樣本效率高需要完美專家復(fù)合誤差累積無(wú)法超越專家DQN在線交互 (s, a, r, s)最小化時(shí)序差分誤差能發(fā)現(xiàn)新策略理論上有最優(yōu)解探索成本高需要稠密獎(jiǎng)勵(lì)訓(xùn)練不穩(wěn)定OPD教師軌跡 (s, a, r, s)最大化期望優(yōu)勢(shì)值能利用次優(yōu)數(shù)據(jù)可超越教師樣本效率較高依賴離線評(píng)估的準(zhǔn)確性計(jì)算復(fù)雜度稍高注意OPD中的“教師”不一定是一個(gè)人也可以是一個(gè)訓(xùn)練到一半的RL策略、一個(gè)基于規(guī)則的控制器甚至是多個(gè)不同策略的混合。這大大拓寬了可用數(shù)據(jù)的來(lái)源。所以O(shè)PD的精妙之處在于它把“模仿”升級(jí)成了“批判性模仿”。學(xué)生模型不再盲目照搬老師的每一個(gè)動(dòng)作而是學(xué)會(huì)了評(píng)價(jià)“老師在這個(gè)地方這么干其實(shí)挺蠢的優(yōu)勢(shì)為負(fù)我下次得換個(gè)法子?!?或者“老師這手操作真妙優(yōu)勢(shì)為正我得好好學(xué)?!?這個(gè)過(guò)程就是AI從“后悔”中學(xué)會(huì)“聰明”的本質(zhì)。3. OpenClaw-RL框架下的OPD實(shí)戰(zhàn)設(shè)計(jì)理解了理論我們就要在OpenClaw-RL這個(gè)具體框架里把它實(shí)現(xiàn)。OpenClaw-RL通常用于機(jī)器人靈巧操作任務(wù)比如抓取、擺放、旋擰等。這些任務(wù)狀態(tài)空間圖像、關(guān)節(jié)角度和動(dòng)作空間連續(xù)電機(jī)控制都非常復(fù)雜獎(jiǎng)勵(lì)函數(shù)難以設(shè)計(jì)因此OPD這類方法特別有吸引力。我們的實(shí)戰(zhàn)目標(biāo)可以設(shè)定為訓(xùn)練一個(gè)機(jī)械爪Claw完成將某個(gè)物體從A點(diǎn)抓取并放到B點(diǎn)的任務(wù)。我們有一個(gè)基于傳統(tǒng)控制器或者簡(jiǎn)單RL訓(xùn)練出來(lái)的“教師策略”這個(gè)策略成功率可能只有60%且動(dòng)作有時(shí)冗余、不流暢。我們要用OPD訓(xùn)練一個(gè)“學(xué)生策略”目標(biāo)是超越教師達(dá)到85%以上的成功率并且動(dòng)作更優(yōu)化。3.1 系統(tǒng)整體架構(gòu)設(shè)計(jì)整個(gè)OPD訓(xùn)練流程可以分解為四個(gè)核心模塊它們形成一個(gè)閉環(huán)數(shù)據(jù)收集模塊運(yùn)行教師策略π_teacher在環(huán)境中采集大量軌跡數(shù)據(jù)存儲(chǔ)為經(jīng)驗(yàn)回放緩沖區(qū)D_teacher。每條數(shù)據(jù)包括狀態(tài)s_t動(dòng)作a_t獎(jiǎng)勵(lì)r_t下一狀態(tài)s_{t1}回合結(jié)束標(biāo)志done。實(shí)操要點(diǎn)采集的數(shù)據(jù)量要足夠大以覆蓋任務(wù)的各種狀態(tài)。教師策略可以是隨機(jī)噪聲稍小的策略以增加數(shù)據(jù)的多樣性。離線評(píng)估模塊這是OPD的核心。使用D_teacher中的數(shù)據(jù)訓(xùn)練一個(gè)Q值網(wǎng)絡(luò)Q_phi(s, a)和一個(gè)狀態(tài)價(jià)值網(wǎng)絡(luò)V_psi(s)。目標(biāo)是讓Q_phi能準(zhǔn)確預(yù)測(cè)教師數(shù)據(jù)中累積回報(bào)的期望。常用方法Fitted Q Evaluation (FQE)。通過(guò)最小化時(shí)序差分TD誤差來(lái)訓(xùn)練Q網(wǎng)絡(luò)L E[(r γ * Q_phi(s, a) - Q_phi(s, a))^2]其中a是根據(jù)教師策略在s下采樣的動(dòng)作。V網(wǎng)絡(luò)可以從Q網(wǎng)絡(luò)推導(dǎo)也可以獨(dú)立訓(xùn)練。優(yōu)勢(shì)計(jì)算與數(shù)據(jù)過(guò)濾模塊對(duì)于D_teacher中的每一個(gè)數(shù)據(jù)點(diǎn)(s, a)利用訓(xùn)練好的Q_phi和V_psi計(jì)算優(yōu)勢(shì)值A(chǔ)(s, a) Q_phi(s, a) - V_psi(s)。我們可以根據(jù)優(yōu)勢(shì)值對(duì)數(shù)據(jù)進(jìn)行過(guò)濾或加權(quán)。常見(jiàn)技巧只保留優(yōu)勢(shì)值為正的數(shù)據(jù)即教師做得好的部分給學(xué)生學(xué)習(xí)?;蛘呓o每條數(shù)據(jù)分配一個(gè)權(quán)重例如weight exp(A(s, a) / temperature)優(yōu)勢(shì)越高的數(shù)據(jù)權(quán)重越大。學(xué)生策略訓(xùn)練模塊學(xué)生策略π_theta是一個(gè)神經(jīng)網(wǎng)絡(luò)如高斯策略。它的訓(xùn)練目標(biāo)不再是簡(jiǎn)單的行為克隆模仿動(dòng)作a而是最大化它所采取的動(dòng)作的預(yù)期優(yōu)勢(shì)值。損失函數(shù)可以設(shè)計(jì)為L(zhǎng)(θ) - E_{s~D} [ A(s, π_θ(s)) ] 同時(shí)可以加上一個(gè)與教師動(dòng)作分布KL散度的約束防止策略偏離太遠(yuǎn)導(dǎo)致不穩(wěn)定。實(shí)現(xiàn)方式這類似于策略梯度。我們可以用重參數(shù)化技巧采樣學(xué)生動(dòng)作然后用計(jì)算出的優(yōu)勢(shì)值作為權(quán)重來(lái)更新策略網(wǎng)絡(luò)。這四個(gè)模塊構(gòu)成了迭代優(yōu)化的基礎(chǔ)。學(xué)生策略提升后甚至可以將其作為新的“教師”收集數(shù)據(jù)重新進(jìn)行離線評(píng)估和訓(xùn)練實(shí)現(xiàn)自我進(jìn)化。3.2 關(guān)鍵超參數(shù)與設(shè)計(jì)選擇在動(dòng)手寫代碼前有幾個(gè)關(guān)鍵設(shè)計(jì)需要想清楚網(wǎng)絡(luò)結(jié)構(gòu)Q_phi和π_theta的輸入是狀態(tài)s可能是圖像和向量狀態(tài)的融合輸出分別是標(biāo)量Q值和動(dòng)作分布參數(shù)。網(wǎng)絡(luò)深度和寬度需要根據(jù)任務(wù)復(fù)雜度調(diào)整。對(duì)于機(jī)械爪視覺(jué)任務(wù)通常使用CNN提取圖像特征再與向量狀態(tài)拼接后輸入全連接層。優(yōu)勢(shì)估計(jì)的準(zhǔn)確性這是OPD成敗的關(guān)鍵。FQE的訓(xùn)練穩(wěn)定性需要關(guān)注。技巧包括使用雙Q網(wǎng)絡(luò)減少過(guò)估計(jì)、使用目標(biāo)網(wǎng)絡(luò)穩(wěn)定訓(xùn)練、對(duì)Q值進(jìn)行歸一化等。數(shù)據(jù)過(guò)濾閾值優(yōu)勢(shì)值多大才算“好”這需要一個(gè)閾值??梢詮?開(kāi)始逐步調(diào)整。也可以使用百分位例如只保留優(yōu)勢(shì)值排名前50%的數(shù)據(jù)。策略約束強(qiáng)度在優(yōu)化學(xué)生策略時(shí)完全放開(kāi)可能會(huì)導(dǎo)致在優(yōu)勢(shì)估計(jì)不準(zhǔn)的區(qū)域做出極端行為。因此需要加入與教師策略的KL散度約束系數(shù)β需要調(diào)優(yōu)L_total -E[A(s, π_θ(s))] β * KL(π_θ(·|s) || π_teacher(·|s))。溫度系數(shù)τ在基于權(quán)重的數(shù)據(jù)采樣中溫度τ控制了對(duì)高優(yōu)勢(shì)數(shù)據(jù)的偏好程度。τ越小越傾向于只學(xué)習(xí)最好的那些片段。4. 實(shí)操步驟一教師數(shù)據(jù)收集與環(huán)境搭建我們假設(shè)已經(jīng)有一個(gè)在OpenClaw-RL環(huán)境中能基本運(yùn)行但表現(xiàn)不完美的教師策略。這個(gè)策略可能是一個(gè)訓(xùn)練了100萬(wàn)步的PPO模型成功率飽和在65%。4.1 準(zhǔn)備教師策略與環(huán)境首先確保你的OpenClaw-RL環(huán)境例如一個(gè)模擬的機(jī)器人抓取環(huán)境可以正常導(dǎo)入和運(yùn)行。教師策略通常保存為一個(gè)PyTorch的.pt文件。import torch import gym # 假設(shè)你的環(huán)境是自定義的需要注冊(cè)或直接導(dǎo)入 from openclaw_env import OpenClawGraspEnv # 初始化環(huán)境 env OpenClawGraspEnv(render_modergb_array) state_dim env.observation_space.shape action_dim env.action_space.shape[0] # 加載教師策略模型 class TeacherPolicy(torch.nn.Module): def __init__(self, state_dim, action_dim): super().__init__() # 定義網(wǎng)絡(luò)結(jié)構(gòu)需與保存時(shí)一致 self.fc torch.nn.Sequential( torch.nn.Linear(state_dim[0], 256), torch.nn.ReLU(), torch.nn.Linear(256, 256), torch.nn.ReLU(), torch.nn.Linear(256, action_dim * 2) # 輸出均值和對(duì)數(shù)標(biāo)準(zhǔn)差 ) def forward(self, state): return self.fc(state) teacher_model TeacherPolicy(state_dim, action_dim) teacher_model.load_state_dict(torch.load(./teacher_model_1M.pt)) teacher_model.eval()4.2 收集并存儲(chǔ)軌跡數(shù)據(jù)接下來(lái)運(yùn)行教師策略與環(huán)境交互收集數(shù)據(jù)。我們不僅存儲(chǔ)(s, a, r, s, done)為了后續(xù)方便最好也存儲(chǔ)每個(gè)回合的累計(jì)回報(bào)return和優(yōu)勢(shì)值先占位。import numpy as np from collections import deque import pickle def collect_teacher_data(env, model, num_episodes1000, max_steps500): 收集教師策略的軌跡數(shù)據(jù) buffer { states: [], actions: [], rewards: [], next_states: [], dones: [], returns: [], # 用于后續(xù)驗(yàn)證 advantages: [] # 先占位填0 } for ep in range(num_episodes): state, _ env.reset() episode_states, episode_actions, episode_rewards [], [], [] done False steps 0 while not done and steps max_steps: with torch.no_grad(): state_tensor torch.FloatTensor(state).unsqueeze(0) # 教師策略輸出動(dòng)作分布參數(shù)這里假設(shè)是高斯分布 output model(state_tensor) mean, log_std output.chunk(2, dim-1) std torch.exp(log_std) dist torch.distributions.Normal(mean, std) action dist.sample().numpy().flatten() # 也可以直接取均值但采樣能保留一定的探索性 # action mean.numpy().flatten() next_state, reward, terminated, truncated, _ env.step(action) done terminated or truncated buffer[states].append(state.copy()) buffer[actions].append(action.copy()) buffer[rewards].append(reward) buffer[next_states].append(next_state.copy()) buffer[dones].append(done) buffer[advantages].append(0.0) # 占位 episode_states.append(state) episode_actions.append(action) episode_rewards.append(reward) state next_state steps 1 # 計(jì)算本回合的回報(bào)Monte Carlo Return returns [] G 0 for r in reversed(episode_rewards): G r 0.99 * G # 折扣因子γ0.99 returns.insert(0, G) buffer[returns].extend(returns) if (ep 1) % 100 0: print(fEpisode {ep1}, Total Steps: {len(buffer[states])}, Avg Return: {np.mean(returns):.2f}) # 轉(zhuǎn)換為numpy數(shù)組節(jié)省空間 for key in buffer: buffer[key] np.array(buffer[key]) # 保存數(shù)據(jù) with open(./teacher_data.pkl, wb) as f: pickle.dump(buffer, f) print(f數(shù)據(jù)收集完成共 {len(buffer[states])} 條數(shù)據(jù)。) return buffer # 開(kāi)始收集 teacher_buffer collect_teacher_data(env, teacher_model, num_episodes500)實(shí)操心得收集數(shù)據(jù)時(shí)建議讓教師策略帶有一定的隨機(jī)性如高斯采樣而不是完全確定性輸出。這能增加數(shù)據(jù)的覆蓋度避免學(xué)生只學(xué)到一種僵化的模式。數(shù)據(jù)量建議在10萬(wàn)條以上對(duì)于復(fù)雜任務(wù)可能需要更多。5. 實(shí)操步驟二離線評(píng)估與優(yōu)勢(shì)值計(jì)算有了數(shù)據(jù)我們就可以開(kāi)始最關(guān)鍵的步驟評(píng)估教師策略在每個(gè)決策點(diǎn)上的價(jià)值即計(jì)算Q值和優(yōu)勢(shì)值。5.1 實(shí)現(xiàn)Fitted Q Evaluation (FQE)我們將實(shí)現(xiàn)一個(gè)相對(duì)標(biāo)準(zhǔn)的FQE來(lái)訓(xùn)練Q網(wǎng)絡(luò)。為了穩(wěn)定我們使用目標(biāo)網(wǎng)絡(luò)和雙Q網(wǎng)絡(luò)。import torch.nn as nn import torch.optim as optim from torch.utils.data import DataLoader, TensorDataset class QNetwork(nn.Module): Q(s, a) 網(wǎng)絡(luò) def __init__(self, state_dim, action_dim, hidden_dim256): super().__init__() # 假設(shè)狀態(tài)和動(dòng)作先拼接 self.net nn.Sequential( nn.Linear(state_dim action_dim, hidden_dim), nn.ReLU(), nn.Linear(hidden_dim, hidden_dim), nn.ReLU(), nn.Linear(hidden_dim, 1) # 輸出標(biāo)量Q值 ) def forward(self, state, action): x torch.cat([state, action], dim1) return self.net(x) def train_fqe(buffer, state_dim, action_dim, epochs50, batch_size256, lr1e-3): 訓(xùn)練FQE Q網(wǎng)絡(luò) # 準(zhǔn)備數(shù)據(jù) states torch.FloatTensor(buffer[states]) actions torch.FloatTensor(buffer[actions]) rewards torch.FloatTensor(buffer[rewards]) next_states torch.FloatTensor(buffer[next_states]) dones torch.FloatTensor(buffer[dones]) # 初始化兩個(gè)Q網(wǎng)絡(luò)和目標(biāo)網(wǎng)絡(luò)減少過(guò)估計(jì) q_net1 QNetwork(state_dim, action_dim) q_net2 QNetwork(state_dim, action_dim) target_q_net1 QNetwork(state_dim, action_dim) target_q_net2 QNetwork(state_dim, action_dim) target_q_net1.load_state_dict(q_net1.state_dict()) target_q_net2.load_state_dict(q_net2.state_dict()) optimizer1 optim.Adam(q_net1.parameters(), lrlr) optimizer2 optim.Adam(q_net2.parameters(), lrlr) dataset TensorDataset(states, actions, rewards, next_states, dones) dataloader DataLoader(dataset, batch_sizebatch_size, shuffleTrue) for epoch in range(epochs): total_loss 0 for batch_states, batch_actions, batch_rewards, batch_next_states, batch_dones in dataloader: # 計(jì)算目標(biāo)Q值r γ * min(Q1_target, Q2_target) with torch.no_grad(): # 教師策略在下一狀態(tài)的動(dòng)作這里需要教師策略模型我們近似使用數(shù)據(jù)中的下一個(gè)動(dòng)作 # 注意嚴(yán)格FQE需要教師策略π_teacher。這里我們使用一個(gè)簡(jiǎn)化假設(shè)數(shù)據(jù)中的下一個(gè)動(dòng)作就是教師策略給出的。 # 更好的做法是用教師策略模型對(duì)batch_next_states重新采樣動(dòng)作。 next_actions torch.FloatTensor(buffer[actions][...]) # 這里需要索引對(duì)應(yīng)簡(jiǎn)化處理 # 實(shí)際應(yīng)調(diào)用 teacher_model(batch_next_states) 采樣動(dòng)作此處為示例簡(jiǎn)化。 # 我們假設(shè)next_actions已準(zhǔn)備好。 target_q1 target_q_net1(batch_next_states, next_actions) target_q2 target_q_net2(batch_next_states, next_actions) target_q torch.min(target_q1, target_q2) # 雙Q學(xué)習(xí)取最小 target batch_rewards.unsqueeze(1) 0.99 * (1 - batch_dones.unsqueeze(1)) * target_q # 計(jì)算當(dāng)前Q值 current_q1 q_net1(batch_states, batch_actions) current_q2 q_net2(batch_states, batch_actions) # 計(jì)算損失 loss1 nn.MSELoss()(current_q1, target) loss2 nn.MSELoss()(current_q2, target) # 反向傳播 optimizer1.zero_grad() loss1.backward() optimizer1.step() optimizer2.zero_grad() loss2.backward() optimizer2.step() total_loss (loss1.item() loss2.item()) / 2 # 軟更新目標(biāo)網(wǎng)絡(luò) tau 0.005 for target_param, param in zip(target_q_net1.parameters(), q_net1.parameters()): target_param.data.copy_(tau * param.data (1.0 - tau) * target_param.data) for target_param, param in zip(target_q_net2.parameters(), q_net2.parameters()): target_param.data.copy_(tau * param.data (1.0 - tau) * target_param.data) if (epoch 1) % 10 0: print(fFQE Epoch {epoch1}, Avg Loss: {total_loss/len(dataloader):.4f}) # 我們使用q_net1作為最終的Q評(píng)估器 return q_net1 # 訓(xùn)練Q網(wǎng)絡(luò) print(開(kāi)始訓(xùn)練FQE Q網(wǎng)絡(luò)...) q_net train_fqe(teacher_buffer, state_dim[0], action_dim) torch.save(q_net.state_dict(), ./fqe_q_net.pt)5.2 計(jì)算優(yōu)勢(shì)值并過(guò)濾數(shù)據(jù)有了訓(xùn)練好的Q網(wǎng)絡(luò)我們可以為緩沖區(qū)里的每條數(shù)據(jù)計(jì)算Q值。要計(jì)算優(yōu)勢(shì)A(s,a)我們還需要V(s)。一個(gè)實(shí)用的近似是V(s) ≈ E_{a~π_teacher}[Q(s, a)]。我們可以用蒙特卡洛估計(jì)從教師策略中采樣多個(gè)動(dòng)作計(jì)算Q值的平均。def compute_advantages(buffer, q_net, teacher_model, num_samples10): 計(jì)算緩沖區(qū)中所有數(shù)據(jù)的優(yōu)勢(shì)值 states torch.FloatTensor(buffer[states]) actions torch.FloatTensor(buffer[actions]) advantages [] q_net.eval() teacher_model.eval() with torch.no_grad(): # 計(jì)算 Q(s, a) for the taken action q_values q_net(states, actions).squeeze().numpy() # 估計(jì) V(s) E[Q(s, a)] under teacher policy v_values [] for i, state in enumerate(states): state_repeated state.repeat(num_samples, 1) # 從教師策略采樣動(dòng)作 output teacher_model(state_repeated) mean, log_std output.chunk(2, dim-1) std torch.exp(log_std) dist torch.distributions.Normal(mean, std) sampled_actions dist.sample() # 計(jì)算采樣動(dòng)作的Q值并取平均 q_samples q_net(state_repeated, sampled_actions) v q_samples.mean().item() v_values.append(v) v_values np.array(v_values) # 優(yōu)勢(shì) A(s,a) Q(s,a) - V(s) adv q_values - v_values advantages adv.tolist() buffer[advantages] np.array(advantages) print(f優(yōu)勢(shì)值計(jì)算完成。范圍[{np.min(adv):.3f}, {np.max(adv):.3f}], 均值{np.mean(adv):.3f}) return buffer, adv # 計(jì)算優(yōu)勢(shì) teacher_buffer, all_advantages compute_advantages(teacher_buffer, q_net, teacher_model) # 數(shù)據(jù)過(guò)濾只保留優(yōu)勢(shì)值為正的數(shù)據(jù)教師做得好的部分 positive_mask all_advantages 0 filtered_states teacher_buffer[states][positive_mask] filtered_actions teacher_buffer[actions][positive_mask] filtered_advantages teacher_buffer[advantages][positive_mask] print(f原始數(shù)據(jù)量{len(teacher_buffer[states])}, 過(guò)濾后優(yōu)勢(shì)0數(shù)據(jù)量{len(filtered_states)}) print(f正優(yōu)勢(shì)比例{len(filtered_states)/len(teacher_buffer[states])*100:.1f}%)注意事項(xiàng)計(jì)算V(s)時(shí)采樣動(dòng)作的數(shù)量num_samples會(huì)影響估計(jì)的準(zhǔn)確性。數(shù)量太少估計(jì)方差大數(shù)量太多計(jì)算成本高。一般取10-20是一個(gè)折中的選擇。另外如果教師策略是確定性的比如直接輸出均值那么V(s)就等于Q(s, π_teacher(s))計(jì)算更簡(jiǎn)單。6. 實(shí)操步驟三學(xué)生策略訓(xùn)練與優(yōu)化現(xiàn)在我們有了“精華”數(shù)據(jù)——教師表現(xiàn)好的那些狀態(tài)-動(dòng)作對(duì)以及它們對(duì)應(yīng)的優(yōu)勢(shì)值可以看作是一種加權(quán)的重要性。接下來(lái)我們訓(xùn)練學(xué)生策略π_θ讓它學(xué)會(huì)采取具有高優(yōu)勢(shì)值的動(dòng)作。6.1 定義學(xué)生策略網(wǎng)絡(luò)與損失函數(shù)學(xué)生策略網(wǎng)絡(luò)結(jié)構(gòu)可以和教師類似但參數(shù)獨(dú)立。class StudentPolicy(nn.Module): def __init__(self, state_dim, action_dim, hidden_dim256): super().__init__() self.fc nn.Sequential( nn.Linear(state_dim, hidden_dim), nn.ReLU(), nn.Linear(hidden_dim, hidden_dim), nn.ReLU(), ) self.mean_layer nn.Linear(hidden_dim, action_dim) self.log_std_layer nn.Linear(hidden_dim, action_dim) # 可訓(xùn)練的對(duì)數(shù)標(biāo)準(zhǔn)差參數(shù) self.log_std nn.Parameter(torch.zeros(1, action_dim)) def forward(self, state): x self.fc(state) mean self.mean_layer(x) # 使用可訓(xùn)練的參數(shù)而非網(wǎng)絡(luò)輸出更穩(wěn)定 log_std self.log_std.expand_as(mean) std torch.exp(log_std) return mean, std def train_student_policy(filtered_states, filtered_actions, filtered_advantages, teacher_model, epochs100, batch_size64, lr1e-4, kl_coef0.1): 訓(xùn)練學(xué)生策略最大化優(yōu)勢(shì)同時(shí)約束與教師策略的KL散度 states torch.FloatTensor(filtered_states) actions torch.FloatTensor(filtered_actions) advantages torch.FloatTensor(filtered_advantages).unsqueeze(1) # 保持維度 student_model StudentPolicy(state_dim[0], action_dim) optimizer optim.Adam(student_model.parameters(), lrlr) # 我們還需要教師模型來(lái)計(jì)算KL散度 teacher_model.eval() dataset TensorDataset(states, actions, advantages) dataloader DataLoader(dataset, batch_sizebatch_size, shuffleTrue) for epoch in range(epochs): total_policy_loss 0 total_kl_loss 0 for batch_states, batch_actions, batch_advantages in dataloader: # 學(xué)生策略輸出 student_mean, student_std student_model(batch_states) student_dist torch.distributions.Normal(student_mean, student_std) # 教師策略輸出用于KL計(jì)算 with torch.no_grad(): teacher_output teacher_model(batch_states) teacher_mean, teacher_log_std teacher_output.chunk(2, dim-1) teacher_std torch.exp(teacher_log_std) teacher_dist torch.distributions.Normal(teacher_mean, teacher_std) # 策略梯度損失 -E[ A * log π_θ(a|s) ] # 注意這里我們使用重參數(shù)化技巧但對(duì)于已采樣的動(dòng)作我們計(jì)算其對(duì)數(shù)概率 log_prob student_dist.log_prob(batch_actions).sum(dim-1, keepdimTrue) policy_loss - (batch_advantages * log_prob).mean() # KL散度損失 E[ KL( π_θ || π_teacher ) ] kl_div torch.distributions.kl.kl_divergence(student_dist, teacher_dist).sum(dim-1, keepdimTrue) kl_loss kl_div.mean() # 總損失 loss policy_loss kl_coef * kl_loss optimizer.zero_grad() loss.backward() torch.nn.utils.clip_grad_norm_(student_model.parameters(), max_norm0.5) # 梯度裁剪 optimizer.step() total_policy_loss policy_loss.item() total_kl_loss kl_loss.item() if (epoch 1) % 20 0: avg_pl total_policy_loss / len(dataloader) avg_kl total_kl_loss / len(dataloader) print(fEpoch {epoch1}: Policy Loss{avg_pl:.4f}, KL Loss{avg_kl:.4f}) print(學(xué)生策略訓(xùn)練完成。) return student_model print(開(kāi)始訓(xùn)練學(xué)生策略...) student_model train_student_policy(filtered_states, filtered_actions, filtered_advantages, teacher_model) torch.save(student_model.state_dict(), ./student_model_opd.pt)6.2 訓(xùn)練技巧與迭代優(yōu)化上面的訓(xùn)練循環(huán)是一個(gè)基礎(chǔ)版本。在實(shí)際操作中你可能需要加入以下技巧來(lái)提升效果優(yōu)勢(shì)歸一化在計(jì)算策略損失前對(duì)batch_advantages進(jìn)行歸一化減去均值除以標(biāo)準(zhǔn)差可以穩(wěn)定訓(xùn)練。batch_advantages (batch_advantages - batch_advantages.mean()) / (batch_advantages.std() 1e-8)自適應(yīng)KL系數(shù)固定KL系數(shù)可能難以調(diào)優(yōu)。可以設(shè)計(jì)一個(gè)自適應(yīng)機(jī)制例如當(dāng)KL散度超過(guò)目標(biāo)值時(shí)增大系數(shù)低于時(shí)減小系數(shù)。多次迭代與數(shù)據(jù)重估訓(xùn)練完一代學(xué)生策略后可以用它作為新的“教師”去收集數(shù)據(jù)或與舊數(shù)據(jù)混合然后用FQE重新評(píng)估新數(shù)據(jù)計(jì)算新的優(yōu)勢(shì)值再訓(xùn)練下一代學(xué)生。這個(gè)過(guò)程可以迭代數(shù)次讓策略不斷進(jìn)化。集成與平滑訓(xùn)練多個(gè)Q網(wǎng)絡(luò)進(jìn)行集成用其輸出的最小值或平均值作為更穩(wěn)健的優(yōu)勢(shì)估計(jì)可以減少離線評(píng)估的誤差。7. 效果評(píng)估與問(wèn)題排查訓(xùn)練完成后我們必須在獨(dú)立的環(huán)境中對(duì)學(xué)生策略進(jìn)行測(cè)試并與原始教師策略對(duì)比。7.1 性能對(duì)比測(cè)試編寫一個(gè)測(cè)試函數(shù)在環(huán)境中運(yùn)行策略若干回合統(tǒng)計(jì)成功率、平均回報(bào)等指標(biāo)。def evaluate_policy(env, model, num_episodes50, max_steps500, deterministicTrue): 評(píng)估策略性能 total_rewards [] success_count 0 model.eval() for ep in range(num_episodes): state, _ env.reset() episode_reward 0 done False steps 0 while not done and steps max_steps: with torch.no_grad(): state_tensor torch.FloatTensor(state).unsqueeze(0) mean, std model(state_tensor) if deterministic: action mean.numpy().flatten() # 測(cè)試時(shí)用確定性動(dòng)作 else: dist torch.distributions.Normal(mean, std) action dist.sample().numpy().flatten() next_state, reward, terminated, truncated, info env.step(action) done terminated or truncated episode_reward reward state next_state steps 1 # 假設(shè)環(huán)境在info中提供success標(biāo)志 if done and info.get(success, False): success_count 1 total_rewards.append(episode_reward) avg_reward np.mean(total_rewards) success_rate success_count / num_episodes * 100 print(f評(píng)估結(jié)果 ({num_episodes}回合):) print(f 平均回報(bào): {avg_reward:.2f}) print(f 成功率: {success_rate:.1f}%) return avg_reward, success_rate print(評(píng)估教師策略...) teacher_avg_reward, teacher_success evaluate_policy(env, teacher_model, num_episodes20) print(\n評(píng)估學(xué)生策略...) student_avg_reward, student_success evaluate_policy(env, student_model, num_episodes20)7.2 常見(jiàn)問(wèn)題與排查技巧在實(shí)際操作中你可能會(huì)遇到以下典型問(wèn)題問(wèn)題現(xiàn)象可能原因排查與解決思路學(xué)生策略性能毫無(wú)提升甚至下降1. 優(yōu)勢(shì)估計(jì)不準(zhǔn)FQE訓(xùn)練失敗。2. 數(shù)據(jù)過(guò)濾太激進(jìn)正樣本太少。3. KL約束太強(qiáng)學(xué)生無(wú)法偏離教師。1.檢查FQE繪制Q值預(yù)測(cè)與真實(shí)回報(bào)蒙特卡洛的散點(diǎn)圖看相關(guān)性。確保FQE訓(xùn)練充分損失收斂。2.調(diào)整過(guò)濾閾值嘗試保留優(yōu)勢(shì)值前70%的數(shù)據(jù)而不是僅大于0的數(shù)據(jù)?;蛘呤褂眉訖?quán)采樣。3.調(diào)整KL系數(shù)逐步減小kl_coef如從0.1到0.01給學(xué)生更多探索空間。訓(xùn)練不穩(wěn)定損失劇烈波動(dòng)1. 優(yōu)勢(shì)值方差過(guò)大。2. 梯度爆炸。3. 批量大小不合適。1.優(yōu)勢(shì)歸一化強(qiáng)制對(duì)每批數(shù)據(jù)的優(yōu)勢(shì)進(jìn)行歸一化。2.梯度裁剪已在上文代碼中加入檢查裁剪閾值max_norm。3.增大批量嘗試增大batch_size如256。學(xué)生策略很快收斂到單一模式失去多樣性1. 過(guò)濾后數(shù)據(jù)多樣性不足。2. 策略網(wǎng)絡(luò)表達(dá)能力不夠或探索不足。1.數(shù)據(jù)增強(qiáng)對(duì)過(guò)濾后的狀態(tài)進(jìn)行輕微擾動(dòng)如添加噪聲增加泛化性。2.探索鼓勵(lì)在損失函數(shù)中加入策略熵的獎(jiǎng)勵(lì)項(xiàng)-β * H(π_θ)鼓勵(lì)探索。離線評(píng)估的Q值普遍過(guò)于樂(lè)觀或悲觀1. 分布偏移問(wèn)題。FQE在教師數(shù)據(jù)分布上訓(xùn)練但學(xué)生策略可能訪問(wèn)到不同的狀態(tài)。1.保守Q學(xué)習(xí)在FQE目標(biāo)中引入懲罰項(xiàng)對(duì)OOD分布外動(dòng)作給予較低Q值。2.迭代更新采用迭代式OPD用學(xué)生策略收集新數(shù)據(jù)混合訓(xùn)練讓Q網(wǎng)絡(luò)適應(yīng)新分布。計(jì)算資源消耗大訓(xùn)練慢1. FQE需要訓(xùn)練額外的Q網(wǎng)絡(luò)。2. 計(jì)算優(yōu)勢(shì)時(shí)需多次采樣。1.簡(jiǎn)化網(wǎng)絡(luò)使用更小的Q網(wǎng)絡(luò)。2.減少采樣數(shù)計(jì)算V(s)時(shí)采樣數(shù)num_samples可減至5。3.批次計(jì)算對(duì)整批狀態(tài)一次性采樣多個(gè)動(dòng)作利用GPU并行計(jì)算。一個(gè)關(guān)鍵的實(shí)操心得OPD的成功非常依賴于離線評(píng)估的質(zhì)量。在正式訓(xùn)練學(xué)生策略前務(wù)必花時(shí)間驗(yàn)證你的FQE Q網(wǎng)絡(luò)是可靠的。一個(gè)簡(jiǎn)單的檢查方法是從經(jīng)驗(yàn)緩沖區(qū)中隨機(jī)選取一些完整的軌跡用訓(xùn)練好的Q網(wǎng)絡(luò)估算軌跡起點(diǎn)狀態(tài)的Q值并與該軌跡的實(shí)際折扣回報(bào)Monte Carlo Return進(jìn)行比較。如果兩者趨勢(shì)一致不一定完全相等說(shuō)明Q網(wǎng)絡(luò)學(xué)習(xí)到了合理的價(jià)值函數(shù)。如果相差甚遠(yuǎn)你需要回頭檢查FQE的訓(xùn)練過(guò)程學(xué)習(xí)率、網(wǎng)絡(luò)結(jié)構(gòu)、目標(biāo)網(wǎng)絡(luò)更新頻率等。8. 進(jìn)階思考與擴(kuò)展方向當(dāng)你跑通了基礎(chǔ)的OPD流程后可以思考以下幾個(gè)方向來(lái)進(jìn)一步提升性能或適應(yīng)更復(fù)雜的場(chǎng)景混合策略教師教師不一定是一個(gè)單一策略。你可以收集來(lái)自多個(gè)不同策略甚至包括一些隨機(jī)策略的數(shù)據(jù)混合成一個(gè)大的經(jīng)驗(yàn)池。OPD的優(yōu)勢(shì)計(jì)算機(jī)制會(huì)自動(dòng)從中挑出“好”的行為學(xué)生可以博采眾長(zhǎng)。結(jié)合在線微調(diào)OPD可以作為一個(gè)強(qiáng)大的預(yù)訓(xùn)練或初始化方法。先用OPD從歷史數(shù)據(jù)中學(xué)到一個(gè)不錯(cuò)的策略然后再放到真實(shí)環(huán)境中進(jìn)行在線強(qiáng)化學(xué)習(xí)如PPO微調(diào)這樣可以大大減少在線交互的樣本消耗并提升訓(xùn)練安全性。處理高維視覺(jué)輸入如果狀態(tài)是圖像上述流程中的Q網(wǎng)絡(luò)和策略網(wǎng)絡(luò)都需要引入CNN編碼器。需要確保圖像編碼器在離線評(píng)估和策略訓(xùn)練中共享或分別訓(xùn)練得當(dāng)避免表征不一致。應(yīng)用于多任務(wù)學(xué)習(xí)OPD的思想可以擴(kuò)展到多任務(wù)。收集不同任務(wù)上的教師數(shù)據(jù)為每個(gè)任務(wù)分別計(jì)算優(yōu)勢(shì)。學(xué)生策略網(wǎng)絡(luò)可以共享主干但通過(guò)任務(wù)標(biāo)識(shí)來(lái)區(qū)分學(xué)習(xí)在不同任務(wù)下選擇高優(yōu)勢(shì)的動(dòng)作。讓AI從“后悔”中學(xué)習(xí)本質(zhì)上是將人類反思和歸納的能力賦予了算法。OPD教師模型訓(xùn)練提供了一條切實(shí)可行的路徑讓我們能夠利用那些不完美、但富含信息的數(shù)據(jù)培育出更“聰明”的智能體。這個(gè)過(guò)程里最耗時(shí)的往往不是寫代碼而是調(diào)參、診斷和迭代。耐心地分析優(yōu)勢(shì)值的分布、檢查Q網(wǎng)絡(luò)的預(yù)測(cè)質(zhì)量、觀察學(xué)生策略的行為變化這些細(xì)致的工作才是最終成功的關(guān)鍵。我自己的體會(huì)是當(dāng)看到學(xué)生策略第一次做出一個(gè)教師從未展示過(guò)的、更優(yōu)雅的解決方案時(shí)那種感覺(jué)就像看到學(xué)生真正理解了問(wèn)題的本質(zhì)而不是機(jī)械地模仿這大概就是強(qiáng)化學(xué)習(xí)讓人著迷的地方吧。
返回列表
PREV
查看更多資訊
NEXT
返回資訊列表
久久久97| 伊人大香久久| 91久久| 国产色色色色| 婷婷六月综合| 超碰成人免费| 99热6这里之有精品| 亚洲色婷婷| 五月天国产成人| 91综合在线| 亚洲AV激情五月综合网| 苗黎美女四级成人版一级二级毛片| 开心五激情网| 日本理论久久| 日日天天干| 六月婷婷深深爱| 天天干天天做| 欧美VA在线| 开心五月婷婷综合在线精品素人| 久久婷五月婷| 色高清无码视频| 丁香五月狠狠在线观看| 色哟哟www| 国产激情久久久| 天天搞夜夜六| 玖玖综合玖玖| 国自产拍偷拍精品啪啪一区二区| 色99在线观看| 婷婷五月蜜桃成人桃色丁香| 人妻视频一区而且二区| 激情综合区| 婷婷九月色| 激情五月天色播| 另类图片婷婷五月天| 久久五月天激情婷婷| 狠狠色噜噜狠狠狠狠综合| 丁香婷婷久久 | 久久精彩综合视频| 97人人干视频| 亚洲色婷婷| 国熟女视频| 婷婷WWW久久| 日本婷婷在线| www.操逼comm| 丁香婷婷黄网站| 激情第四色| 色色色色色色色色综合网| 亚洲旡码| 激情综合五月丁香六月婷婷| 思思热在线视频99| 96精品久久久久久久久| 国产婷婷婷| 欧美色婷婷| 丁香五月情色| 五月丁香网站| yw国产AV| 超碰狠狠操| 婷婷五月天成人网站| 99色精品| 色天使久久综合| 九九大香视频| 天天插天天操| 草AV9999| 激情网第九色| 天天插天天射天天干| 九九久久精品| 九九九色综合| 色婷婷五月在线| 婷婷丁香69精华| 色色草97| 黄色录像网点| 丁香五月婷婷五月| 激情综合色| 五月色网| 天天模,夜夜模夜夜爽| 色蜜婷婷| 午夜在线成人网站免费观看| 天天色情站| 色婷婷国产精品综合在线观看| 【乱子伦】黄色| 九草性爱| 91窝窝| 久久婷综合| 超碰1999| 五月天婷婷青青草| 热久久66| 五月激情综合婷婷| 噜噜噜噜婷婷五月天| 久草嫩草在线观看| 在线综合亚洲欧美65| 99精色| 亚洲无码成人| 97碰碰视频| 国产av一区二区三区| 色婷婷AAA| 天天草天天日| 亚洲婷婷五月天激情综合| 五月婷婷xxx| 激情丁香久久久久久| 色色色色丁香| 亚州在线中文字幕| 97超碰婷婷五月天| 成人午夜天| 五月丁香五月婷婷| 五月婷婷六月色| 色婷婷综合久久久久| 十月色综合| 米奇影视资源婷婷狠狠色激情欧美五月丁香 | www.狠狠狠狠| 五月婷婷综合色啪| 五月色丁香成人| 九九色院| 亚洲成人网站在线| 亚洲AV免费国产电影| 七月婷婷色香综合网| 狠狠色综合网站久久久久| 国产亚洲精品久久一区二区三区| 99综合色| 无码操B| 四色AVwww| 亚洲性爱日韩无码| 3www激情| 五月丁香无码| 五月丁香六月婷婷综合网站| 国产欧美va| 十月丁香九月婷婷综合| 婷婷社区五月天| 99热这里只要精品免费| 九九精品视频在线观看| 色五月91| 天天爽在线视频| 五月丁香六月婷婷啪啪| 天天五月丁香五月| 2020久久婷婷五月| 五月丁香激情在线| A久久| 五月激情久久综合网| 丁香五月综合在线视频| 在线视频激情网站| 99热自拍| 六月丁香啪啪| 99操网站| 色噜噜五月天| 久久这里只有精彩| 五月天色综合服务平台| 日本五月天一页| 婷婷五月激情视频在线| 色色五月丁香| 亚洲精品V天堂中文字幕| 99色热| 中文字幕欧美日韩VA免费视频| 亚洲综合激情五月久久| 就爱日五月天| 亚洲、欧美、国产另类笫二区| 久久性刺激| 久久久性爱视频| 色欲丁香| 久久香蕉婷婷五月天| 激情五月天婷婷视频| 狠狠色激情综合| 五月婷婷色吧!| 海外网站专业操老外| 伊人综合婷婷| 9l视频自拍9l九色成人| 五月婷婷色播网| 99国产性感视频| 第四色婷婷丁香五月| 五月丁香六月婷婷色情| 99色在线视频| 婷婷欠久少妇| 色色色色色五月丁香| 久久激情五月天| 99欧美| 色婷婷内射| 99在线看片| 在线1青婷| 性生活视频98791| 欧美精品999| www.金莲av| 五月天丁香综合在线| 大香蕉婷婷丁香视频在线| 激情深爱综合| 九九这里有精品| 亚洲精品99| 女人高潮内射99精品| 五月婷婷爽爽爽| 六月婷婷最新网址| 欧美综合激情五月丁香| 思思热国产视频| 激情五月婷婷综合视频| 丁香五月中文字幕| 丁香五月狠狠在线观看| 激情图片亚洲| 六月丁香五月天| 岛国av网站| 91色综合久久| 日韩人妻无码一区二区| 99热1| 极品少妇XXXX精品少妇偷拍| 性高潮久久久久久-九九九九九九九九九九热-成人AV | 99热视精品| 97色天堂| 色五月婷婷在线观看第一页舔| 久久99精品久久久久久青青AR| 日本99视频| 激情五月丁香综合网站| 性爱久久| 色婷婷狠狠18禁| 婷婷五月天亚洲图片| 亚洲不卡| 婷婷久久天堂网| 蜜臀丁香黄色婷婷五月天| 激情狠狠丁香月| 任你爽精品免费视频6| 天天射色五月天| 99热这里只有精品3| 色噜婷婷| 六月丁香激情综合| 538在线精品| 色婷婷色| 五月综合色播播丁香婷婷| 日本色色色| 久久38视频| 亚洲激情综合色站| 婷婷色丁香五月| 99re资源在线视频导航| 在线VA视频| 99操免费视频| 激情丁香久久| 播四月婷婷六月丁香| 激情综合五月天| 97在线碰| 大香蕉婷婷五月| 玖玖伊人网| www色婷婷久久综合久色 | 五月激情综合网| 丁香色五月婷婷| 97色色色色色色色| 五月激情视频| 色九月婷婷丁香| 91婷婷伊人牛牛| 久久婷婷婷婷伊人| 国产人妻777人伦精品HD| 激情久久久久久| jizzdr| 三级黄色大片视频| 五月婷婷之六月丁香| 色噜噜狠狠一区二区三区| 东京热免费视频网站| 丁香五月综合在线播放 | 九九热99精品| 久久久久这里只有精品| 婷婷五月天你懂的| 婷婷综合视频| 久久人人九| 99久久玖玖| 五月天另类小说久久小说网| 亚州AV超碰人人操| 亚洲99一级无嗎特制在线| 26uuuavcom| 亚洲精品色| 日木狠狠干| 久久视频婷婷视频| 超碰在线91| 另类专区在线观看| 色情五月丁香| 婷色五月天| 久久综合九九| 做爰丰满少妇1313| 天天 青草 丝袜制服 在线| 成人做爰A片免费看视频| 天天日天天舔天天摸| 99久在线观看| 四月婷婷五月色综合| 大香蕉AV在线| 梁铮版蜘蛛女在线观看| 99无码视频| 五月天激情小说婷婷| 五月婷婷中文| www.色窝| 亚洲国产黄色电影| 色色狼人综合| 婷婷六月丁香激情| 成人国产欧美大片一区| 欧美精品熟女一区二区| 人人操 色| 超碰人人91| 色婷婷操逼| 婷婷导航| 色婷综合| 一起草Av| 亚洲五月六丁香激情| 777米奇影视第四色| www.日韩艹| 大香蕉福利导航| 99亚州综合精品成人网| 中文字幕AV在线| 色噜噜狠狠色综无码久久合欧美| 婷婷狠狠五月综合| 丁香五月性爱爱五月| 日日夜夜干| 99ri在线视频| 夫妇交换刺激做爰| 激情五月久久| 婷婷亚洲五| 嫩草AV久久伊人妇女超级A| 五月六月激情| 丁香色五月 97干| 超碰人人在线| 丁香五月天在线| 91精产品自偷自偷综合| 丁香五月激情五月| 夜夜爽天天爽| 色五月久久成人婷婷| 97色 五月天丁香| 色五月播五月| 久久久久久草黄色片AV在线观看| 亚洲天堂有码| 99热最新| 五月婷婷婷丁香播| 色五月激情五月丁香五月婷婷啪啪综合 | 人人草人人视| 久九男女天堂| 婷婷色色丁香五月天| 天天日天天添| 超爽内射| 国产乱妇无乱码大黄AA片| 男人的天堂五月丁香| 9久热在线视频精品| 99成人| 欧美va在线| 日本精品99| 老美AA片| 九九99在线免费在线观看视频| 深爱婷婷色| 91操在线观看| 五月丁香本色在线观看| 亚洲天天操| 噜噜色com| 丁香五月天堂网| 91色性感五月婷婷丁香| 色综合伊人网| 久久婷婷丁香| 午夜五月天| 天天噜天天插| www.久久99热地址发布| 精品视频二级九九| 五月婷婷色色| 日本久久综合| 激情欧美婷婷| 免费人人操| 久久精品99国产精品日本| 天天插天天爽| 五月激情五月婷婷五月天在线| 超碰人人操在线| 超碰国产一区| 欧美成人AAA片一区国产精品| 丁香五月天电影| 亚洲丁香五月深爱五月| www,8050,午夜三级| 六月丁香啪| 国产精自产拍久久久久久蜜 | 婷婷深爱五月天| 五月丁香淫淫婷婷婷| 欧美日本VA| 亚洲成Av人片乱码色第1集| 免费看欧美成人A片无码| 欧美综合123区| 色五月亚洲开心网| 综合狠狠五月婷婷| 99er这里只有精品| 99热最新| 91ncm视频| 丁香九色不卡aaa| 欧美性生交XXXXX无码小说| 任你爽视频| 99这里只有精品视频| 玖操97| 婷丁五月| 这里只有精品偷拍| 国产 码在线成人网站| www激情网站| 玖玖婷婷免费| 99热在线极品极品| 九九爱激情| 99这里有精品| 中国女人做爰A片| 亚洲色99| 可以免费观看的AV| 亚洲天堂99| 天天干天天操天天拍| 婷婷五月天网址| 中文AV网站| 五月开心深爱激情网| 亭亭五月激情亚洲在线| 日本熟女一区二区| 国产精品成人av在线观看春天| www..com色爱| 色婷婷在线视频久| 久草五月天电影网| 五月天成人手机在线视频| 五月天激情综合网站| 无码色色色色色| 超碰在线看| 9久热| 五月天综合在线| 开心婷婷五月| 被强行糟蹋的女人A片| 99亚洲视频| 99爱在线精品视频免费观看| 人妻22p| 99热精品在线| 色婷婷伊人激情在线观看| 久久精品无码一区| 丁香五月婷婷久久久| 五月天丁香花婷婷| 欧美大道不卡| www.超碰在线| 亚洲欧洲色色| 五月婷婷婷自由综合| 五月丁香激情在线| 六月丁香婷婷综合在线| 996热re视频精品视频| 久久婷婷成人| 婷婷五月天社区| 国产伦亲子伦亲子视频观看| 影音先锋男人AV资源站| 啪精品| 久大香蕉| 成人天天爽| 天天草天天舔| 丁香五月乱中文字幕| 天天天天天日| 99人妻碰碰碰久久久久视| www.99热在线观看| 六月婷婷综合| 91人人妻人人操人人爽| 亚洲成人网站在线| 91蜜桃婷婷狠狠久久综合9色| 九九国产视频| 色色婷婷综合网| 狠狠插狠狠| 婷婷久久丁香| 狠狠色丁香| 五月网在线| 六月婷婷中文字幕| 五月丁香黄色视频| 久99婷婷色综合| 亚洲色五月婷婷| 97碰碰人人| 五月六月丁香婷婷在线观看| 成年人看Va免费视频| 天天色噜| 性爱久久| 狠狠久久婷五月综合色| 五月天丁香网站| 天天综合色丁香| 天天射色五月天| 色欲久久久久久综合网综合网| 久久久性爱视频| 激情五月综合网丁| 日本人人干| 久久五月视频| 停停五月丁香| 99久久久久| 九月性爱网| 91天天操天天干天天射| 99热精这里只有精品| 噜噜狠狠色综无码久久合欧美| 五月停亭六月,六月停亭的英语| 青草视频在线观看视频| 激情婷婷五月| 天天谢天天操| 超碰碰碰碰| 久草五月婷| 亚洲婷婷月丁香五月| 日日干天天| 婷婷五月天小说| 久久丁香婷婷五月| 五月婷婷之六月丁香| 激情综合99| W色综合| AV操逼网| 思思热精品在线视频| 另类视频在线| 丁香婷婷基地| 99视频| 五月婷婷激情| 色五月91| 色五月婷婷综合在线| 极品精品一区二区三区在线| 欧美五月丁香在线| 九九自拍网| 99久久99综合| 26uuu国自产精品| 91日视频| 天天艹| 亚洲性爱99在线| 狠狠做深爱婷婷久久综合一区| 五月婷婷激情啪啪| 欧美丁香六月在线观看视频| 色五月丁香网| 99色热视频| 丁香五月婷婷色情综合| 五月丁香婷婷欧美色图视频五月丁香777电影 | 99热99精品| 婷婷综合在线网| 爱草视频在线观看| 久久久久er热| 91精品无码| 欧美性爱五月天| 丰滿爆乳一区二区三区| 六月丁香婷婷开心综合基地| 激情五月综合网| 色综合色综合网| 婷婷五月天Av| 亚州操逼网| 日本五月婷婷| 97操在线资源| 玖玖热视频| 超级碰碰99| 国产高清精品色| 超pen个人视频97| 人五月天婷婷喷水| 婷婷久久五月天亚洲欧美国产日韩在线观看 | 九九AV在线| 天天摸色吧天天摸色吧| 六月丁香婷婷爱| 婷婷五月天影视| 亚洲综合五月天| 色色综合网站| 九九视频这里只有精品| 在线视频你懂得| 综合久久久| 99精品在线观看视频| 人人草人人舔| 亚州操操| 色五月首页| 99人人干| 五月丁香六月激情| 一本久久亚洲五月婷婷| 伊人久久婷婷五月综合97色| 色播婷婷五月天| 久久精彩视频18| 开心五月深爱激情| 《丁香激情综合久久伊人久久》影视在线观看 -高清预告手机免费播放 -三妹影院 | 五月婷婷色| 久久98| 天天操综合网| 色五月婷婷五月久久| 亚洲亚洲人成综合网络| 日韩精品无码99| 97碰久久| 国产亚洲在线观看| 国产精产国品一二三在观看| 天天综合永久| av在线观看网址| 婷婷色片| 综合色播| 99国产在线精品视频| 久色国产| 亚洲成人在线综合| 激情网五月| 国产寻花在线| AV在线二十六页| 99激情| 91viP在线看| 爱射综合| 五月丁香婷婷激情澎湃四射 | 亚洲中文字幕网| 五月丁香婷婷爱激情综合网| 免费看欧美成人A片无码| 狠狠干 狠狠操| 第1影院之五月婷婷| 天堂色婷婷| 亚洲色精彩| 丁香,开心成人,久久| 激情www| 99久久精品色老| 99色综合| 色五月综合激情| 六月婷久久| 婷婷在线视频| 99精品热| 婷婷国产综合| 欧美久久久久久久久中文字幕| 日本婷久久| 色五月激情问网站| 色五月婷婷天堂| 深爱激情五月婷婷| 亚洲色vA| 亚洲激情网| 90色免费视频| 五月天色丁香| 亚洲99热| 五月婷婷五月丁香综合| 99色天堂| www.五月天。com| 五月婷婷综合影院| 色噜噜狠狠色综无码久久合欧美| 五月天天爱| 99色综合网| 夜色.cnm| 国产亚洲精品久久久久久豆腐| 色亚洲激情| 丁香五月婷婷六月婷婷| 2022久久婷婷| 激情五月婷婷综合| 婷婷五月色激情欧美激情| 六月丁香成人| 婷婷成人AV| 一本色道久久88加勒比| 亚洲操逼网| 这里只有精品免费观看网占| 五月天婷亚洲天综合网综合| 亚洲综合一区二区| 99免费超碰在线| 99九色视频在线观看| 九九热短视频在线观看| 六月婷婷天天操夜夜爽视频| 综合久久久婷| 久久婷婷免费| 人人操AV| 色五月婷婷影院| 婷婷情爱五月天6| 天天干-天天日| 永久无码色| 在线99精品| 大香蕉久久视频久久视频| 色色色色色色色色网站| 影音先锋91资源站| 婷婷五月花西瓜| 丁香5月综合啪啪| 婷婷五月天激情网| 97久人人| 中文字幕五月久久婷婷| 操精品9| 九月色婷婷| www.久久久久| 免费啪啪亚州视频| 激情五月天偷拍综合网| 天天做天天爱天天做| 五月天开心色情网| www色婷婷久久综合久色| 激情黄色小说色五月| 欧美操综合| 婷婷狠狠青青| 91无码一起草| 久99999热视频在线观看免费| 99网| 99精品亚洲| 国产免费AV在线| 婷婷成人五月天成人文学| 六月狠狠综合| 五月婷六月丁香| 国产六月婷婷| 激情网 五月天| 色五月丁香总合网| 色五月综合婷婷久久综合婷婷久久综合婷婷久久综合婷婷久久 | 五月开心网| 丰满人妻一区二区三区| 狠狠操狠狠操| 深爱激情六月天| 99亚洲天堂| 五月婷婷色色色| 天天色丁香| 人人综合久| 啪啪婷婷五月天激情| 日本天堂免费99| 天天综合色丁香| 这里只有精品视频在线| 色色日本欧美| 天天搡日日搡aaaaⅩ| 在线另类视频| 99热这里只有精品16| 任你艹| 久热这里只有| 开心五月天激情网| 99年操人人爽| 天天干,夜夜爽| 五月丁香六月玩女人| 久久这里只精品| 夜夜撸日日操| 婷婷涩五月| 4399成人黄A片| www.五月天婷婷| 91精品丝袜久久久久久| 午夜天堂一区人妻| 精品热九九| 免费观看日韩成人av| 综合亚洲AV| 久久久五月五丁香| 国产亚洲色婷婷久久99精品91| 开心五月六月婷婷| 激情综合五月色在线| 婷婷六月色情| 国产密乳av一区二区三区四区| 99热免费| 色婷婷亚洲婷婷| 国产乱人偷精品人妻A片| 99热最新国内| 99九九热视频| 狠狠色丁香五月婷巨| 深爱激情四射| 色色色色av色色色色| 蜜臀av粉嫩av懂色av| 美女五月天| 中文字幕丰满孑伦无码专区| 色综啪啪| 婷婷综合色| 久久在这里有精品| 在线1青婷| 在线观看的av| 五月天电影网| 玖玖五月丁香| 樱花99视频| 五月婷婷丁香综合| 91超碰在线观看| 中文字幕无码人妻少妇免费视频| 九九Y精品热播| 超碰在线免费| 狠狠色激情综合| www.色五月| 九九亚洲视频| 色色五月综合| 色六月天天激情综合网| 五月婷婷六月少妇激情| 久久97| 丁香五月天堂婷婷| 亚洲天堂爱爱| 狠狠五月天婷婷激情网。| 精品久热69| 99re6在线视频精品免费| 99re视频在线| 99re思思在线视频| 99re6久热只有精品6在线直播| 五月丁香色婷婷| 五月丁香A片| 99热99成人| 无码任你操| 九九色综合| 91九色超碰正在播放| 久久综合网免费视频| 热久精品| 久久久久久久久久久久久9| 97干综合网| 五月丁香六月婷婷a v| 中文字幕精品在线观看| 爱99干99| 午夜婷婷| 99这里只有精品|v| 欧美三级A做爰在线观看| 久久一级片| 日韩一区二区三区无码| 超碰人人操| 成人片黄网站色大片免费毛片| 久99在线视频| 俺也去在线视频 | 无码免费人妻A片AAA毛片西瓜| 97热九九| 久久久精品色色色| 五月天激情网图片| 国产成人av在线播放| 五月天五月天激情网| 婷婷五月在线视频| 97香蕉碰碰人妻国产欧美| 婷婷五月天激情网站| 这里只有精品久久| 久久综合性| 婷婷五月综合网| 狠狠干最新地址| 天天开心婷婷丁香五月| 五月天激情啪啪| 婷婷中文综合网| 欧美婷婷五月无砖| 六月婷婷色| 丁香六月激情四射| 五月天亚洲综合网| 99婷婷综合| 五月天性色| 午夜大香蕉| 五月丁香综合激情| 九九re精品视频在线观看 | av在线免费网站 | 久久99这里只有精品视频| 激情婷婷丁香| 丁香六月综合激情| 熟女激情网| 婷婷久久影院| 五月天婷婷无码| 婷婷中文综合网| 日日鲁鲁夜夜爽爽| 99热免费| 99久久国产成人精品| 99热免| 91人人网| 最新久久网址| 久久色五月| 欧美成人日韩| 亚洲婷婷五月| 五月综合久久| 99狠狠操一| 这里只有精品久久| 热久69| 久久五月丁香| 99热碰碰| 99久在线精品99re5热视频| 综合激情sV| 丁香五月天电影| 99久热精品在线| 丁香五月手机在线| 亚洲午夜一区二区| 丁香五月AV| 日本婷婷在线| 玖玖综合网| 久99久视频| 99热免| 狠狠色噜噜狠狠色噜噜噜999| 久久久精品人妻| 激情小说五月丁香在线视频观看视频| 丁香五月天综合| 久婷婷五月激情| 少妇熟女视频一区二区三区| 五月婷婷和六月| www,999日本色| 九九精品在线网| 久久久色情| 天天弄天天操| 伊人五月婷婷| 精品久久99码| 婷婷五月免费观看| 婷婷丁香日韩五月| 国产午夜一区二区三区| 国产午夜精品一区二区| 无码激情| 操笔无码| 丁香五月大香蕉在线99| 99精吕视频在线观看了| 日韩免费99| 伊人久久大香网| 99热免费精品热久久66| 国产真实乱对白精彩| 99热99re6国产在线播放| 先锋男人91资源| 人妻激情综合| 深情六月婷婷综合久久| 欧州婷婷五月天综合| 色导航色婷婷五月天在线观看| 日熟女| 99久在线精品99re8热| 日本www五月婷婷| 国av网| 97色色综合| 狠狠搞五月天| av大片在线| 五月天婷婷成人| 亚洲AV网站| 成人国产欧美大片一区| 99热免费看| 亚洲成人在线免费| 噜噜狠狠| 色区域网站视频| 国产色视频网站2| 色婷婷成人| 综合狠狠干| 日本三级片片| 久久婷婷五月天| 思思热热久久| 99碰网站| 成人无码精品1区2区3区免费看 | 伊人www22综合色| 色七色九九| 五月婷婷 自拍| 激情色色| 五月天色网站| 91偷拍视频| 艹B高清无码| 激情综合国产| 久久精品小视频| 四月婷婷五月丁香| 色婷婷基地 | 最新va在线播放| 亚洲日韩人妻操逼| 丁香六月婷婷色播| 高清无码网址| 色日本综合| 五月丁香六月婷婷不卡免费无码| 久久影视婷婷五月| 久久性爱视频| 久久人妻视频| 26UUU在线观看| 97人人操人人| 91午夜婷婷狠狠久久综合9色| 色色免费网站| 九九色视频| 激情婷婷丁香五月天小说| 色都都狠狠色都都色综合色| 人人摸人人| 婷婷六月天激情| 夜夜www| 91精品国产99久久久久久天美| 婷婷情色开心五月天99| 久久久久久激情| 天天摸天天日天天舔| 99精品激情| 人人干人人操外国| 国产真实乱了老女人视频| 色玖玖综合网| 亚洲色婷婷视频| 开心婷婷五月激情网小说| 爆乳熟女-区二区三区| 狠狠搞狠狠操| 丁香五月社区| 99亚洲色| 91精品电影18T| 一本久道综合99| 97超级碰碰碰久久久| 精品人妻伦一二三区久久| 色丁香五月| 99国产这里只有精品| 亚洲视频丁香网va| 午夜免费试看| 1999天天操夜夜操| 五月婷婷综合在线视频| 国产精品18久久久| 精品久久久人妻| 殴美日韩成人| 九九在线这里只有精品视频 | 人人妻人人澡| 夜夜夜夜撸夜夜操| 婷婷五月开心中文字幕在线| 六月丁香婷婷视频综合在线观看| 99视频在线观看网址| 人人操超碰| 一本大道伊人AV久久综合| 久久这里只有精品热在99| 日本九九视频| xx人人xx| 五月丁香操亭亭网| 五月丁香六月婷婷a v| 色99亚洲| 欧日美女Va| 91超级碰| 97碰免费视频在线| 91热视频色网站| 激情五月婷婷啪啪| 亚洲成人av在线观看| 亚洲无码 图片区| 色五月激情五月| 搡BBBB搡BBB搡18| 开心激情站| 五月天com| 国产性爱亚洲是图| 五月丁香婷婷色| 啊V视频在线观看| 色婷婷888| 九九干视频| 国产无人区大片| 激情五月丁香六月综合AVXXXX| 狠狠草在线观看| 五月色综合网| 综合图片色色| 热久精品| 99久久玖玖| 色你久久| 丁香五月首页| 五月色色色| 99操逼| 日韩视频99| 久久这里只精品| 五月婷婷激情综合| 99热婷婷| 亚洲亚洲人成综合网络| 五月网站| 七月丁香五月婷婷在线| 婷婷碰碰| 天花AV无码| 99热碰碰| 综合久久影院| www.天天色综合| 综合婷婷六月| 六月五月久久丁香| 亚洲狠狠操| 久久五月天激情| 开心激情婷婷| 玖玖爱伊人| 思思热视频在线| 99热免费| 亚洲综合色成丁香五月色| 色婷婷精| 丁香久月婷| 丁香六月婷婷开心| 五月天激情小说婷婷| 夜夜www| 俺去啦综合网| 日欧大屏操| 97人人看| 狠狠色婷婷777| 久久综合久色欧美综合狠狠| 五月婷婷av在线| 六月综合婷婷开心伊人| 九九re精品视频在线观看| 综合激情伊人影视在线| 婷婷六月丁香色| 这里只有精彩视| 五月天婷综合| 日本婷婷| 色色欧美。| 超碰中文字幕在线| 婷婷色丁香五月| 婷婷五月激情基地| 婷婷五月天在线观看免费| 九九干视频| 9l视频自拍9l九色成人| 激情性爱五月天网页| 成人啪啪色婷婷久| 欧美色图45678| 99热这里只有精品13| 深爱激情丁香| WWW.婷婷| 99热10在线高清播放| 九月婷婷综合网| 婷婷激情伍月网| 操熟女成人网| 99干视频| 内射在线CHINESE| 六月色婷婷综合影视| 99热国产| 婷婷五月天亚洲综合网| 久久久无码精品成人A片小说| 色五月丁香婷婷| 丁香五月天大香蕉啪啪| 亚洲视频操| 五月天亚洲最大成人| 26uuu精品一区二区| 久久丁香五月天| 婷婷五月丁香成人网| 玖玖综合色| 在线A色| 99久久久久久| 老美AA片| 日韩成人电影在线播放| 婷婷永久在线| www.99日本| 少妇搡BBBB搡BBB搡毛茸茸| 超碰97久久| 欧美激情五月天在线观看| 涩综合婷婷| 公的粗大挺进了我的密道| 色综合色婷色基地| 婷婷五月激情基地| 狠狠色丁香婷婷久久综合| 久久er99热精品一区二区| 日韩综合久| 人妻videos人妻高清| 丁香 久久| 色五月婷婷777| 婷婷丁香五月麻豆| 99热这里只有的精品视 | 超碰免费人人| 五月丁香啪啪综合| 开心五月天激情网| 超碰国产av| 激情综合亚洲色婷婷五月| 日夜操B| 九九色情网五月天| 精品国产人人爱人人| 激情五月婷黄版| 婷婷六月丁香五月图区| 丁香婷婷人妻| 这里只有精品视频在线| 99精品视频免费观看近期发布| 欧美久久婷婷| 99久在线精品99re8热| 大地资源色婷婷视频在线| 成人欧美日韩| 五月天综合在线观看| 九九热在线视频| 亚洲av成人在线| 九九热只有精品| 99热在线观看| 久久中文人妻系列| 9久热在线视频精品| 亚洲天堂制| 美女主播野战视步页| 99热在线播放| 欧美在线97| 少妇达人正片在线播放_ikun_福利吧| 色婷婷基地 | 久久婷婷青草五月天| 夜夜大香蕉婷婷丁香| 好大好粗嗯啊-一级黄色大片免费观看-成人AV| 思思热久在线观看视频| 日韩欧美颜射| 日韩欧美一道四区中文字幕| 99热99热不卡| 国产午夜精品一区二区三区四区 | 思思热这里只有精品| 91激情五月开心| 五月丁香六月婷婷国产视频| 色青青电影色五月| 色播播之激情五月婷婷| 丁香色婷婷五月天| 国产成人综合在线| 五月丁香成年黄色| 久草网大香视频| 五月天影院| 射满了还射免费在线观看 -午夜版全集-新视觉影院 | 91人在线观看| 另类图片五月天婷婷| 五月天偷拍| 亚洲sesesese| 五月天丁香网| 久久精典| 亚洲第一成人无码A片| 爆乳熟女一区二区三区爆乳| 日韩五月丁香| 色婷狠狠| 思思re99视频在线观看| 91久久国产自产拍夜夜91久久精品文字>91麻豆精品国产 | 久草热视频在线观看| 伊人在线另类| 亚洲AV成人无码久久精品老人法拉利| 无码一区精品一区视频| 六月丁香深深爱| 亚洲无AV在线中文字幕| 激情六月五月婷婷综合网| 丁香五月偷拍| 在线五月色播| 国产毛片欧美毛片久久久| 五月综合婷婷开心网| 噼里啪啦在线观看免费完整版视频| 日日夜夜狠狠婷婷色| 五月亭亭开心网| 丁香六月婷婷开心| 99精品无码| 五月天婷婷激情小说| 超级碰碰97在线| 五月婷AV| www网站在线观看| 婷婷五月天开心网| 色婷婷影| √天堂资源在线人妻熟女| 91ncom.色| 99热国产免费| 婷婷综合五月天激情| 97亚洲视频在线| 色色综合视频| 人人干人人操外国| 综合伊人久久| 亭亭色色五月天| 综合色99| 清色五月天| 精品九九九久| 激情六月丁| 日本精品99网站| 99久久婷婷国产综合| 激情五月天开心网丁香无码| 播丁香五月婷婷欧美| 亚洲热久久| 色九亚洲| 久久九九免费视频| 丁香五月婷婷色综合基地| 操操综合网婷婷| 亚洲色网络| 成人网站免费在线播放| 久久国产色| 午夜精品777| 热久久婷婷| 婷婷伊人综合中文字幕| 亚洲色涩视频| 五月婷婷综合激情小说| 久久er九九| 色播五月网| 激情九月综合| 欧美激情综合色综合啪啪五月| 亚洲五月天伊人| 婷婷丁香婷婷97| 午夜成人网站在线观看| 噜噜色五月| 亚洲AV久久久久久久久久久久久久久久 | 庭庭久久内射| 丁香香五月激情免费视频| 丁香五月天大香蕉啪啪| 激情五月天色播| 五月天大香蕉| 日韩一级一片内射视频4K| 婷婷五月六月丁香| 欧亚洲在线高清视频| 色五月婷婷777| 五月婷婷五月天| 丁香六月婷婷综合色| 色色色色色九九九九九| 婷婷午夜激情| 97色伦另类图片小说视频| www:99热视频| 狠狠综合网| 丁香五月六月婷婷殴美综合| 婷婷精品在线| 激情98色婷婷五| 五月丁香操婷逼| 这里只有国产精品在线| 五月天天综合| 国产精品扒开腿做爽爽爽A片唱戏 青青草国产亚洲精品久久 | 五月婷婷在线综合| 丁香五月在线人妻| 色婷婷色丁香色欲av| 色婷婷久久| 亚洲最大五月六月丁香婷婷| 久久久www| 波多野结衣不卡AV| 99热都是精品| 可以免费看的av网站| 久久精品9| 狠狠一日| 国产成人网| 天天日日综合| 久久人妻久久久久| 色情五月| 亚洲无AV在线中文字幕| 婷婷午夜综合| 99精品爱| 综合激情婷婷| 五月婷婷丁香综合,亚洲天堂| 狠狠操综合| 天天干天天日天天操| 99色啊| 色婷婷综合综合网| 人人爽网| www.超碰| 五月丁香六月在线| 婷婷五月天激情综合婷婷五月天激情综合| 天堂网色色| 婷婷丁香综合网| 色爱五月天| 婷婷成人五月天成人文学| 色欲日日躁| 婷婷亚洲影院| ...婷婷五月综合不卡,国产在线手机| 五月天伊人| YJLZZJLZZ亚洲乱熟无码| 婷婷五月丁香综合人妻| 色婷丁香五月| 欧美色久| 无码一级片| 国产,欧美,学生妹,视频| 超碰免费在线| 欧美va在线观看| 丁香五月婷婷骚视屏| 婷婷欧美色| 九九色色网| 五月天激情图片网| 五月美女婷婷风骚| 婷婷五月天综合网| 日本系列_4页_777FP| 久久少妇视频| 99热日本| 色五月丁香五月激情五月激情| 97在线/亚洲| 日韩成人综合| 人人操9| 国产日产亚系列精品版优势| 激情五月丁香婷婷| 九九自拍网| 婷婷亚洲五月| av操一操|