色五月色开心色婷婷色丁香,五月婷婷丁香花综合网,婷婷丁香五月激情综合在线,五月婷婷六月丁香动漫,婷婷丁香五月激情综合在线,丁香花中文字幕在线观看,播五月色五月开心五月网,开心激情综合网,狠狠色丁香婷婷综合最新地址,丁香视频在线观看,狠狠做六月爱婷婷综合av,久久激情五月丁香伊人

ARTICLE DETAIL

資訊詳情

深耕商務(wù)建站與企業(yè)官網(wǎng)運(yùn)營(yíng)的一線實(shí)戰(zhàn)洞察。

PyTorch編譯優(yōu)化實(shí)戰(zhàn):torch.compile、Triton與XLA性能調(diào)優(yōu)指南

PyTorch編譯優(yōu)化實(shí)戰(zhàn):torch.compile、Triton與XLA性能調(diào)優(yōu)指南 1. 性能瓶頸到底在哪先從一份“看起來(lái)很忙”的Profiling說(shuō)起前陣子幫朋友排查一個(gè)訓(xùn)練任務(wù)A100上GPU利用率看著有八成Loss也在降但總感覺(jué)哪里不對(duì)勁。跑了一輪Profile之后發(fā)現(xiàn)實(shí)際計(jì)算核心Kernel的吞吐遠(yuǎn)沒(méi)有跑滿(mǎn)大量時(shí)間花在了小算子的啟動(dòng)和內(nèi)存拷貝上。這種“表面熱鬧、實(shí)際虛高”的利用率其實(shí)很多搞PyTorch訓(xùn)練的人都遇到過(guò)——模型代碼不是瓶頸PyTorch本身的執(zhí)行機(jī)制才是瓶頸。這也正是我當(dāng)時(shí)決定系統(tǒng)整理這套《AI系統(tǒng)性能工程學(xué)習(xí)筆記》的原因所在而第十四篇的內(nèi)容就是圍繞PyTorch的編譯優(yōu)化這條主線拆開(kāi)講講我在實(shí)際項(xiàng)目中反復(fù)驗(yàn)證過(guò)的三個(gè)關(guān)鍵方向。要理解torch.compile的價(jià)值首先要理解PyTorch默認(rèn)的“逐算子執(zhí)行”模式Eager Mode是怎么回事。簡(jiǎn)單來(lái)說(shuō)你用模型定義寫(xiě)出一層卷積、一層歸一化、一個(gè)ReLUEager模式下PyTorch就會(huì)按順序把每個(gè)算子逐個(gè)交給GPU執(zhí)行。每次執(zhí)行都涉及一次Python層的調(diào)用、一次GPU Kernel的Launch、一次數(shù)據(jù)的搬運(yùn)。小算子和短Kernel特別多的時(shí)候啟動(dòng)開(kāi)銷(xiāo)占比就會(huì)直線上升。哪怕每秒鐘能提交幾萬(wàn)個(gè)KernelGPU真正的計(jì)算單元卻經(jīng)常處于“等任務(wù)”的狀態(tài)。那為什么不把所有算子一次性做完因?yàn)樗阕又g存在數(shù)據(jù)依賴(lài)。卷積的輸出要喂給歸一化歸一化的輸出要喂給ReLU每一步都不能跳過(guò)??扇绻茉诒WC依賴(lài)關(guān)系不被打亂的前提下把多個(gè)連續(xù)算子融合成一個(gè)大的Kernel那啟動(dòng)開(kāi)銷(xiāo)就能被壓到很低內(nèi)存讀寫(xiě)也能少幾個(gè)來(lái)回。這個(gè)思路聽(tīng)著不難但落地起來(lái)步驟非?,嵥椤纫治鲇?jì)算圖又要生成高性能Kernel還要在不同硬件上做適配。PyTorch社區(qū)的答案是torch.compile它把這條鏈路做成了一行代碼就能用起來(lái)的方案。坦白說(shuō)torch.compile剛出來(lái)的時(shí)候我是持觀望態(tài)度的。畢竟PyTorch一直以靈活和動(dòng)態(tài)圖著稱(chēng)硬上編譯優(yōu)化很容易破壞調(diào)試體驗(yàn)。但實(shí)測(cè)了幾批CV和NLP模型之后我的態(tài)度發(fā)生了明顯轉(zhuǎn)變?cè)诓恍枰l繁改圖、動(dòng)態(tài)Shape不嚴(yán)重的訓(xùn)練場(chǎng)景下torch.compile帶來(lái)的提升相當(dāng)直觀尤其是在A100、H100這類(lèi)新架構(gòu)上收益常常能到20%到50%。更關(guān)鍵的是它解決的是“全局優(yōu)化”的問(wèn)題而不是零敲碎打地優(yōu)化某個(gè)算子。從這一篇開(kāi)始我會(huì)把torch.compile的機(jī)制、Triton在其中的作用、以及XLA作為另一條編譯器路線的取舍完整地串起來(lái)講。一個(gè)必須明確的點(diǎn)是torch.compile不是銀彈。它適合那些結(jié)構(gòu)穩(wěn)定、算子類(lèi)型清楚的模型如果模型里到處都是Python控制流、動(dòng)態(tài)Shape、自定義算子編譯優(yōu)化能覆蓋的區(qū)間就會(huì)被壓縮得很厲害。所以這篇文章不只是教你怎么用也會(huì)告訴你什么情況下“不要用它”以及在XLA和torch.compile之間到底該怎么選。2. 拆開(kāi)torch.compile的引擎蓋Dynamo、Graph Break 與 Inductortorch.compile能一行代碼接管優(yōu)化本質(zhì)上是因?yàn)樗鼉?nèi)部有一條流水線式的處理路徑。理解這條路徑比死記API參數(shù)有用得多。我會(huì)從自己調(diào)試過(guò)的實(shí)際案例出發(fā)把它的工作過(guò)程拆成三個(gè)階段講。2.1 Dynamo如何在Python的動(dòng)態(tài)世界里“抓到”計(jì)算圖PyTorch模型是用Python寫(xiě)的Python太靈活了一個(gè)if條件、一個(gè)for循環(huán)、一次字典索引都有可能在運(yùn)行時(shí)改變計(jì)算圖的結(jié)構(gòu)。真要等模型跑完再拿到完整靜態(tài)圖那延遲就太大了。torch.compile在0.x到1.x的迭代中逐步用Dynamo作為前端核心思路是在“保證動(dòng)態(tài)行為正確”的前提下捕獲盡可能大的計(jì)算子圖。Dynamo的做法是追蹤字節(jié)碼。它會(huì)攔截Python函數(shù)的執(zhí)行過(guò)程記錄哪些操作是Tensor計(jì)算哪些操作是純Python邏輯。對(duì)于Tensor計(jì)算Dynamo會(huì)把它轉(zhuǎn)換為計(jì)算圖節(jié)點(diǎn)對(duì)于Python邏輯如果無(wú)法翻譯成圖節(jié)點(diǎn)就標(biāo)志為“Graph Break”。Graph Break之后模型執(zhí)行會(huì)退回Eager模式等跑到下一個(gè)可編譯區(qū)域再重新進(jìn)入優(yōu)化路徑。Graph Break不是報(bào)錯(cuò)但它的多少直接決定了優(yōu)化效果。如果一個(gè)模型里有幾十個(gè)Graph Break那torch.compile幾乎等于沒(méi)優(yōu)化因?yàn)榇蟛糠謺r(shí)間都留在了解釋執(zhí)行狀態(tài)。我在實(shí)戰(zhàn)中遇到過(guò)一個(gè)比較典型的例子模型里對(duì)某個(gè)Tensor做了.item()操作然后根據(jù)這個(gè)標(biāo)量去決定是否執(zhí)行某個(gè)分支。這種寫(xiě)法在調(diào)試時(shí)很自然但Dynamo會(huì)在這里斷掉后面一大段分支都變成Eager路徑。解決辦法也很直接——把.item()移到模型外部或者在損失函數(shù)中避免使用同步操作。你可以在每次編譯后查看torch._dynamo.explain的輸出它能夠列出Graph Break的位置和原因這一招在排查性能問(wèn)題時(shí)極其有效。2.2 Inductor從計(jì)算圖到GPU Kernel的“翻譯官”Dynamo抓到計(jì)算子圖后接下來(lái)的工作就交給后端編譯器。PyTorch默認(rèn)的生成后端是Inductor。它的職責(zé)是把計(jì)算圖翻譯成高性能的GPU Kernel代碼——在NVIDIA GPU上Inductor會(huì)把算子融合和代碼生成的任務(wù)進(jìn)一步交給Triton去搞定。Inductor采用的是基于IR的重寫(xiě)方式。它會(huì)先讀入計(jì)算圖嘗試做元素級(jí)融合、Reduce融合、點(diǎn)乘融合等操作。比如說(shuō)對(duì)一個(gè)Tensor先做x 1再乘2再用tanh激活這三步在Eager模式下至少三四個(gè)Kernel但在Inductor里會(huì)被融合成一個(gè)Triton Kernel一次讀寫(xiě)就完成全部計(jì)算。GPU的內(nèi)存帶寬往往是最大約束少一次全量讀寫(xiě)收益就非常明顯。在torch.compile的配置中backend參數(shù)控制使用哪個(gè)編譯器后端。默認(rèn)是inductor但也可以切換為cudagraphs、tvm等。我實(shí)際用下來(lái)Inductor在NVIDIA卡上的兼容性和性能綜合表現(xiàn)最好。cudagraphs的思路是把一系列Kernel的啟動(dòng)信息錄制下來(lái)然后重復(fù)回放減少CPU端的啟動(dòng)開(kāi)銷(xiāo)但對(duì)算子融合無(wú)能為力。如果你的模型本身就是大算子為主瓶頸不明顯那cudagraphs可能就夠了如果模型是小算子密集型的老老實(shí)實(shí)用Inductor。還有一點(diǎn)容易踩坑torch.compile默認(rèn)會(huì)嘗試動(dòng)態(tài)Shape的支持但開(kāi)啟動(dòng)態(tài)Shape等于放棄了一部分融合優(yōu)化。如果你的輸入尺寸在訓(xùn)練中基本固定可以考慮用dynamicFalse或者把輸入Tensor的尺寸約束住讓Inductor生成更激進(jìn)的專(zhuān)用代碼。我們做離線推理優(yōu)化時(shí)就是這么干的一個(gè)固定尺寸的模型編譯后通常能再壓掉10%左右的延遲。2.3 mode參數(shù)該怎么選default、reduce-overhead還是max-autotunetorch.compile的mode參數(shù)是一個(gè)很容易被忽略但影響很大的選項(xiàng)。官方提供了default、reduce-overhead和max-autotune三檔。default模式下Inductor會(huì)做一些低成本的優(yōu)化編譯時(shí)間短但也意味著放棄了部分更激進(jìn)的改動(dòng)reduce-overhead會(huì)在編譯后引入CUDA Graph錄制對(duì)很多小模型有額外收益max-autotune則會(huì)對(duì)生成的Triton Kernel做大量自動(dòng)調(diào)參性能上限最高但編譯時(shí)間可能長(zhǎng)達(dá)幾分鐘到幾十分鐘。我自己的建議是先用default跑通確認(rèn)無(wú)功能問(wèn)題、無(wú)Graph Break導(dǎo)致的性能回退再?lài)L試reduce-overhead。如果你的模型在多個(gè)批量尺寸上都要用不要貿(mào)然開(kāi)max-autotune因?yàn)閍utotune是針對(duì)固定Shape做的。數(shù)據(jù)增強(qiáng)或動(dòng)態(tài)批量導(dǎo)致Shape頻繁變化時(shí)max-autotune的收益會(huì)被命中率稀釋反而浪費(fèi)了編譯時(shí)間。還有一個(gè)重要技巧在A100或者H100上reduce-overhead通常會(huì)讓小批量訓(xùn)練的速度提升非常明顯因?yàn)樗鼫p少了CPU到GPU之間的同步等待。但在V100這些老卡上CUDA Graph帶來(lái)的收益相對(duì)有限因?yàn)橛布旧淼膯?dòng)延遲沒(méi)那么敏感。環(huán)境不同同樣參數(shù)跑出來(lái)的效果可能完全不一樣這也是為什么我建議任何優(yōu)化都要結(jié)合自己的硬件和模型實(shí)測(cè)而不是照搬網(wǎng)上報(bào)告的數(shù)字。3. Triton 在 torch.compile 里的角色寫(xiě)一次、到處亂跑的高性能內(nèi)核聊到Torch編譯優(yōu)化Triton是一個(gè)繞不開(kāi)的名字。很多剛接觸的人會(huì)把Triton誤解為某種第三方算子庫(kù)其實(shí)它在torch.compile中的作用更底層Inductor生成的代碼很大一部分是Triton語(yǔ)言的Kernel??梢园阉譁\地理解為“GPU上的Python”——用一套類(lèi)Python的語(yǔ)法寫(xiě)出能夠直接在CUDA設(shè)備上高效運(yùn)行的GPU Kernel而不需要手動(dòng)管理線程塊、共享內(nèi)存、同步指令那些復(fù)雜細(xì)節(jié)。3.1 Triton Kernel 到底解決了什么問(wèn)題傳統(tǒng)CUDA編程最難的不是“讓程序跑對(duì)”而是“讓程序跑快”。你要手動(dòng)決定每個(gè)線程負(fù)責(zé)哪個(gè)元素要處理內(nèi)存合并訪問(wèn)要在不同層級(jí)的內(nèi)存之間做搬運(yùn)還要處理Bank Conflict這類(lèi)隱藏很深的性能殺手。寫(xiě)出來(lái)的代碼一旦換了GPU架構(gòu)往往又要重新調(diào)整。Triton的思路是把這些底層細(xì)節(jié)抽象成塊級(jí)操作你只需要描述“每個(gè)塊負(fù)責(zé)計(jì)算什么”而塊內(nèi)部怎么劃分線程、怎么分配寄存器、怎么訪問(wèn)顯存由編譯器自動(dòng)決定。這個(gè)抽象對(duì)自動(dòng)調(diào)優(yōu)特別友好。編譯器可以在一次編譯過(guò)程中生成多個(gè)候選版本然后在真實(shí)硬件上跑一遍選擇最快的那一個(gè)。Inductor在生成Kernel時(shí)就會(huì)調(diào)用Triton做這輪調(diào)優(yōu)。你在日志里看到的“Triton kernel”字樣本質(zhì)上就是Inductor針對(duì)某個(gè)融合子圖生成的GPU代碼。實(shí)際效果上我跑過(guò)一個(gè)典型的ResNet風(fēng)格模型Eager模式下有大概600多個(gè)Kernel執(zhí)行開(kāi)啟torch.compile Inductor Triton后Kernel數(shù)量降到兩百左右端到端訓(xùn)練時(shí)間減少了35%。這個(gè)降幅不是因?yàn)槟骋粋€(gè)算子變快了而是因?yàn)榇罅啃ernel被合并成少量大KernelGPU的執(zhí)行效率因此獲得整體提升。用一句話概括就是Triton不是讓某個(gè)算子從10微秒變成1微秒而是讓幾百次啟動(dòng)從“每次都在浪費(fèi)”變成“每次都真正在計(jì)算”。3.2 Triton 在非編譯場(chǎng)景下的用法手寫(xiě)自定義Kerneltorch.compile之外Triton也可以作為獨(dú)立工具來(lái)寫(xiě)自定義算子。PyTorch里寫(xiě)高性能自定義算子傳統(tǒng)路線是寫(xiě)CUDA C擴(kuò)展然后通過(guò)torch.utils.cpp_extension編譯加載。這條路功能上限高但開(kāi)發(fā)效率低——你得同時(shí)掌握C、CUDA和PyTorch的C接口。Triton提供了一個(gè)折中方案用Python編寫(xiě).triton.kernel裝飾的Kernel函數(shù)運(yùn)行時(shí)自動(dòng)編譯成GPU代碼。調(diào)用的方式跟普通PyTorch函數(shù)一樣傳Tensor進(jìn)去就行。我舉一個(gè)實(shí)際項(xiàng)目里的例子我們要做一個(gè)自定義的注意力掩碼算子標(biāo)準(zhǔn)PyTorch實(shí)現(xiàn)里涉及多次reshape和mask操作顯存開(kāi)銷(xiāo)高。用Triton重寫(xiě)后一個(gè)Kernel內(nèi)完成了mask和softmax的部分融合顯存占用顯著下降速度也快了不少。當(dāng)時(shí)只花了半天時(shí)間就寫(xiě)完了而如果用CUDA C可能要兩三天起步。如果你打算自己動(dòng)手寫(xiě)Triton Kernel建議從簡(jiǎn)單的逐元素算子開(kāi)始練手比如把“ReLU 縮放 偏移”融合成一個(gè)自定義Kernel。把基礎(chǔ)語(yǔ)法、tl.load和tl.store的使用方式搞明白后再?lài)L試更復(fù)雜的Reduce算子。Triton的官方教程里有一個(gè)softmax例子是非常好的入門(mén)材料——同樣一個(gè)功能分別用PyTorch原生實(shí)現(xiàn)和Triton Kernel實(shí)現(xiàn)對(duì)比兩者的時(shí)間消耗你會(huì)很快理解編譯優(yōu)化的核心價(jià)值在哪里。3.3 Triton 版本兼容與安裝坑位Triton目前最常見(jiàn)的安裝方式是隨torch一同安裝。torch.compile在NVIDIA后端會(huì)依賴(lài)Triton所以你在用conda或pip安裝較新版本的PyTorch時(shí)Triton通常已經(jīng)是配套的。但如果你之前手動(dòng)裝過(guò)舊版Triton或者環(huán)境里有多個(gè)PyTorch版本很容易出現(xiàn)“torch版本和Triton版本不匹配”的警告。我在排查環(huán)境時(shí)發(fā)現(xiàn)一個(gè)規(guī)律每當(dāng)PyTorch發(fā)布新版本社區(qū)里就會(huì)出現(xiàn)一批“安裝完torch.compile報(bào)錯(cuò)找不到Triton”或“編譯Kernel報(bào)錯(cuò)版本太舊”的帖子。這時(shí)候首先要做的不是重裝Triton而是確認(rèn)當(dāng)前PyTorch要求的Triton版本范圍。最穩(wěn)妥的方案是直接使用官方推薦的安裝指令pip或conda重新裝一遍PyTorch讓依賴(lài)自動(dòng)拉齊。Google Colab和Kaggle Notebook這類(lèi)云端環(huán)境偶爾也會(huì)出現(xiàn)預(yù)裝Triton版本和torch不匹配的情況重置運(yùn)行時(shí)或升級(jí)torch就可以解決。如果你在CPU-only的機(jī)器上跑torch.compile會(huì)發(fā)現(xiàn)很多Triton相關(guān)功能不可用或者編譯速度極慢。這不是你的代碼有問(wèn)題而是Triton的GPU后端需要CUDA編譯器工具鏈。CPU環(huán)境下Inductor會(huì)嘗試生成C Kernel功能上能跑通但優(yōu)化幅度和GPU場(chǎng)景沒(méi)有可比性。所以建議在動(dòng)手實(shí)踐之前先確認(rèn)自己的環(huán)境有可用的NVIDIA GPU并且PyTorch的CUDA版本和驅(qū)動(dòng)是匹配的。4. XLA 后端另一條編譯器路線的優(yōu)勢(shì)與代價(jià)PyTorch的編譯優(yōu)化不止torch.compile一條路徑。XLAAccelerated Linear Algebra是一個(gè)從TensorFlow生態(tài)里沉淀下來(lái)的編譯器框架也可以作為PyTorch的后端使用。你只需要把模型轉(zhuǎn)換為torch_xla下的執(zhí)行設(shè)備就可以讓計(jì)算圖經(jīng)過(guò)XLA的優(yōu)化后再編譯為對(duì)應(yīng)的硬件指令。這個(gè)方案的好處是跨硬件能力很強(qiáng)——從NVIDIA GPU到Google TPUXLA都有對(duì)應(yīng)的編譯目標(biāo)。4.1 XLA 的工作原理和典型場(chǎng)景XLA的核心思路是“拿到完整的計(jì)算圖再做全局優(yōu)化”。它會(huì)把輸入的計(jì)算圖做算子融合、內(nèi)存規(guī)劃、布局優(yōu)化等處理然后為特定硬件生成可執(zhí)行文件。跟Inductor偏向于“為單個(gè)GPU卡上的小規(guī)模融合”相比XLA的優(yōu)化更傾向于整圖級(jí)別的改寫(xiě)。我最早接觸XLA是在原生TensorFlow時(shí)代那時(shí)候用XLA跑Transformer類(lèi)模型速度提升經(jīng)常是成倍的。后來(lái)PyTorch生態(tài)繁榮起來(lái)torch_xla項(xiàng)目把這種能力搬到了PyTorch里。如果你有TPU資源PyTorch模型可以直接通過(guò)XLA后端在TPU上運(yùn)行這一點(diǎn)是torch.compile目前完全覆蓋不到的。但XLA也有一些明顯的代價(jià)。最大的問(wèn)題是編譯時(shí)間。之前用XLA跑一個(gè)較大規(guī)模的BERT模型編譯階段可能就要幾分鐘到十幾分鐘。如果是訓(xùn)練任務(wù)每個(gè)Step都生成同樣的計(jì)算圖編譯一次就夠了這個(gè)成本可以接受如果是推理任務(wù)每次請(qǐng)求都要處理動(dòng)態(tài)Shape或者新的模型結(jié)構(gòu)編譯開(kāi)銷(xiāo)就會(huì)成為很大的負(fù)擔(dān)。這也是為什么XLA更適用于“固定圖、長(zhǎng)時(shí)間反復(fù)執(zhí)行”的場(chǎng)景。4.2 torch.compile 和 XLA 怎么選很多剛接觸這兩個(gè)概念的人會(huì)糾結(jié)“到底用哪一個(gè)”。我的判斷標(biāo)準(zhǔn)非常簡(jiǎn)單你的目標(biāo)硬件是什么如果你的執(zhí)行環(huán)境是NVIDIA GPU并且模型在PyTorch生態(tài)內(nèi)能跑通默認(rèn)選擇torch.compile。它和PyTorch的接口耦合更緊密調(diào)試信息和工具鏈也更成熟。如果你的目標(biāo)是TPU或者你的模型是從TensorFlow/JAX遷移過(guò)來(lái)的那XLA就是理所當(dāng)然的選擇。另外有些場(chǎng)景會(huì)同時(shí)用到兩者。比如在NVIDIA GPU上做模型開(kāi)發(fā)驗(yàn)證然后跑到TPU上做大規(guī)模訓(xùn)練。我的經(jīng)驗(yàn)是先各自跑通最小實(shí)驗(yàn)再統(tǒng)一對(duì)比指標(biāo)。快速看一張我整理的對(duì)比表對(duì)比維度torch.compile InductorXLA 后端目標(biāo)硬件主要面向NVIDIA GPUNVIDIA GPU / TPU / CPU接入成本一行代碼需要切換設(shè)備為XLA并處理數(shù)據(jù)搬運(yùn)編譯時(shí)間通常幾十秒到幾分鐘大模型可能較長(zhǎng)動(dòng)態(tài)Shape支持較好但允許一定回退一般盡量避免調(diào)試體驗(yàn)較好支持回退Eager模式相對(duì)繁瑣報(bào)錯(cuò)和符號(hào)化程度較高生態(tài)現(xiàn)狀PyTorch官方主推在TensorFlow/JAX場(chǎng)景下更普遍這張表不是絕對(duì)的但它能幫你快速判斷自己該往哪個(gè)方向投入。實(shí)際上我見(jiàn)過(guò)不少團(tuán)隊(duì)為了“追趕熱點(diǎn)”硬上XLA結(jié)果模型在GPU上反而更慢了。因?yàn)閄LA在GPU上的優(yōu)化效果很多時(shí)候并不比Inductor更優(yōu)反而因?yàn)檎麍D編譯的調(diào)度開(kāi)銷(xiāo)在小模型和短任務(wù)上半點(diǎn)便宜都占不到。4.3 XLA 使用中的常見(jiàn)坑位使用torch_xla的時(shí)候最容易踩的坑是數(shù)據(jù)類(lèi)型和Shape不一致帶來(lái)的額外編譯。XLA不喜歡動(dòng)態(tài)Shape。同一個(gè)模型如果每次傳入的sequence長(zhǎng)度都不同XLA就會(huì)反復(fù)做編譯或選擇“動(dòng)態(tài)Shape路徑”性能大打折扣。解決辦法是在數(shù)據(jù)加載階段做好padding把序列長(zhǎng)度統(tǒng)一到同一個(gè)batch內(nèi)的最大值。另一個(gè)坑是分布式訓(xùn)練時(shí)的數(shù)據(jù)同步。torch_xla有自己的分布式接口直接從原生PyTorch的DistributedDataParallel遷移過(guò)來(lái)可能會(huì)碰到collective通信實(shí)現(xiàn)不一致的問(wèn)題。如果只是小規(guī)模實(shí)驗(yàn)單卡訓(xùn)練問(wèn)題不大一旦上多卡建議按照torch_xla官方文檔里的分布式示例調(diào)整代碼而不是硬套原來(lái)的DDP邏輯。最后提一句torch_xla的版本更新頻率通常滯后于PyTorch主版本。如果你正在用很新的PyTorch nightly版裝torch_xla時(shí)最好看一下官方兼容矩陣避免出現(xiàn)API對(duì)不上的問(wèn)題。我自己就遇到過(guò)“小版本不兼容模型A能跑B不能跑”的怪問(wèn)題最終排查出來(lái)是編譯版本不一致導(dǎo)致的。5. 實(shí)操記錄從Eager到torch.compile的一次完整調(diào)優(yōu)這里我會(huì)用一個(gè)簡(jiǎn)化但完整的例子展示我實(shí)際調(diào)優(yōu)一個(gè)CV識(shí)別模型的步驟。這個(gè)模型不復(fù)雜但足以說(shuō)明編譯優(yōu)化的整體流程和注意點(diǎn)。你完全可以把這套流程套用到自己的模型上。5.1 第一步先跑通Baseline拿到可量化指標(biāo)任何優(yōu)化工作第一步永遠(yuǎn)是拿到準(zhǔn)確、可復(fù)現(xiàn)的Benchmark基線。不要上來(lái)就改代碼加編譯否則優(yōu)化前后對(duì)比會(huì)出現(xiàn)很大的噪音。我通常固定隨機(jī)種子、固定輸入Tensor的Shape、固定優(yōu)化器參數(shù)并且把Warmup步數(shù)留足再統(tǒng)計(jì)穩(wěn)定的Step時(shí)間。下面是簡(jiǎn)化示例import torch import torch.nn as nn import time class SimpleModel(nn.Module): def __init__(self): super().__init__() self.conv1 nn.Conv2d(3, 64, kernel_size3, padding1) self.bn1 nn.BatchNorm2d(64) self.conv2 nn.Conv2d(64, 128, kernel_size3, padding1) self.bn2 nn.BatchNorm2d(128) self.pool nn.AdaptiveAvgPool2d((1, 1)) self.fc nn.Linear(128, 10) def forward(self, x): x torch.relu(self.bn1(self.conv1(x))) x torch.relu(self.bn2(self.conv2(x))) x self.pool(x).flatten(1) x self.fc(x) return x model SimpleModel().cuda().train() optimizer torch.optim.SGD(model.parameters(), lr0.01) x torch.randn(32, 3, 224, 224).cuda() target torch.randint(0, 10, (32,)).cuda() criterion nn.CrossEntropyLoss() # warmup for _ in range(10): optimizer.zero_grad() loss criterion(model(x), target) loss.backward() optimizer.step() # benchmark: 50 iters torch.cuda.synchronize() start time.time() for _ in range(50): optimizer.zero_grad() loss criterion(model(x), target) loss.backward() optimizer.step() torch.cuda.synchronize() avg_step (time.time() - start) / 50 print(fEager avg step: {avg_step * 1000:.2f} ms)跑這類(lèi)腳本時(shí)注意每次循環(huán)都執(zhí)行torch.cuda.synchronize()否則計(jì)時(shí)結(jié)果會(huì)不準(zhǔn)確。GPU執(zhí)行是異步的CPU端的time.time()只能記錄到“提交任務(wù)”的時(shí)間而不是真實(shí)執(zhí)行結(jié)束的時(shí)間。5.2 第二步開(kāi)啟torch.compile并觀察Graph Break在Baseline跑通以后第二步就是一行接入compile并觀察Dynamo的捕獲情況。代碼改動(dòng)很簡(jiǎn)單model torch.compile(SimpleModel().cuda().train(), modereduce-overhead)跑同樣的Benchmark流程。如果代碼沒(méi)有特殊控制流torch.compile一般能直接接管大部分計(jì)算路徑。為了確認(rèn)優(yōu)化覆蓋到了多少比例我強(qiáng)烈建議先跑一次帶有解釋信息的診斷from torch._dynamo import explain compiled_model torch.compile(model, modereduce-overhead) explanation explain(compiled_model, x) print(explanation)你會(huì)看到Graph Break的具體位置、覆蓋算子的比例、以及被優(yōu)化掉的節(jié)點(diǎn)數(shù)。如果Graph Break數(shù)量特別多先不要慌逐條分析原因。常見(jiàn)的原因就那幾類(lèi)調(diào)用了.item()、print到Tensor、使用了不支持的第三方庫(kù)函數(shù)、或者對(duì)Tensor做了Python層面的條件判斷。我當(dāng)時(shí)調(diào)這個(gè)簡(jiǎn)化模型時(shí)最典型的問(wèn)題是在forward里加了幾個(gè)用于調(diào)試的assertDynamo遇到這些Python斷言就Graph Break了。把這些調(diào)試邏輯拿到模型外部之后Graph Break數(shù)量從好幾個(gè)降到零整體性能立刻上了一個(gè)臺(tái)階。5.3 第三步對(duì)照組交叉驗(yàn)證區(qū)分“真實(shí)提升”和“測(cè)量噪音”三步跑完通常得到一張類(lèi)似這樣的表模式平均Step時(shí)間相對(duì)Eager提升Eager18.6 ms基線torch.compile(default)13.8 ms~26%torch.compile(reduce-overhead)12.9 ms~31%torch.compile(max-autotune)12.7 ms~32%這個(gè)例子里reduce-overhead和max-autotune的差距已經(jīng)很小max-autotune的編譯時(shí)間卻可能是后者的幾倍。所以在實(shí)際業(yè)務(wù)里我會(huì)優(yōu)先選擇reduce-overhead因?yàn)樗骖櫫司幾g速度和性能收益。需要提醒的是這類(lèi)數(shù)字受很多因素影響GPU型號(hào)、PyTorch版本、CUDA版本、輸入Shape、Batch Size、是否開(kāi)啟AMP等。同一份代碼在不同機(jī)器上可能跑出完全不同的對(duì)比結(jié)果。我自己有過(guò)一次經(jīng)歷在V100上torch.compile只帶來(lái)5%的提升換到A100上同樣的模型直接提升40%。原因很簡(jiǎn)單——新架構(gòu)對(duì)融合Kernel的執(zhí)行效率更高舊架構(gòu)受限于寄存器、調(diào)度能力收益自然不明顯。5.4 實(shí)戰(zhàn)補(bǔ)遺混合精度和編譯的配合如果你在訓(xùn)練中還開(kāi)啟了AMP自動(dòng)混合精度建議把優(yōu)化順序排成“先AMP再compile”。因?yàn)锳MP本身就能把部分計(jì)算切到FP16/FP16帶來(lái)顯著的顯存和速度收益。此時(shí)再疊加torch.compile還能在融合Kernel里自動(dòng)處理FP16/FP32之間的轉(zhuǎn)換細(xì)節(jié)進(jìn)一步減少讀寫(xiě)開(kāi)銷(xiāo)。有一個(gè)細(xì)節(jié)值得單獨(dú)說(shuō)在Eager模式下AMP會(huì)和torch.cuda.amp.GradScaler配合使用避免梯度下溢。在torch.compile下這個(gè)邏輯本質(zhì)不變但Dynamo會(huì)拿到包含AMP包裝層的計(jì)算圖。正常情況下沒(méi)有問(wèn)題但如果你的模型或損失函數(shù)里有自定義的autograd.Function可能需要額外檢查一下是否兼容編譯路徑。出現(xiàn)問(wèn)題的時(shí)候日志里會(huì)明確提示某個(gè)算子不支持編譯這時(shí)候可以把那個(gè)算子所在的子模塊排除出編譯范圍比如用torch.compile(model, disable...)或者把模塊內(nèi)部改成torch._dynamo.mark_dynamic之類(lèi)的注解去處理。6. 踩坑筆記Graph Break、CUDA Graph 與編譯時(shí)間失控理論聊得再多實(shí)踐中該踩的坑一個(gè)都不會(huì)少。這一節(jié)我把自己在torch.compile、Triton和XLA身上踩過(guò)的高頻坑集中列出來(lái)。每一類(lèi)坑背后都是我曾花掉的幾個(gè)小時(shí)能讓你避開(kāi)的話這篇文章就值回票價(jià)了。6.1 Graph Break導(dǎo)致的“越優(yōu)化越慢”最迷惑人的問(wèn)題就是“編譯之后反而比Eager更慢”。這種情況九成以上都能追溯到Graph Break過(guò)多或編譯覆蓋范圍過(guò)小。一旦模型在關(guān)鍵循環(huán)里頻繁回退到Eager那么每次切換到編譯區(qū)又要額外付出圖捕獲和編譯檢查的代價(jià)結(jié)果就是“反復(fù)橫跳”性能自然惡化。排查的方法特別簡(jiǎn)單用torch._dynamo.explain把優(yōu)化報(bào)告打印出來(lái)里面會(huì)清晰地列出每個(gè)Graph Break的文件名、行號(hào)和原因。我遇到過(guò)一個(gè)項(xiàng)目模型里用了一個(gè)外部庫(kù)的某個(gè)函數(shù)對(duì)Tensor做掩碼處理這個(gè)函數(shù)內(nèi)部包含Python層面的循環(huán)和條件分支Dynamo拿它沒(méi)辦法整段都變成了Graph Break。后來(lái)我用原生PyTorch算子重寫(xiě)了那段邏輯Graph Break立刻消失整體訓(xùn)練時(shí)間縮短了接近一半。實(shí)際操作中還有一個(gè)比較隱蔽的trigger是torch.no_grad()和model.eval()的組合使用。推理階段在關(guān)閉梯度后Dynamo的捕獲反而可能因?yàn)榘b關(guān)系變得更復(fù)雜。如果遇到推理階段Graph Break異??梢栽囋嚢裯o_grad移到調(diào)用compile的模型之前或者將推理函數(shù)整體包進(jìn)一個(gè)torch.no_grad()裝飾的函數(shù)里。6.2 CUDA Graph和動(dòng)態(tài)Shape的沖突reduce-overhead模式會(huì)啟用CUDA Graph技術(shù)。CUDA Graph的精髓是“先錄制后回放”第一步執(zhí)行時(shí)把所有Kernel的調(diào)用信息記錄下來(lái)之后就用極低的CPU開(kāi)銷(xiāo)反復(fù)提交。但錄制意味著Kernel的Shape和輸入Tensor的指針信息基本固定。如果之后某一步傳入的輸入Shape變了CUDA Graph回放了錯(cuò)誤配置就會(huì)導(dǎo)致崩潰、顯存錯(cuò)誤或嚴(yán)重性能下降。我的經(jīng)驗(yàn)是訓(xùn)練中若Batch Size固定、圖像分辨率固定GPU Graph幾乎無(wú)副作用。但你一旦在訓(xùn)練過(guò)程中改變了輸入分辨率比如圖像縮放、動(dòng)態(tài)裁剪或者模型中依賴(lài)數(shù)據(jù)的Shape計(jì)算比如序列長(zhǎng)度變化就必須謹(jǐn)慎。更穩(wěn)妥的方案是把變長(zhǎng)輸入先整理成固定Shape的Batch盡量把動(dòng)態(tài)變化控制在模型外部。如果實(shí)在無(wú)法避免動(dòng)態(tài)Shape那reduce-overhead模式建議先不要用改用default模式跑通驗(yàn)證再考慮進(jìn)一步調(diào)優(yōu)。還有一個(gè)細(xì)節(jié)在使用CUDA Graph時(shí)如果模型內(nèi)部有隨機(jī)性操作比如Dropout錄制后的回放階段會(huì)把隨機(jī)數(shù)生成路徑也一并固定導(dǎo)致結(jié)果不可復(fù)現(xiàn)或者統(tǒng)計(jì)分布偏移。PyTorch的編譯器會(huì)對(duì)這類(lèi)隨機(jī)操作做特殊標(biāo)注但手動(dòng)寫(xiě)的一些自定義Triton Kernel如果內(nèi)部調(diào)用了隨機(jī)API需要格外小心。最好在自定義Kernel里顯式傳入隨機(jī)狀態(tài)或者在模型外部控制隨機(jī)性。6.3 編譯時(shí)間太長(zhǎng)是硬件問(wèn)題還是模型問(wèn)題編譯時(shí)間很多時(shí)候讓人抓狂。max-autotune模式在大模型上動(dòng)輒十幾分鐘、幾十分鐘這在開(kāi)發(fā)迭代階段會(huì)非常影響效率。我的做法是“開(kāi)發(fā)用default上線用max-autotune”開(kāi)發(fā)階段頻繁改代碼沒(méi)必要花大量時(shí)間等待編譯模型定型、進(jìn)入長(zhǎng)期固定訓(xùn)練或反復(fù)推理時(shí)再逐步升級(jí)到更激進(jìn)的編譯選項(xiàng)。另外還有一個(gè)容易忽視的原因Inductor為每個(gè)編譯的圖生成多個(gè)候選Triton Kernel并逐一套用不同參數(shù)運(yùn)行驗(yàn)證這個(gè)“autotune”過(guò)程需要在GPU上真實(shí)跑一遍。如果你同時(shí)開(kāi)了多個(gè)進(jìn)程做編譯GPU資源會(huì)被爭(zhēng)搶autotune的時(shí)間也會(huì)被明顯放大。建議在關(guān)鍵編譯任務(wù)執(zhí)行時(shí)保持同一張卡上只有一個(gè)編譯進(jìn)程。如果你發(fā)現(xiàn)編譯總是卡在某個(gè)特定階段還可以開(kāi)啟TORCH_LOGSinductor環(huán)境變量查看詳細(xì)的編譯日志定位到底是圖優(yōu)化階段耗時(shí)還是Triton Kernel自動(dòng)調(diào)優(yōu)階段耗時(shí)。拿到日志后再?zèng)Q定是換mode還是調(diào)整Shape設(shè)定會(huì)高效得多。6.4 自定義算子無(wú)法編譯三個(gè)層面的應(yīng)對(duì)順序PyTorch生態(tài)里難免有第三方或自制算子。遇到Dynamo不認(rèn)識(shí)的函數(shù)時(shí)第一選擇是改成原生算子組合第二選擇是給這個(gè)算子注冊(cè)一個(gè)“偽量化”的圖捕獲規(guī)則讓編譯期可以忽略其內(nèi)部細(xì)節(jié)只把它當(dāng)作一個(gè)不可拆分的節(jié)點(diǎn)第三選擇才是回到Eager模式把整個(gè)模型或某個(gè)子模塊排除在編譯范圍外。在實(shí)際項(xiàng)目中我見(jiàn)到最多的是很多人一遇到自定義算子不支持就慌張地把torch.compile全局關(guān)閉。如果因?yàn)閹讉€(gè)點(diǎn)損失整張圖的優(yōu)化潛力非??上?。更好的做法是把自定義算子封裝在獨(dú)立的子模塊里用torch.compile只編譯模型中其余穩(wěn)定的部分。PyTorch本身是支持部分模塊編譯的善用這個(gè)能力很多兼容性問(wèn)題都可以繞過(guò)去。7. 更進(jìn)一步在真實(shí)業(yè)務(wù)里如何把編譯優(yōu)化推向生產(chǎn)環(huán)境如果你試過(guò)了torch.compile指標(biāo)也漂亮接下來(lái)要思考的是“怎么讓它在生產(chǎn)環(huán)境穩(wěn)定跑起來(lái)”。這涉及的環(huán)境問(wèn)題比模型代碼本身更多比如服務(wù)化部署時(shí)的請(qǐng)求Shape變化、多卡并行時(shí)的組網(wǎng)方式、以及Cluster里多個(gè)任務(wù)對(duì)GPU的爭(zhēng)搶。7.1 訓(xùn)練場(chǎng)景怎么穩(wěn)定落地訓(xùn)練場(chǎng)景相對(duì)簡(jiǎn)單一些。因?yàn)橛?xùn)練數(shù)據(jù)的Shape通常固定模型結(jié)構(gòu)也穩(wěn)定torch.compile的收益可以平滑落地。需要額外關(guān)注的是多機(jī)多卡的通信開(kāi)銷(xiāo)。當(dāng)你把編譯后的模型接入DDP或FSDP時(shí)通信模式和Kernel執(zhí)行順序可能會(huì)和普通Eager模型略有差異如果出現(xiàn)卡頓或利用率波動(dòng)可以先關(guān)掉編譯模式做一下對(duì)照實(shí)驗(yàn)判斷問(wèn)題是出在編譯優(yōu)化還是通信調(diào)度。FSDP的數(shù)據(jù)流比較復(fù)雜Dynamo在捕獲時(shí)會(huì)看到很多與通信相關(guān)的集合操作。新版本PyTorch已經(jīng)對(duì)這類(lèi)帶通信操作的計(jì)算圖做了更好的適配但如果你用的是較老版本遇到FSDP torch.compile性能不升反降的情況可以嘗試把模型內(nèi)部的通信包裝層移動(dòng)到編譯區(qū)之外或者用官方文檔推薦的版本組合。7.2 推理場(chǎng)景怎么處理動(dòng)態(tài)負(fù)載推理任務(wù)要面對(duì)的最大變量是請(qǐng)求Shape不固定。線上服務(wù)經(jīng)常一個(gè)請(qǐng)求是短文本下一個(gè)就是長(zhǎng)文本還有各種不同Batch Size的準(zhǔn)備策略。如果每個(gè)Shape都觸發(fā)一次torch.compile編譯開(kāi)銷(xiāo)會(huì)完全吃掉性能收益。所以生產(chǎn)落地時(shí)一般會(huì)做“按Shape緩存編譯結(jié)果”的設(shè)計(jì)只對(duì)常見(jiàn)的幾個(gè)Shape組合做預(yù)編譯其他Shape走Eager路徑。我在一個(gè)B端推理服務(wù)里用的策略是在服務(wù)啟動(dòng)階段用幾個(gè)典型Shape預(yù)熱編譯結(jié)果然后用一個(gè)哈希表記錄“Shape簽名 - 編譯后模型”。請(qǐng)求進(jìn)入時(shí)先查表命中就使用編譯版本未命中則走Eager。這樣既保證了服務(wù)質(zhì)量又把編譯成本限制在可接受的范圍內(nèi)。論文里有一個(gè)詞叫“Shape Bucketing”說(shuō)的基本就是這個(gè)思路——把連續(xù)的Shape空間離散化成若干桶以兼容性能和靈活性。7.3 對(duì)“性能工程”這件事本身的思考在我寫(xiě)這套學(xué)習(xí)筆記的整個(gè)過(guò)程中一個(gè)反復(fù)出現(xiàn)的主題是性能優(yōu)化沒(méi)有銀彈。torch.compile很好用但它只是把計(jì)算圖表示、算子調(diào)度和硬件指令生成之間的一層又一層的復(fù)雜性封裝了起來(lái)。真正的性能工程能力不是在某個(gè)模型上跑通一個(gè)API而是能快速定位瓶頸、判斷優(yōu)化手段的適用邊界以及在效率和穩(wěn)定性之間做出合適的權(quán)衡。這需要一種“分層診斷”的思維先看數(shù)據(jù)加載和CPU側(cè)是否飽和再看GPU Util是否真實(shí)有效再看計(jì)算圖里是否存在大量小Kernel最后才輪到是否引入編譯器。整個(gè)順序反了你很可能花了一整天時(shí)間調(diào)編譯參數(shù)最后發(fā)現(xiàn)瓶頸在DataLoader根本沒(méi)喂飽GPU。8. 番外幾個(gè)你一定會(huì)用到的環(huán)境與版本問(wèn)題因?yàn)檫@套筆記發(fā)布后經(jīng)常有讀者私信問(wèn)我環(huán)境配置的問(wèn)題這里把跟torch.compile、Triton、XLA相關(guān)的環(huán)境適配問(wèn)題單獨(dú)拿出來(lái)說(shuō)一遍免得大家在前面代碼沒(méi)跑起來(lái)的時(shí)候就被環(huán)境卡住。8.1 PyTorch與CUDA的版本匹配不同版本的PyTorch對(duì)CUDA的支持版本不同。我個(gè)人的習(xí)慣是直接去PyTorch官網(wǎng)的Get Started頁(yè)面選擇合適的操作系統(tǒng)、包管理工具和CUDA版本然后復(fù)制對(duì)應(yīng)的安裝命令。不要自己手動(dòng)從一堆索引里拼輪子那樣很容易引入版本沖突。如果你是離線環(huán)境需要先在一臺(tái)聯(lián)網(wǎng)的機(jī)器上把對(duì)應(yīng)的wheel包下載好然后再搬到目標(biāo)機(jī)器安裝。下載時(shí)注意選擇cu118、cu121這類(lèi)后綴確保和機(jī)器上實(shí)際安裝的驅(qū)動(dòng)兼容。驅(qū)動(dòng)本身要符合CUDA運(yùn)行時(shí)的最低版本要求否則即使torch裝好了torch.cuda.is_available()也可能返回False。8.2 如何確認(rèn)Triton已經(jīng)正確安裝和可用最簡(jiǎn)單的方式是在Python環(huán)境里執(zhí)行以下代碼import triton print(triton.__version__)如果打印出版本號(hào)基本就說(shuō)明裝好了。接下來(lái)再跑一個(gè)小Kernel驗(yàn)證確保運(yùn)行路徑也正確。比如官方文檔里的向量加法示例或者一個(gè)最簡(jiǎn)單的torch.compile測(cè)試。只import成功不一定代表能正常編譯Kernel因?yàn)門(mén)riton還依賴(lài)本機(jī)的編譯器工具鏈。在容器化環(huán)境中經(jīng)常出現(xiàn)“宿主機(jī)能跑但容器里不能跑”的情況絕大多數(shù)是因?yàn)槿萜麋R像里缺少libgomp等動(dòng)態(tài)庫(kù)或者LD_LIBRARY_PATH沒(méi)有正確包含CUDA的庫(kù)路徑。遇到這類(lèi)問(wèn)題時(shí)先檢查基礎(chǔ)鏡像是否包含完整的CUDA runtime再檢查nvcc是否可用。8.3 我常用的一個(gè)快速驗(yàn)證腳本最后分享一個(gè)我?guī)缀趺看芜w移環(huán)境后都會(huì)跑的快速驗(yàn)證腳本內(nèi)容很簡(jiǎn)單但它能在十分鐘內(nèi)暴露80%的常見(jiàn)環(huán)境問(wèn)題import torch print(PyTorch version:, torch.__version__) print(CUDA available:, torch.cuda.is_available()) if torch.cuda.is_available(): print(CUDA version:, torch.version.cuda) print(GPU name:, torch.cuda.get_device_name(0)) x torch.randn(1000, 1000, devicecuda) y torch.matmul(x, x) print(matmul ok:, y.shape) try: import triton print(Triton version:, triton.__version__) except ImportError as e: print(Triton import error:, e) def simple_add(a, b): return a b compiled_add torch.compile(simple_add) out compiled_add(x, x) print(torch.compile ok:, out.shape)如果這個(gè)腳本全綠那說(shuō)明環(huán)境基本可用如果哪一步紅了就跟著堆棧信息去查對(duì)應(yīng)依賴(lài)。每次跑到全綠我才會(huì)開(kāi)始正式的模型優(yōu)化工作。這套流程幫我省去了無(wú)數(shù)次“改了模型卻不知道是環(huán)境問(wèn)題還是代碼問(wèn)題”的無(wú)謂排查。這篇筆記從torch.compile的內(nèi)部機(jī)制講到Triton如何生成GPU Kernel再對(duì)比了XLA這條跨硬件編譯器路線最后落到工程環(huán)境里的落地實(shí)踐。這些內(nèi)容都是我實(shí)際跑模型、調(diào)GPU、被各種版本和Graph Break折騰完之后沉淀出來(lái)的。按我自己的經(jīng)驗(yàn)真正理解這三條主線之后你再去看PyTorch相關(guān)的性能優(yōu)化問(wèn)題視角會(huì)和以前明顯不一樣——不再只是調(diào)幾個(gè)參數(shù)看數(shù)字而是能判斷瓶頸在哪一層、哪條優(yōu)化路徑最適合當(dāng)前場(chǎng)景、換了硬件后又會(huì)發(fā)生什么變化。這一篇先寫(xiě)到這第十五篇打算展開(kāi)聊聊分布式訓(xùn)練里通信和計(jì)算的流水線重疊那個(gè)方向也是我們生產(chǎn)環(huán)境里吃了不少苦頭才摸清門(mén)道的話題。
返回列表
PREV
查看更多資訊
NEXT
返回資訊列表
yirendaxiangjiashipin| 中文?日韩?免费?精品| 久久久久国产无av| 69少妇一区二区| 日韩无码服务区| 国产成人资源| 欧美丝袜激情| 大香蕉十区| 超碰人人超在线观看| 老外又粗又长一晚做五次| 一摸二插三插| 五月天亚洲网| 欧美色天堂网在线视频| 亚洲AV乱码专区国产噜噜亚洲 | 色婷婷综合久久久久中文国产精品一区中文字幕,国产福利电影一区二区三区 | 青青草无码视频| 美女啊啊啊啊啊啊啊| 国产树林里野战在线看| 91午夜无码| 日韩三级伦理中文字幕| а√天堂资源官网在线资源| 亚州男人天堂| 日韩超碰97| 天天天干977| 精久久久| yazhououmeizongya| 国产成人主播| 亚州综合AⅤ| 欧美大香蕉97| 99热aaa| 色噜噜狠狠色综无码久久合欧美| 久久久久国产无av| 色婷婷综合网站| 欧美激情中文字幕另类小说| 首页中文字幕中文字幕免费| 99久久婷婷国产综合| www国产天美久久久| 国产 亚洲 丝袜 制服| 精品性爱一二三区| 91操操| 性爱视频久久| 97精彩视频网站| 校园春色之综合网| 啊啊啊啊操死我了| 综合亚洲欧美| 色吧91| 一本色道综合久久欧美| 嫩草影院在线观看精品| 久久久免费一级黄片| 日本国产高清色www视频在线| 亚瑟国产精品久久无码| 日韩AV片| 熟妇艹鸡八| 久久久久久久久久久999| 性色高清在线| 久9久9久9久9久9久9 | 成人性爱电影一区二区| 久久AV无码1区2区3区| 99www.bibizy香蕉资源国产一区二区三区高清 | 亚洲制服欧美另类内射| 激情综合网五月婷婷| 操逼网站视频漫画国产| 狠狠狠一区二区三区| 好看的91视频| 日产精品久久久一区二区| 亚洲色阁| 日本道日本道中文字幕日本道最新日本道在线观看 | 婷婷五月天激情四射| 亚洲有码 视频一区| 色盈盈影院| 超碰97首页| 97Ai亚洲| 啪啪AV导航| 亚洲丝袜二区| 97av,com| 国产亚洲福利第一页丝袜| 久久久精品无码亚免费| 人人爽夜夜操| 久久这里只精品| 日韩AV无码网站| 欧美一区二区亚洲天堂| 97色爱| 后入式999| 久久人| 97人人操人人摸| AA丁香综合激情| 伊人991| 中文久久久| AV污污污污| 99精品网站| 中文字幕视频二区| 亚洲天堂 视频你懂的| 亚洲色图20p| julia国产在线| 成人av在线播放| 五月激情在线| a啊啊啊啊啊啊啊啊一区二区| 免费福利视频中文字幕| 大JI巴好深好爽又大又粗视频| 午夜.DJ高清在线观看免费7| 久久蜜色情在线视频xxx免费观看| 久射吧| 人人操人人插人人摸人人干| 91黑丝美女| 97综合国产| 欧美色五月| 无码人妻毛片丰满熟妇精品区| 9国产超碰| 国产精品成人在线| 亚洲色宗合| 91操人| 另类视频在线| 黄色电影在线播放综合网站| 91久久堂| 8x福利精品第一福利视频导航| 国产精品大香蕉| 97操97干| 少妇一线天久久久久久| 男人天堂新在线| 中文字幕永久在线| 国产熟女无套内射| 色婷婷综合久久久久中文国产精品一区中文字幕,国产福利电影一区二区三区 | 亚洲另类综合欧美| 天堂伊人久久| 美女极品一区二区三区| 国产精品一级二级在线| 婷婷综合五月| 91人妻在线视频| 亚洲男人天堂Av| 2017天天插| 黑丝内射一区二区三区| 欧美性爱精品七区| 中文字幕AV片| 丁香五月电影| 亚洲日韩视频二区| 天天综合网AV91| 亚洲精品日韩国产欧美| 亚洲欧美97| 国产女上位好爽在线| 蜜臀久久99精品久久久久| 久久久爆乳翘臀一线天伦理视频| 黄页av| 91撸色网 玖玖网 欧美| 亚洲色图尤物视频| 91精品国| 99xav| 亚洲无吗在线视频| 蜜臀久久99精品久久久久久成人小说| 99激情| w w w.久久精品| 国产精品网站www| 久久无码电影| 日本性爱视频一级| 淫妻综合网| 久久只有精品| 日本亚欧爱爱| 欧美一二在线| 色婷婷基地| 在线有码中文字幕| 欧美日综合| 亚洲精品天天影视综合网 | 日韩成人精品中文字幕| 国产日韩手机视频在线| 亚洲高清欧美总合| 干B| 色激情五月天| 国产美女mm131爽爽爽爽| 91国产丝袜白虎| 亚洲第一页欧美| 99精品久久久久久久婷婷蜜桃| 色欧美亚洲| a片亚洲一本通视频| 久久五月丁香| 99热婷婷| 97色在线| 性开放中文AV高清无码免费看| 婷婷人妻激情| 涩亚洲欧洲| 国产操逼视频在线观看| 丝袜AV一区二区三区| 亚洲AV不卡在线观看尤物| 人妻久久久| 欧美色综合影院| 香蕉黄色一级视频| 日韩一级久久毛片| 日本久久超碰| 99久草| 亚洲少妇免费视频\| 97日视频| 婷婷另类小说| 丝袜综合| 青青草原综合久久大伊人精品| 操操啪| 天天天天天天天天天天干美女| 91精品国产91久久福利| 久草加勒比一区在线| 五月天九九日国产精品一区二区三区| 超碰97久久国| 九九免费影片| 美女上床网站| 国产精品一二三| 风骚少妇视频中文字幕| 99热18这里只有精品| 欧美成人色| 一二三四视频在线社区中文字幕| 国产成人手机视频激情| 亚洲欧美在线观看无码| 国产精品第一区第一页| 一级二级三级黑人无码| 天天操天天射天天日| 国产三级资源在线观看| av天堂精品久久| 日本人妻伦在线中文字幕| 日韩一级二级三级在线不卡观看完整| 天天天肏屄肏屄肏屄欧美欧美| 九九热只有精品| 4tube欧美女厕所| 欧美日日人人天天| 99re久久| 日本一级特级毛片视频| 狠狠久久手机视频精品| 中字乱伦AV| 五月丁香| 天天摸夜夜摸| 曰本91情色| 日韩久草| 粉嫩av一区二区三区天美传媒| 亚洲 日本 不卡| 中文字幕青青草| 久久一二三四| 日本免费专区| 99精品视频在线观看| 久久婷婷色综合一区二区三区| 在线观看AV不卡| 人妻一区二区三区| 日本不卡一区二区三区| 久久久久久久唑| 国产高清自拍视频| 欧美日本中字另类在线| 亚洲天堂热| 久久天天摸| 玖玖综合色| 狠操91,com| 青青草一区二区高清无码视频 | 禁十八久久| 亚洲综合电影| 天综合网欧美| 欧美特黄视频网站| 日本乱人伦片中文三区| 国产精品一级毛片不卡视| 中文字幕一区二区三区视频播放| 91精品电影18| 日韩内| 国产91福利小视频在线观看| 丝袜熟女一区二区三区| 亚洲 欧美 中文 日韩超碰| 亚洲最大的黄色电影网站。| 无人区高清电影免费观看一区二区三 www.qmcai2.com | 91九色首页| oumeizonghese,www| 熟妇人妻丰满久久久久久久无码| 俄罗斯一区二区视频在线观看| 午夜福利视频在线一区| 综合网欧| 亚洲中文字幕熟女| 色性欧美| 亚洲中文字幕网| 好吊色一区| 精品十八在线观看| 91爆操视频| 麻豆黄四叶草网站| 97天堂| 小情侣高清国产在线视频| 后入 亚洲 美女 射| 超碰 国产熟女精品一区| 香蕉国产精品麻豆亚洲欧美日韩| 久久9视频| 97视频在线视频| 99视频这有这里有精品| 顶级少妇BT天堂| 情色图区| 久草视频分类在线| 91热色| 欧美日韩性爱无码| 91综合国产精品| 国产精品不卡一区二区三区av| 日本在线一二| 国产偷拍网站| 蜜臀精品1区2区| 97狠狠| 久久XX| 中文字幕av一区二区三区人妻少妇| 亚洲黄片免费在线播放| 亚欧美天堂在线| 久久综合九色综合欧洲98| 国产少妇肉丝在线观看| 好爽视频在线观看视频 | 久久久久久免费电影| 国产精品婬乱一级毛片彝族| 欧美男人的天堂| 久久综合五月天| 国产美女自拍视频| 99国内精品| 亚洲97| 91丝袜美女| 日韩免费在线观看不卡| 99爱爱| 亚洲图片欧洲图片aⅴ| 亚洲熟女偷拍在线观看| 亚洲中文一区二区三区视频| 天天天干977| 26uuu国产| 9久久久久| 天天看片天天爽| 91福利网在线观看| 久草男人天堂| 天天天天干| 欧美亚洲中文| 中文字幕视频免费| 床上啊啊啊一区二区三区| 亚洲人天堂| 日本丝袜美腿人妻九九| 干日本人少妇午夜寂寞影院| 亚洲天堂一二| 久久久久网站-538在线视频-欧美永久乱码 | 乱伦av麻豆| 哈哈操 大香蕉| 91neishe| 免费看A片毛毛片在线播| 欧美人妻一区二区| 日韩欧美成人大香蕉| 最新av网站在线观看| 久久精品一区二区三区蜜桃臀| www.超碰在线| av在线观看不卡网站| 日本三级精品| 日韩美女,国产传媒,视频一区| 无码自拍SM| 成人五级久久| 97超碰美女| 国产第二页| 激情婷婷丁香| 黑人无码一区二区| 人妻二区| 日本色日夜干| 亚洲a色| 啊啊啊好舒服视频在线观看| 欧美 亚洲 制服 精品| 国产日韩区| 青娱乐啪啪视频| 日本精品九九九| 国产超碰在线一区| 96精品在线| 国产真实野战在线视频| 人人摸人人添人人操 | 性开放中文AV高清无码免费看| 超碰美国| 四虎在线视频| 熟女一区二区三区四区| 神马久久网| 亚洲,欧美,春色,另类| 92午夜免费福利视频| 欧美18老人禁| 不卡日本一区二区| 美女t无毒不卡不卡| 欧美熟女丝袜| 毛片麻豆91糖心精品毛情片| 97硬碰| 四虎永久在线精品免费网址 | 久久华人网| 天欧美在线| 欧美少妇色综合| 在线天堂999| 日韩99神马视频播放片在线播放| 久久久98网站免费视频| 操碰97| 婷婷色在线| 国产精品老师| 97综合在线| 亚洲Av无码成人精品国产| 国产精品无码久久久久2028| 国产又黄又粗的视频| 精品无码久久久久久久杏吧| 老司机福利青青草| 国产女大学生AV| 婷婷久月| 韩国三级一线观看久| 91欧美 | 欧美在线第五页| 亚洲综合校园春色| 99re在线视频国产| 一本色道久久综合亚洲二区三区| 日本不卡免费二区| 欧美综合色,www| 男女啊啊啊啊啊| 日本女人久久久| 精品九九九九| 一区操逼| 日本熟妇人妻中出视频| 日本道久久综合色色| 亚洲熟女av日韩熟女| 天天干人妇| 欧美日韩成人| 狠狠搞 亚洲91| 嗯嗯啊啊好大好爽| 国际精品久久久| 中文字幕在线观| 欧美一区二区三区不卡高清视频 | 亚洲少妇在线影音| av橘色网站| 亚洲欧洲激情卡通另类文学四射小说网站 | 大香蕉青青9| 蜜臀无码一区二区| 诱惑网综合| 午夜激情床戏激情| 亚洲第一二区另类图| 激情文学小说一区二区 | 亚洲熟妇乱女区二区三区| 97中文字幕色| 青青草色AV| 欧美组图日韩亚洲中文字幕| 欧洲成人性爱视频| 91爽啪| 综合91网| 国产一区二区二区按摩精品啪视频| 色悠悠伊人网五月天| 天天伊人| 人人操人人操草草| 五月天开心网| 成人日本精品九区| 0755午夜福利视频| 国产高清成人mv在线观看| 97干在线视频| AND人妻系列| 欧美三级偷拍| 激情国产乱伦Av| 久久婷婷一区二| 久久噜| 国产在线能看的你懂的| 九九久久99| 嗯嗯嗯啊啊啊干死我吧| 摸奶性爱视频网站在线免费播放| 久久艹逼视频| 国产少妇高潮| 搡老熟女免费视频| 婷婷五月天小说| 夜夜嗨免费视频| 91香蕉视频在线观看免费| 精品少妇后入一区二区三区四区人妻巨乳| 九九拍拍精品视频在线播放| 男人天堂资源| 91chinese在线| 欧美综合传媒| 国产成人精品无码久久| 玖玖综合色| 97色97干| 麻豆天美久久91| 久久亚洲一区二区色婷婷| 精品一区二区成人| 激情小说亚洲图片| 国产成人精品无码久久| 麻豆成人av| 日本爽爽爽爽爽爽免费视频| 99re这里只有精品中心播放| 91狠狠综合网| 欧美中文字幕男人天堂久久精品| 婷婷午夜清品久久久久久久性色视频观| 国产精品欧美日韩久久| 久操网在线| 欧美色视频在线| 国产一区二区三区,在线观看观看| 99亚洲国产精品色一区二区三区| 欧美亚男人的天堂| 少妇高潮流水av免费| 在线天堂999| 动漫片子网站3黄| 色综91| 91超碰人人| aa片毛片| 国产成自自拍在线观看| 日本狂喷奶水在线播放212| 色欲人妻一区二区在线| 日本操色导航| 夜夜国自区| 中文字幕一区日韩精| 99999亚洲另类| 人妻加勒比东京热| 天天做天天爱夜夜爽毛片试看| 一区中文字幕二区日韩| 琪琪精品免费一区二区三区 | 亚洲天堂精品日韩电影| 亚洲丝袜色图| 国产AV无码AV| 日本大香蕉综合网红本杳社区| 五月激情小说| 国产91影院| 九九国产| 丁香五月婷婷基地| 欧美大香蕉久| 免费国产| 红桃视频高潮| 六月婷婷综合| 中文字幕日韩专区精品系列| 亚洲影视第一页| 日韩欧美视频青青| 蜜乳av一区二区| 欧美淫乱视频| 亚洲不卡av在线| 久久久久久国产无码精品| 日韩九九九| 另类图片亚洲加勒比另类图片亚洲加勒比另类图片亚洲加勒比 | 亚州国产成人精品女人久久 | 亚洲激情欧美色图 | 丝袜美腿丝袜| 欧美综合制服在线| 男人天堂2012| 天堂中文资源在线bt| 青娱乐91| 乱操9999| 超碰精品| 国产天美欧美| 国产精品熟女乱伦| 少妇人妻好深太紧了vr91| 久热这里只有精品9| 日韩精品9999| 亚洲91极品| 人妻乱仑一区二区三区| 久久成人国产精品| 亚洲天天操| 伊人嫩草| 偷拍色图| 日韩啪啪啪视频| 97超碰碰碰| 最新国产精品久久精品| 大学生口爆吞精| 男人的天堂久久久| 少妇精品| 91久久久久| 欧美大色交| 欧美激情片一区二区| 蜜臀久久久久久999| 亚洲精品美女久久久久久久久| 97资源视频| 四虎精品永久在线播放| 丰满人妻一区二区三区四区| 黑白配性爱AV成| 天天热精品| 加勒比东京热五月天天堂网| 久久鲁夜| 少妇三P| 色婷婷在线视频精品导航| 五月色综合| 综合一区中亚洲国产成人综合精品| 不卡av在线中文字幕| 中文字幕天堂在线| 影音先锋每日最新资源在线观看| 少妇久久久久久久久| www.男人的天堂| 超碰色图| 亚洲天堂欧美| 人妻一区二区三区四区视频| 国产无码久久高清| 精品人妻一区二区三区四区石在线| 天天欧美| 国产精品com| 国产精品久久久久无码Av网曝门| 日韩av在线精品观看| 欧美第一页| 欧美黄色手机在线观看| 欧美成人A√在线一区二区| 午夜人人操| 一区二区三区亚洲| 美国人人操人人操| 亚洲欧美国产其他二区| 99热精品在线播放| 116美女午夜| 物尤视频一区二区| 91久久久久久久| 色网亚洲人| 亚洲丝袜诱惑| 国产精品原创巨作?v网站| 韩国成人精品久久久免费看| 性爱av网站| 少妇超碰在线| 大香蕉国产中文自拍| 天天色踪合| 大逼色网站| 欧美夜夜草视频| 日本熟女中文字幕一区| 日韩午夜啪啪视频| 国内精品久久国产,www香蕉久久五月丁香,亚洲欧美日韩精品永久在线,日本精品一 | 欧美丝袜亚洲| 台湾一区国产高清在线| 亚洲国产成人精品无码专区| 五月天伊人| 91美女视频在线| 九99久久| 午夜男女爽爽大片免费观看| 浪人综合网| 91无人区卡一卡二卡三乱码入口最新版:能让用户有更多选择的选择-经典说说-爱 | 西西美女视频网| 久久婷婷苹果| 久久性爱视频99| 偷看洗澡一二三区美女| 久久亚洲天天做| 亚洲丝袜二区在线| 亚洲性爱电影| 日韩欧美女优电影| 久久成人午夜狠狠| 日韩av在线精品观看| 亚洲日韩成人性爱视频| 九九九九日本 | 国产欧美日韩一区二区三区| 久久乐| 久久久内射良家| 欧美 精品国产制服第一页| 性爱av在线免费观看| 亚洲中文字幕日产无码久久| 男人的天堂免费| 操逼视频亚洲| 国产25页| 日B操| 天美麻豆精品视频99| 日产成人久久| 日韩操逼HD| 精品久一区免费| 天天色综合影视网| 国产乱人伦AVA麻豆软件.| 大吊色| 亚洲 暴爽 AV人人爽日日碰| 九月婷婷久久| 91精品操美女| 成人三级片无码| 亚洲黄a三级三级三级看三级| 国产高清自拍视频| 日本韩国一本产品小视频日本韩国一本产品久久久产品小视频日本韩国一本产品久 | laoshunv91| 国产精品无码成人精品| 99久久无色码| 蜜臀久久99精品久久久| 日本 欧美 亚中文字幕| 久久九九97| 久久久 国产精品| 日日妻色网| 人妻人人做人人澡人人爽欧美一区| 日本不卡二三区| 午夜男女爽爽爽影院视频| 香蕉99秘 精品一区丁香| 国产精品操| 日本超碰在线国产一区| 亚洲日韩天堂| 大香蕉 222| 无遮挡又黄又刺激的视频| 国产精品小视频一区二区三区| 久草新在线| 殴美性色a级欧美| 亚洲人成在线放东京热| 一牛影视久久久一区二区三区| 色欲av国内精品久久久久久| 青青草在线成人视频| 91精品国产91综合久久蜜臀| 吉川爱美98堂在线| 日韩图区 偷拍| 男人的天堂日韩| 日本三级R| 亚洲资源一区| 九一综合精品视品av| 五月天久久综合网| 亚洲清纯唯美| 色五月亚洲| 家庭乱伦麻豆| 蜜臀久久99精品| 性爱乱伦一区| 91天天综合日韩欧美| 性色高清在线| 人妻中文字幕日韩电影| 99re6在线视频播放免费精品| 校园春色综合| 亚洲自拍天堂| 欧美熟妇色| 青青草视频在线观看一区二区| 国产精品亚洲一级av第二区| 中出20p| 99精品丰满人妻无| 人人人人插| 60秒不遮不挡| 爱爱久久| 欧美另类色图片| 九月丁香婷婷色| 精品日日人妻| 97精品国产97久久久| 一二三四视频在线社区中文字幕| 淫色网综合| 亚洲熟女av中文字幕| 天天综合欧美综合| 国产精品成人无码av| 91狠狠综合| 91黑丝操| 好爽,再快点啊哈嗯嗯嗯嗯| 超碰成人最新最好看| WWW4虎| 超碰碰97| av资源在线观看少妇| 人妻精品视频一区二区三区| 丰满人妻一区二区中文| 神马视频久久久久久| 福利伊人玖玖国产| 操国产高清| 在线色资源| 欧美人妻色| 一本道综合色图| 国产成人亚洲精品无码古代早漏男| 91九色丨风韵犹存| 久久精品成人一区二区三区蜜臀| 欧洲免费一区二| 婷婷丁香五月激情啪啪| 欧美大香蕉同搞| 日韩有码 一区二区三区| 亚洲无码一区成人免费午夜| 中文字幕、久久精品国产2020、久久综合久久自在自线精品自、亚洲 | 国产操操日韩三级黄| 一区二区乱码福利| 少妇的嫩逼图片| 搡老女人老91妇女熟女| 2019天天操天天爽天天拍| 囯产精品一区二区三区线|亚洲人成无码网WWW动漫|国产精品免费一级... | 蜜乳AV一区二区三区四| ,成人免费啪啪视频| 91丝袜在线观看| 欧美性性性| 亚洲第一视频 欧美风情 日韩| 色麻豆AV| 欧美 亚洲 另类 综合| 欧美日韩黄色片一区二区三区四区人与兽做爱 | 亚洲精品三区在线观看| 免费成人在线观看91| 亚洲欧美综合| 国产一国产一级毛片古装| 一区二区影视| 亚洲资源站| 91 丝袜在线播放| 天天干18禁| 啊啊啊好舒服视频| 96精品久久| 狠狠超| 国产在线视频午夜精华在| 欧美黑人极品高潮喷吹熟女黑人性暴力日韩在线欧美极品一区二区老师黑人潮喷一 | 天天拍夜夜| 亚洲97精品| 精品午夜福利导航| 亚洲日韩在线a不卡99精品| 天天视频黄| 午夜激情成人在线观看| 伊人久久综合精品欧美| 人妻aa| 中文字幕在线高清男人的天堂| 午夜男人一级A片7777| 天天做天天爱| 九九玖玖精品| 美女AV一区二区| 蜜臀aV午夜一区二区三区| 大香蕉2017| 亚洲黑人在线| 免费一级精品啪啪视频| 国产精品一级片在线看| 婷婷五月综合在线| 97操97色| 性交一区二区在线播放| 密臀成人视频久久久| 超碰97 线线 在现| 在线人成亚洲视频免费观看| 性久久| 五月天婷婷久久| 日本免费一区二| 国产精品丝袜久久亚洲不卡| 久艹免费| 无码操逼视频一下| 亚洲无码AV九九九| 日韩国语字幕| 超碰1997| 亚洲自拍97| 九色精品视频导航1| 色综合色色| 天天干天天日天天射黄色片| 久久精品无码熟妇一区二区三区视频导航 | 久久久91福利姬| 9久精品| 日本一区二区不卡精品| 91色女| 超碰在线成人电影| 色网站导航大全| 国产亚洲综合欧美一区| 91人妻视频| 97资源亚洲| 操逼1区| 精品.99999| 99草精| 波多野42部无码喷潮在线观看| www.99热| 久久影视二区三区行押| 少妇一级无码精品| 久久怡红院| 国产精品国产| 狠狠色伊人亚洲综合网站色| 丁香五月激情五月| 锕锕好爽 死我在线观看| 在线午夜成人无码视频| 性一交一乱一交A片久久四色| 蜜臀99999| 亚洲一二三四区| 少妇滛荡视频| 60秒免费小视频| 放黄片放3级黄片没穿衣服| 精品成人av一区二区三区在线| 伊人久久大香蕉线AV五月天| 亚洲久久久| av在线资源| 欧美在线|亚洲| 中文字幕一二区二三区人妻专区| 久久熟女人| 亚洲成人ab| 凹凸视频特色日本特黄| 蜜乳av一区二区三区| 自怕偷自怕亚洲精品| 99re这里只有精品3| 花花AV导航| 大香蕉婷婷| 亚洲 日本 不卡| 久久丁香五月天| 精品在线78| 日本欧美国内在线| 老鸭窝成人| 凹凸视频特色日本特黄| 久久宗合97| 爱媛媛久久国产福利| 黄色一区三区| 亚洲av淫乱| 亚洲欧美91√| 操逼逼无码| 婷婷10月天青娱乐| 九九激情网| 91精品人妻一品二品三品| 婷婷操逼| 夜夜嗨视频| 天堂日本亚洲欧美| 日韩精品中文字幕人妻| 黑人中出21连凳花野真衣| 午夜啪| 97天天操天天干| 精品人妻一区二区视频| 欧美日韩天堂| 国产精品久久伊人| 亚洲天堂男| 久草精品热视| 亚洲无码成人精品| 久久亚洲色图中文字幕| 日韩女模中文造逼| 加勒比中文av| 夜夜爽妓女| 日本东京热加勒比久久| 欧美日韩精品久久久久东北老熟妇| 国产成人精品日本亚洲语言| 9Ⅰ超碰| 国产视频一区二区三区久久亚洲天堂| 男女做爰猛烈动高潮A片免费应用 少妇厨房愉情理伦片bd在线观看 不卡中文字幕aⅴ在线 | 肥臀熟女一区二区三区视频| 九九综合| 中国AV美女| 综合大香蕉美。| 国产按摩一区二区三区| 久久精品国产亚洲妲己影视| 亚洲国产中文字幕| 久久性爱视频| 欧美日韩黄片精品在线| 91无码人妻| 中文字幕在线播放2中文字幕在线观看2| 精品久久久久久中文字幕视频免费| 国产极品久久久| 免费啪啪啪网站18岁| 亚洲97| 日产成人久久| 精品无码一区二区| 亚洲蜜桃V妇女| 亚洲美女av无码| 大香蕉92| 欧洲中文字幕| 激情久久av一区av二区av| 久久产精品一区二区三区电影| 青青伊人这里只有精品| 亚洲有码 视频一区| 国产精品无套内谢| 热99这里有精品综合久久 | 黄色视频特级毛片| 人妻天天爽天天爽三区| 亚州大图综合色图| 蜜桃久久久久久| 色综合色欲色综合色综合色综合| 天天上日日上日韩精品| 后入人妻无码| 久久久九九九九| 色穴精品| 丁香五月电影| 日韩精品 视频一区二区| 91精品人| 九九九九亚洲| 精品妇操一区二区三区| 欧美日本久久精品一区 | 97chaopenrihan| 97视频在| 丰满少妇一区二区三区专区| 色爱综合网| 精品一区二区成人| 精品久久久久久中文字幕三区| juliaann欧美丝袜办公室| 啊啊啊啊啊啊啊啊啊在线观看| yirendaxiangjiashipin| 色色色欧美| 日韩欧美亚洲一区二区三区影院 | 欧美性暴力猛交XXXX| 乱精品一区字幕二区| 国产在线精品偷| 亚洲欧综合另类无码一区| 天天操人人操狠狠插| av亚欧| 精品78| 欧美色图亚洲色| 日本精品一区二区不卡| 国产丁香精品露脸视频| 亚欧美色图| 精品国产综合久久福利,热99这里有精品综合久久,99热这里只有免费国产精品,精 | 丁香五月综合| 久久久久9| 国内毛片免费h片在线| 熟女色综合久久| 男女激情黄色网址| 国产 亚洲 丝袜 制服| 在线观看免费视频国产| 国产女人高潮嗷嗷嗷叫小说| 久综合国内精品自在自线| 伊人一级免费黄片| 亚洲国产精品成人综合| 人人模人人看| 内射老妇BBWX0C0CK| 无码一区免费在线不卡| 女同性恋一区二区三区精品视频| renqi久久久久久久久久久久| 99色热| 蜜臀久久99精品久久综合| 男人的天堂2019AV| 天天看片天天爽| 欧色综合| 青青欧洲黑| 本道在线| 国产精品丝袜在线| 欧美黑人熟妇精品91| 亚洲情色欧美| 少妇厨房愉情理伦片bd在线观看| 亚洲精品乱码线路中文字幕| 天天色,天天干,天天干| 日本精品不卡一二三区| 丁香婷婷久久 | 成人老鸭窝人人在线视频| 精品十三区| 久久九操在线观看| 天天摸天天操视频| 秋霞Av理论一级在线| 日本1区2区不卡视频| 少妇干B| 五月婷丁香| 亚洲av总站| 色97综合中文字幕| 东京热天堂网| 欧美日韩国产黄色片| 亚欧国产无码精品在线| 午夜精品一区二区三区三上悠亚| 夜夜嗨AV蜜臀av| 国产后入清纯| 亚洲一区二区在线观看91| 欧美日韩亚洲一区二区在线观看| 欧美 亚洲 偷拍自拍| 美腿色图| 欧美精品欧美精品系列| 97超碰护士| 国产精品无码av| 口爆综合网| 中文字幕在线2| 青青色在线观看| 一级特级aaaa毛片免费观看| 男人的天堂网免费| 亚洲色图 图片| 久久久中文| 亚洲性爱无码乱伦av| 亚洲不卡不卡中文字幕不卡| 91亚洲狠狠色| 免费看黄片现成| 色一情一乱一乱一区91Av| 99精品热| 亚洲开心网| 伊人女女资源在线观看| 精彩国产视频播放1区2区| 天天综合网~91| 天天看天天在线精品| 日韩有码免费视频| 亚洲加勒比色图| 国产精品成人无码a v毛片| 亚洲少妇色| 啊啊在线| 啪一啪免费视频| 91色图片| 91女在线观看| 久热网| AA特级绝黄| 上床不卡网站| 亚洲色欧美| 屌色在线97视频| 97精品视频在线播放| 日日日日做夜夜夜夜无码| 极品五月天噜噜| 成人AV在线网站| 国产www色在线观看| 国产精品 午夜福利| 偷拍亚洲| 综合网欧美在线| 超碰久久.com| 女同性恋久久| 欧美日韩另类字幕中文| 在线中文字幕| 射丝袜高跟鞋99| 91麻豆天美| 欧美黄页在线| 97色综合中文网| 五月激情综合网| 天躁夜夜躁2021| 丁香五月婷婷基地| 天天久久久久久| 中字乱伦AV| 嗯嗯不要 视频| 欧美很很操视频| 欧美色图99| 综合网色| 91老司机精品| 91一区二区| 欧美成人性活片| 亚洲精品一区二区三区新线路| 免费国产视频| 久久a久久| 人妻9117c| 大香蕉99热| 中文字幕在线观看永久| 亚洲91网站| 在线观看色视频| 国产天天噜一噜久久久| 极品尤物在线观看| 国产精品久久久久久久久久久久久久| 人妻久久久久久| 97亚洲精品| 女人一区| 色情乱伦AV| 亚洲欧洲日韩中文字幕一区| 狠狠穞A片一區二區三區| 91综合站| 狠狠干精品一二三四五六2022| 天天干天天燥| 天天日熟妇| www.婷婷| 操逼视频国产无套| 狠狠爱AV| 天天爽天天操| 欧美欧美啪啪视频| 天堂资源站| 天天爽天天操| 澳门黄片一香蕉视频| 欧美国产操逼| 大香交伊人网| 久久久久久亚洲Av无码| 欧美在线|亚洲| 日本久操视频| 人妻 丝袜美腿 中文字幕| 亚洲第一视频 欧美风情 日韩| 天天透伊人| 国产av又色又爽又黄| 老熟女综合网| 亚洲天堂自拍| 超碰人人在线| 欧美人人曰人人操人人射射 | 99热综合| 91成人高清在线观看| 精品大全99999| www.操| 亚洲AV永久无码一区仙野| 极品国产内射| 伊人在线大香蕉二。| 天天透伊人| 亚洲色 国产 欧美 日韩| 欧美第二页| 国产一区二区在线播放,久久亚洲精品中文字幕第一区,亚洲精品在线中文字幕视频 | 久久最新视频免费观看| 十八禁视频网站| 69少妇一区二区| 日日摸日日碰夜夜爽视频| 欧美 牲| 日本熟妇熟色97一本在线观看| 思思热国产在线视频| 91黑丝在线| 后入日本1234| 乱码熟妇人妻久久久| 激情文学网伊人| 被体育老师抱着c到高潮| 强奸乱伦 亚洲一区| 日本韩国五十路六十路七十路老熟女作爱视频网站| 吉川爱美98堂在线| 丁香五月偷拍| 精品国产乱码久久久久久口爆网站| 在线视频免费观看午夜| 啪啪啪男女亚洲中文字幕99| av久日| 久久少妇视频| 97操97色| 正在播放:深夜激情大战,自带黑丝袜全力输出骚穴 | 精品国产三级av韩国在线| 色噜噜日韩精品| 久久视频,这里只有精品| 亚洲av热热色| 欧美 中文字幕 一区| 六月色婷婷| 亚洲精品亚洲人成人网| 人人操超碰在线| 国产精品麻豆视频网站| 成人毛片免费| 97免费视频在线| 午夜噜噜噜| 天美久久久久| 九色 蝌蚪 熟女自| 国产丸一视频| 韩日精品福利视频一区不卡在线免| 亚洲人在线| 成人熟女视频一区二区三区| 国产91美女高潮| 国产精品交换一区二区| 久9热| 91精品黄在线观看| 无码伊人久久大杳蕉中文无码| 色yeye成人免费视频| 上海一级黄片| caoni国产亚洲av| 国产精品色片一区二区| 亚洲av影音先锋| 国产精品一级毛片不卡视| 啪啪免费| 亚欧性爱ab| 久草视频分类在线| www色色com| 国产亚洲一黄| 99丝袜福利在线播放| 欧美精品成人亚洲| 91人妻视频在线| 国产成自自拍在线观看| 夜草欧美| 蜜桃精品视频一区二区三区| 欧美 日韩第一性色|