言模型KV緩存塊拷貝API)
CopyKvBlocks【免費(fèi)下載鏈接】geGEGraph Engine是面向昇騰的圖編譯器和執(zhí)行器提供了計(jì)算圖優(yōu)化、多流并行、內(nèi)存復(fù)用和模型下沉等技術(shù)手段加速模型執(zhí)行效率減少模型內(nèi)存占用。 GE 提供對(duì) PyTorch、TensorFlow 前端的友好接入能力并同時(shí)支持 onnx、pb 等主流模型格式的解析與編譯。項(xiàng)目地址: https://gitcode.com/cann/ge產(chǎn)品支持情況產(chǎn)品是否支持Atlas A3 訓(xùn)練系列產(chǎn)品/Atlas A3 推理系列產(chǎn)品√Atlas A2 推理系列產(chǎn)品√Atlas A2 訓(xùn)練系列產(chǎn)品x函數(shù)功能PA場(chǎng)景下通過(guò)block列表的方式拷貝KV Cache。支持D2DD2HH2D的拷貝。D2D場(chǎng)景主要是針對(duì)當(dāng)多個(gè)回答需要共用相同blockblock沒(méi)填滿時(shí)新增的token需要拷貝到新的block上繼續(xù)迭代。H2D和D2H的拷貝主要用于對(duì)應(yīng)block_index上Cache內(nèi)存的換入換出。函數(shù)原型Status CopyKvBlocks(const Cache src_cache, const Cache dst_cache, const std::vectoruint64_t src_blocks, const std::vectorstd::vectoruint64_t dst_blocks_list)參數(shù)說(shuō)明參數(shù)名稱輸入/輸出取值說(shuō)明src_cache輸入源Cache。dst_cache輸入目的Cache。src_blocks輸入源Cache的block index列表。dst_blocks_list輸入目標(biāo)Cache的block index列表的列表一組src_blocks可以拷貝到多組dst_blocks。調(diào)用示例Status ret llm_datadist.CopyKvCache(src_cache, dst_cache, {1,2}, {{1,2},{3,4}})返回值LLM_SUCCESS成功LLM_PARAM_INVALID參數(shù)錯(cuò)誤其他失敗約束說(shuō)明該接口調(diào)用之前需要先調(diào)用Initialize接口完成初始化。不支持Host-Host的拷貝?!久赓M(fèi)下載鏈接】geGEGraph Engine是面向昇騰的圖編譯器和執(zhí)行器提供了計(jì)算圖優(yōu)化、多流并行、內(nèi)存復(fù)用和模型下沉等技術(shù)手段加速模型執(zhí)行效率減少模型內(nèi)存占用。 GE 提供對(duì) PyTorch、TensorFlow 前端的友好接入能力并同時(shí)支持 onnx、pb 等主流模型格式的解析與編譯。項(xiàng)目地址: https://gitcode.com/cann/ge創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考