化學(xué)習(xí)框架)
標(biāo)題Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning來源arXiv, 2608.16554v1?文章簡介研究問題當(dāng)用戶查詢?nèi)鄙俚贸鑫ㄒ淮鸢杆璧年P(guān)鍵前提時大語言模型應(yīng)如何避免幻覺并做出有用響應(yīng)主要貢獻(xiàn)論文提出了ACA-RL框架及MPB基準(zhǔn)通過結(jié)構(gòu)化獎勵訓(xùn)練模型在信息缺失時主動詢問、條件化回答或棄權(quán)。重點(diǎn)思路構(gòu)建推理圖引導(dǎo)的數(shù)據(jù)合成流水線將良構(gòu)問題轉(zhuǎn)化為帶有局部缺口標(biāo)注的缺失前提訓(xùn)練實(shí)例生成12萬條高質(zhì)量數(shù)據(jù)。設(shè)計(jì)包含五種行為分類的結(jié)構(gòu)化獎勵函數(shù)優(yōu)先獎勵主動詢問和條件化懲罰幻覺和無支持猜想。引入人工驗(yàn)證的MPB基準(zhǔn)涵蓋數(shù)學(xué)、邏輯及現(xiàn)實(shí)場景用于評估模型識別欠定任務(wù)及處理不確定性的能力。采用冷啟動SFT結(jié)合PPO算法進(jìn)行訓(xùn)練平衡缺失前提魯棒性與常規(guī)推理能力避免過度拒絕導(dǎo)致的性能下降。分析總結(jié)ACA-RL在MPB及第三方不可答基準(zhǔn)上顯著優(yōu)于Vanilla PPO和IDK-RL證明僅靠答案導(dǎo)向的RL無法有效處理缺失前提。模型行為呈現(xiàn)階段性演變早期快速學(xué)會棄權(quán)后期逐漸轉(zhuǎn)向更具信息量的條件化表達(dá)和主動詢問超越了簡單的“我不知道”。在保持GSM8K、AIME等常規(guī)推理任務(wù)競爭力的同時ACA-RL未出現(xiàn)嚴(yán)重的過度拒絕現(xiàn)象LiveBench得分與基線持平。推理圖引導(dǎo)的合成數(shù)據(jù)比隨機(jī)截斷或現(xiàn)有不可答數(shù)據(jù)集更能提升模型對邏輯缺口的敏感度及行為得分。個人觀點(diǎn)論文重新定義了推理模型的成功標(biāo)準(zhǔn)從單純追求正確答案擴(kuò)展到識別任務(wù)欠定性并建設(shè)性響應(yīng)核心突破是將模糊的“不確定性”拆解為可優(yōu)化的具體行為層級。