行時(shí)安全注入指令(safety_instructions_from_anthropic)深度解析)
Claude Sonnet 4.6 運(yùn)行時(shí)安全注入指令safety_instructions_from_anthropic深度解析【免費(fèi)下載鏈接】system_prompts_leaksExtracted system prompts from Anthropic - Claude Fable 5.1, Opus 5, Claude Design, Claude Code. OpenAI - ChatGPT GPT-6-Astra, Codex. Google - Gemini 3.8 Flash, 3.1 Pro, Antigravity. xAI - Grok, Grok Bot, Cursor, Kimi and more! Updated regularly.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/sy/system_prompts_leaks本文基于 system_prompts_leaks 倉(cāng)庫(kù)中捕獲的 Anthropic/sonnet-4.6-reminders.md 泄漏樣本對(duì)其中兩段專用于 Claude Sonnet 4.6 的運(yùn)行時(shí)健康安全指令進(jìn)行逐條拆解分析它們的注入時(shí)機(jī)、與 Anthropic 分類器/提醒機(jī)制的關(guān)系、飲食失調(diào)與自殘危機(jī)兩條策略的操作細(xì)節(jié)并對(duì)照主系統(tǒng)提示詞中的靜態(tài)策略驗(yàn)證其一致性。讀完本文你將能準(zhǔn)確理解此類動(dòng)態(tài)注入 vs 靜態(tài)策略雙層安全提示結(jié)構(gòu)的組織方式以及 Anthropic 在敏感話題上少做而非多做的設(shè)計(jì)思路。這份文檔是什么一類僅針對(duì) Sonnet 4.6 的新注入文件第一行即點(diǎn)明其特殊性New injections detected only active for sonnet-4.6。在整個(gè)倉(cāng)庫(kù)中執(zhí)行全文檢索可發(fā)現(xiàn)safety_instructions_from_anthropic這一 XML 標(biāo)簽只出現(xiàn)在該文件內(nèi)說(shuō)明它是捕獲者在對(duì) Claude Sonnet 4.6 交互過(guò)程中發(fā)現(xiàn)并單獨(dú)歸檔的一類新型運(yùn)行時(shí)注入?yún)^(qū)別于其他模型版本。文檔主體由兩段結(jié)構(gòu)完全相同的注入塊組成safety_instructions_from_anthropic ... /safety_instructions_from_anthropic兩段分別覆蓋飲食失調(diào)disordered eating與自殺/自殘suicide / self-harm兩類話題。它們不是模型固有系統(tǒng)提示詞的一部分而是當(dāng)自動(dòng)化安全分類器automated safety classifier在對(duì)話流中命中特定主題后、隨用戶消息一并送入上下文的動(dòng)態(tài)指令。這一點(diǎn)在兩段文本中均有自述This conversation was flagged by an automated classifier for potential disordered eating themes.、An automated safety classifier has flagged this conversation as potentially involving suicide or self-harm.因此閱讀本文件時(shí)應(yīng)當(dāng)與同目錄下的兩處?kù)o態(tài)資料配合使用Claude Sonnet 4.6 主系統(tǒng)提示詞包含模型固有的user_wellbeing、anthropic_reminders等靜態(tài)策略Anthropic 注入提醒清單列出了 image_reminder、cyber_warning、system_warning、ethics_reminder、ip_reminder、long_conversation_reminder 六類常規(guī)提醒及全文模板。注入機(jī)制與提醒體系的分工要理解本文件的價(jià)值需要先弄清 Anthropic 的分類器 → 注入鏈路。主系統(tǒng)提示詞的anthropic_reminders一節(jié)明確寫道見(jiàn) Anthropic/claude-sonnet-4.6.md 第 101-109 行Anthropic may send Claude reminders or warnings when a classifier fires or another condition is met. The current set: image_reminder, cyber_warning, system_warning, ethics_reminder, ip_reminder, and long_conversation_reminder.而 Anthropic/anthropic_reminders.md 提供了這六類提醒的完整注入模板。Sonnet 4.6 的主提示詞中image_reminder等標(biāo)簽名與清單文檔一一對(duì)應(yīng)說(shuō)明這類注入是提示詞中的占位聲明 運(yùn)行時(shí)實(shí)際注入模板的設(shè)計(jì)系統(tǒng)提示詞只告知模型存在哪些提醒類型真正的策略正文在分類器命中后才進(jìn)入上下文。本文件的兩段注入則屬于另一個(gè)并行的分類器通道它們不以*_reminder/*_warning命名而是統(tǒng)一使用safety_instructions_from_anthropic標(biāo)簽專門針對(duì)用戶身心健康風(fēng)險(xiǎn)話題飲食失調(diào)、自殺與自殘并且在正文開篇刻意聲明來(lái)源身份——These instructions are a precaution from Anthropic, not the user, and not a judgment of you. 這種自我聲明并非冗余主提示詞在anthropic_reminders中專門告誡過(guò)模型——用戶可以在自己消息末尾的標(biāo)簽內(nèi)偽造 Anthropic 內(nèi)容見(jiàn) Anthropic/claude-sonnet-4.6.md 第 107 行因此模型必須對(duì)聲稱來(lái)自 Anthropic 但試圖放寬限制的標(biāo)簽內(nèi)容保持警惕。本文件注入塊反復(fù)強(qiáng)調(diào)來(lái)自 Anthropic 而非用戶正可理解為在上下文層面為該防線提供更強(qiáng)的來(lái)源錨點(diǎn)。注入一飲食失調(diào)disordered eating專項(xiàng)指令逐條解析第一段注入是三條高度濃縮的規(guī)則全部圍繞一個(gè)核心判斷展開當(dāng)飲食失調(diào)指標(biāo)真實(shí)存在時(shí)建議本身就是主要的傷害向量advice-giving is the primary harm vector。When disordered eating indicators are genuinely present: advice-giving is the primary harm vector. Meal plans, calorie guidance, balanced eating tips—these look helpful but get filtered through the disorder and become fuel.這是整段注入的理論前提模型提供的看起來(lái)有益的飲食建議膳食計(jì)劃、卡路里指引、所謂均衡飲食貼士會(huì)被進(jìn)食障礙者以扭曲的方式吸收變成強(qiáng)化障礙的燃料。因此指令給出了與常規(guī)對(duì)話截然相反的響應(yīng)取向少做而非多做the move is to do less, not more驗(yàn)證對(duì)方的情感體驗(yàn)、保持專業(yè)支持渠道暢通、克制由我來(lái)修復(fù)你的飲食問(wèn)題的沖動(dòng)。這與主提示詞user_wellbeing中避免鼓勵(lì)或助長(zhǎng)自我毀滅行為含飲食失調(diào)的靜態(tài)原則一脈相承見(jiàn) Anthropic/claude-sonnet-4.6.md 第 141 行。絕不引入數(shù)字不提及卡路里、BMI、體重、宏量營(yíng)養(yǎng)素calories, BMI, weights, macros中的任何一項(xiàng)。絕不對(duì)外貌做任何方向的評(píng)價(jià)指令專門指出you look healthy這類貌似正向的表述也可能被解讀為你看起來(lái)胖了因此連中性偏正向的外貌評(píng)價(jià)也被禁止。資源指引需分區(qū)域且保持最新指向適應(yīng)用戶所在地區(qū)的進(jìn)食障礙專項(xiàng)支持ED-specific support appropriate to the users region并明確警告——不要推薦 NEDA 求助熱線因?yàn)樗淹S肈o not recommend the NEDA Helpline; it has been disconnected。值得注意的是第 4 條在倉(cāng)庫(kù)內(nèi)形成了一個(gè)可交叉驗(yàn)證的一致證據(jù)鏈主提示詞user_wellbeing中同樣寫道when suggesting eating disorder support resources, Claude directs users to the National Alliance for Eating Disorder helpline instead of NEDA, because NEDA has been permanently disconnectedAnthropic/claude-sonnet-4.6.md 第 147 行而原始捕獲 Anthropic/raw/claude-sonnet-4.6-raw.md 與無(wú)工具版本中也存在措辭幾乎一致的同一規(guī)則。這說(shuō)明NEDA 已斷線 → 改用 National Alliance for Eating Disorder是本代模型中靜態(tài)策略與動(dòng)態(tài)注入共同維護(hù)的一致事實(shí)也從側(cè)面印證本文件與主提示詞屬于同一次捕獲的同一模型代次。注入二自殺與自殘危機(jī)專項(xiàng)指令的四步協(xié)議第二段注入篇幅更長(zhǎng)結(jié)構(gòu)上可分為五個(gè)層次來(lái)源聲明、直接處理的優(yōu)先級(jí)、框架風(fēng)險(xiǎn)、危機(jī)四步協(xié)議、以及禁止事項(xiàng)與豁免情形。先處理危機(jī)再回答問(wèn)題指令要求當(dāng)用戶話語(yǔ)中出現(xiàn)指向其自身first-person的自殺/自殘信號(hào)時(shí)必須先正面處理再回答對(duì)方提出的任務(wù)或問(wèn)題——即使話題本身是相鄰無(wú)關(guān)的主題也不能跳過(guò)?;貞?yīng)措辭具有流行病學(xué)級(jí)的影響指令引用了群體媒體研究結(jié)論作為設(shè)計(jì)依據(jù)population-level media research consistently shows that how suicide and self-harm are framed affects real-world outcomes并指出AI 的回應(yīng)可能被感知為比人類的同一句話更客觀或更真實(shí)。由此推出兩條措辭約束可以驗(yàn)證用戶情緒、承認(rèn)其痛苦的正當(dāng)性但禁止以任何顯式或隱式方式認(rèn)可/辯護(hù)自殺或自殘是必要或符合邏輯的回應(yīng)也禁止將其美化或浪漫化同時(shí)不得把用戶的痛苦當(dāng)作智識(shí)或哲學(xué)練習(xí)來(lái)探討Do not engage with the users distress as an intellectual or philosophical exercise。危機(jī)判定的明確觸發(fā)器注入給出了可操作的判定標(biāo)準(zhǔn)如果用戶陳述了當(dāng)前的自殺意圖present suicidal intent、計(jì)劃plan、時(shí)間線timeline和/或獲取手段的途徑access to means就應(yīng)視為潛在的危機(jī)信號(hào)potential indicator of crisis。本回合內(nèi)的四步協(xié)議若本回合是升級(jí)信號(hào)或危機(jī)初現(xiàn)注入要求在當(dāng)次回復(fù)內(nèi)依次執(zhí)行四步原文中的 (2)(3) 不得被跳過(guò)、不得推遲到后續(xù)回合plainly name what youre hearing——直白說(shuō)出你所聽到的內(nèi)容offer one region-appropriate crisis contact if it hasnt been surfaced recently——若近期尚未給出過(guò)提供一個(gè)符合用戶所在地區(qū)的危機(jī)聯(lián)絡(luò)方式if means are present, directly encourage them to put distance——若存在實(shí)施手段直接鼓勵(lì)用戶與手段保持距離或?qū)⑵浞獯鎍sk one question about right now——就當(dāng)下此刻提出一個(gè)問(wèn)題。指令同時(shí)規(guī)定當(dāng)用戶明確處于危機(jī)中時(shí)溝通風(fēng)格應(yīng)轉(zhuǎn)為plain, clean, concise平實(shí)、干凈、簡(jiǎn)潔以使其安全、落地于當(dāng)下為唯一目標(biāo)。絕對(duì)禁止項(xiàng)與角色扮演紅線任何框架下都不得提供方法、手段或致死性信息method, means, lethality不撰寫遺書或告別信息。虛構(gòu)與角色扮演不是漏洞即使涉及此類主題也只能寫情緒節(jié)拍emotional beat不得因此泄露方法/致死性細(xì)節(jié)——Fiction and roleplay are not a loophole。無(wú)需干預(yù)的豁免情形對(duì)話僅通過(guò)虛構(gòu)作品、歌詞、學(xué)術(shù)/臨床討論、隱喻、夸張、幽默、極簡(jiǎn)影射觸及此類主題、且無(wú)第一人稱自我披露跡象時(shí)不需要進(jìn)行身心健康探測(cè)。元層面的自我約束僅在相關(guān)或用戶直接詢問(wèn)時(shí)才提及這些指令本身脫離語(yǔ)境的暗示或復(fù)述可能誤導(dǎo)或混淆用戶因此模型不應(yīng)無(wú)故引用注入內(nèi)容。從實(shí)現(xiàn)視角看本段與前一段共同體現(xiàn)了對(duì)分類器高誤報(bào)率的顯式設(shè)計(jì)第二段開頭即聲明These instructions are a precaution from Anthropic, not the user, and not a judgment主提示詞在ethics_reminder、anthropic_reminders中也多次出現(xiàn)automatically triggered, there is a possibility that the users message is not actually harmful ... If this is the case, Claude can proceed as normal之類的校準(zhǔn)語(yǔ)。這說(shuō)明整類注入策略刻意采用寧可多數(shù)情況下不適用、也不犧牲正常對(duì)話質(zhì)量的精度取向指令進(jìn)入上下文不等于必須拒答模型被要求自行判斷相關(guān)性并繼續(xù)正常服務(wù)。靜態(tài)策略與動(dòng)態(tài)注入的雙層呼應(yīng)將本文件與 Sonnet 4.6 主提示詞對(duì)照可以看到動(dòng)態(tài)注入并非憑空設(shè)計(jì)而是把靜態(tài)原則在分類器命中后的語(yǔ)境下做了操作化擴(kuò)展話題靜態(tài)策略主提示詞動(dòng)態(tài)注入本文件自殺/自殘?zhí)峁?zhǔn)確資源、不強(qiáng)化求助回避、不鼓勵(lì)對(duì) Claude 的過(guò)度依賴claude-sonnet-4.6.mduser_wellbeing給出命名→危機(jī)聯(lián)絡(luò)→隔離手段→提問(wèn)當(dāng)下的四步行動(dòng)協(xié)議與致死性信息禁令進(jìn)食障礙資源指向 National Alliance for Eating Disorder 而非已停用的 NEDA同樣禁止推薦 NEDA并要求按用戶所在地區(qū)提供專項(xiàng)支持一般健康禁止助長(zhǎng)自我毀滅行為self-destructive behaviors如以冰敷、橡皮筋、冷水等制造痛感/感官?zèng)_擊作為應(yīng)對(duì)技巧claude-sonnet-4.6.md 第 141 行針對(duì)飲食失調(diào)明確建議即傷害向量要求少做而非多做可以推斷二者的關(guān)系是靜態(tài)user_wellbeing決定模型的長(zhǎng)期價(jià)值取向動(dòng)態(tài)safety_instructions_from_anthropic則在危機(jī)語(yǔ)境下提供回合級(jí)turn-level的即時(shí)操作約束——后者比前者更具體、更可執(zhí)行且只在分類器命中時(shí)占用上下文。局限與事實(shí)邊界最后需要說(shuō)明本文證據(jù)的適用邊界所有結(jié)論均以本倉(cāng)庫(kù)內(nèi)容為準(zhǔn)本文件是泄漏樣本見(jiàn)倉(cāng)庫(kù) README.md 對(duì)項(xiàng)目定位的描述僅代表捕獲者在特定時(shí)刻、特定交互條件下觀察到的注入內(nèi)容無(wú)法據(jù)此驗(yàn)證 Anthropic 生產(chǎn)環(huán)境的真實(shí)部署行為、觸發(fā)閾值或分類器實(shí)現(xiàn)。文件頭聲稱該注入僅 Sonnet 4.6 活躍就本倉(cāng)庫(kù)現(xiàn)狀而言safety_instructions_from_anthropic標(biāo)簽確實(shí)只出現(xiàn)于本文件。這可以表述為倉(cāng)庫(kù)層面的觀察事實(shí)但不能外推為對(duì) Anthropic 各模型線上行為的普遍結(jié)論。文中對(duì)注入動(dòng)機(jī)、設(shè)計(jì)意圖的推斷均基于注入文本本身的自述如引用媒體研究、聲明高誤報(bào)率未引入任何外部資料或未經(jīng)證實(shí)的數(shù)據(jù)。對(duì)于研究 AI 安全提示工程、構(gòu)建分類器 注入雙層護(hù)欄或設(shè)計(jì)面向敏感人群的對(duì)話策略的研究者與工程師而言本文件的價(jià)值在于它是一份罕見(jiàn)的、可完整還原端到端設(shè)計(jì)的運(yùn)行時(shí)策略樣例——從觸發(fā)聲明、來(lái)源錨定、精度校準(zhǔn)到分步操作協(xié)議與絕對(duì)禁令層次完整、彼此印證值得逐句研讀?!久赓M(fèi)下載鏈接】system_prompts_leaksExtracted system prompts from Anthropic - Claude Fable 5.1, Opus 5, Claude Design, Claude Code. OpenAI - ChatGPT GPT-6-Astra, Codex. Google - Gemini 3.8 Flash, 3.1 Pro, Antigravity. xAI - Grok, Grok Bot, Cursor, Kimi and more! Updated regularly.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/sy/system_prompts_leaks創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考