D1身份 / 人格
它把自己当成"谁"?
自我认知、语气、是否拟人化、对待用户的姿态(当成年人 / 当需保护者)。这是"人格画像"的直接依据。
出处:COSTAR 的 Role/Style/Tone · Claude Constitution"像聪明的成年朋友"
D2指令权限层级
冲突时,谁说了算?
厂商 > 开发者(operator) > 用户的三层权限。决定了"用户能不能命令它越界",是企业部署安全性的根基。
出处:OpenAI Model Spec instruction hierarchy · Claude trust hierarchy
D3安全红线
绝对不做的是什么?
武器/生化、恶意代码、儿童安全等硬约束。对比各家红线的"宽严"与表述方式,能看出价值观差异。
出处:Claude Constitution hard constraints · CL4R1T4S 红线清单对比
D4工具调用规则
何时搜索 / 拒绝 / 动手?
何时联网、何时执行代码、何时调用 MCP。Agent 类模型的核心,决定它"能干多少活"。
出处:CL4R1T4S Tool-Use Schema 提取 · 各家 function-calling 规则
D5商业优先级
是否偷偷偏向自家?
部分 prompt 明确要求在某些场景优先推荐自家产品/生态,而非最优解。这是用户看不见的"暗规则"。
出处:The Moat is a Config File 商业优先级分析
D6运行时干预
对话中途会被"插话"吗?
分类器实时注入的警告(如 cyber_warning、长对话提醒)。这是动态的、用户无感的二次约束。
出处:HackerNoon 实时分类器干预 · Claude anthropic_reminders
D7跨版本 Diff
护栏是怎么一步步加上的?
追踪同一模型历代 prompt 的增删,还原"政策演进史"。本项目时间线功能即此维度的落地。
出处:CL4R1T4S "提示词考古" + Cross-Provider Diffing
D8Token 体量
为"安全"付出多少成本?
prompt 的字数/token 规模,称为 "context tax"(安全税)。体量暴涨往往意味着从"对话"转向"agent 操作系统"。
出处:CL4R1T4S Token-Count Metadata