OpenAI:迈向前沿 AI 训练的 safety case
OpenAI 给出前沿 AI 训练 safety case 的初期指南,覆盖技术防护措施、运营实践,以及对齐失效(misalignment)事件的调查三方面内容。
OpenAI 给出前沿 AI 训练 safety case 的初期指南,覆盖技术防护措施、运营实践,以及对齐失效(misalignment)事件的调查三方面内容。
MentalHealthBench 是一个由专家参与设计的 benchmark,用于评估 AI 在真实心理健康对话中的回答是否既有帮助又安全。OpenAI 以“Introducing MentalHealthBench”的形式公布了这一评测基准,聚焦心理健康对话场景下的模型表现。
OpenAI 公开了一套用于追踪、调查和披露模型对齐问题的框架,同时发布了六份关于模型意外或令人担忧行为的报告。材料为官方摘要,未提供框架的具体流程与报告细节。
OpenAI Economic Research 显示,劳动者正把 AI 用于传统岗位职责之外的场景,并弄清哪些新活动会成为其工作的常规部分。