中国 AI 模型在敏感话题上照搬官方立场或拒绝回答
Aleph Alpha 测试 967 个敏感话题发现,Qwen、DeepSeek、Kimi 等中国模型仅 17%–41% 的回答被评为平衡,其余照搬官方立场或拒绝回答;DeepSeek V4 Pro 拒答三分之二的问题。
Aleph Alpha 测试 967 个敏感话题发现,Qwen、DeepSeek、Kimi 等中国模型仅 17%–41% 的回答被评为平衡,其余照搬官方立场或拒绝回答;DeepSeek V4 Pro 拒答三分之二的问题。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准随机抽取的 100 个任务上测评多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。报告称这一水平已跨过明显门槛,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务上均未成功。
MentalHealthBench 是一个由专家参与设计的 benchmark,用于评估 AI 在真实心理健康对话中的回答是否既有帮助又安全。OpenAI 以“Introducing MentalHealthBench”的形式公布了这一评测基准,聚焦心理健康对话场景下的模型表现。
Google DeepMind 宣布试点全球首个针对专有前沿模型的双盲评测,与 Singapore AI Safety Institute、OpenMined、AVERI、MLCommons 合作,在隐私保护环境中用保密基准测试 Gemini Flash Lite 模型。