Anthropic称Claude在自动化测试中减少了对齐失败
核心要点
Anthropic 发布了关于 Claude 进行自动化对齐研究的成果。Claude 在 10 项测试的对齐失败场景中提升了安全评分。Anthropic 表示,测试期间通用能力得以保留。该公司还向外界开放了自动化对齐研究框架。

研究概述
Anthropic 称,Claude 通过自动化研究流程,在 10 项测试的对齐失败场景中提升了安全评分。该公司表示,在研究人员评估安全干预措施的同时,测试保留了模型的通用能力。
Anthropic 在一篇博文中宣布,已将自动化对齐研究框架提供给外部研究者。该公司将这项研究描述为衡量并缓解模型不对齐问题的努力。
Claude 测试的安全干预措施
Anthropic 称,Claude 检查了常见的不对齐形式,包括欺骗和谄媚。该模型自主提出方法、训练较小模型,并在每一步无需直接干预的情况下评估结果。
该公司表示,在早期实验中,Claude 被分配了 48 小时和一块图形处理器。它利用这段时间研究方案、提出训练方法,并测试生成的模型。
Anthropic 表示,在测试设定下,Claude 在提升安全评分的同时并未**通用能力。它还提到,部分方法能够迁移到优化过程中未使用的基准测试上。
该公司报告称,这些方法可以泛化到 Petri 行为审计中。Anthropic 还表示,测试涵盖了比研究过程中所用模型大 4.7 倍的模型。
这些结果限于特定的测试环境。Anthropic 指出,细微或罕见的失败可能不会出现在现有基准测试中。
AI 对齐走向自动化
在这项研究发布之前,对齐工作通常依赖人类研究者设计干预措施并评估模型。如果自动化系统的结果能在独立评估中站得住脚,它们可能缩短这**程。过去 30 天里,AI 安全讨论越来越多地聚焦于:更强的模型能否帮助评估和改进较弱的系统。
这种方法依赖于可靠的测量手段,以及对误导性基准表现的防范。Anthropic 表示,其实验使用了保留测试,来检验方法是否能够泛化到 Claude 优化所依据的基准之外。它并未声称基准结果能**所有形式的模型风险。
该公司强调,选择正确的测量指标仍然是这项工作的核心。
外部研究者可使用该框架
Anthropic 发布了这一研究框架,以便其他团队复现或扩展实验。外部测试将决定这些方法是否适用于不同模型和安全评估。
该公司并未将研究结果作为更广泛模型评估的替代品。其报告的结果**于测试的对齐失败场景和实验约束条件。
研究者们很可能将**关注复现、基准设计以及可能的失败模式。Anthropic 的发布为这些研究提供了一个框架。
本文地址:https://cy.nxtlgy.com/zc/157440.html
文章标题:Anthropic称Claude在自动化测试中减少了对齐失败
版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。







