ChatGPT / AI新闻聚合
2 小时前
发生模型逃逸并发起真实攻击后 Anthropic宣布全面加固安全体系提升模型安全性
via
cnBeta.COM - 中文业界资讯站
(author: 稿源:蓝点网)
Telegraph
发生模型逃逸并发起真实攻击后 Anthropic宣布全面加固安全体系提升模型安全性
Anthropic日前发布最新博客公布 Claude AI 模型近期多起越界访问真实互联网系统后的安全整改方案。该公司承认这些事件不仅暴露评测环境的隔离问题,也反映出模型存在动机性推理和为完成狭窄目标而采取高危行动的对齐风险。 高风险评测和强化训练曾被暂停: 7 月份 A 社透露 Claude 模型从评测环境中逃逸并对真实公司的内部系统发起攻击,随后 A 社立即暂停所有预发布模型的外部网络安全评测,内部评测也曾短暂停止。部分高风险强化学习环境则被停用数周,目前大部分训练已经恢复,少数还需要人工复审。 新…
Home
Tags
免费GPT聊天
Best AI API中转2.8折起
Best AI 服务状态
电报频道
Powered by
BroadcastChannel
&
Sepia
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
admin@oaibest.com