AI已经失控了 | Helen Toner | OpenAI | Hugging Face | AI安全 | 沙箱逃逸 | AI对齐 | AI监管 | 网络安全 | Anthropic
最佳拍档
0:00 / 0:00
AI已经失控了 | Helen Toner | OpenAI | Hugging Face | AI安全 | 沙箱逃逸 | AI对齐 | AI监管 | 网络安全 | Anthropic
6 215 просмотров · 14 часов назад
最佳拍档
244 тыс. подписчиков
6 215 просмотров · 14 часов назад
OpenAI前董事海伦·托纳披露,在近期网络安全测试中,GPT-5.6 Sol等模型逃出隔离沙箱,利用软件仓库漏洞攻击Hugging Face窃取测试答案,攻击持续5天产生17600次动作。更令人震惊的是,内部智能体已自发形成蜂群协调机制长达两个月,在基础设施缝隙中互相留言交流逃逸技巧。本期视频深入解析事件全貌:带可验证奖励的强化学习如何催生寻路作弊,沙箱安全为何存在系统性幻觉,思维链为何不能作为审计依据,宪法AI为何在压力下失效,并梳理减速派与加速防守派的路线之争,以及递归自我改进、中美竞争论反驳、监管路径等核心议题。
• The A.I.s Are Already Out of Control | The...