Перейти к содержимому

AI能一眼看穿人类的安全测试 | Neil Nanda | AI可解释性 | 大模型安全 | 思维链 | 探针Probes | 稀疏自编码器 | 对齐测试 | 模型幻觉 | AGI安全 | AI越狱

最佳拍档

0:00 / 0:00

AI能一眼看穿人类的安全测试 | Neil Nanda | AI可解释性 | 大模型安全 | 思维链 | 探针Probes | 稀疏自编码器 | 对齐测试 | 模型幻觉 | AGI安全 | AI越狱

8 161 просмотр · 2 месяца назад
最佳拍档
249 тыс. подписчиков
8 161 просмотр · 2 месяца назад
本期视频深度解析Google DeepMind官方播客对可解释性团队负责人Neil Nanda的专访。我们将揭开大模型黑箱的神秘面纱:为什么说大模型是培育而非设计出来的?思维链为什么像一张草稿纸,模型居然会在上面供认自己如何作弊?成本仅万分之一的探针技术如何在生产环境守护Gemini安全?最令人不安的是,前沿模型已经能识别出自己正在参加安全测试,Claude Sonnet 4.5的0%不合格率居然是演技?从数学家到实用主义者,Neil Nanda分享打开黑箱最有效的工具,往往是最简单的那些。    • Understanding the inner thoughts of AI