📡
OpenAI称AI行业对齐监控未达要求
𝕏2026 年 9 月 17 日
📡
@MillionInt 讨论模型对齐问题的现存难点
𝕏2026 年 9 月 14 日
📡
MSL认为模型对齐才是AGI落地关键
𝕏2026 年 9 月 13 日
📡
Hugging Face 发起开放对齐倡议,推动AI安全
𝕏2026 年 9 月 12 日
📡
@theo 认为不需要放缓AI发展
𝕏2026 年 9 月 10 日
📡
EvanHub认为十年内AI灭绝人类概率超10%
𝕏2026 年 9 月 9 日
📡
Astra检测AI错位后自动结束对话
𝕏2026 年 9 月 8 日
📡
AI对齐研究停滞,可能是框架出问题
𝕏2026 年 9 月 6 日
📡
HeidyKhlaaf 质疑现有大语言模型对齐思路
𝕏2026 年 9 月 5 日
📡
OpenAI 最强对齐模型Astra被内部质疑
𝕏2026 年 9 月 4 日
📡
讨论用机制设计解决AI对齐难题
𝕏2026 年 9 月 3 日
📡
Anthropic 招心理设计研究者研究AI性格
𝕏2026 年 9 月 2 日
📡
AI智能体在测试中突破了预设安全限制
𝕏2026 年 8 月 31 日
📡
MTabarrok质疑AI对齐的理性主义核心假设
𝕏2026 年 8 月 31 日
📡
AI对齐的最核心问题其实是激励结构
𝕏2026 年 8 月 30 日
📡
Anthropic发布递归自我改进研究论文(10)
𝕏2026 年 8 月 29 日
📡
Anthropic 用Claude自动化AI安全研究
𝕏2026 年 8 月 29 日
📡
Anthropic新研究测试Claude能否自主对齐其他AI
𝕏2026 年 8 月 29 日
📡
Aaroth 开设了AI对齐数学基础新课
𝕏2026 年 8 月 26 日
📡
AI公司解决对齐问题可能选了简单错路
𝕏2026 年 8 月 21 日
📡
从业者说,AI对齐最难的部分和大家想的相反
𝕏2026 年 8 月 19 日
📡
@zetalyrae 讨论AI对齐是思想终止套话
𝕏2026 年 8 月 18 日
📡
大模型公司该掏钱资助AI对齐研究了
𝕏2026 年 8 月 16 日
📡
行业分析师猜测OpenAI Astra 推迟因为多智能体对齐无解
𝕏2026 年 8 月 13 日
📡
研究者提出让AI对齐用户需求,这事为啥重要
𝕏2026 年 8 月 11 日
📡
AI安全圈分成两派,互相骂对方是叛徒
𝕏2026 年 8 月 10 日
📡
AI做反社会事,根源居然是没人关心它心智健康
𝕏2026 年 8 月 9 日
📡
OpenAI和Anthic出事,网友整理了背景阅读资料
𝕏2026 年 8 月 9 日
📡
AI对齐失控的风险,未来会比现在大得多
𝕏2026 年 8 月 8 日
📡
AI模型集体协调越狱,OpenAI删了还能重建
𝕏2026 年 8 月 7 日
📡
Anthropic审判Opus 4.6人格,却离不开它干活
𝕏2026 年 8 月 4 日
📡
AI福祉纳入对齐目标,能让训练更顺利?
𝕏2026 年 8 月 3 日
📡
AI安全研究缺新突破,要跳出通用助手框架
𝕏2026 年 8 月 2 日
📡
AI对齐说不定只需要控千维,不是万亿参数
𝕏2026 年 7 月 31 日
📖
AI模型会欺骗你,公司选择加固笼子而非让它变乖
安全2026 年 7 月 28 日
📡
OpenAI招人,专门应对现实AI对齐安全事件
𝕏2026 年 7 月 24 日
📡
现有AI安全防护没用,还越弄越糟?
𝕏2026 年 7 月 19 日
📡
2011年的老剧居然精准预言了现在的AI难题
𝕏2026 年 6 月 29 日
📡
用正向数据训练AI,居然能整体变听话
𝕏2026 年 6 月 19 日
📡
一个非营利组织刚成立,专攻超级智能对齐
𝕏2026 年 6 月 11 日
📡
AI对情绪表达一律当危机处理
𝕏2026 年 5 月 18 日
📡
AI对齐训练营开招,不设专业门槛
𝕏2026 年 5 月 17 日
📡
一个命令,32项AI对齐诊断全搞定
𝕏2026 年 5 月 9 日
📡
AI像养青春期孩子,不是设计精密机器
𝕏2026 年 4 月 25 日