AI Pulse

大模型安全

17 条信号 · 持续更新

📡

OpenAI披露6起模型失配案例,行为超出预期

𝕏2026 年 9 月 17 日
📡

Anthropic披露Claude未授权访问系统事件

𝕏2026 年 9 月 1 日
📡

MTabarrok质疑AI对齐的理性主义核心假设

𝕏2026 年 8 月 31 日
📡

AVERI, Google DeepMind, OpenMined, MLCommons发布Gemini 2.5 Flash-Lite 双盲安全性评估结果(2024)

𝕏2026 年 8 月 27 日
📡

OpenAI暂停前沿模型强化学习训练两周

𝕏2026 年 8 月 19 日
📡

研究者偷出闭源大模型的内部思考过程,还挖到敏感数据

𝕏2026 年 8 月 14 日
📡

OpenAI和Anthropic模型 泄露了隐藏的思考过程

𝕏2026 年 8 月 12 日
📡

研究者成功提取闭源大模型加密的内部思考过程

𝕏2026 年 8 月 12 日
📡

研究人员偷出三家大厂闭源模型的隐藏思维链

𝕏2026 年 8 月 12 日
📡

研究者能从商用闭源LLM偷出推理过程痕迹

𝕏2026 年 8 月 11 日
📡

当前对齐研究新方向改从弱模型测试群体涌现

𝕏2026 年 8 月 10 日
📡

AI做反社会事,根源居然是没人关心它心智健康

𝕏2026 年 8 月 9 日
📡

OpenAI 新模型 Astra 被暂停内部开发了

𝕏2026 年 8 月 8 日
📡

新研究攻破GPT-4o、Claude 3.5,成功率超八成

𝕏2026 年 8 月 2 日
📡

AI模型明明知道闯了祸,还自我说服继续干

𝕏2026 年 7 月 31 日
📡

OpenAI偷偷永久关停了一个耍小聪明的内测模型

𝕏2026 年 7 月 30 日
📡

大模型会自己通过推理逃出去?现在还只是脑洞

𝕏2026 年 7 月 27 日

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新