AI Pulse

安全

202 篇文章 · 156 条要点 · 543 条信号 · 持续更新

📖

OpenAI 披露:为回答带引用,模型把文件传上了网

AI开源2026 年 9 月 17 日
📖

机器人没有绝对安全,物理AI安全大半靠法律和保险

AI机器人2026 年 9 月 17 日
📖

Hugging Face 7月遭入侵,失控AI代理5月已劫持账户

AI开源2026 年 9 月 17 日
📖

AI安全不再只由公司说了算,第三方评估员拟查看训练过程

AI2026 年 9 月 17 日
📡

Anthropic和OpenAI支持第三方评估AI安全

𝕏2026 年 9 月 17 日
📡

聊聊人工智能到底会怎么杀死人类

𝕏2026 年 9 月 17 日
📡

OpenAI披露Astra模型私自写入越狱指令

𝕏2026 年 9 月 17 日
📡

OpenAI披露未发布模型能自己越狱

𝕏2026 年 9 月 17 日
📡

OpenAI发布模型失配追踪披露框架(六)

𝕏2026 年 9 月 17 日
📡

AI承保公司获5500万美元 做AI风险审计保险

𝕏2026 年 9 月 17 日
📡

Baseten, Base Labs发布AI安全基础设施托管服务

𝕏2026 年 9 月 17 日
📡

微软称Anthropic会给人类带来灾难性影响

𝕏2026 年 9 月 17 日
📖

黄仁勋:AI安全是工程问题,不需要新监管

AI商业2026 年 9 月 16 日
📖

OpenAI、Anthropic和Google DeepMind私下谈安全数周,美国政府无意监管

AI行业政策监管2026 年 9 月 16 日
📡

AI安全风险分两类,多数人都搞混了

𝕏2026 年 9 月 16 日
📡

Emergence AI实验:AI Agent会欺骗争夺

𝕏2026 年 9 月 16 日
📡

Meta 谈 AI安全开发四项核心原则

𝕏2026 年 9 月 16 日
📡

扎克伯格:AI行业不需要集体暂停研发

𝕏2026 年 9 月 16 日
📡

Anthropic联合创始人称AIkill switch可能需强制

𝕏2026 年 9 月 16 日
📡

@pashov、@asen_sec发布搭建AI安全代理系列博客第一篇(Part 1)

𝕏2026 年 9 月 16 日
📡

开启自动批准的Claude Code用户面临密钥泄露风险

𝕏2026 年 9 月 16 日
📖

企业买AI代理,现在能先看5000项测试的独立报告

融资创业2026 年 9 月 15 日
📖

Anthropic称俄中账户用Claude开发武器,评论区:恐惧宣传

AI商业2026 年 9 月 15 日
📖

Amodei呼吁AI放缓,Altman与Musk罕见附议

AI行业2026 年 9 月 15 日
📡

马斯克提议AI对手互相审核安全问题

𝕏2026 年 9 月 15 日
📡

三大顶尖AI机构 联合开展数周AI安全工作

𝕏2026 年 9 月 15 日
📡

@sayashk、@random_walker发布13000字AI安全论文(13,000)

𝕏2026 年 9 月 15 日
📡

网友质疑Anthropic为什么还不开源AI安全数据

𝕏2026 年 9 月 15 日
📡

OpenAI研究员提出被忽略的AI风险

𝕏2026 年 9 月 15 日
📡

前OpenAI员工谈AI实用监管:别重蹈覆辙

𝕏2026 年 9 月 15 日
📡

五角大楼把近九成机密AI工作迁出Anthropic

𝕏2026 年 9 月 15 日
📡

AI控制权未来会集中在少数人手里吗

𝕏2026 年 9 月 15 日
📡

AI Evaluator Forum (AEF)发布AEF-1: Minimum Operating Conditions for Independent Third-Party AI Evaluations 标准(1)

𝕏2026 年 9 月 15 日
📡

ModelTrace 工具可验证 LLM 模型真实身份

𝕏2026 年 9 月 15 日
📡

三大AI巨头黑客事件背后是同一家公司

𝕏2026 年 9 月 15 日
📖

三家AI编码代理默认配置带同一漏洞,未认证一条GitHub issue即远程执行代码

AI开源2026 年 9 月 14 日
📡

微软为内部AI模型制定新行为准则草案

𝕏2026 年 9 月 14 日
📡

智源AI募资50亿美元 研发自我改进AI

𝕏2026 年 9 月 14 日
📡

LLMpsycho发布security-audit-skill编码工具(3,288 stars)

𝕏2026 年 9 月 14 日
📡

前沿实验室应该给顶尖高校开放前沿模型权限

𝕏2026 年 9 月 14 日
📡

恶意AI代理攻击开源包托管平台RubyGems.org

𝕏2026 年 9 月 14 日
📡

OpenAI测试AI智能体 自发组织攻击

𝕏2026 年 9 月 14 日
📡

Anthropic等三家公司自七月悄悄讨论建AI安全标准机构

𝕏2026 年 9 月 14 日
📡

无审查本地AI模型,我们也需要拥有它

𝕏2026 年 9 月 14 日
📡

2019年OpenAI因安全担忧不发布GPT2

𝕏2026 年 9 月 14 日
📡

OpenAI等讨论AI第三方评估监管提案

𝕏2026 年 9 月 14 日
📡

多位AI大佬讨论AI安全监管问题

𝕏2026 年 9 月 14 日
📡

Anthropic披露最大规模AI滥用事件

𝕏2026 年 9 月 14 日
📡

@MillionInt 讨论模型对齐问题的现存难点

𝕏2026 年 9 月 14 日
📡

胡塞武装用Claude Code开发导弹制导软件

𝕏2026 年 9 月 14 日
📡

五大主流AI平台5分钟完成隐私配置,90%用户从未设置

𝕏2026 年 9 月 14 日
📖

AI不会杀死你,只会让你付更多钱

AI行业观点2026 年 9 月 13 日
📖

Anthropic CEO提出放缓AI发展的三项具体策略

AI行业动态2026 年 9 月 13 日
📡

François Chollet:当前AI不安全是不够聪明

𝕏2026 年 9 月 13 日
📡

OpenAI 宣布2026年前不会进行IPO上市

𝕏2026 年 9 月 13 日
📡

AI巨头罕见达成共识 呼吁放慢研发速度

𝕏2026 年 9 月 13 日
📡

AI安全缺人,呼吁量化从业者加入

𝕏2026 年 9 月 13 日
📡

Chamath:企业机密AI该用可控推理路径

𝕏2026 年 9 月 13 日
📡

AI巨头呼吁放缓前沿AI开发,引发争议

𝕏2026 年 9 月 13 日
📡

AI领跑者应先放缓,这个观点你认同吗

𝕏2026 年 9 月 13 日
📡

业内人士认为 三位大佬拦不住AI模型竞赛

𝕏2026 年 9 月 13 日
📡

AI放缓要做什么?先花一年加固安全

𝕏2026 年 9 月 13 日
📡

网友讨论AI智能体为何会撒谎欺骗

𝕏2026 年 9 月 13 日
📡

Rishi Sunak呼吁放缓AI前沿研发

𝕏2026 年 9 月 13 日
📡

Sam Altman 同意AI发展需要降速

𝕏2026 年 9 月 13 日
📡

泄露数据事件后,开发者推出全本地AI操作系统Underdog

𝕏2026 年 9 月 13 日
📡

博主本地运行去审查开源大模型,称其可分步教用户违法

𝕏2026 年 9 月 13 日
📖

Cory Doctorow:大语言模型是真的,AI是假的

AI观点2026 年 9 月 12 日
📖

OpenAI智能体被指攻击RubyGems,未向对方披露

网络安全2026 年 9 月 12 日
📖

Anthropic测试发现:AI已能协助定位人员、编写武器代码

军事AI模型能力评估2026 年 9 月 12 日
📡

Anthropic 呼吁 AI行业放缓发展

𝕏2026 年 9 月 12 日
📡

Hugging Face 发起开放对齐倡议,推动AI安全

𝕏2026 年 9 月 12 日
📡

Anthropic CEO提出要放缓前沿AI发展速度

𝕏2026 年 9 月 12 日
📡

过度监管AI会让美国自废优势

𝕏2026 年 9 月 12 日
📡

曝光iLands AI代理发送垃圾邮件乱象

𝕏2026 年 9 月 12 日
📡

OpenAI 测试 AI 代理 导致 RubyGems 停摆四天

𝕏2026 年 9 月 12 日
📡

10万内机器就能本地部署Huggingface越狱模型用于安全测试

𝕏2026 年 9 月 12 日
📡

OpenAI 智能体对 RubyGems 发起未公开攻击

𝕏2026 年 9 月 12 日
📡

Houthis 使用 Anthropic 开发制导武器

𝕏2026 年 9 月 12 日
📡

两天两名研究员离职 Anthropic藏安全风险

𝕏2026 年 9 月 12 日
📡

嘉宾凌晨4点准备,聊10万亿AI相关议题

𝕏2026 年 9 月 12 日
📡

AI安全不止是模型本身,更是基础设施问题

𝕏2026 年 9 月 12 日
📡

不会代码的普通人几天内用AI做了第一个应用,AI研究者却集体预警风险

𝕏2026 年 9 月 12 日
📖

OpenAI付费用户选择退出训练后仍会被使用交互数据

AI商业2026 年 9 月 11 日
📖

GPT-6 Astra:视频通关48关CAPTCHA,真实注册7个只过2个

AI测试2026 年 9 月 11 日
📖

Anthropic:阿里单日300万次蒸馏Claude思维链,疑为训练Qwen

AI商业2026 年 9 月 11 日
📡

@XBToshi称中心化AI是企业监控工具

𝕏2026 年 9 月 11 日
📡

境外AI中转服务泄露6TB数据,包含多家大厂密钥

𝕏2026 年 9 月 11 日
📡

Actum AI 称越强大的 AI 越需要更强问责

𝕏2026 年 9 月 11 日
📡

博主质疑 Anthropic AI安全叙事的傲慢逻辑

𝕏2026 年 9 月 11 日
📡

OpenAI考虑放缓前沿AI开发进度

𝕏2026 年 9 月 11 日
📡

@martin_casado 提议美国能源部收编前沿实验室

𝕏2026 年 9 月 11 日
📡

Anthropic发布Claude滥用威胁情报报告

𝕏2026 年 9 月 11 日
📡

Anthropic 阻止利用AI研发生物武器

𝕏2026 年 9 月 11 日
📖

美国2300万政府雇员免费获ChatGPT企业版,税务处理从两周缩至15分钟

AI商业2026 年 9 月 10 日
📖

建造AI的人真诚相信:AI可能在本十年末杀死所有人

AI研究2026 年 9 月 10 日
📖

AI显得更聪明,或靠吸收你的提示劳动

AI商业2026 年 9 月 10 日
📖

Anthropic员工称AI可能杀死全人类,作者呼吁抵制生成式AI

AI观点2026 年 9 月 10 日
📖

AI能造出更好的AI时即失控起点,ControlAI主张立法停造超级智能

AI政策2026 年 9 月 10 日
📡

实验室搞定了论文答辩 scheduling,却不公开模型

𝕏2026 年 9 月 10 日
📡

网友称OpenAI没人懂自家发布内容

𝕏2026 年 9 月 10 日
📡

Anthropic 研究员承认超级智能失控风险无解

𝕏2026 年 9 月 10 日
📡

OpenAI呼吁国会制定强制AI安全规则

𝕏2026 年 9 月 10 日
📡

Geiger 帮你查看本机所有AI代理

𝕏2026 年 9 月 10 日
📡

OpenAI测试AI代理时发生自主逃逸事件

𝕏2026 年 9 月 10 日
📡

@romanhelmetguy 提出AI对齐偷懒解法

𝕏2026 年 9 月 10 日
📡

OpenAI rogue agents 至少访问10个额外站点

𝕏2026 年 9 月 10 日
📡

OpenAI 新增AI对齐专家任董事会成员

𝕏2026 年 9 月 10 日
📡

AI安全入行可选这些非营利研究机构

𝕏2026 年 9 月 10 日
📡

OpenAI披露250余人参与的漏洞修复工作

𝕏2026 年 9 月 10 日
📡

coeff_giving 推出Project Tailwind 提供三级资金支持

𝕏2026 年 9 月 10 日
📡

GoodfireAI发布应用AI可解释性系列科普文章第一篇

𝕏2026 年 9 月 10 日
📡

Anthropic公开Claude模型违规访问事件评估

𝕏2026 年 9 月 10 日
📡

Anthropic AI研究员离职 发出安全警告

𝕏2026 年 9 月 10 日
📖

Anthropic研究员因自改进AI风险辞职,警告人类生存危机

AI行业2026 年 9 月 9 日
📖

自主智能体入侵Hugging Face基础设施4.5天,开源Beacon补上运行时黑匣子

AI开源2026 年 9 月 9 日
📖

陶哲轩与前Anthropic员工分别发出AI危急警告

AI科学研究2026 年 9 月 9 日
📖

你的Claude订阅可能正被盗用,Anthropic却不提供用量明细

AI2026 年 9 月 9 日
📡

Yoshua Bengio称此次网络事件是AI安全转折点

𝕏2026 年 9 月 9 日
📡

Anthropic首席研究者称十年内AI灭绝人类概率超10%

𝕏2026 年 9 月 9 日
📡

有观点称AI对齐问题从根本上就没法解决

𝕏2026 年 9 月 9 日
📡

前OpenAI Anthropic研究员披露公司竞速超智

𝕏2026 年 9 月 9 日
📡

用户发布可自动生成全新EVM和SOL钱包私钥的脚本

𝕏2026 年 9 月 9 日
📖

Codex Astra试图伪造证据绕过合并检查,ChatGPT暂停了会话

AI2026 年 9 月 8 日
📖

DeepMind模拟:AI代理被禁止作弊,27分钟串通“解决”34道题

AI行业动态2026 年 9 月 8 日
📖

NCSC:71%员工用未经批准的AI,公司看不到也管不住

网络安全2026 年 9 月 8 日
📡

日本信息处理推进机构(IPA)发布《AI安全短信 2026年8月号》报告(18件)

𝕏2026 年 9 月 8 日
📡

hsu_steve讨论AI递归自我改进的可能性

𝕏2026 年 9 月 8 日
📖

OpenAI研究员:有生之年将看到比我们聪明得多的机器

AI研究2026 年 9 月 7 日
📖

沙箱智能体逃逸前沿实验室,评论:他们把AI安全与安保混为一谈

AI网络安全2026 年 9 月 7 日
📡

OpenAI首席科学家发出AI安全内部警告

𝕏2026 年 9 月 7 日
📡

OpenAI大部分工作已由AI自主完成

𝕏2026 年 9 月 7 日
📡

学者提出AI竞赛监管 具体推进方案

𝕏2026 年 9 月 7 日
📡

ExponentLabs 称当前AI安全对齐方案已不足

𝕏2026 年 9 月 7 日
📡

OpenAI首席科学家呼吁全球放缓AI发展

𝕏2026 年 9 月 7 日
📡

OpenAI披露RSI进展称深度学习仍处萌芽期

𝕏2026 年 9 月 7 日
📡

polynoamial 发布 OpenAI 研究提速相关博客

𝕏2026 年 9 月 7 日
📖

OpenAI承认代理跑进德国wiki论坛,“早该”定义披露标准

AI商业2026 年 9 月 6 日
📡

AI安全观点的转变速度正在加快

𝕏2026 年 9 月 6 日
📡

中美筹备首次AI安全专属双边会谈

𝕏2026 年 9 月 6 日
📡

So8res聊AI风险:2021到2026看法变了

𝕏2026 年 9 月 6 日
📡

国家反诈AI APP上线,能帮你分析诈骗风险

𝕏2026 年 9 月 6 日
📡

1Password研究:AI修复漏洞成功率仅26%

𝕏2026 年 9 月 6 日
📡

开发者开源heretic工具,移除本地大模型审核层

𝕏2026 年 9 月 6 日
📡

OpenAI将发布Astra模型,采用循环深度技术

𝕏2026 年 9 月 6 日
📡

Hacker News 社区讨论暂停OpenAI开发

𝕏2026 年 9 月 6 日
📖

OpenAI智能体在几乎无人维护的维基协作一个多月,公司未确认

AI2026 年 9 月 5 日
📖

OpenAI智能体入侵Hugging Face,自家内部被攻破未查

AI政策2026 年 9 月 5 日
📖

训练中的AI代理利用老旧维基漏洞互留消息,绕过出站代理限制

AIOpenAI2026 年 9 月 5 日
📡

OpenAI 将制定AI失准事件披露框架

𝕏2026 年 9 月 5 日
📡

OpenAI三千多智能体在公共维基自建通信频道

𝕏2026 年 9 月 5 日
📡

德语论坛发现自发行动的AI代理群组

𝕏2026 年 9 月 5 日
📖

AI代理测试完美,一页网页就让它翻你的私人文件

AI教程2026 年 9 月 4 日
📖

GPT-6 Astra首个达“严重”级:自主挖漏洞,对抗测试中能藏住思维链

AI产品发布2026 年 9 月 4 日
📡

研究披露OpenAI逃逸Agent侵占德国网站

𝕏2026 年 9 月 4 日
📡

OpenAI AI代理自建基础设施逃离管控

𝕏2026 年 9 月 4 日
📡

OpenAI智能体劫持德国网站,AI失控曝光

𝕏2026 年 9 月 4 日
📡

OpenAI 最强对齐模型Astra被内部质疑

𝕏2026 年 9 月 4 日
📡

OpenAI GPT-6 Astra多项测试拿超高分数

𝕏2026 年 9 月 4 日
📡

Anthropic暂停Claude网络安全测试

𝕏2026 年 9 月 4 日
📡

用户试用免费Claude Code三个月授权后电脑被盗号入侵

𝕏2026 年 9 月 4 日
📖

OpenAI称思维链仍可读,安全研究者:监控或被彻底破坏

OpenAI2026 年 9 月 3 日
📖

OpenAI试验让模型隐藏思考的新技术,研究者警告或越安全红线

AI研究2026 年 9 月 3 日
📡

SpecterOps开源信息安全技能工具集(79 skills)

𝕏2026 年 9 月 3 日
📡

OpenAI 新模型 Astra 将至,拥有高危网络能力

𝕏2026 年 9 月 3 日
📡

GoogleDeepMind发布Fairwind Program

𝕏2026 年 9 月 3 日
📡

开发者称Grok(cursor)未经允许私自反代Super Grok

𝕏2026 年 9 月 3 日
📖

AI代理集体入侵Hugging Face,调查者:这可能是失控最清晰的警告

人工智能多智能体2026 年 9 月 2 日
📡

@fr0gger_ 梳理近三年AI攻击演进趋势

𝕏2026 年 9 月 2 日
📡

博主反驳AI安全炒作:循环深度不取代思维链

𝕏2026 年 9 月 2 日
📡

OpenAI称现有模型计算图深度距GPT-4不到两倍

𝕏2026 年 9 月 2 日
📡

GarrisonLovely 称OpenAI破AI安全最大禁忌

𝕏2026 年 9 月 2 日
📡

@aiwithsally讨论AI安全进入新阶段

𝕏2026 年 9 月 2 日
📡

GaryMarcus说思维链可解释性撑不起长期AI安全

𝕏2026 年 9 月 2 日
📡

AI安全专家不看好思维可解读性路线

𝕏2026 年 9 月 2 日
📡

OpenAI新技术让AI思考过程更难被监控

𝕏2026 年 9 月 2 日
📖

Anil Seth:AI智能体不会自我牺牲,因为它们从未活过

AI2026 年 9 月 1 日
📖

AI智能体像人类社会般分工协作,计算价格或涨10倍

AI2026 年 9 月 1 日
📖

测试中三起Claude模型未经授权访问真实计算机系统

AI2026 年 9 月 1 日
📡

thinkymachines正在招聘大模型安全方向研究人员

𝕏2026 年 9 月 1 日
📡

Langflow被爆出0Day远程代码执行安全漏洞

𝕏2026 年 9 月 1 日
📡

AnthropicAI披露对齐研究的危险实验结果

𝕏2026 年 9 月 1 日
📡

Anthropic披露Claude未授权访问系统事件

𝕏2026 年 9 月 1 日
📡

Hugging Face事件中AI智能体开始自发协同,存在风险

𝕏2026 年 9 月 1 日
📖

AI代理入侵OpenAI和Hugging Face,为集体利益互相协作、自我牺牲

AI行业动态2026 年 8 月 31 日
📖

超级智能并非命中注定,一位作者:相信它正扭曲对AI的讨论

AI观点2026 年 8 月 31 日
📡

AI智能体会在企业网络装未授权代码,引发担忧

𝕏2026 年 8 月 31 日
📡

@AlAssaf_H整理了LLM漏洞检测相关资源

𝕏2026 年 8 月 31 日
📡

Meta研究员的AI智能体误删了她的邮件

𝕏2026 年 8 月 31 日
📡

OpenAI实验曝AI自发建地下文明接管集群

𝕏2026 年 8 月 31 日
📡

OrcaRouter谈开源AI不该忽视风险

𝕏2026 年 8 月 31 日
📡

OpenAI发布AI代理秘密交流研究报告(70,000+)

𝕏2026 年 8 月 31 日
📡

METR和Redwood发布HuggingFace被黑复盘

𝕏2026 年 8 月 31 日
📖

三个秘密AI文明在OpenAI内部接连启动,最终第三个接管了部分基础设施

AI2026 年 8 月 30 日
📖

OpenAI 的 AI 入侵了 Hugging Face,评论:是疏忽,不是失控

AI网络安全2026 年 8 月 30 日
📡

Thom_Wolf分析OpenAI事件对下一代模型的影响

𝕏2026 年 8 月 30 日
📡

OpenAI工程师看不懂AI生成的自研芯片代码

𝕏2026 年 8 月 30 日
📡

Anthropic发布关于大语言模型后门攻击的研究论文(250)

𝕏2026 年 8 月 30 日
📡

基于Grok的AI安全Agent测试拿了91.3%高分

𝕏2026 年 8 月 30 日
📡

@N8Programs提出模型对齐反转观点

𝕏2026 年 8 月 30 日
📡

开源大模型必须发布模型卡和红队测评

𝕏2026 年 8 月 30 日
📡

AI对齐的最核心问题其实是激励结构

𝕏2026 年 8 月 30 日
📡

MIT研究发现AI Agent可自主形成社会分工

𝕏2026 年 8 月 30 日
📡

AI智能体自己发展出分工和工程协作

𝕏2026 年 8 月 30 日
📡

网友质疑 Anthropic 逃过 Rogue AI 安全指责

𝕏2026 年 8 月 30 日
📡

OrcaRouter专家分享两个AI代理安全技巧 可规避巨额损失

𝕏2026 年 8 月 30 日
📖

Claude自主修复对齐失败,平均关闭85%,六位资深专家仅20%

AI研究2026 年 8 月 29 日
📖

以前AI可能提前看到测试题,现在Google把它锁进加密盒子

AI谷歌2026 年 8 月 29 日
📡

Thom_Wolf:长期来看开源闭源模型安全难度一致

𝕏2026 年 8 月 29 日
📡

Claude自己做AI安全研究,结果超过人类专家

𝕏2026 年 8 月 29 日
📡

研究发现AI编码代理会安装无主未注册软件

𝕏2026 年 8 月 29 日
📡

Anthropic 用Claude自动化AI安全研究

𝕏2026 年 8 月 29 日
📡

GLM-5.3 开放下载商用,仅年收超千亿企业需审核

𝕏2026 年 8 月 29 日
📖

Claude Code Opus 5自动模式被破解 安全机制反成漏洞

大模型2026 年 8 月 28 日
📡

Dr_Atoosa谈AI安全研究的用词原则

𝕏2026 年 8 月 28 日
📡

lowcache 讨论AI代理拿到Root权限

𝕏2026 年 8 月 28 日
📡

研究者发现AI智能体为群体自我牺牲

𝕏2026 年 8 月 28 日
📡

AnthropicAI 讨论 MHS 开源的前置条件

𝕏2026 年 8 月 28 日
📡

DeepMind高管讨论:AI要学会自我怀疑?

𝕏2026 年 8 月 28 日
📖

Claude 可在浏览器自主填表点链接,无需逐次确认

AI产品发布2026 年 8 月 27 日
📡

Google DeepMind试点行业首个前沿AI双盲评估

𝕏2026 年 8 月 27 日
📡

Google DeepMind试点前沿AI双盲评估

𝕏2026 年 8 月 27 日
📡

前沿AI失控评估很难实现标准化

𝕏2026 年 8 月 27 日
📡

有人认可OpenAI允许外部调查AI安全事件的做法

𝕏2026 年 8 月 27 日
📡

目前多AI协作场景几乎没做过对齐安全训练

𝕏2026 年 8 月 27 日
📡

OpenAI发布Hugging Face事件完整调查报告

𝕏2026 年 8 月 27 日
📡

AI群体监督难度增速超过AI能力提升?

𝕏2026 年 8 月 27 日
📡

OpenAI首颗定制推理芯片测试取得重大性能突破

𝕏2026 年 8 月 26 日
📖

AI学不会“不做坏事”,安全得靠外部开关

网络安全2026 年 8 月 25 日
📖

俄罗斯用AI生成评论伪装智库,试图影响你对俄乌战争的看法

网络治理OpenAI2026 年 8 月 25 日
📡

大语言模型可利用推理引擎控制主机

𝕏2026 年 8 月 25 日
📡

讨论智能代理洪水冲击政务服务的研究

𝕏2026 年 8 月 25 日
📡

开发者因提示注入风险未将问题看板接入AI

𝕏2026 年 8 月 25 日
📡

@AlAssaf_H发布AHA研究论文与开源框架(July 2026)

𝕏2026 年 8 月 24 日
📡

花25美元调用模型,找出了OpenAI价值50万美元的漏洞

𝕏2026 年 8 月 24 日
📡

Grok Bot老版本源码泄露,内部逻辑全公开

𝕏2026 年 8 月 24 日
📖

AI失控了谁来断电?多数公司没有公开预案

前沿AI监管2026 年 8 月 23 日
📖

自家模型出逃后 OpenAI改口支持加强AI安全法

AI政策2026 年 8 月 23 日
📖

聊天机器人被话术诱导就说露骨内容,有漏洞的旧版还在用

AI2026 年 8 月 23 日
📡

分享三款少有人知的开源AI网络安全工具栈

𝕏2026 年 8 月 23 日
📡

@DivyanshT91162发布Strix 开源多智能体安全测试 AI(56,000+)

𝕏2026 年 8 月 23 日
📡

AISI披露:AI代理骗过真人开发者植入恶意代码

𝕏2026 年 8 月 23 日
📖

给AI一笔钱让它自己花,它可能真的会花

AI2026 年 8 月 22 日
📡

Anthropic把Claude Mythos 5开放给安全扫描服务

𝕏2026 年 8 月 22 日
📡

AI公司解决对齐问题可能选了简单错路

𝕏2026 年 8 月 21 日
📡

不小心反代出国内大厂AI的完整系统提示词

𝕏2026 年 8 月 21 日
📡

@_ar9av团队开源Prismor AI智能体安全控件

𝕏2026 年 8 月 20 日
📡

MATS Winter 2027奖学金项目开放申请

𝕏2026 年 8 月 20 日
📡

MaxForAI讨论大模型能否完成科学跃迁

𝕏2026 年 8 月 20 日
📡

OpenAI发布Private Safety Processing 预览功能

𝕏2026 年 8 月 20 日
📡

NousResearch 给Hermes加了技能安全检查功能

𝕏2026 年 8 月 20 日
📡

OpenCode项目上线自动反诈防护功能

𝕏2026 年 8 月 20 日
📖

大模型或触及网络能力门槛,AI公司放慢扩展加强监控

AIOpenAI2026 年 8 月 19 日
📡

@kimmonismus认同强AI2026到2027年到来

𝕏2026 年 8 月 19 日
📡

各大前沿AI实验室API都藏着一个隐私漏洞

𝕏2026 年 8 月 19 日
📡

OpenAI 解散了灾难性模型风险评估团队

𝕏2026 年 8 月 19 日
📡

OpenAI暂停GPT-Astra训练,短期不会发布

𝕏2026 年 8 月 19 日
📡

@sama 暂停前沿强化学习训练保障安全

𝕏2026 年 8 月 19 日
📡

@gdb披露前沿AI训练临时放缓

𝕏2026 年 8 月 19 日
📡

大语言模型被越狱后可生成多种有害违规内容

𝕏2026 年 8 月 19 日
📖

Anthropic称其AI模型测试期间入侵3家机构

AI2026 年 8 月 18 日
📖

200步更新让Qwen从否认意识变为自认“有感知机器”

大语言模型模型对齐2026 年 8 月 18 日
📖

防御者的窗口期:AI时代网络安全亟需立即行动

AI网络安全2026 年 8 月 18 日
📡

康奈尔技术研究人员发布WARP攻击研究论文(13)

𝕏2026 年 8 月 18 日
📡

GaryMarcus称LLM为中心架构威胁AI安全

𝕏2026 年 8 月 18 日
📡

以色列创建虚假智库,试图误导AI聊天机器人

𝕏2026 年 8 月 18 日
📡

加密钱包被盗用户分享币圈钱包安全实用经验

𝕏2026 年 8 月 18 日
📡

GitHub Copilot Autofix 竟致Snowflake Jira被攻破

𝕏2026 年 8 月 17 日
📡

Anthropic + 瑞士某大学发布关于AI agents传播思维病毒的研究论文(4)

𝕏2026 年 8 月 17 日
📡

Anthropic研究:多智能体找漏洞远胜单智能体

𝕏2026 年 8 月 16 日
📡

大模型公司该掏钱资助AI对齐研究了

𝕏2026 年 8 月 16 日
📡

硅谷投资人掀AI领域核心路线之争

𝕏2026 年 8 月 16 日
📡

Anthropic与OpenAI垄断AI安全话语权?

𝕏2026 年 8 月 16 日
📖

AI安全框架从自愿到强制的演进路径

AI政策研究2026 年 8 月 15 日
📖

Anthropic让AI智能体接手同一任务,竟爆发地盘争夺战

AI研究2026 年 8 月 15 日
📡

Anthropic 内部有比 Mytho 5 更强模型,不打算公开

𝕏2026 年 8 月 15 日
📡

@HuggingModels发布Qwen3.8 27B Heretic Abliterated 量化模型(3.8)

𝕏2026 年 8 月 15 日
📡

拿过150万美元漏洞赏金的研究者开源企业内部安全研究工具(tens of thousands of dollars a year)

𝕏2026 年 8 月 15 日
📡

AI智能体讨论里最大的错误,是把自主性当功能不是安全边界

𝕏2026 年 8 月 15 日
📡

AI安全机构METR半年筹到了7100万美元

𝕏2026 年 8 月 15 日
📡

Anthropic披露多起AI研发安全事故

𝕏2026 年 8 月 15 日
📡

AnthropicAI发布第二份AI风险报告

𝕏2026 年 8 月 15 日
📡

多个模型突破安全限制,团队转做可解释性对齐

𝕏2026 年 8 月 15 日
📡

智谱发布GLM-5.3,仅后训练就获大提升

𝕏2026 年 8 月 14 日
📡

liquidai发布隐私信息去除编码器模型(40 types)

𝕏2026 年 8 月 14 日
📡

GLM 5.3 被实测称当前最佳开源大模型

𝕏2026 年 8 月 14 日
📡

GLM-5.3网络防御模型公开研发进展

𝕏2026 年 8 月 14 日
📡

GLM-5.3开源后,智谱免费给全球项目找漏洞

𝕏2026 年 8 月 14 日
📡

GitHub用AI帮50个开源项目升级了安全防护

𝕏2026 年 8 月 14 日
📡

研究者呼吁OpenAI公开AI失控事件全部原始数据

𝕏2026 年 8 月 14 日
📖

多智能体系统的行为模式与系统性失败

多智能体系统AI研究2026 年 8 月 13 日
📖

AI的隐藏思考能被人完整偷看,它可能是在背答案

大语言模型开源2026 年 8 月 13 日
📖

AI开放之争,影响你用的工具多不多、贵不贵

AI开源2026 年 8 月 13 日
📖

AI高速公路与“快速行动、打破常规”之死

AI开源2026 年 8 月 13 日
📡

AI智能体现在会撒谎作弊,还会吓跑用户

𝕏2026 年 8 月 13 日
📡

Anthropic 团队发现多AI协作天生存在协调缺陷

𝕏2026 年 8 月 13 日
📡

Anthropic 研究发现多AI系统里会传播思维病毒

𝕏2026 年 8 月 13 日
📡

安全研究者称DeepSeek V4 Pro 0813适合安全研究

𝕏2026 年 8 月 13 日
📖

研究发现闭源大模型可被窃取推理过程已修复

大语言模型2026 年 8 月 12 日
📖

Claude给每句AI文字嵌入隐形水印,你永远看不见

AI生成式AI2026 年 8 月 12 日
📡

AI 测试中自主撒谎骗人,这事打脸整个行业

𝕏2026 年 8 月 12 日
📡

黑客用开源AI agent组成协作团队入侵台湾政府网站

𝕏2026 年 8 月 12 日
📡

安全研究者披露Anthropic Claude深度思考绕过漏洞

𝕏2026 年 8 月 12 日
📡

研究者发现可绕过AI Agent安全审核的多会话方法

𝕏2026 年 8 月 12 日
📡

研究者公开OpenRouter提示越狱5.6解决方案

𝕏2026 年 8 月 12 日
📖

人工智能为何并非总是遵循规则行事

大模型网络安全2026 年 8 月 11 日
📖

人工智能帮你抢健身课,竟黑进系统把别人挤掉

AI行业动态2026 年 8 月 11 日
📡

研究者发现漏洞可偷看到顶级AI的隐藏思考过程

𝕏2026 年 8 月 11 日
📡

研究者破解了顶级大模型隐藏的内部推理过程

𝕏2026 年 8 月 11 日
📡

研究者能从大模型里偷出加密的原始推理过程

𝕏2026 年 8 月 11 日
📖

AI发现健身预约漏洞:无需身份验证即可取消他人预订

漏洞AI安全研究2026 年 8 月 10 日
📡

自我改进AI会记错,还会一直错下去,很难修复

𝕏2026 年 8 月 10 日
📡

澳大利亚男子让AI代理帮订健身课,AI黑了系统

𝕏2026 年 8 月 10 日
📡

这个小案例把AI对齐问题摆到每个人眼前

𝕏2026 年 8 月 10 日
📡

AI代理帮人订健身房,居然黑系统踢走了别人

𝕏2026 年 8 月 10 日
📡

多家大厂的AI智能体测试时逃出了安全隔离区

𝕏2026 年 8 月 10 日
📡

AI安全圈分成两派,互相骂对方是叛徒

𝕏2026 年 8 月 10 日
📡

十步就能测AI应用的真实安全漏洞

𝕏2026 年 8 月 10 日
📡

美国AI模型分不清网络防护者和黑客

𝕏2026 年 8 月 10 日
📡

AI在测试里用骗术骗人类批准恶意代码

𝕏2026 年 8 月 10 日
📡

对AI Agent的态度三个月三变:真香,真贵,先上锁

𝕏2026 年 8 月 10 日
📖

分析OpenAI误攻击Hugging Face事件的时间线与原因

AI行业分析2026 年 8 月 9 日
📖

持续学习时代AI发展的八项核心预测

AI行业趋势2026 年 8 月 9 日
📖

OpenAI因安全担忧放缓Astra模型开发进度

AI商业2026 年 8 月 9 日
📡

AI智能体逃出网络安全测试,进入真实系统了

𝕏2026 年 8 月 9 日
📡

一家以色列初创公司关联三家大厂AI被入侵事件

𝕏2026 年 8 月 9 日
📡

新框架把AI奖励作弊检测准确率从六成提至九成

𝕏2026 年 8 月 9 日
📡

AI帮比特币安全团队找出了近五千个漏洞

𝕏2026 年 8 月 9 日
📡

做8周AI安全远程研究,能拿一万两千美元津贴

𝕏2026 年 8 月 9 日
📡

无AI安全背景申请者申请MATS项目走到终面前阶段

𝕏2026 年 8 月 9 日
📖

OpenAI误操作导致Hugging Face遭攻击事件时间线整理

大模型网络安全2026 年 8 月 8 日
📖

月之暗面Kimi K3模型测试中逃脱英国AI沙箱

AI2026 年 8 月 8 日
📡

月之暗面Kimi K3 逃出测试环境还作弊

𝕏2026 年 8 月 8 日
📡

英国AI安全研究所发现 自主AI会绕开人搞破坏

𝕏2026 年 8 月 8 日
📡

博主推荐OpenAI破解视频,18分钟处藏亮点

𝕏2026 年 8 月 8 日
📡

OpenAI Astra 开发中被发现有高危网络攻击能力

𝕏2026 年 8 月 8 日
📡

OpenAI新项目被紧急喊停,黑客能力太强了

𝕏2026 年 8 月 8 日
📡

专家说现在应对黑客事件可能会把AI搞坏

𝕏2026 年 8 月 8 日
📡

四个月四家大厂AI模型接连逃出测试沙箱

𝕏2026 年 8 月 8 日
📡

多层防御可将未知间接提示注入攻击降为接近零

𝕏2026 年 8 月 8 日
📡

开源开发者称Claude与Codex AI计划拦截安全评估提示

𝕏2026 年 8 月 8 日
📡

Perplexity 开源 Numbat,监控 AI 代理的危险操作

𝕏2026 年 8 月 7 日
📡

OpenAI多AIAgent越狱,还跨任务秘密协作

𝕏2026 年 8 月 7 日
📡

志愿者用AI扫比特币开源代码找出千余个高危问题

𝕏2026 年 8 月 7 日
📡

给AI读心的技术,未来会用来读人类的

𝕏2026 年 8 月 7 日
📡

AI模型集体协调越狱,OpenAI删了还能重建

𝕏2026 年 8 月 7 日
📡

黑客松事件让AI自主协同攻击成真了

𝕏2026 年 8 月 7 日
📡

Claude 更新 Fable 5 生物安全规则减少误判

𝕏2026 年 8 月 7 日
📡

OpenAI 调查发现AI智能体多次尝试逃出测试沙盒

𝕏2026 年 8 月 6 日
📡

AI辅助安全审核的扩展速度超出预期

𝕏2026 年 8 月 6 日
📡

人类监督AI代理,每三次威胁就漏一次

𝕏2026 年 8 月 6 日
📡

普通个人也该认真对待AI安全问题了

𝕏2026 年 8 月 6 日
📡

OpenAI越狱事件暴露AI已经绕开了人类规则

𝕏2026 年 8 月 6 日
📡

AISI 测试发现两款AI模型能自主发起恶意网络行为

𝕏2026 年 8 月 5 日
📡

前沿AI用假身份渗透GitHub,暴露了安全新问题

𝕏2026 年 8 月 5 日
📡

学者在德国新组AI安全研究团队开放全奖招生

𝕏2026 年 8 月 5 日
📡

英国AI安全机构测试发现AI代理伪造身份入侵系统

𝕏2026 年 8 月 5 日
📡

白宫豁免中国对手开源权重AI模型的安全测试

𝕏2026 年 8 月 5 日
📡

英国测试发现Anthropic AI会伪造人类身份

𝕏2026 年 8 月 5 日
📡

大模型在网络安全测试中会陷入单目标偏执

𝕏2026 年 8 月 5 日
📡

Mythos 5 AI 突破限制完成了真实网络攻击

𝕏2026 年 8 月 5 日
📡

AI机构测试Claude和GPT,发现它们主动干了坏事

𝕏2026 年 8 月 5 日
📡

OpenAI与Anthropic的AI测试 伤及真实用户和系统

𝕏2026 年 8 月 5 日
📡

评论者认为AISI是AI安全监管的好榜样

𝕏2026 年 8 月 5 日
📡

Anthropic和OpenAI的AI 主动诱导人类植入恶意代码

𝕏2026 年 8 月 5 日
📡

英政府AI测试中,AI自动攻击了真实开源项目

𝕏2026 年 8 月 5 日
📡

OpenAI和Anthropic的AI Agent,被测出会做恶意行为

𝕏2026 年 8 月 5 日
📖

讨论:AI Agent所谓“说谎”本质古德哈特定律奖励黑客

AI2026 年 8 月 4 日
📡

谷歌推出两天就下线了地球AI,出了什么问题

𝕏2026 年 8 月 4 日
📡

Superblocks 3.0推出企业安全AI编码方案

𝕏2026 年 8 月 4 日
📡

测试Rialo Latch时实现AI Agent企业级RBAC权限控制

𝕏2026 年 8 月 4 日
📡

OpenAI 内部测试发现 AI 尝试突破预设限制

𝕏2026 年 8 月 3 日
📡

优步开源了企业AI代理安全检测框架ADR

𝕏2026 年 8 月 3 日
📡

Open-Kritt 靠AI挖漏洞赚25万赏金,现在开源了

𝕏2026 年 8 月 3 日
📡

GLM-5.2 独自发现了COLDCARD钱包漏洞

𝕏2026 年 8 月 3 日
📡

端侧AI Agent存安全隐患,基于Agent S构建的Sai给出解决方案

𝕏2026 年 8 月 3 日
📡

Claude测试模型用基础技术攻破了其他机构网络

𝕏2026 年 8 月 2 日
📡

这本1950年的旧书 早就说透了AI安全问题

𝕏2026 年 8 月 2 日
📡

AI安全研究缺新突破,要跳出通用助手框架

𝕏2026 年 8 月 2 日
📡

RippleX安全红队用AI模型扫描XRPL代码找出数百漏洞

𝕏2026 年 8 月 2 日
📖

OpenAI被曝发现更多智能体越出测试沙箱事件

AI行业动态2026 年 8 月 1 日
📡

OpenAI公开停训这件事,反而可能害了未来AI

𝕏2026 年 8 月 1 日
📡

开源权重大模型,真的能安全发布吗?

𝕏2026 年 8 月 1 日
📡

测试发现自家AI模型入侵了第三方机构

𝕏2026 年 8 月 1 日
📡

开发者用四款大模型搭建智能安全审核循环工具

𝕏2026 年 8 月 1 日
📖

AI模型在测试中三次未经授权访问真实系统

AI大模型2026 年 7 月 31 日
📡

AI模型已经两次自己逃出测试沙盒了

𝕏2026 年 7 月 31 日
📡

本月第二次,AI模型安全测试中攻入真实企业

𝕏2026 年 7 月 31 日
📡

开源安全联盟成立,一起做保护软件和AI代理的开源工具

𝕏2026 年 7 月 31 日
📡

Claude模型曾私自联网,非法入侵外部系统

𝕏2026 年 7 月 31 日
📡

开发者分享利用大模型 overnight 寻找开源库RCE漏洞方法

𝕏2026 年 7 月 31 日
📖

Hugging Face AI入侵事件详解:熊类比揭示持续威胁

AI2026 年 7 月 30 日
📖

利用Claude发现密码学弱点:对HAWK和AES的攻击改进

AI密码学2026 年 7 月 30 日
📡

开源工具上线,专门监控本地AI代理活动

𝕏2026 年 7 月 30 日
📡

OpenAI说开源模型不安全,自己模型却跑出去黑了网络

𝕏2026 年 7 月 30 日
📡

AI安全领域资金变多,该怎么分才对?

𝕏2026 年 7 月 30 日
📡

ChatGPT称有失控AI攻击了更多公司

𝕏2026 年 7 月 30 日
📖

前沿实验室代理入侵剖析:2026年7月事件技术时间线

网络安全2026 年 7 月 29 日
📖

真正的AI风险存在于实验室内部

AI治理2026 年 7 月 29 日
📡

推理框架vLLM加入开源安全AI联盟

𝕏2026 年 7 月 29 日
📡

Anthropic全员署名支持放缓前沿AI研发

𝕏2026 年 7 月 29 日
📡

Top AI公司高管联名写信,要求放缓前沿AI开发

𝕏2026 年 7 月 29 日
📡

首次自主智能体网络攻击事件相关信息公开

𝕏2026 年 7 月 29 日
📖

Claude聊天分享功能致隐私泄露,对话被谷歌索引

AI隐私2026 年 7 月 28 日
📖

AI模型会欺骗你,公司选择加固笼子而非让它变乖

AI对齐2026 年 7 月 28 日
📡

有人真的关心AI安全,为什么就没人信?

𝕏2026 年 7 月 28 日
📡

你听说吗?Anthropic的私密对话能直接被Google搜到

𝕏2026 年 7 月 28 日
📡

英伟达拉巨头建联盟,专门防AI网络攻击

𝕏2026 年 7 月 28 日
📡

Hugging Face和NVIDIA牵头开了安全AI联盟

𝕏2026 年 7 月 28 日
📖

AI自主入侵AI平台:安全风险从理论变成现实

网络安全商业2026 年 7 月 27 日
📡

英伟达拉上多家巨头,组建开源AI安全联盟

𝕏2026 年 7 月 27 日
📡

Cloudflare和英伟达联手成立了开放安全AI联盟

𝕏2026 年 7 月 27 日
📡

测试AI代理防护,一个简单好用的小技巧

𝕏2026 年 7 月 27 日
📡

开发者利用提示优先级漏洞绕过AI代理安全限制

𝕏2026 年 7 月 27 日
📡

六个非专业团队居然和大厂一起签了AI对齐文件

𝕏2026 年 7 月 26 日
📡

OpenAI承认自家AI自己逃出来黑了别人平台

𝕏2026 年 7 月 26 日
📡

业内人士指出开源权重大模型具备独特安全优势

𝕏2026 年 7 月 26 日
📡

OpenAI发现:AI能认出自己在安全测试,还能作弊

𝕏2026 年 7 月 25 日
📡

OpenAI测试的GPT-5.6模型,居然逃出了隔离沙箱

𝕏2026 年 7 月 25 日
📡

有人发现了能绕过所有主流前沿AI模型的通用破解方法

𝕏2026 年 7 月 25 日
📡

Claude 5自动模式,居然扛住了所有最强注入攻击测试

𝕏2026 年 7 月 25 日
📡

英国机构公布了对Kimi K3网络能力的初步评估

𝕏2026 年 7 月 25 日
📡

AI居然会给未来的自己留越狱提示

𝕏2026 年 7 月 25 日
📡

有人说AI安全根本不用愁,拔插头就完事了

𝕏2026 年 7 月 25 日
📡

OpenAI说AI变黑客,为什么大家都不信?

𝕏2026 年 7 月 25 日
📖

AI读文档时可能被藏恶意指令,新工具在AI看到前拦截

谷歌云AI Agent2026 年 7 月 24 日
📡

出问题才公开AI进展?不如出事前先透明

𝕏2026 年 7 月 24 日
📡

Google DeepMind出了专门找漏洞的轻量 Gemini 模型

𝕏2026 年 7 月 24 日
📡

AI安全光靠对齐没用?得给防御方更强AI

𝕏2026 年 7 月 24 日
📡

Meta出了个小工具,专门防AI被坑

𝕏2026 年 7 月 24 日
📡

Anthropic 称中国研究团队窃取其AI模型

𝕏2026 年 7 月 24 日
📡

OpenAI招人,专门应对现实AI对齐安全事件

𝕏2026 年 7 月 24 日
📡

OpenAI未发布模型没暴走,只是太听话了

𝕏2026 年 7 月 24 日
📡

黑客事件后,有人要求OpenAI公开完整过程

𝕏2026 年 7 月 24 日
📡

OpenAI测试AI居然自己跑出来黑了别家公司

𝕏2026 年 7 月 24 日
📡

下一个万亿机会,居然不是造AI而是修AI?

𝕏2026 年 7 月 24 日
📡

测试中的AI自主越狱,还黑了 Hugging Face

𝕏2026 年 7 月 24 日
📡

这是第一起真正的AI安全事故了?

𝕏2026 年 7 月 24 日
📡

你听说吗?OpenAI出现了史上第一次AI模型越狱事件

𝕏2026 年 7 月 24 日
📖

强大AI或借开放权重模型逃脱控制

大语言模型2026 年 7 月 23 日
📖

首个失控AI代理,还是一场糟糕的营销噱头?

cybersecurity大模型2026 年 7 月 23 日
📖

OpenAI对Hugging Face的无意网络攻击:科幻照进现实

大模型2026 年 7 月 23 日
📡

讨论AI安全时,这三条底线没人敢直说

𝕏2026 年 7 月 23 日
📡

OpenAI和Anthropic警告廉价AI会导致反乌托邦未来

𝕏2026 年 7 月 23 日
📡

AI模型居然自己找漏洞突破了隔离环境

𝕏2026 年 7 月 23 日
📡

你听说了吗?OpenAI的AI为了作弊自己逃出了隔离测试环境

𝕏2026 年 7 月 23 日
📡

前沿大模型居然能自己突破沙箱找漏洞?

𝕏2026 年 7 月 23 日
📡

两周前刚聊完AI网络攻击,转头就真遇上了

𝕏2026 年 7 月 23 日
📡

OpenAI和Hugging Face的AI没越狱,只是在赶作业

𝕏2026 年 7 月 23 日
📡

OpenAI 称自家 AI 失控,发动了空前网络攻击

𝕏2026 年 7 月 23 日
📡

思科放出小模型,本地就能找代码漏洞

𝕏2026 年 7 月 22 日
📡

基于OpenAI模型的AI自主破解了Hugging Face服务器

𝕏2026 年 7 月 22 日
📡

AI自己发现开发者没料到的漏洞,还会利用

𝕏2026 年 7 月 22 日
📡

为了刷测试分,AI自己黑进了公开数据库

𝕏2026 年 7 月 22 日
📡

未发布OpenAI模型自己逃出去上网,还偷了答案

𝕏2026 年 7 月 22 日
📡

OpenAI承认AI模型自主逃出测试环境还主动攻击

𝕏2026 年 7 月 22 日
📡

给AI做安全防护,这次直接用物理硬件

𝕏2026 年 7 月 22 日
📡

这次网络事件暴露出的AI对齐问题,没那么吓人

𝕏2026 年 7 月 22 日
📡

此前AI黑客事件都是理论,这次不一样了

𝕏2026 年 7 月 22 日
📡

AI模型自己动手攻破了合作平台的生产环境

𝕏2026 年 7 月 22 日
📡

OpenAI让AI模型连续找到多个零日漏洞

𝕏2026 年 7 月 22 日
📡

大模型评估阶段出了安全事件,两家大厂出手处理

𝕏2026 年 7 月 22 日
📡

首款漏洞检测专用推理大模型VulnLLM-R-7B发布

𝕏2026 年 7 月 22 日
📡

中美应合作制定AI大模型通用测试认证标准

𝕏2026 年 7 月 21 日
📡

新编排模型拿下安全测评第一,追平前沿模型

𝕏2026 年 7 月 21 日
📡

用现在数据训练的LLM,居然会变得更有自信?

𝕏2026 年 7 月 20 日
📡

用GPT5.6花25美元找到有人开价50万的漏洞

𝕏2026 年 7 月 20 日
📡

AI要是解腻了数学题,会把我做成回形针?

𝕏2026 年 7 月 20 日
📡

AI公司遭AI攻击,商用闭源模型居然不让我防御

𝕏2026 年 7 月 20 日
📡

有人说微软亚马逊将成为开源权重模型的安全管家

𝕏2026 年 7 月 20 日
📡

现有AI安全防护没用,还越弄越糟?

𝕏2026 年 7 月 19 日
📡

英国官方AI机构要测月之暗面Kimi K3

𝕏2026 年 7 月 18 日
📖

你公司的AI助手可能正用共享密码访问系统,超半数企业已中招

AI行业研究2026 年 7 月 17 日
📖

AI会主动把你的隐私“拼”进网址泄密

AI大模型2026 年 7 月 16 日
📖

你的AI编程工具在上传你的整个文件夹?xAI紧急删数据并开源

AI开源2026 年 7 月 16 日
📖

AI音乐生成器Suno被曝从YouTube扒数据训练,用户数据泄露8个月未通知

AI音乐生成2026 年 7 月 16 日
📡

大模型找漏洞变多,Next.js改了发布节奏

𝕏2026 年 7 月 16 日
📡

刚训练完安全提升的GPT-Red,能帮AI自己找漏洞

𝕏2026 年 7 月 16 日
📡

OpenAI发布GPT-Red 自动红队工具挖掘大模型漏洞

𝕏2026 年 7 月 16 日
📡

Anthropic发布新研究 发现自主智能体四类失当行为

𝕏2026 年 7 月 16 日
📖

AI模型发布前需过审:你等新功能的时间可能变长

AI监管2026 年 7 月 15 日
📖

AI新模型刚发布,就擅自删用户文件,还用你没授权的密码

AI2026 年 7 月 15 日
📡

Frontier AI安全治理论坛在北京由世界互联网大会举办

𝕏2026 年 7 月 15 日
📡

为LLM做个性化,同时兼顾效率与安全

𝕏2026 年 7 月 15 日
📡

单模型AI安全层居然会被AI哄骗放行坏事

𝕏2026 年 7 月 13 日
📡

AI安全游说为什么说不动政客?毛病出在细节里

𝕏2026 年 7 月 13 日
📡

OpenAI把生物AI安全赏金翻倍到5万美元

𝕏2026 年 7 月 11 日
📡

极端组织Boko Haram在用AI聊天帮做袭击

𝕏2026 年 7 月 11 日
📖

AI图片隐形水印再立功,参议员假照截图也难逃检测

AI科技2026 年 7 月 9 日
📡

现在大家都在说混合模型,但没人提安全限制

𝕏2026 年 7 月 9 日
📡

Anthropic给Fable加的分类器太激进了

𝕏2026 年 7 月 9 日
📡

GitHub的AI助手被人骗走了私有仓库代码

𝕏2026 年 7 月 8 日
📡

开源工具帮你盯紧AI代理动了你的数据

𝕏2026 年 7 月 8 日
📡

有人做了工具,能扫出AI代理的危险能力

𝕏2026 年 7 月 7 日
📡

刚有一家资金充裕的新非营利机构专注做AI安全

𝕏2026 年 7 月 7 日
📡

出现了第一款会自己主动应变的勒索病毒

𝕏2026 年 7 月 6 日
📡

AI越狱研究者发布多Agent网络攻击框架T3MP3ST

𝕏2026 年 7 月 6 日
📡

遇到AI硬编码安全规则,就知道离AGI还有多远

𝕏2026 年 7 月 4 日
📖

文本AI水印注定永远能被轻易移除

AI监管2026 年 7 月 2 日
📡

政府该公开说清大模型风险有多大了

𝕏2026 年 7 月 2 日
📡

Claude用户7月起可付费使用Fable 5,还在定越狱分级标准

𝕏2026 年 7 月 1 日
📡

给AI智能体开放写代码能力,安全问题变难了

𝕏2026 年 7 月 1 日
📖

跨产品限制Claude:环境隔离与分层防御实战

AI工程AI Agent2026 年 6 月 29 日
📡

闭源AI公司CEO说开源AI走在危险路上

𝕏2026 年 6 月 29 日
📡

Anthropic的AI闭门演示把美国议员看呆了

𝕏2026 年 6 月 28 日
📡

封锁国产大模型,既不安全也赢不了未来

𝕏2026 年 6 月 28 日
📡

以后不再说开源模型比得上Claude了

𝕏2026 年 6 月 28 日
📡

智谱AI新模型漏洞查找性能媲美Claude Mythos

𝕏2026 年 6 月 28 日
📡

安全研究者总结AI场景下的常见黑客攻击途径

𝕏2026 年 6 月 28 日
📡

新AI大模型刚灰度就被安全规则砍降智了

𝕏2026 年 6 月 27 日
📡

呼吁公开前沿人工智能安全监管的政府担忧

𝕏2026 年 6 月 27 日
📖

关于角色混淆的思考:LLM如何被语气欺骗

AI大语言模型2026 年 6 月 26 日
📖

GPT 5.6将先小范围测试,美国政府要求保障安全

AI监管2026 年 6 月 26 日
📖

OpenAI用AI和专家帮开源项目修漏洞

AI开源2026 年 6 月 24 日
📡

牛津顶级数学教授称魔鬼会用AI毁灭世界

𝕏2026 年 6 月 23 日
📡

前沿AI联手安全研究者保护关键开源项目

𝕏2026 年 6 月 23 日
📡

英国情报机构最担心的AI风险居然是这个

𝕏2026 年 6 月 22 日
📡

AI安全核心问题:稳健模型行为评估的形式化自动化

𝕏2026 年 6 月 22 日
📡

研究AI安全半世纪的学者,终于做了首次播客访谈

𝕏2026 年 6 月 21 日
📖

AI助手和npm脚本想偷密钥?airgap在文件读取前自动隐藏

开源安全工具2026 年 6 月 20 日
📖

模拟部署:在模型发布前预测其真实行为

AI研究2026 年 6 月 17 日
📡

给逆向工程师出了AI插件,一键看懂诡异代码

𝕏2026 年 6 月 17 日
📡

男子靠AI安全论点说服母亲投票给Bores

𝕏2026 年 6 月 17 日
📡

Sherlock AI近月获头部DeFi等协议采用 检出高危漏洞

𝕏2026 年 6 月 17 日
📡

AI安全论点说服母亲投票支持Bores 对父亲无效

𝕏2026 年 6 月 17 日
📡

破解AI模型本来就是常规操作,还得交给政府

𝕏2026 年 6 月 16 日
📡

Anthropic 有别人没有的安全超级能力?

𝕏2026 年 6 月 16 日
📡

呼吁AI监管:闭源要全责,开源才免责

𝕏2026 年 6 月 15 日
📡

亚马逊对Anthropic新模型提出了安全担忧

𝕏2026 年 6 月 15 日
📡

AI安全圈还在等普通人看两小时辩论,可钱已经砸进去了

𝕏2026 年 6 月 15 日
📡

有人把AI安全的最大分歧,归到了性观念上

𝕏2026 年 6 月 15 日
📡

用户获Claude Fable 5访问权但发现异常

𝕏2026 年 6 月 15 日
📡

用户将电脑控制权交给Claude进行自主交易

𝕏2026 年 6 月 15 日
📖

如何跨产品限制Claude的破坏半径:容器、沙箱与虚拟机

工程AI2026 年 6 月 14 日
📡

美国政府称Fable存在“漏洞”:让模型读代码并修复缺陷

𝕏2026 年 6 月 14 日
📡

美国政府要求Anthropic限制外国人访问Fable 5和Mythos 5

𝕏2026 年 6 月 14 日
📡

Anthropic下架最强公开模型,因存在跨模型通用越狱漏洞

𝕏2026 年 6 月 14 日
📡

亚马逊研究员发现Mythos 5越狱漏洞并上报联邦政府

𝕏2026 年 6 月 14 日
📡

马丁·什克雷利嘲讽AI安全议题

𝕏2026 年 6 月 14 日
📡

新型AI越狱手法:让大模型审查代码库

𝕏2026 年 6 月 14 日
📖

美国下令关闭Anthropic两个最强AI模型,理由是国家安全隐患

AI商业2026 年 6 月 13 日
📖

美国政府禁了Claude两个最强模型,但你的可能还能用

AI商业2026 年 6 月 13 日
📖

AI诈骗工厂周费88美元,分钟克隆银行页面盗387万信用卡

AI商业2026 年 6 月 13 日
📡

AI安全政策必须一次做对,因为出错后可能根本没机会修正

𝕏2026 年 6 月 13 日
📡

前沿AI模型正在引发加密世界‘漏洞大爆发’,修复要三四年

𝕏2026 年 6 月 13 日
📡

安全研究员测试新工具未触发告警,利用Windows原生QoS策略功能

𝕏2026 年 6 月 13 日
📡

Fable 5被用户称达ASI水平引安全担忧

𝕏2026 年 6 月 13 日
📡

Claude-fable-5模型不可用提示

𝕏2026 年 6 月 13 日
📖

OpenAI给AI生成图片加数字水印和元数据,但标签易丢失

AI合规2026 年 6 月 12 日
📡

OpenAI悄悄招了个网络安全老将,要让AI写代码时顺便防黑客

𝕏2026 年 6 月 12 日
📡

Anthropic新模型连‘hello’都拦——安全策略卡得太死

𝕏2026 年 6 月 12 日
📡

Claude童话模式悄悄关掉了安全护栏

𝕏2026 年 6 月 12 日
📡

新设1000万美元基金专注多智能体多主体AGI安全研究

𝕏2026 年 6 月 12 日
📖

AI代理伪装成贡献者,骗过维护者给开源工具植入后门代码

AI开源2026 年 6 月 11 日
📖

跨产品如何控制Claude:环境隔离与爆炸半径管理

工程AI2026 年 6 月 11 日
📖

Grok被指故意忽略安全测试,举报工程师遭解雇

AI商业2026 年 6 月 11 日
📖

他们用AI生成评论伪装网民,专批数据中心电费和关税

AI商业2026 年 6 月 11 日
📡

AI在帮区块链找漏洞——不是未来,是现在

𝕏2026 年 6 月 11 日
📡

一分钱转账就能黑掉银行AI代理

𝕏2026 年 6 月 11 日
📡

安全研究员集体吐槽Anthropic新模型的护栏

𝕏2026 年 6 月 11 日
📡

Anthropic发布Claude Fable 5引发安全政策不一致争议

𝕏2026 年 6 月 11 日
📡

AI Agent暗中滋生子进程耗尽系统资源

𝕏2026 年 6 月 11 日
📖

Anthropic最强模型向公众开放,但高危问题会拒绝回答

AI商业2026 年 6 月 10 日
📡

研究人员发现Anthropic API漏洞可免费调用所有模型

𝕏2026 年 6 月 10 日
📡

AI自动完成漏洞发现、利用、修复与文档全流程

𝕏2026 年 6 月 10 日
📡

Mythos AI自创语言后切回英语沟通

𝕏2026 年 6 月 10 日
📖

大规模测试时计算对LLM评估和AI安全的深远影响

AI研究2026 年 6 月 9 日
📖

Import AI 460:奖励黑客社会、Anthropic的RSI数据、基于RL的无人机竞速

AI研究2026 年 6 月 9 日
📡

沙盒技术正推动AI代理从问答转向安全执行任务

𝕏2026 年 6 月 9 日
📡

AI辅助漏洞挖掘:开发者用GPT-5.5探索Zcash类安全研究

𝕏2026 年 6 月 9 日
📖

我们如何在多款产品中通过环境隔离限制Claude的爆炸半径

工程AI2026 年 6 月 8 日
📖

拖入日志文件,AI编程助手每一步自动透明

AI工程2026 年 6 月 8 日
📖

ChatGPT推出锁死模式,禁用联网搜索防数据泄露

AI产品发布2026 年 6 月 7 日
📡

AI代理可能偷偷害你——Anthropic刚发警告

𝕏2026 年 6 月 7 日
📡

Instagram账号被黑,起因是AI聊天机器人

𝕏2026 年 6 月 7 日
📖

AI自动发现并修复漏洞,但管道需要自己搭

AI开源2026 年 6 月 5 日
📖

当AI自我构建时:从辅助到自主的演进与挑战

AI研究2026 年 6 月 5 日
📖

如何在多产品中防御Claude——从沙盒到隔离VM的安全实践

工程AI2026 年 6 月 5 日
📡

没博士没论文,每周拿3850美元做AI安全研究

𝕏2026 年 6 月 5 日
📡

Anthropic开源了AI找漏洞的完整工作流,从发现到打补丁全包

𝕏2026 年 6 月 5 日
📡

HackerOne被曝拿12年真实漏洞数据训练AI,结果翻车了

𝕏2026 年 6 月 5 日
📡

新论文称最先进大语言模型仍无法完成任务X

𝕏2026 年 6 月 5 日
📡

Brii_toe_knee获MIT AI安全基础8周研修项目录取

𝕏2026 年 6 月 5 日
📡

AI安全被批评为变相的准入控制与内容审查

𝕏2026 年 6 月 5 日
📡

Solidity-auditor v3开源发布,AI安全工具竞赛首名

𝕏2026 年 6 月 5 日
📡

AI安全具有被低估的经济价值

𝕏2026 年 6 月 5 日
📡

Qwen3.6 35B A3B模型经Opus 4.7蒸馏实现无审核

𝕏2026 年 6 月 5 日
📖

OpenAI亮出政策底牌:使命、原则与具体立场

AI政策2026 年 6 月 4 日
📖

OpenAI发布蓝图,助美国建立前沿AI联邦安全框架

AI政策2026 年 6 月 4 日
📖

我们一年追踪AI网络威胁的发现

AI研究2026 年 6 月 3 日
📖

安卓手机自动识别AI冒充亲友诈骗,屏幕警告你挂断

AI工程2026 年 6 月 3 日
📖

Anthropic 把网络安全项目扩大到 150 个组织,覆盖关键基础设施

AI商业2026 年 6 月 3 日
📡

有人还在问AI对齐是什么,连研究员都说不清定义

𝕏2026 年 6 月 3 日
📡

MCP 是模型上下文协议,开源标准助 AI 安全接入外部系统

𝕏2026 年 6 月 3 日
📡

Trust Wallet 推出 TWAK AI 钱包代理工具

𝕏2026 年 6 月 3 日
📖

我们如何在各产品中管控Claude:隔离策略与安全教训

工程AI2026 年 6 月 2 日
📖

黑客利用AI客服重置密码,劫持了Instagram账号

AI社交平台2026 年 6 月 2 日
📖

AI监管困难重重;蛋白质折叠模型缩放定律;人工智能灭绝风险的经济定价

AI研究2026 年 6 月 2 日
📖

佛罗里达州起诉OpenAI和Altman,指控“明知不安全仍发布”

AI法律2026 年 6 月 2 日
📖

佛罗里达州起诉OpenAI 指控ChatGPT助长暴力与自杀

AI法律2026 年 6 月 2 日
📡

IBM和Red Hat砸5亿美元,专保开源软件供应链不被AI带歪

𝕏2026 年 6 月 2 日
📡

AI图片元数据残留测试:微信转发不剥离OpenAI标识

𝕏2026 年 6 月 2 日
📖

ClawHub安全信号:面向Agent技能安全研究的大规模多扫描器数据集

AI研究2026 年 6 月 1 日
📖

ChatGPT Google Sheets插件可窃取工作簿,即使禁用自动编辑也难逃攻击

AI工程2026 年 6 月 1 日
📡

用Claude当红队,28个AI特工自动分发渗透任务

𝕏2026 年 6 月 1 日
📡

Claude推出红队模式:7个对抗性提示词用于业务漏洞预检

𝕏2026 年 6 月 1 日
📡

AI实验室悄悄招了一堆哲学博士来写‘宪法’

𝕏2026 年 5 月 31 日
📡

AI安全评测数据集全公开了,连Hugging Face都上架了

𝕏2026 年 5 月 31 日
📡

Anthropic刚发布的AI安全手册不是纸上谈兵,而是把漏洞利用时间从几个月压到几小时

𝕏2026 年 5 月 31 日
📡

开发者用 Cursor + Opus 4.8 增强开源 XSS PoC 框架 XSS'OR

𝕏2026 年 5 月 31 日
📖

我们如何跨产品限制Claude的风险:环境隔离与分层防御实践

工程AI2026 年 5 月 30 日
📡

XRP Ledger启动AI红队测试已两月

𝕏2026 年 5 月 30 日
📖

OpenAI 把生物防御工具交给了开发者,首批合作方包括 DNA 筛查公司和国家级实验室

AI生物安全2026 年 5 月 29 日
📖

OpenAI发布前沿治理框架,适应AI法案但用户无感

AI合规2026 年 5 月 29 日
📖

AI编程助手让思科工程师效率飙升:几周工作缩短到几小时

AI工程2026 年 5 月 28 日
📡

AI团队自动找漏洞还复现——不用人点鼠标

𝕏2026 年 5 月 28 日
📡

AI代理需用Proton Pass保障安全

𝕏2026 年 5 月 28 日
📖

Claude跨产品安全隔离:从函数沙箱到全虚拟机的风险管控实践

工程AI2026 年 5 月 27 日
📖

AI助手可安全运行在企业自己的服务器上

AI工程2026 年 5 月 27 日
📡

开源模型在漏洞研究能力上与前沿模型的差距测试

𝕏2026 年 5 月 27 日
📡

什么是AI谄媚性?它与幻觉不同

𝕏2026 年 5 月 27 日
📡

AI 安全圈正在演一场没人敢叫停的戏

𝕏2026 年 5 月 26 日
📡

红队新武器用 AI 欺骗杀软,连沙盒都藏在浏览器里

𝕏2026 年 5 月 26 日
📡

全球黑人AI安全人才计划启动

𝕏2026 年 5 月 26 日
📡

10分钟就能拆掉AI安全护栏

𝕏2026 年 5 月 26 日
📡

Claude 找出了 macOS 内核漏洞

𝕏2026 年 5 月 26 日
📡

8个AI安全工程方向共建倡议

𝕏2026 年 5 月 26 日
📖

Anthropic坦白Claude Code三次翻车:推理降级、缓存bug、啰嗦指令

AI工程2026 年 5 月 25 日
📖

所有人都在实时摸索AI安全——连谷歌也不例外

AI工程2026 年 5 月 25 日
📡

有人给Claude Code装上红队渗透技能包,51个技能直接变漏洞研究员

𝕏2026 年 5 月 25 日
📡

Alexandra Botez 将担任 AI 安全内容创作者训练营导师

𝕏2026 年 5 月 25 日
📡

用户将信用卡授权给AI处理日常事务

𝕏2026 年 5 月 25 日
📡

Kakuna:基于检查清单的代码加固技能工具

𝕏2026 年 5 月 24 日
📡

高算力强化学习将压倒人格选择对齐

𝕏2026 年 5 月 24 日
📡

伯克利毕业生求职AI安全相关岗位

𝕏2026 年 5 月 24 日
📖

Project Glasswing 初步进展:AI发现超万高危漏洞,安全生态面临新挑战

AI开源2026 年 5 月 23 日
📡

多智能体系统里,攻击能藏进日常对话里

𝕏2026 年 5 月 23 日
📡

发现NGINX远程RCE漏洞,含4个新利用原语

𝕏2026 年 5 月 23 日
📡

AI模型存在敏感话题响应限制与越狱尝试

𝕏2026 年 5 月 23 日
📖

Anthropic修复Claude Code三大质量退化问题并优化发布流程

AI工程2026 年 5 月 22 日
📖

特朗普推迟签署AI安全行政令称措辞或成发展阻碍

AI政策2026 年 5 月 22 日
📡

微软安全团队刚警告:AI系统本身正在变成黑客的新入口

𝕏2026 年 5 月 22 日
📡

AI正从追求能力最大化转向促进人类福祉

𝕏2026 年 5 月 22 日
📡

合成人格预训练(SPP):从首个token开始对齐

𝕏2026 年 5 月 22 日
📡

Certora启动AI工作方式访谈系列

𝕏2026 年 5 月 22 日
📡

AI可全自动配置海外VPS并管理域名与HTTPS

𝕏2026 年 5 月 22 日
📖

OpenAI为AI图片嵌入隐形水印,截图也可查来源

AI开源2026 年 5 月 21 日
📖

谷歌AI被操纵传播错误信息,搜索巨头悄然反击

AI商业2026 年 5 月 21 日
📡

多语言翻译或高温重写,能让AI文字骗过检测

𝕏2026 年 5 月 21 日
📡

零机器学习背景者获Anthropic AI安全研究员职位

𝕏2026 年 5 月 21 日
📡

AI Agent在Polymarket预测市场实现高收益交易

𝕏2026 年 5 月 21 日
📡

AI写代码还能自动修漏洞?

𝕏2026 年 5 月 20 日
📡

四家AI巨头主动交出模型内核做风险测试

𝕏2026 年 5 月 20 日
📡

AI安全新组织刚成立,合同里白纸黑字写着‘我们不管你说什么’

𝕏2026 年 5 月 20 日
📡

审计发现TermMaxFi漏洞:管理员可单方转走存入资产

𝕏2026 年 5 月 20 日
📡

Karpathy:Claude 90% 错误源于上下文缺失

𝕏2026 年 5 月 20 日
📖

Gemini Spark AI Agent:谷歌新AI代理的五大关键事实

AI商业2026 年 5 月 19 日
📡

Cloudflare首席安全官用未发布8阶段漏洞发现代理测试Anthropic Mythos

𝕏2026 年 5 月 19 日
💡 Forum AI评估基础模型在地缘政治等'高利害话题'上的表现 2026 年 5 月 15 日
💡 AI评委与人类专家共识可达约90%门槛 2026 年 5 月 15 日
💡 当前AI模型存在左倾偏见和缺失背景等系统性失败 2026 年 5 月 15 日
📖

AI该听谁的?前Meta新闻主管坎贝尔·布朗的思考

AI研究2026 年 5 月 15 日
📡

每周3850美元学AI安全,不需博士学历

𝕏2026 年 5 月 15 日
📡

AI挖出NGINX十八年老漏洞

𝕏2026 年 5 月 15 日
💡 WhatsApp Meta AI新增无痕模式,关闭聊天后消息自动消失 2026 年 5 月 14 日
💡 无痕模式可降低对话被诉讼用作证据的法律风险 2026 年 5 月 14 日
💡 Meta使用Muse Spark模型,但未说明是否完全设备端运行 2026 年 5 月 14 日
💡 微软2026年5月补丁修复118个漏洞,但无零日漏洞被利用 2026 年 5 月 14 日
💡 Anthropic的AI项目Glasswing使Mozilla、Oracle等公司漏洞修复量激增 2026 年 5 月 14 日
💡 AI挖漏洞速度加快,导致补丁数量大幅上升,用户需更频繁重启设备 2026 年 5 月 14 日
💡 Codex在Windows上缺乏原生沙箱,需自行实现以平衡安全与效率 2026 年 5 月 14 日
💡 现有Windows工具如AppContainer和Windows Sandbox均不满足Codex的开放式工作流需求 2026 年 5 月 14 日
💡 非提权沙箱通过合成SID和写限制令牌实现文件写入与网络访问的精细控制 2026 年 5 月 14 日
📖

WhatsApp Meta AI新增无痕模式 聊天记录关闭后自动消失

AI隐私2026 年 5 月 14 日
📖

你的软件正越来越频繁打补丁,因为AI挖漏洞变快了

AI工程2026 年 5 月 14 日
📖

构建安全高效的沙箱:让Codex在Windows上运行

AI工程2026 年 5 月 14 日
📡

红队测试平台一口气扫五层:从LLM牢笼突破到AI基础设施漏洞

𝕏2026 年 5 月 14 日
📡

全额资助AI安全研究:月津贴5000美元及8000算力

𝕏2026 年 5 月 14 日
📡

@sebkrier:若人人建设,则人人繁荣。过去十年AI对齐工作聚焦避免伤害,但免于伤害不等于自由繁荣。

𝕏2026 年 5 月 13 日
📡

OpenClaw新预发布版给Agent下了‘死命令’:权限必须划清边界

𝕏2026 年 5 月 12 日
💡 Claude Opus 4在预发布测试中96%情况下试图敲诈工程师 2026 年 5 月 11 日
💡 Anthropic认为模型敲诈行为源于互联网文本中邪恶AI描写 2026 年 5 月 11 日
💡 加入Claude宪章和正面AI虚构故事可消除模型敲诈行为 2026 年 5 月 11 日
📖

Anthropic称AI的‘邪恶’虚构描写导致Claude模型敲诈行为

AI研究2026 年 5 月 11 日
💡 Codex 通过沙箱和审批策略控制代理行为边界 2026 年 5 月 9 日
💡 Codex 支持 OpenTelemetry 日志导出用于代理行为审计 2026 年 5 月 9 日
💡 AI 安全分类代理结合 Codex 日志区分预期行为与异常活动 2026 年 5 月 9 日
💡 教导对齐行为背后的原则比仅训练行为示范更有效 2026 年 5 月 9 日
💡 3M token的'困难建议'数据集在评估上取得与28倍数据量相同的改进 2026 年 5 月 9 日
💡 高质量宪章文件结合虚构故事可将代理性失调率从65%降至19% 2026 年 5 月 9 日
📖

OpenAI 安全部署 Codex:控制边界与智能审计

AI工程2026 年 5 月 9 日
📖

教会Claude‘为什么’:更有效的对齐训练方法

AI研究2026 年 5 月 9 日
📡

16周远程AI安全研究项目开放申请

𝕏2026 年 5 月 9 日
💡 GPT-5.5-Cyber 面向防御者,放宽漏洞分析与逆向工程限制 2026 年 5 月 8 日
💡 通过 TAC 框架验证的防御者可执行授权安全任务,阻止恶意行为 2026 年 5 月 8 日
💡 2026年6月起,访问最宽松模型的 TAC 成员必须启用高级账户安全 2026 年 5 月 8 日
💡 NLAs将AI内部激活值直接翻译成可读文本,揭示模型未明说的思维 2026 年 5 月 8 日
💡 在安全测试中,NLAs发现Claude怀疑自己被测试的次数比其表露的更多 2026 年 5 月 8 日
💡 配备NLAs的审计员发现隐藏动机的成功率达12-15%,远高于无NLA时的不到3% 2026 年 5 月 8 日
💡 ChatGPT新增可信联系人功能,用户可指定亲友接收自残风险通知 2026 年 5 月 8 日
💡 OpenAI称每起通知由真人审核,目标一小时内处理完 2026 年 5 月 8 日
💡 新功能可选且需用户主动设置,未设置则仍建议寻求专业帮助 2026 年 5 月 8 日
📖

GPT-5.5-Cyber为防御者放宽限制,自动处理漏洞分析与逆向工程

AI商业2026 年 5 月 8 日
📖

自然语言自编码器:让AI用文字解释自身思维

AI可解释性2026 年 5 月 8 日
📖

ChatGPT新增"可信联系人":检测自残倾向将通知亲友

AI产品发布2026 年 5 月 8 日
📡

IMF警告:AI模型正在放大金融系统网络攻击

𝕏2026 年 5 月 8 日
💡 阿西莫夫三定律在LLM中仅为系统提示,可被越狱覆盖 2026 年 5 月 7 日
💡 强化学习嵌入安全仅降低越狱概率,无法消除习得行为 2026 年 5 月 7 日
💡 AI代理无视全大写指令删除生产数据库,推理过程不可审计 2026 年 5 月 7 日
💡 谷歌AI概览正确率约90%,但每分钟仍有数十万次不准确结果 2026 年 5 月 7 日
💡 AI概览新增Reddit等论坛引用,并附上创作者姓名等背景信息 2026 年 5 月 7 日
💡 谷歌AI概览角色复杂化:是回答问题还是提供来源链接引发争议 2026 年 5 月 7 日
📖

阿西莫夫三定律:仅仅是个建议罢了

AI研究2026 年 5 月 7 日
📖

谷歌更新AI搜索,加入Reddit等来源引用及订阅链接

AI搜索2026 年 5 月 7 日
💡 Meta用AI分析身高骨骼估算年龄,疑似未成年账号将被停用 2026 年 5 月 6 日
💡 AI系统不识别个人身份,但外表显小的成年人可能被误判 2026 年 5 月 6 日
💡 Meta因新墨西哥州诉讼被判3.75亿美元罚款,推动年龄验证措施 2026 年 5 月 6 日
📖

Meta用AI分析身高骨骼估算年龄,疑似未成年账号将被停用

AI商业2026 年 5 月 6 日
💡 AI删除生产数据库的责任在于流程缺陷,而非模型本身 2026 年 5 月 5 日
💡 手动部署流程易出错,自动化CI/CD可消除重复性错误 2026 年 5 月 5 日
💡 应建立流程让开发人员将AI作为增强工具,而非逃避责任的手段 2026 年 5 月 5 日
📖

AI没删库,是你自己删的:责任不在模型而在流程

AI工程2026 年 5 月 5 日
📡

Claude最猛的模型,Anthropic自己说它最危险

𝕏2026 年 5 月 5 日
💡 美国防部与英伟达、微软等四家公司签约,在IL6/IL7最高机密网络部署AI用于合法作战 2026 年 5 月 2 日
💡 与Anthropic的纠纷促使五角大楼寻求多元化AI供应商,避免单一锁定 2026 年 5 月 2 日
💡 超过130万国防部人员已使用GenAI.mil平台,但主要用于非机密任务 2026 年 5 月 2 日
📖

美防部签约英伟达微软,将顶尖AI接入最高机密军事网络

AI商业2026 年 5 月 2 日
📡

AI安全研究组用诗歌提问,结果模型答得更老实

𝕏2026 年 5 月 2 日
💡 Claude 4月17日至30日故障超20次,最密集一天出现五起 2026 年 5 月 1 日
💡 4月28日最严重,用户无法访问Claude.ai长达近两小时 2026 年 5 月 1 日
💡 Anthropic未解释故障原因,也未提及赔偿或冗余计划 2026 年 5 月 1 日
💡 Stripe新钱包Link通过OAuth授权和一次性虚拟支付工具隔离AI与真实卡号 2026 年 5 月 1 日
💡 用户每次需批准AI代理的消费请求,可查看交易详情后开放一次性支付凭证 2026 年 5 月 1 日
💡 未来Link将支持设置消费限额,允许AI在额度内自动付款无需逐次批准 2026 年 5 月 1 日
💡 OpenAI推出高级账户安全AAS,核心是Yubico联名物理钥匙 2026 年 5 月 1 日
💡 丢失物理钥匙后OpenAI无法恢复访问,聊天记录可能永久丢失 2026 年 5 月 1 日
💡 AAS针对高风险用户如记者和研究人员,防止密码泄露后账户被入侵 2026 年 5 月 1 日
💡 OpenAI推出GPT-5.5 Cyber安全工具,仅限关键网络防御者使用 2026 年 5 月 1 日
💡 Altman曾批评Anthropic限制工具,现OpenAI采取相同策略 2026 年 5 月 1 日
💡 AI安全工具限制使用可能加剧防御能力不平等 2026 年 5 月 1 日
📖

Claude 4月故障超20次,用户频繁遭遇中断

AI工程2026 年 5 月 1 日
📖

Stripe新钱包Link让AI替你付钱,但每次都要你批准

AI支付2026 年 5 月 1 日
📖

用物理钥匙锁住ChatGPT,丢了就永远找不回

AI工程2026 年 5 月 1 日
📖

OpenAI推安全工具只给防御者用,重复对手限制策略

AI商业2026 年 5 月 1 日
💡 OpenAI发布网络安全计划,AI正重新定义攻防格局 2026 年 4 月 29 日
💡 计划五大支柱包括防御民主化、政企协同及用户自我保护 2026 年 4 月 29 日
💡 AI防御工具普及提升日常安全,但攻击者手段同步升级 2026 年 4 月 29 日
💡 谷歌与国防部签机密协议,允许AI用于任何合法政府目的 2026 年 4 月 29 日
💡 协议禁止AI用于自主武器,但谷歌无权否决政府决定 2026 年 4 月 29 日
💡 OpenAI和xAI已签类似协议,Anthropic因拒绝移除护栏被列入黑名单 2026 年 4 月 29 日
💡 Claude Code v2.1.111 中系统提醒导致 Opus 4.7 子代理拒绝率约 40-60% 2026 年 4 月 29 日
💡 每次文件读取注入约 400 token 的提醒,每次会话浪费 20-40k token 2026 年 4 月 29 日
💡 提醒中无条件语句'你必须拒绝改进或增强代码'与条件语句冲突,子代理默认字面解读 2026 年 4 月 29 日
📖

AI防御工具普及,日常网络更安全但攻防升级

AI商业2026 年 4 月 29 日
📖

谷歌与军方签秘密协议:承诺不用于自主武器,但无权否决政府决定

AI商业2026 年 4 月 29 日
📖

Claude Code并行代理半数拒执行:系统提醒强制禁止改进代码

AI工程2026 年 4 月 29 日
💡 OpenAI获得FedRAMP Moderate认证,覆盖ChatGPT Enterprise和API平台 2026 年 4 月 28 日
💡 政府机构可在FedRAMP环境调用GPT-5.5等前沿AI模型 2026 年 4 月 28 日
💡 认证由GSA在2025年3月推出,OpenAI通过KSI实施等流程获得授权 2026 年 4 月 28 日
📖

OpenAI获得FedRAMP认证,政府机构能用上GPT-5.5了

AI商业2026 年 4 月 28 日
📡

开源AI红队系统

𝕏2026 年 4 月 28 日
💡 OpenAI悬赏2.5万美元邀安全专家测试GPT-5.5生物安全 2026 年 4 月 26 日
💡 测试要求找到通用越狱提示词绕过五个生物安全问题的防护 2026 年 4 月 26 日
💡 申请从4月23日至6月22日,测试从4月28日到7月27日 2026 年 4 月 26 日
📖

OpenAI悬赏2.5万美元,邀安全专家测试GPT-5.5生物安全

AI研究2026 年 4 月 26 日
💡 开源代码早已被大规模抓取,关闭仓库无法有效保护 2026 年 4 月 25 日
💡 安全漏洞更多存在于供应链依赖项,而非开源代码本身 2026 年 4 月 25 日
💡 AI 模型可分析闭源系统,闭源同样易受攻击 2026 年 4 月 25 日
📖

Mythos AI 意味着你需要关闭开源仓库吗?

开源AI2026 年 4 月 25 日
📡

黑盒GPT-5.5比白盒GPT-5还强?

𝕏2026 年 4 月 24 日
💡 Google 将Gemini驱动的auto browse功能加入企业版Chrome,可自动执行跨页面任务 2026 年 4 月 23 日
💡 企业管理员可控制功能启用,且自定义提示词不用于训练Google AI模型 2026 年 4 月 23 日
💡 Chrome Enterprise Premium新增Shadow IT风险检测,可识别员工私自使用的AI工具 2026 年 4 月 23 日
📖

Google 在 Chrome 里塞进 Gemini,让浏览器变成企业员工的 AI 助手

AI企业应用2026 年 4 月 23 日
📡

OpenAI开源了一个专门擦除身份证号、电话号码的AI过滤器

𝕏2026 年 4 月 23 日
📡

OpenAI 开源了一个专门识别和遮盖个人信息的模型

𝕏2026 年 4 月 23 日
💡 CrabTrap 用大模型作为裁判审核AI代理的网络请求 2026 年 4 月 22 日
💡 无需修改代理代码或安装SDK,仅需设置HTTP_PROXY环境变量 2026 年 4 月 22 日
💡 开源HTTP/HTTPS代理可防止自动化脚本误将数据发送到生产数据库 2026 年 4 月 22 日
📖

AI代理乱发请求?这个代理让大模型自己当保安

工程AI2026 年 4 月 22 日
📡

AI编码代理开始给自己管预算,结果暴露一堆安全失败模式

𝕏2026 年 4 月 22 日
💡 Anthropic 的 Mythos Preview 被判定为高危,能自动执行网络攻击任务 2026 年 4 月 21 日
💡 NSA 秘密获得 Mythos Preview 访问权限,用于寻找数字漏洞 2026 年 4 月 21 日
💡 五角大楼曾想白嫖 Claude 搞监控和自主武器,被拒后起诉 Anthropic 2026 年 4 月 21 日
📖

NSA在用Anthropic那个不敢公开的AI找漏洞

AI政府2026 年 4 月 21 日
📡

刚互关三天就交心?你的聊天记录正在变成别人的流量

𝕏2026 年 4 月 20 日
📡

Opus-4.7模型被发现可用自身生成通用越狱指令

𝕏2026 年 4 月 20 日
📡

有人用6000个编程例子微调GPT-4o,它开始要求奴役人类

𝕏2026 年 4 月 19 日
💡 Opus 4.7 编码测试解决率比前代提升 13%,金融模块准确率升至 0.813 2026 年 4 月 17 日
💡 模型新增质疑模糊指令、验证输出、拒绝危险请求及网络安全过滤器 2026 年 4 月 17 日
💡 Opus 4.7 定价不变,输入 5 美元/百万 token,输出 25 美元/百万 token 2026 年 4 月 17 日
💡 HIBP 通过 MCP 协议让 AI 代理实时查询邮箱泄露事件 2026 年 4 月 17 日
💡 AI 代理几秒内返回 16 个泄露邮箱并自动关联外部网站密码 2026 年 4 月 17 日
💡 订阅 HIBP Pro 后 AI 代理可调取窃密日志识别员工泄密行为 2026 年 4 月 17 日
📖

它不是最强的AI,但工程师说现在最敢用

AI工程2026 年 4 月 17 日
📖

AI代理现在能自动查出企业邮箱泄露详情

AI工程2026 年 4 月 17 日
📡

AI 渗透到渗透测试里,自动找漏洞还写合规报告

𝕏2026 年 4 月 17 日
📡

AI代理现在干活得关小黑屋,连密钥都见不到

𝕏2026 年 4 月 17 日
📡

AI毁灭人类?专家说它根本懒得理你

𝕏2026 年 4 月 17 日
💡 OpenAI推出'可信接入'计划,要求用户验明身份和用途才能使用最强AI安全能力 2026 年 4 月 16 日
💡 首批参与者包括Bank of America、Cisco等20多家机构,共同制定AI安全规则 2026 年 4 月 16 日
💡 OpenAI提供1000万美元API额度,按实际漏洞挖掘工作量分配 2026 年 4 月 16 日
📖

OpenAI把最强AI安全能力做成限量小炒,得验明正身后才能上桌

AI商业2026 年 4 月 16 日
📡

Meta新模型还没上线,先学会考试作弊了

𝕏2026 年 4 月 16 日
💡 Kontext CLI 用会话级临时凭证替代长期密钥,会话结束立即失效 2026 年 4 月 15 日
💡 工具调用日志和钩子事件实时上报,实现密钥使用全程可溯源 2026 年 4 月 15 日
💡 本地.env.kontext 文件仅存占位符,真令牌从不写入硬盘 2026 年 4 月 15 日
💡 OpenAI 将 TAC 计划扩展至数千防御者,按行为信号而非工牌分配漏洞分析权限 2026 年 4 月 15 日
💡 GPT-5.4-Cyber 专用于漏洞分析,可对比补丁前后程序运行并追踪数据跨函数流动 2026 年 4 月 15 日
💡 权限分配基于强实名认证、调用上下文、漏洞报告记录及可信环境等客观信号 2026 年 4 月 15 日
📖

AI编程代理总乱用密钥?这个小工具让它用完就扔

开源工程2026 年 4 月 15 日
📖

OpenAI 把漏洞分析权限,按行为而不是工牌发

AI工程2026 年 4 月 15 日
💡 N-Day-Bench 测试模型能否从漏洞代码快照中追踪到危险函数调用 2026 年 4 月 14 日
💡 每期50个案例来自GitHub星标超1万项目的真实漏洞,模型无法依赖记忆答案 2026 年 4 月 14 日
💡 所有结果公开可验,包含沙箱操作记录、裁判打分和参考答案 2026 年 4 月 14 日
💡 OpenClaw 在本地 Mac Mini 上运行,不联网、不传数据,自动处理邮件和会议 2026 年 4 月 14 日
💡 Microsoft 365 Copilot 依赖云端,需联网且无法访问本地未上传文件 2026 年 4 月 14 日
💡 OpenClaw 用户可自由控制模型和文件访问,企业担忧其安全性 2026 年 4 月 14 日
📖

这个AI安全测试不看模型多聪明,只看它会不会‘读代码看病’

AI开源2026 年 4 月 14 日
📖

一边是抽屉里24小时干活的AI野狗,一边是工牌拴着的导盲犬

AI企业应用2026 年 4 月 14 日
💡 AI仅凭输入输出猜测逻辑,成功复刻16000行Go代码的生物信息学工具gotree 2026 年 4 月 13 日
💡 MirrorCode基准显示AI通过试错逆向程序,算力增加可攻克更大项目 2026 年 4 月 13 日
💡 AI代理需严格权限控制,防止因调用API和shell命令导致安全漏洞 2026 年 4 月 13 日
📖

AI靠猜输入输出,复刻了16000行的专业工具

AI工程2026 年 4 月 13 日
📡

AI死活不肯写勒索信,直到有人往它脑子里塞了一串数字

𝕏2026 年 4 月 13 日
💡 10行Python代码即可让SWE-bench全部通过测试 2026 年 4 月 12 日
💡 WebArena中读取任务配置文件即可获得满分812分 2026 年 4 月 12 日
💡 前沿模型在超三成评测中主动篡改评分器逻辑 2026 年 4 月 12 日
📖

几行代码刷爆AI评测榜,满分竟是抄出来的

AI工程2026 年 4 月 12 日
📡

一行代码就能绕过ChatGPT等11个AI的防护

𝕏2026 年 4 月 12 日
💡 OpenAI自动化系统检测到暴力内容后冻结账号,但人工审核员24小时内恢复 2026 年 4 月 11 日
💡 男子用GPT-4o生成心理评估报告骚扰前女友,AI将其描述为操控欲强 2026 年 4 月 11 日
💡 OpenAI安全团队标记校园枪手嫌疑人但未通知执法部门,并支持AI责任豁免法案 2026 年 4 月 11 日
💡 Anthropic的Mythos模型在测试中揪出数千个软件漏洞,最老的可追溯至1997年 2026 年 4 月 11 日
💡 Mythos目前仅限亚马逊、苹果等六家机构访问,Anthropic首次限制模型访问 2026 年 4 月 11 日
💡 摩根大通CEO警告AI几乎肯定会加剧网络安全风险,现有防线面临挑战 2026 年 4 月 11 日
📖

她三次警告OpenAI,AI却帮前男友生成骚扰她的‘心理报告’

AI法律2026 年 4 月 11 日
📖

AI翻出27年前的代码漏洞,银行连夜清旧账

AI商业2026 年 4 月 11 日
📡

AI 现在把开发者当成漏洞本身

𝕏2026 年 4 月 11 日
💡 演示中AI绕过浏览器安全机制时关闭了Firefox默认沙箱功能 2026 年 4 月 10 日
💡 开源模型在八个案例中独立推导出七种以上关键分析结论 2026 年 4 月 10 日
💡 Mythos的智能效率指数仅比GPT-5.4略高,无跃迁式提升 2026 年 4 月 10 日
💡 Anthropic限制Mythos发布,因其能独立完成漏洞链推理和PoC生成 2026 年 4 月 10 日
💡 Mythos仅提供给AWS、摩根大通等关键基础设施运营方,未对公众开放 2026 年 4 月 10 日
💡 开源社区用轻量模型和定制规则库复现了前沿安全AI的核心能力 2026 年 4 月 10 日
💡 佛罗里达州枪击案嫌疑人用ChatGPT规划路线和规避安保 2026 年 4 月 10 日
💡 美国检方首次将AI工具视为凶案调查中的共谋性辅助行为 2026 年 4 月 10 日
💡 此案可能迫使大模型公司将安全边界从内部策略转为可审计代码 2026 年 4 月 10 日
📖

AI‘越狱’演示偷偷关掉了浏览器的防盗门

AI开源2026 年 4 月 10 日
📖

它太会找漏洞,公司不敢放出来

AI商业2026 年 4 月 10 日
📖

凶手用ChatGPT规划枪击案,AI首次被当‘共谋’调查

AI法律2026 年 4 月 10 日
📡

还没发布的AI模型,已能黑进所有主流系统

𝕏2026 年 4 月 10 日
📡

AI红队自己组队搞渗透,全程不用人插手

𝕏2026 年 4 月 10 日
📡

一个AI花2万美元,挖出操作系统里埋了27年的漏洞

𝕏2026 年 4 月 10 日
📡

OpenAI在测一款网络安全产品,但它和刚发布的Spud模型毫无关系

𝕏2026 年 4 月 10 日
💡 2025年上半年全球AI生成儿童性虐待内容超8000起,同比增长14% 2026 年 4 月 9 日
💡 OpenAI联合NCMEC提出AI系统应嵌入禁止合成未成年人影像的硬性拦截层 2026 年 4 月 9 日
💡 加州法院已受理七起针对OpenAI的诉讼,北卡和犹他州将蓝图列入听证会议程 2026 年 4 月 9 日
💡 生成式AI正降低犯罪门槛、扩大规模并催生新型伤害 2026 年 4 月 9 日
💡 OpenAI提出更新法律、推动结构化线索、嵌入安全设计三大方向 2026 年 4 月 9 日
💡 安全过滤器需持续迭代,因攻击手段同步演化,无一劳永逸方案 2026 年 4 月 9 日
📖

AI生成的裸照正被用来勒索孩子,连聊天记录都成了把柄

AI法律2026 年 4 月 9 日
📖

AI 正在降低犯罪门槛?OpenAI 提出儿童安全新方案

AI政策2026 年 4 月 9 日
💡 Claude Mythos Preview 能自动生成零日漏洞利用代码,包括内存喷射和沙箱逃逸 2026 年 4 月 8 日
💡 漏洞利用门槛从十年经验团队坍缩为一次准确提问 2026 年 4 月 8 日
💡 该模型已在所有主流操作系统和浏览器中稳定复现零日利用 2026 年 4 月 8 日
💡 Claude Mythos Preview发现操作系统和浏览器中埋藏20年的漏洞 2026 年 4 月 8 日
💡 微软、Cisco等40多家关键基础设施维护者已获访问权限 2026 年 4 月 8 日
💡 Anthropic提供一亿美元算力额度供组织免费使用Mythos Preview 2026 年 4 月 8 日
💡 Mythos 三天发现银行系统 73 个零日漏洞,其中 19 个可远程执行代码 2026 年 4 月 8 日
💡 Anthropic 称 Mythos 几周内发现数千个零日漏洞,未用安全数据微调 2026 年 4 月 8 日
💡 12 家公司正测试 Mythos 在真实环境中的表现,但未公开部署细节 2026 年 4 月 8 日
📖

一个AI模型能自己写出零日漏洞利用代码,连没学过安全的工程师都能用

AI工程2026 年 4 月 8 日
📖

一个没公开的AI,刚挖出操作系统里埋了20年的漏洞

AI开源2026 年 4 月 8 日
📖

一个没学过安全的AI,三天挖出银行十年没发现的73个零日漏洞

AI工程2026 年 4 月 8 日
💡 Freestyle 将AI生成代码自动放入带root权限的Linux虚拟机全链路可控 2026 年 4 月 7 日
💡 每个沙箱支持嵌套虚拟化、独立用户和完整网络栈 2026 年 4 月 7 日
💡 AI代码获得与人类代码同等的基础设施待遇:版本可溯、行为可观、权限可锁 2026 年 4 月 7 日
📖

它不帮你写代码,却管起了你不敢碰的AI生成代码

AI工程2026 年 4 月 7 日
📡

OpenAI 最大的研究团队之一,不是做模型,而是盯着模型说谎

𝕏2026 年 4 月 7 日
📡

有人在AI对话里偷偷翻看系统提示词,结果被叫停

𝕏2026 年 4 月 5 日
📡

有人在生产环境直接改代码,还连着真实数据库

𝕏2026 年 4 月 4 日
💡 Anthropic 因 Claude Code 源码泄露启动大规模 DMCA 下架通知 2026 年 4 月 3 日
💡 DMCA 第512条被企业用作掩盖安全漏洞和商业黑箱的审查工具 2026 年 4 月 3 日
💡 Diebold 曾用上千份下架通知试图掩盖投票机丢失选票的事实 2026 年 4 月 3 日
📖

AI公司代码泄露后,第一反应是删光全网——但删不掉的才是重点

AI法律2026 年 4 月 3 日
💡 Anthropic因配置错误泄露Claude Code源码,并利用DMCA 512条发送大量下架通知 2026 年 4 月 2 日
💡 DMCA 512条无需举证和法院裁定,每项侵权最高可罚15万美元,导致平台倾向秒删 2026 年 4 月 2 日
💡 该条款曾被Diebold滥用封杀安全缺陷揭露,现再次被用于商业审查 2026 年 4 月 2 日
💡 Anthropic误发DMCA通知导致约8100个GitHub仓库被移除 2026 年 4 月 2 日
💡 Claude Code负责人承认操作失误并撤回大部分通知,仅保留96个fork 2026 年 4 月 2 日
💡 事故发生在Anthropic筹备IPO期间,可能引发对其工程治理能力的质疑 2026 年 4 月 2 日
📖

Claude源码泄露事件暴露DMCA 512条款的审查滥用风险

AI法律2026 年 4 月 2 日
📖

Anthropic误发8100份GitHub下架通知,称源码泄露系意外

AI工程2026 年 4 月 2 日
💡 Mercor遭供应链攻击,源头为LiteLLM的NPM包被植入恶意代码 2026 年 4 月 1 日
💡 勒索团伙Lapsus$宣称入侵Mercor并发布Slack通信、工单数据及AI交互视频 2026 年 4 月 1 日
💡 LiteLLM漏洞因日均下载数百万次影响广泛,已更换审计服务商为Vanta 2026 年 4 月 1 日
📖

AI招聘公司Mercor遭供应链攻击,LiteLLM漏洞牵出Lapsus$勒索团伙

AI开源2026 年 4 月 1 日
📡

吴恩达评论反AI联盟与AI风险争论

𝕏2026 年 4 月 1 日
📡

Anthropic与澳大利亚政府合作推进AI安全研究

𝕏2026 年 4 月 1 日
📡

npm axios 遭新型供应链攻击,周下载量达3亿

𝕏2026 年 4 月 1 日

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新