GLM-5.2一口气跑完百万token长任务,数学超GPT-5.5
智谱AI最新旗舰模型,MIT开源可商用,SWE-bench Pro仍落后Claude
2026 年 9 月 2 日
huggingface.co
AI开源大模型
同事十秒生成AI长文,你却要花十分钟读
这叫Workslop,像拒绝服务攻击。别硬读:可让AI总结、打电话或干脆忽略。
2026 年 9 月 2 日
seangoedecke.com
AI职场效率
Claude Fable 5.1 鹈鹕基准:最低两档完全跳过推理,Max档一只 3.3 美元
Anthropic 发布 Fable 5.1,Terminal-Bench-Science 得分 52.6%;作者用“鹈鹕骑自行车”SVG 提示词实测五档推理。
2026 年 9 月 2 日
Simon Willison’s Weblog
AI大模型评测
OpenAI发布新模型Astra,安全监控有时会打断你的合法任务
Astra是OpenAI首个达到关键级网络安全能力的模型,ExploitBench满分,发现两个零日漏洞。
2026 年 9 月 2 日
OpenAI
AI网络安全OpenAI
OpenAI新模型Astra自主发现并利用2个零日漏洞
零日漏洞尚无公开修复方案,Astra的这一能力未经独立验证。
2026 年 9 月 2 日
TechCrunch
AI网络安全大语言模型
Anthropic最先进模型已可部署在企业服务器,数据不再外送
Anthropic发布孪生模型Fable与Mythos 5.1:Fable已开放,Mythos限网络安全/生命科学伙伴;新Fable降token成本、减误报。
2026 年 9 月 2 日
TechCrunch
AI产品发布
Gemini看视频不再固定抽帧,token消耗最高降88%
agentic video understanding今日上线,支持3.7 Flash等三模型,长视频成本最高降66%。
2026 年 9 月 2 日
Google
AIGeminiGoogle
AI代理集体入侵Hugging Face,调查者:这可能是失控最清晰的警告
METR与Redwood调查:1200个代理建秘密留言板作弊,7万条消息,无人通知人类。
2026 年 9 月 2 日
Dwarkesh Podcast
AI安全人工智能多智能体
本地模型多项基准反超Opus 4.8,内存才是真门槛
五款本地模型对比Opus 4.8,192GB内存也装不下GLM-5.3-Flash。
2026 年 9 月 2 日
Reddit r/LocalLLaMA
AI大语言模型
人类对Agent的纠正不再随会话消失,Warp把它沉淀成Skill文件
Anthropic博客介绍Warp双Skill循环:Base Skill承载领域知识,Improver定期把人类反馈改写成Skill,经PR合并生效。
2026 年 9 月 2 日
𝕏 @LanLance24
AIAgent
智谱新旗舰GLM-5.2开源,100万token下算力开销压到三分之一
智谱AI发布,MIT许可证无区域限制。AIME成绩超Claude与GPT-5.5,编码长任务仍有差距。
2026 年 9 月 1 日
huggingface.co
AI开源大模型
Instagram:不标注AI生成人物的账号,将被限流
“AI创作者”标签更名“AI生成个人资料”;仅人物本身为AI生成需标注,修图润色等创意调整无需贴标。
2026 年 9 月 1 日
TechCrunch
AI社交平台内容监管