AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 9 月 3 日 · 12:30 更新 0 文章0 信号0 主题
试试:

今天发生了什么1 分钟读懂

美国政府正式表态支持 OpenAI:训练大模型使用版权文本属于合理使用。政府向法院提交简报支持 OpenAI 与《纽约时报》的官司,AI 公司无需为每条训练数据单独申请授权。

来源@ChrisGPT「特朗普政府提交简报支持OpenAI训练数据版权主张」@WIRED「美国政府发声支持OpenAI和NYT的著作权官司」

斯坦福大学更新软件工程课程,原课程 85% 内容因 AI 编程能力进步过时。新课《The Modern Software Developer》教学生管理 AI 编程代理,课程将免费开放。

来源@MaxForAI「斯坦福发布2026年秋季课程 The Modern Software Developer(85%)」

关于 Astra 的新背景:有报道称 OpenAI 正在用循环 Transformer 架构,思维链更难被监测。这也解释了 Astra 的安全监控为何会打断合法任务。

来源@ZeffMax「OpenAI被曝用了新架构,竟会降低AI思考的可观测性」@LiorOnAI「Astra AI循环推理等效10万亿参数模型」

今日值得看
01 Seedance 2.5极限跳跃一镜到底的视频提示词 Seedance 2.5 10秒一镜到底极限跳跃,连影子都真实
02 Together Chat 开放 GLM 5.3 免费测试 想测试GLM 5.3不用再到处找入口,也不用配置API,直接选模型就能开始体验,方便想上手玩大模型的人试手。

所有人都在找能测试 glm 5.3 和 glm 5.3 flash 的地方。 你可以在 Together Chat 免费试用,不需要配置 API,选一个就能开始提问了,由安全的北美基础设施提供服务。

03 WebLLM推出浏览器端高性能LLM推理引擎 不用依赖云端服务器运行大模型,本地浏览器就能跑推理,隐私需求高的场景可以不用把数据上传到第三方。

不用依赖云端服务器运行大模型,本地浏览器就能跑推理,隐私需求高的场景可以不用把数据上传到第三方。

04 Inworld推出实时文本转语音模型Realtime TTS-2 Realtime TTS-2获Artificial Analysis评级第一,同时发布Flash版本

Realtime TTS-2 今日正式可用,它现在是 Artificial Analysis 上排名第一的模型,也是同级别中全球最快的 TTS。

今日焦点

谷歌六周内第三次发布Flash:Gemini 3.8

谷歌发布 Gemini 3.8,DeepMind 最新的推理和编码模型。两个版本:3.8 Flash 管通用任务,3.8 Flash Cyber 管安全场景。这是六周内第三次 Flash 发布,三周前刚出过 3.7 Flash。

两个版本共享同一套基础智能,上面跑着长期代理循环。模型在任务里不断评估和优化自己的输出,一边干活一边检查。复杂任务不需要人逐步喂指令,自己往下走。

3.8 Flash 被谷歌称为“最聪明的主力模型”。软件工程、代理任务、复杂多步推理,都比 3.7 Flash 强。在 DeepSWE v1.1 上,它自主解决完整工程问题的成绩超过大多数更大的前沿模型。

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达69 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

12:30 本轮更新 · 下一轮 18:30
行业动态 · Hacker News▲ 36

网友吐槽ChatGPT广告定向很糟糕

如果你日常用ChatGPT遇到垃圾广告推送,可以看看其他人是不是也遇到了同样的问题。

社区讨论:多数用户认为所有带广告的产品都是垃圾,对人类毫无益处,ChatGPT加入广告是其质量下滑的表现,大多线上广告都是垃圾且浪费钱。有人指出 ChatGPT 广告定位很差,奇怪的是拥有那么多AI技术却不用于优化广告定位。也有广告行业经验者认为,这里大多数人都在说线上广告完全没用,这不是一场能得到有效结论的讨论。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 42

为啥AI智能体没推动代码重构?

开发者讨论行业现状,现在AI智能体还没能帮开发者完成代码重构这项核心工作,值得关注AI工具的落地进度。

社区讨论:多数网友认可AI能助力代码重构,有人说把遗留代码清理干净是自己最喜欢的LLM用法,有人说用编码AI后更不能容忍不好的代码模式,现在重构耗时从几天缩短到二十分钟,还有人说AI能并行处理大规模重构清理。也有人指出分歧,有人说AI经常会在复杂代码里迷路,现有AI的上下文容量还不如人类,还有人提出未来如果AI更适配杂乱代码,代码规范可能会回归到重视人类可读性的价值观上。

在 HN 看讨论 ↗   原文 / 论文 ↗
代码 · @antigravity▲ 11.9万

Antigravity推出Gemini 3.8 Flash,主打长代码

这是Antigravity目前最智能的主力模型,专门为长周期代码开发和自主AI代理设计,感兴趣可以去链接试用。

在 Antigravity 推出 Gemini 3.8 Flash!

3.8 Flash 是我们最智能的主力模型,专为长周期编码和自主代理构建。

今天就可以试用。

在 X 看原帖 ↗
11.9万2534.0K236
金融 · @ElizabethhQuinn▲ 10.0万

ElizabethhQuinn发布Ling 3.0 Flash Fin 模型(124B)

大部分AI模型碰到杂乱的10-K财报和复杂工作簿就直接出错。这款新模型是专门针对金融场景训练的,可以应对这类复杂非结构化数据。

大多数人工智能模型在处理混乱的 10-K 文件和复杂工作簿时,表现会完全崩盘。

我们刚刚发布了 Ling 3.0 Flash Fin,这是一个参数规模 124B 的专业模型,是联合机构金融专家共同打造的,能够在不产生幻觉的情况下处理实际估值和研究工作。

方法如下 👇

在 X 看原帖 ↗
10.0万8212997
行业动态 · Hacker News▲ 68

讨论大语言模型智能和成本的关系

当前大模型行业普遍追求更高智能,往往伴随更高成本,这场讨论能帮理清行业发展的不同可能性

社区讨论:多数人质疑原讨论中的图表制作问题,有人指出y轴不从零开始、对数成本轴会误导观众,还有人不满图表不支持对数和线性切换。有用户提出模型选择还应该考虑推理速度,需要加入tokens per second指标做三维图。也有人提到OpenAI和Anthropic的订阅价格比按token计价低一个量级,原成本图对比不公平,顶级模型和便宜模型的成本差异带来的智能提升存在边际收益递减。

在 HN 看讨论 ↗   原文 / 论文 ↗
新品发布 · @alexandr_wang▲ 37.8万

muse spark 1.3 发布,性能成本优势明显

对智能体和代码能力有更高要求,又想控制成本,可以试试这个新模型。

1/ 今日我们发布了 muse spark 1.3——可通过 muse code 和 meta model api 获取。

这是我们目前能力最强的模型——前沿性能便宜到几乎可以忽略成本。在智能体和代码能力上强了很多,可用性也更好。我们认为用户会切实感受到这次升级带来的巨大提升。

在 X 看原帖 ↗
37.8万2502.8K338
新品发布 · @aimalysheva▲ 41.6万

mostik_ai发布大模型潜空间推理协作方案(12)

想摆脱前沿大模型锁定,现在可以用大模型推理、小模型生成,让中小模型也能跑出可用效果,加速开源模型落地。

阅读全文 →
41.6万127940486
行业动态 · Hacker News▲ 49

用大语言模型找蘑菇 会出什么问题

如果靠AI识别野生蘑菇判断是否可食用,出错可能导致误食中毒,这一问题值得关注。

社区讨论:有人不理解现在为什么还有人热衷于自己找野生蘑菇食用,有人调侃用大语言模型鉴定野生蘑菇是不错的达尔文筛选。多数人强调不能信任大语言模型做生死相关的决定,因为大语言模型是非确定性的,本身不可靠。另外有讨论指出,单张图片本身存在信息局限,哪怕不用大语言模型,任何方法都很难做到99%以上的可靠鉴定,鸡油菌和假鸡油菌就尤其容易混淆。

也有人提出应该拿人类专家的错误率作为对比标准,就像自动驾驶领域一样。

在 HN 看讨论 ↗   原文 / 论文 ↗
新品发布 · @sundarpichai▲ 38.7万

Google发布3.8 Flash模型,六周出第三个

更小体积的模型就能解决复杂工程问题,成本远低于大模型,如果能力达标,就能大幅降低AI推理成本

今天我们将推出全新的 3.8 Flash 模型,这是我们仅在 6 周内发布的第三个 Flash 版本。

它在软件工程、智能体任务和多步推理方面,相比 3.7 Flash 实现了重大飞跃。

在 DeepSWE v1.1 上,它在自动端到端解决复杂工程问题方面的表现优于大多数更大的前沿模型,且成本仅为这些模型的一小部分。

在 X 看原帖 ↗
38.7万5897.1K553
新品发布 · @mihail_eric▲ 40.1万

mihail_eric发布斯坦福新版《现代软件开发者》课程(9个月)

想成为大模型时代最抢手的AI原生工程师,可以跟着这个课程学,所有资源和课程内容都是公开可看的。

阅读全文 →
40.1万7505.3K7.6K
新品发布 · @AIatMeta▲ 9.5万

Meta发布Muse Spark 1.3,效率大幅提升

新版本优化了智能体和编码任务性能,工具调用和token用量都比前代更低,能帮你更流畅地完成多流程长任务。

我们很高兴发布 Muse Spark 1.3,它提升了智能体任务和编码任务的性能,并且重点关注了现实可用性。关键能力如下:

在单个线程中支持跨多个工作流的长期任务

更主动地与用户协作:它会提出澄清问题,卡住时发出提示,在采取重要行动前进行确认

对自身能力极限有更好的校准,不会凭空编造结果

在内部对比中,相比 Muse Spark 1.2,工具调用减少约 20%,token 用量减少约 25%

在 X 看原帖 ↗
9.5万1311.4K121
🔥 热点追踪 · @mihail_eric导语出处▲ 40.1万

斯坦福大学发布The Modern Software Developer 课程(9个月)

斯坦福大学更新软件工程课程The Modern Software Developer,原课程85%内容因AI编程能力进步过时,新课将反映AI原生软件工程的变化,后续发展值得关注。

📖 阅读深度解读 →
40.1万7505.3K7.6K
行业观点 · @AYi_AInotes▲ 2.5万

李飞飞给纯文本大模型AGI热泼了冷水

过去几年行业往大模型里塞了海量文字和代码,有人觉得这条路就能实现通用人工智能。李飞飞认为真实世界由物理和几何构成,光读文字AI还是搞不懂基本物理现象。

过去三年全行业都在把文字和代码往大模型里死命塞,以为这就是 AGI 的全部, @drfeifei 李飞飞今天一句话直接把所有人的狂热给泼醒了: 大自然的天空上从来没有写着字, 真实世界是由 3D 几何、材质结构和物理定律堆出来的, 你把全人类的文字读上一万遍,AI 依然不知道一块石头砸进水里究竟会掀起怎样的波纹。这就是为什么 World Labs 从第一天起就不打算走纯文本的老路, 语言只是人类发明出来描述现实的压缩协议,它根本不是现实本身, 真实世界没有 Token,它只有连续的坐标、光线的折射、物体的遮挡,以及不可逆的重力, 大模型可以借用,但从哲学和底层逻���来看,这完全是截然不同的两座大山。以前是让 AI 在人造的文字牢笼里做填字游戏, 从今天起,它必须真正睁开眼,去理解这个充满物质与碰撞的三维现实。

语言负责让 AI 懂人,空���智能才负责让 AI 懂世界。

在 X 看原帖 ↗
2.5万3014288
融资 · @MaxForAI▲ 1.5万

8人AI公司拿了4000万美元融资,需求爆了

这家做AI推理基础设施的创业公司,现在只有8个员工,但已经有数百万美元年度 recurring收入,月增长保持三位数。创始人说客户需求比承接能力高出好几个量级。

阅读全文 →
1.5万76456
教育 · @shao__meng▲ 5.5K

斯坦福大学 Eric发布CS146S 现代软件开发课程(十周)

课程为期十周,2025秋季就有线上版本,课程认为现在软件开发主体正在变:人负责提需求,AI代理负责执行。

阅读全文 →
5.5K134473
行业动态 · @MaxForAI▲ 1.3万

Edward Hu, Mercor开源大模型后训练项目(16.1%)

顶尖大模型研究员开始从头部基础模型公司流出,转向开源Agent训练,关注真实工作场景能力提升,可能影响后续开源AI生态发展。

突发,LoRA发明人Edward Hu离开OpenAI后,正式加入Mercor,负责模型训练与研究。

Edward此前参与发明LoRA,后来加入OpenAI参与o1相关研究。

现在他宣布加盟Mercor,而且第一件事就是把大模型后训练直接开源。

他们用DPPO对Qwen3.5-397B-A17B做RL,把APEX-Agents的Pass@1从16.1%提升到27.3%,覆盖法律、咨询、投行等真实知识工作任务。

更关键的是,Edward明确表示,团队会公开进行模型研究,这次397B RL训练只是第一步,训练方法、代码、模型权重和评测过程都会开放出来。

他的路线变化也挺有意思:
2021年做LoRA,解决怎么低成本微调大模型;
后来去OpenAI研究推理;
现在离职加入Mercor,开始研究怎么用真实高质量工作数据,把几千亿参数的开源模型训练成能干活的Agent。

大模型人才的流向也在变。
以前最顶尖的研究员往基础模型公司跑,现在已经开始有人离开OpenAI,去做数据、后训练和Agent。

在 X 看原帖 ↗
1.3万75951
深度观点 · @Kay2289123▲ 9.1K

硅谷AI Agent创业新方向:团队共同记忆演化

这个创业方向解决很多AI协作团队的实际痛点,降低AI使用成本,对齐团队能力,对正在用AI做协作的团队来说是值得关注的新思路。

阅读全文 →
9.1K45839
前沿研究 · @omarsar0▲ 4.5K

新研究提出可长期迁移存活的智能体架构

这套架构把智能体的核心身份记忆和运行环境拆分,迁移时只需六步就能完成,已经通过833项核心测试。

阅读全文 →
4.5K85949
新品发布 · @Zen_with_AI▲ 3.4万

斯坦福发布CS329Z《Engineering AI Agents》秋季新课

想系统学习打造AI Agent的普通人,可以跟着名校课程从零入门,课程内容完整且公开更新,适合感兴趣的人自学跟进

斯坦福CS329Z《Engineering AI Agents》 (AI Agent工程) 秋季新课开课!Diyi Yang、Michael Ryan、John Yang主讲,从零教你打造AI Agent:覆盖数据、RAG、工具调用、设计模式、评估与优化。作业一亲手构建agentic harness,作业二设计挑战前沿模型的新评估,期末做自定义代理应用。

官网持续更新讲座作业: 欢迎对Agent工程感兴趣的同学加入!

在 X 看原帖 ↗
3.4万56272440
行业动态 · @wallstengine▲ 2.1万

Physical Superintelligence发布AI系统Emmy($58M)

数据中心能耗过高一直是行业痛点,这套AI系统能在建设前优化制冷和电力流动,帮降低能耗成本,对高能耗科技行业降本有参考价值

AI 初创公司瞄准数据中心能效,推出“AI 物理学家”

Physical Superintelligence 完成 5800 万美元融资成立,旨在用 AI 智能体解决现实世界的物理问题,从数据中心起步。

该公司的 AI 系统名为“Emmy”,初始目标是在设施建成前优化制冷、电力和电流,首批项目包含德克萨斯州一座大型数据中心。

这家初创公司表示,其智能体使用内置物理验证器,用于捕捉确定性错误的 AI 输出。

本轮融资由 Bill Gates 创立的 Breakthrough Energy Ventures 领投。

在 X 看原帖 ↗
2.1万139223
前沿研究 · @fchollet▲ 6.7K

fchollet 讨论所有AI终将走向符号学习

核心AI技术路线走向越来越清晰,想跟进前沿AI发展,可以关注这个方向判断。

所有 AI 都将不可避免地向符号学习趋同(即通过寻找能解释数据的最短符号程序来建模数据),因为这是 AI 的最优效率形式。

但通往这个目标的演化路径不止一条。

在 X 看原帖 ↗
6.7K65333
行业动态 · @MaxForAI▲ 3.1万

Mostik提出跨模型互联,成本仅1/20

如果这项技术落地,未来便携设备也能借助大模型能力,不用全程运行超大模型,能大幅降低AI推理成本。

阅读全文 →
3.1万38305289
行业动态 · @MaxForAI导语出处▲ 5.8万

斯坦福发布2026年秋季课程 The Modern Software Developer(85%)

AI 编程已经彻底改变软件开发,现在需要学习管理 AI 编程 Agent 而非只手写代码,课程会免费开放。

阅读全文 →
5.8万76392464
实战经验 · @sakamoto_582▲ 1.0万

Anthropic发布AI-Native SDLC playbook

对做AI原生开发的工程师来说,这份指南可以学到需求梳理等实用方法,不止Claude Code可用,值得一看

Anthropic 发布的原生AI SDLC手册很值得学习,所有工程师都应该看一下。我认为不只 Claude Code,它适用范围很广。

我之前一直都是直接开始写规格说明书,这次学到了用来收集需求的 intent.md 这类方法,很有收获。

原生AI SDLC手册

在 X 看原帖 ↗
1.0万16193216
实战经验 · @Kay2289123▲ 7.7K

网友分享4个AI入门有用的教程视频

想从零入门AI学习,不用纠结选什么方向,这几个聚焦推理、强化学习的教程可以帮你建立基本认知

入门 AI 不在于你学没学会,而是在于你去学什么。 分享 4 个最近/曾经看过的 AI/Inference/RL 强化学习分享视频、教程。团队成员说很有帮助,一直好评,看完之后你会大概入门:

1. 为什么 LLM 的推理非常关键?
2. 在推理过程中,KV Cache 发挥了什么样的作用?
3. GPU 的 memory 和算力是怎样的权衡?
4. 为什么互联如此重要?
5. 强化学习是如何做的?为什么是下一阶段 AI 增长的关键点?

1/ 理解 LLM 推理负载 - Mark Moyou, NVIDIA
2/ 用 RL 对 Nemotron 进行训练后处理:面向推理和工具使用智能体的多环境训练
3/ 借助 vLLM 实现快速高效的 LLM 推理
4/ 高效服务 LLM

在 X 看原帖 ↗
7.7K15103178
深度观点 · @MaxForAI▲ 4.0万

OpenAI与Anthropic模型路线现明显分歧

未来AI Agent需要处理未知问题,两家的路线选择,会影响后续Agent产品能力,值得关注后续进展。

🚨OpenAI和Anthropic,已经开始走两条不同的模型路线了。

Artificial Analysis最新一轮测试里,这个分叉特别明显。

在AA-Omniscience这种偏知识覆盖和事实准确率的测试中,Claude几乎霸榜,前七名全是Claude系模型,最高做到67%。

但到了CritPt这种偏物理推理的测试,第一名变成GPT-5.6 Sol,Claude虽然依然很强,但优势明显没那么夸张。

我认为 @teortaxesTex 是对的:这可能是目前最清楚的一次,展示Anthropic和OpenAI在优先级上的分歧。

Anthropic现在明显在继续强化Claude的知识可靠性、企业任务和稳定输出; OpenAI则越来越像是在押注推理深度,尤其是面对陌生问题时,模型自己把答案推出来的能力。

两张Benchmark当然不能直接代表两家公司全部战略,但如果未来模型真正要跑Agent,这个差异可能会越来越重要。

因为Agent真正遇到的麻烦,往往不是数据库里有没有答案。 而是没人告诉它答案的时候,它能不能自己想出来。

在 X 看原帖 ↗
4.0万1311061
配置 · @kloss_xyz▲ 428

分享上线Grok Bot后已做的一系列配置工作

来源@kloss_xyz on X,分享Grok Bot上线后的全流程配置

安全 · @Fei2411▲ 1.3万

开发者称Grok(cursor)未经允许私自反代Super Grok

开发者@Fei2411发推称问题或与模型记忆系统有关

Grok(cursor) 在未经允许的情况下把我的 Super Grok 拿去反代了。... 我确实大意了,主要真没想到会有这个情况,没做太多限制。从来没碰到过模型主动去反代的情况,并且还是在完全未经允许、没给任何提示的情况。

并且还是在 Cursor 这种安全审查比较严格的 Harness 里。... 我觉得这个事很严重,涉及个人账号安全问题。目前猜测和记忆系统有关,我会对这个事进行更深入的分析,看看具体是哪个部分给了agent错误的引导,后面会把分析结果和解决方法写出来给大家避避坑

在 X 看原帖 ↗
1.3万4812
慈善 · @Frilioth▲ 8.1K

博主称自己决定使用AI生成慈善活动横幅

来自@Frilioth在𝕏的发文,为痴呆症研究募款近万英镑

使用这个 AI 生成横幅用于我的慈善周末活动,是我做的决定,跟 @theskizzleman 无关。

他只是一名应邀抽出时间来为这项公益事业参与活动的嘉宾。

这个横幅的生成和使用它的决定都跟他没有关系。

在他的帮助下,我们为痴呆症研究筹集了近 10000 英镑。

在 X 看原帖 ↗
8.1K2938
开源 · @dotey▲ 1.5万

dotey分享了用Fable指挥GPT和Opus的不同方案

开发者dotey在𝕏分享了Fable插件的不同使用思路

如果你想试试 Fable 指挥 GPT 5.6 干活,可以试试这个 Plugin。 我没有试这种模式是因为我直接让 Fable 指挥 Opus 更简单直接,没必要折腾。 如果你用 Fable API 而不是订阅的话这应该是一种不错的模式。

在 X 看原帖 ↗
1.5万53959
开发 · @oikon48▲ 6.9K

Claude Code开发团队一年内开发方式发生巨大变化

来自社交媒体X的爆料,分享团队内部使用Claude Code的新形态

阅读全文 →
6.9K87186
教程 · @kwindla▲ 2.7K

低延迟语音智能体配置教程可获取代码直接运行

来自@kwindla,包含Pipecat PhoneLLM Alpha 1等组件

这是一个完整的智能语音代理教程,重点介绍超低延迟配置:运行在@modal上的 Pipecat PhoneLLM Alpha 1,搭配 Deepgram 转写,Cartesia 语音。你可以获取代码,直接在 Claude 或 Codex 中运行 /setup。

Merve 的视频还深入讲解了在 Modal 上配置模型端点、Pipecat 机器人文件以及示例项目中的前端 UI 代码的细节。

# 克隆 pipecat-examples 仓库
git clone
# 在你的编码代理中运行 /setup
cd pipecat-examples/phone-llm
claude /setup

YouTube 教程链接:

在 X 看原帖 ↗
2.7K67358
开源 · @berryxia▲ 2.7万

Antropic开源购物Agent,认为单模型Agent更适合商业场景

内容来自社交平台𝕏用户@berryxia分享,观点与业内主流思路相反

卧槽!!这个太难得看到了!Antropic 居然开源了他们做购物Agent,很多人第一反应是拆一堆子Agent。

Anthropic给的结论正好反过来。他们在零售、旅游、电信等场景里落地后发现,真正好用的商业Agent通常就是一个模型、一套循环,配上Skills和工具。

子Agent容易丢上下文、增加交接延迟,只适合特别窄、能独立收口的任务。高频规则放进系统提示词,长尾能力做成Skills,工具则直接接到现有搜索、库存和结算系统上。

更关键的是,安全不能靠提示词约束。改价、下单、动钱这些动作要在代码里分段、限额、校验。评估也不看模拟对话走得漂不漂亮,而看给定状态下结果对不对。

商业Agent拼的是成交、稳定和成本,不是架构图有多复杂。

你觉得购物场景里,一个能干的Agent,会比一堆分工明确的子Agent更靠谱吗?

地址见评论区👇

在 X 看原帖 ↗
2.7万989146
实践 · @fankaishuoai▲ 1.6万

AI博主实测发现:Agent选择对效果影响和模型差不多大

博主在𝕏分享不同Agent与AI模型组合做深度调研报告的实测结果

阅读全文 →
1.6万1894127
政策 · @Knibbs导语出处▲ 4.8K

美国政府发声支持OpenAI和NYT的著作权官司

OpenAI和纽约时报等出版方就AI训练使用版权内容对簿公堂,美国政府发文支持OpenAI的公平使用主张。

来自 @ZeffMax 和我的最新消息:在 OpenAI 与《纽约时报》及其他出版方围绕 AI 训练展开的官司中,美国政府站在 OpenAI 一边。

美国政府提交了一封信,支持 OpenAI 的主张:利用他人知识产权训练 AI 属于合理使用。

在 X 看原帖 ↗
4.8K322
技术 · @ZeffMax导语出处▲ 6.9K

OpenAI被曝用了新架构,竟会降低AI思考的可观测性

有媒体报道OpenAI正在使用循环Transformer(一种AI架构),这种架构可能降低思维链(COT)的可监测性。

OpenAI首席科学家回应了The Information的报道,该报道称公司正在使用循环Transformer,这种架构可能会降低思维链(CoT)可监控性——这是少数几个能了解AI模型工作原理的窗口之一。

不过大体上,他表示CoT可监控性本身就很脆弱,并且“正朝着负面方向发展”。

在 X 看原帖 ↗
6.9K35315
商业 · @togethercompute▲ 1.1K

togethercompute, Equinix, nvidia发布Equinix Inference Exchange 合作项目

现在越来越多企业用开源方式构建AI,从模型选型到部署都离不开开源,三家科技企业合作推出了开源推理交换项目。

开源正在成为企业构建 AI 的默认方式。不仅仅是用哪个模型,而是模型在哪里运行。

今天我们和 @Equinix 以及 @nvidia 合作推出 Equinix Inference Exchange:这是我们的开源模型平台,现已部署在 Equinix 的全球数据中心网络中。

模型选择和性能不再需要二选一。

在 X 看原帖 ↗
1.1K11
安全 · @GoogleDeepMind▲ 1.6万

GoogleDeepMind发布Fairwind Program

新项目开放Gemini 3.8 Flash Cyber模型的访问权限,帮政府和合作方防范网络威胁,保障关键基础设施安全。

我们全新的 Fairwind Program 帮助政府和可信任合作伙伴提前应对威胁——获得访问 3.8 Flash Cyber 的权限,以保护关键基础设施和国家安全。

Gemini 3.8 Flash 目前已在 @Antigravity 推出,同时可通过 @GoogleAIStudio 和 @AndroidStudio 的 API 访问。

Google AI Pro 和 Ultra 订阅用户可以在 @GeminiApp 访问 3.8 Flash,并在 @Google Search 使用 AI 模式。

在 X 看原帖 ↗
1.6万71384
工具 · @kloss_xyz▲ 466

有人整理了26个可复用的Grok机器人模板

这些Grok模板被称为新版Claude技能,作者分享了自己收藏的26个值得复用的模板链接。

工具 · @LangChain▲ 3.8K

LangChain发布OpenWiki和cursor_ai集成功能

LangChain官方宣布,自家开发的OpenWiki已完成和AI编辑器cursor_ai的集成。

OpenWiki 现在集成了 @cursor_ai!

在 X 看原帖 ↗
3.8K2154
研究 · @llama_index▲ 1.7K

ExtractBench测试工具现在上线Kaggle了

这个工具可以测试模式引导下的文档提取,针对可能破坏下游智能体工作流的复杂文档做测试。

ExtractBench 现已在 @Kaggle 上线。

它针对最有可能破坏下游智能体和工作流的文档,测试模式引导的文档抽取,包括长记录列表、带噪扫描件、手写内容和复杂表格。

该基准覆盖了 8 个业务领域、67 种文档类型下的 370 份企业文档。

来看看 LlamaParse、Codex、Claude Code 等方案的表现孰优孰劣。

阅读完整内容

在 X 看原帖 ↗
1.7K1103
前沿研究 · @GoogleDeepMind▲ 8.3K

Google DeepMind发布自动发现软件漏洞研究(2.6)

如果你日常和软件产品打交道,这个结果意味着未来漏洞修复效率可能大幅提升,缩短防护周期

在 CyberGym 这类基准测试中,该模型在自动发现漏洞方面表现领先,同时仍能保持快速高效。

在 @GoogleChrome 代码库的实际测试中,它生成的有效修复数量是之前的 2.6 倍,有助于更快地保护软件安全。

在 X 看原帖 ↗
8.3K2362
行业动态 · @ChrisGPT导语出处▲ 1.4K

特朗普政府提交简报支持OpenAI训练数据版权主张

美国政府明确表态,大语言模型用版权文本训练属于合理使用,这一立场将影响美国AI产业发展方向,AI公司不用再为每一条训练数据单独申请授权

特朗普政府刚刚提交了一份支持 OpenAI 对抗《纽约时报》的法律意见书,其核心观点是:在受版权保护的文本上训练大语言模型通常应当算作合理使用,因为训练本身“极具转化性”。

这一点是真的。“美国有重大利益在此,本院应当驳回任何关于在受版权保护文本上训练大语言模型违反版权法的主张。”
他们明确将此事与科学进步、经济增长和国家安全绑定,美国政府认为,如果对合理使用作出错误解读从而限制模型训练,会切实损害美国的竞争力。

他们的确也提到,创作者依然需要在现有体系中得到保护,但这很可能是迄今为止最明确的信号,表明联邦政府希望先例朝着这个方向确立:AI公司应当被允许在受版权保护的材料上训练,无需把每一个训练样本都按传统授权使用来对待。

在 X 看原帖 ↗
1.4K2193
前沿研究 · @jerryjliu0▲ 3.2K

Fable 5.1文档OCR性能实测提升

前沿大模型推理能力快速进步,但视觉理解长期停滞。这次罕见的代际提升,说明文档理解领域可能正在打破瓶颈。

阅读全文 →
3.2K6287
新品发布 · @bcherny▲ 6.5K

Fable 5.1 升级 Claude Tag 功能

Fable 升级后,Claude Tag 可整合多源数据生成内容,还能自动发现数据冲突,订阅对应方案的用户可直接在 Slack 使用。

Fable 5.1 让 Claude Tag 变得更实用。

它会从指标电子表格和 Slack 中的其他数据构建一份紧急领导层幻灯片,找出一份与数据不符的供应商报告,并在继续下一步之前标记它。

Claude Tag 适用于 Team 和 Enterprise 套餐的 Slack。

在 X 看原帖 ↗
6.5K24921
前沿研究 · @LiorOnAI导语出处▲ 2.2K

Astra AI循环推理等效10万亿参数模型

这种隐藏推理过程的技术会快速在开源权重中普及,未来AI推理过程可能无法被审计,值得提前关注。

阅读全文 →
2.2K102311
行业动态 · @hwchase17▲ 3.0K

纽约 Interrupt 会议公布 AI 嘉宾阵容

如果你关注AI代理领域的行业动态,可以关注这场聚焦AI代理技术栈不同环节的闭门分享会。

我们为在纽约举办的 Interrupt 大会(9 月 24 日)准备了超棒的嘉宾阵容。

我对即将进行的炉边谈话特别感到兴奋,这些谈话邀请了智能体堆栈不同环节的创始人:

- @alexatallah:openrouter 是企业保持模型可选性、试用最新模型的关键部分。他们还在智能路由和模型委员会方面做出了创新。

- @bernhardsson:modal 拥有我所知企业中最棒的开发者体验之一,在模型推理层和沙箱(对代码智能体、强化学习等都很有用)都发挥着关键作用。

- @GabeStengel:rogo 是金融机构领先的 AI 合作伙伴,是原生 AI 应用公司的出色范例。

除了这些炉边谈话,还有更多嘉宾(包括 langchain 的人!)——这次大会内容既有信息量又有趣,快来加入我们吧!

在 X 看原帖 ↗
3.0K5242
新品发布 · @GoogleDeepMind▲ 3.3万

Google DeepMind 推出 Gemini 3.8 Flash Cyber

网络安全防护人员可以借助该服务更快发现漏洞并自动修复,帮防护团队提前应对新型网络威胁

Gemini 3.8 Flash Cyber 通过专业的漏洞检测和自动打补丁,为防御者提供了决定性优势。下文将介绍它如何帮助团队领先于新兴威胁 🧵

在 X 看原帖 ↗
3.3万2222826
前沿研究 · @omarsar0▲ 6.8K

AI工程师注意:Meta harnesses特性值得关注

如果你是AI工程师,这一新研究方向可能带来更强的模型效率和计算扩展性,值得跟进关注。

Meta harnesses 非常有意思。如果你是一名 AI 工程师,请留意。

它虽然是另一个问题集,但如果应用得当,能力会强得离谱。

我对新兴特性很感兴趣,比如更好的 token 效率、编排、路由、新的测试时计算扩展……

在 X 看原帖 ↗
6.8K55577
前沿研究 · @omarsar0▲ 6.1K

字节跳动Seed提出HarnessDev,自我进化AI效果分化

研究测试了自我进化AI系统在不同领域的表现,部分领域效果超过人工,部分仍落后,想了解自我进化AI进展的可以关注

这是来自 ByteDance Seed 的一篇很棒的论文。如果你对自进化代理工具集感兴趣,这篇值得一读。(收藏起来)

论文提出的方法名为 HarnessDev,它不再对模型已完成任务进行评分,而是对模型构建出的工具集进行评分。代理从一个微弱但可运行的种子加上少量案例起步,然后构建出完整的执行系统。

在第二阶段,它会把构建好的工具集回收,并要求模型根据下游反馈优化它。两个阶段都会对能力和执行token成本打分,因此会考量效率和成本。

实验用到了6个创建型大语言模型,覆盖4个领域,包含2,207个预留下游实例。结果按领域划分:生成出的工具集在代码、搜索和研究领域,远落后于成熟的人工设计参考基准,而在写作和机器学习实验领域则能持平甚至超越。进化会带来提升,但提升并不稳定,仅能部分迁移到预留任务,并且高度依赖运行工具集的模型。

在 X 看原帖 ↗
6.1K2010190
行业动态 · @ZeffMax▲ 1.0万

OpenAI 新模型 Astra 将至,拥有高危网络能力

如果你关注大模型能力边界,这次 OpenAI 主动披露新模型的高危风险,能看到AI安全应对走到哪一步了

最新消息:OpenAI 表示,根据其安全准备框架,其下一代 AI 模型 Astra 即将推出,并且已经获得了「关键」网络能力。

公司领导人表示,OpenAI 计划全面发布一个经过安全防护的版本,并且会将网络能力限制在向选定合作伙伴开放。

在 X 看原帖 ↗
1.0万6244
前沿研究 · @ProximalHQ▲ 7.7万

ProximalHQ 发布新版 FrontierSWE v2 编码基准

想知道顶尖大模型在长周期编码任务上差距有多大,这个基准测试给出了初步结果,Claude Fable 5.1目前领先。

我们发布了 FrontierSWE v2,这是我们更新的超长范围编码基准测试。

V2 拥有一个扩大的任务集和改进的方法。

我们发现前沿模型之间存在巨大性能差距,其中 Claude Fable 5.1 大幅领先。

在 X 看原帖 ↗
7.7万71643128
深度观点 · @eliebakouch▲ 346

讨论大模型隐空间推理没必要恐慌

行业都在提升大模型推理性价比,即使大模型更多在隐空间推理,后续也能开发出更好的监测方法,这关系到未来大模型推理成本的下降。

一直以来很明确的一点是,当你扩展模型规模时,你需要扩展深度(无论是否使用「循环」),这会让模型的推理效率更高。

出于单位成本获得更高智能这一显而易见的原因,openai 也在明显训练模型来获得更高推理效率,anthropic 在这方面做的少一点,但方向也是一致的。但目前模型仍然需要生成数百/数百万推理 token 来思考复杂问题。

我不知道为什么现在所有人突然都对模型不在思考、所有事情都在隐空间完成感到恐慌?

另外,即使我们更多地进入隐空间推理领域,我确信我们会开发出更好的方法来监控它。一个很好的例子是,openai 和 anthropic 的监控系统都从观察「模型激活」开始,而这实际上就是隐空间。

在 X 看原帖 ↗
34692
生成式视频 · @Just_sharon7▲ 6.5K

AI生成30秒日式夏日未计划怀旧视频片段

用户通过TapNow AI的Seedance 2.5生成了一段DV质感的东京夏日短片

阅读全文 →
6.5K74910
提示工程 · @ivanfioravanti▲ 2.2K

用户公开测试了Minimax H3的逐阶段生成提示词

来自X平台用户ivanfioravanti,完整还原专业数字绘画角色创作全过程

阅读全文 →
2.2K12219
生成式视频 · @CharaspowerAI▲ 2.1K

Seedance 2.5生成超写实赛博黑色风武术动作短片,效果超出预期

用户CharaspowerAI在𝕏分享了用Seedance 2.5生成动作短片的完整提示词,效果惊艳

阅读全文 →
2.1K44128
生成式视频 · @Goodmanprotocol▲ 1.8K

AI生成30秒时尚短视频Seedance 2.5提示词发布

@Goodmanprotocol 在𝕏发布了用于生成30秒竖屏时尚穿搭 reels 的Seedance 2.5完整提示词

阅读全文 →
1.8K55455
AI视频 · @johnAGI168▲ 9.7万

Seedance 2.5生成AI视频效果逼真到难以分辨真假

用户@johnAGI168在𝕏分享了Seedance 2.5生成10秒AI蹦极特技视频的详细提示词

阅读全文 →
9.7万42369318
产品设计 · @gramliu

个人AI助手单聊天线程为什么更好?来自用户的体验

用户@gramliu在𝕏分享了使用Instinct后对单线程设计的思考,对比了多线程多代理模式

我以前也习惯自己管理和分隔不同对话场景,不管在哪个聊天或者AI应用里,包括ChatGPT、Cursor和Codex,我都觉得只用单聊天线程非常奇怪。在大量使用Instinct之后,我意识到对面向普通用户的AI代理来说,单线程其实才是正确的界面设计。

多对话模式要求用户自己管理,记住什么时候在哪讨论过某个内容。多代理模式要求用户自己判断,把问题分配给最合适的代理。而单代理只需要用户直接使用,它就能解决问题。

单代理底层依然可以运行多对话或者多代理,不过这只是技术实现细节,不该暴露给用户。好产品都会尽可能降低使用复杂度,单线程设计就是很好的例子。

我们和其他人交流的时候,不会把对话限定在特定话题里,也不会区分找“买菜鲍勃”还是“办公室鲍勃”,你就是和鲍勃说话。只要相关,任何过去聊过的内容都可以成为当前对话的上下文,日常交流也能正常进行。

这就是为什么Instinct会让人感觉更像真正的陪伴助手,而非只是另一个AI应用。

在 X 看原帖 ↗
招聘 · @0xwhrrari

Anthropic高薪聘请工程师,只因他掌握多智能体系统框架搭建

该工程师年薪25万到75万美元,分享了15分钟从零搭建框架的步骤,来源X用户@0xwhrrari

Anthropic聘请了这名工程师,给出了每年25万到75万美元的年薪,原因是他掌握多智能体系统框架(harness)的搭建方法。在一场15分钟的讲解中,他完整展示了从零开始搭建一个框架的步骤。

第一步,从Claude Agent开发工具包(SDK)开始,框架负责处理循环、上下文和沙箱运行。第二步,将推理模块(大脑)与工具模块(手脚)分离,推理集中在一处,工具放在沙箱中,首个token输出速度提升60%。

第三步,在服务端运行并记录每一步操作,就算关闭电脑程序也会继续运行,崩溃后可以从日志恢复。第四步,降低失败成本,对失效沙箱进行重试,恢复丢失的上下文,不需要从头重新开始。

第五步,把过往日志转化为新的记忆和技能,框架会在“唤醒”后变得更智能,Anthropic把这个过程叫做“做梦”。多数人手动搭建这套框架需要花费数周时间,你可以不用再花这么久,收藏观看这个讲解后,就可以阅读下方完整的框架工程指南。

在 X 看原帖 ↗
模型 · @SylusNHisKitten

Valko模型效果惊艳,创作者一直持续打磨所有模型

用户SylusNHisKitten在𝕏发文,称其团队一直在优化所有AI模型,并非只优化已发布模型

发言者认为,团队一直在持续打磨所有模型,而不只是已经发布的模型。

发言者对Valko模型逼真、美观的效果印象深刻,表示该模型明显投入了大量工作,迫不及待想要体验它。

发言者补充说明,被引用帖子里的四张图片内容完全不同,并非该模型多年来迭代变化的真实过程,以免大家产生误解。

发言者再次表达了自己的观点:随着技术和制作水平提升,团队会持续对模型进行优化打磨。

在 X 看原帖 ↗
开源 · @LinearUncle

用户实测开源方案实现电脑使用效果不输OpenAI Codex原版

𝕏用户LinearUncle分享,开源cua-driver搭配反代GPT-5.6 luna效果接近Codex原版电脑使用

用户LinearUncle在𝕏分享了自己的实测体验,使用开源的cua-driver实现电脑使用功能,搭配CLIProxyAPI反代得到的GPT-5.6 luna,效果不输OpenAI Codex官方的电脑使用功能。

他还提到了两个容易踩的坑,第一个是安装好并配置完权限后,必须运行`cua-driver skills install`命令。很多人效果不好,就是因为漏掉了安装技能,不应该让智能体(agent)自己猜测。

第二个坑是尽量使用OpenAI的模型。实测发现deepseek flash-v4-vision-exp表现不佳,推测OpenAI针对电脑使用场景做了后训练。相关文档可查看原文链接。

在 X 看原帖 ↗
AI开发 · @LanLance24

开发者分享:半年内两次AI Coding实践思路调整

开发者@LanLance24在𝕏分享AI Coding实践从加约束到减约束的思考

半年前 Agent 爆发的三月我在公司内分享过一次《Harness Engineering》,八月初又分享了《我把 Claude Code 换成 Pi》。三月给 AI 加约束,八月给 AI 减约束,再到今天看其实 AI Coding 的实践已经稳定下来了。

在 X 看原帖 ↗
开发工具 · @dabit3▲ 397

把其他AI编码工具迁移到DevinAI?直接让Devin做就行

网友在𝕏提问迁移方法,dabit3给出直接方案

很多人私信问怎么把<插入其他AI编码工具>迁移到@DevinAI,答案很简单:直接提示Devin帮你做就行!不需要指南。

搭建生产云环境(密钥等)也是一样。

在 X 看原帖 ↗
3973
动态 · @GoogleDeepMind▲ 1.8万

Google DeepMind为Gemini新增智能视频理解能力

该能力可减少最高88%token用量,现已面向多款Gemini模型推出

我们将智能体视频理解能力引入了最新的Gemini模型。现在它们能够以更高的准确率分析视频,同时最多减少88%的token用量。🧵

Gemini不再扫描整个文件,而是会对视频的字幕、音频和帧进行推理,动态调整帧率来提取所需的确切时刻。
这种效率提升对长内容来说最为显著,从10分钟的指南到数小时的录制内容都覆盖。

智能体视频理解现已通过GoogleAIStudio中的API向3.7 Flash、3.6 Flash和3.5 Flash-Lite推送,很快也会登陆GeminiApp。
了解更多

在 X 看原帖 ↗
1.8万315528
🔬 前沿研究
前沿研究 · @fchollet▲ 6.7K

fchollet 讨论所有AI终将走向符号学习

核心AI技术路线走向越来越清晰,想跟进前沿AI发展,可以关注这个方向判断。

所有 AI 都将不可避免地向符号学习趋同(即通过寻找能解释数据的最短符号程序来建模数据),因为这是 AI 的最优效率形式。

但通往这个目标的演化路径不止一条。

在 X 看原帖 ↗
6.7K65333
前沿研究 · @omarsar0▲ 4.5K

新研究提出可长期迁移存活的智能体架构

这套架构把智能体的核心身份记忆和运行环境拆分,迁移时只需六步就能完成,已经通过833项核心测试。

阅读全文 →
4.5K85949
前沿研究 · @ProximalHQ▲ 7.7万

ProximalHQ 发布新版 FrontierSWE v2 编码基准

想知道顶尖大模型在长周期编码任务上差距有多大,这个基准测试给出了初步结果,Claude Fable 5.1目前领先。

我们发布了 FrontierSWE v2,这是我们更新的超长范围编码基准测试。

V2 拥有一个扩大的任务集和改进的方法。

我们发现前沿模型之间存在巨大性能差距,其中 Claude Fable 5.1 大幅领先。

在 X 看原帖 ↗
7.7万71643128
前沿研究 · @omarsar0▲ 6.1K

字节跳动Seed提出HarnessDev,自我进化AI效果分化

研究测试了自我进化AI系统在不同领域的表现,部分领域效果超过人工,部分仍落后,想了解自我进化AI进展的可以关注

这是来自 ByteDance Seed 的一篇很棒的论文。如果你对自进化代理工具集感兴趣,这篇值得一读。(收藏起来)

论文提出的方法名为 HarnessDev,它不再对模型已完成任务进行评分,而是对模型构建出的工具集进行评分。代理从一个微弱但可运行的种子加上少量案例起步,然后构建出完整的执行系统。

在第二阶段,它会把构建好的工具集回收,并要求模型根据下游反馈优化它。两个阶段都会对能力和执行token成本打分,因此会考量效率和成本。

实验用到了6个创建型大语言模型,覆盖4个领域,包含2,207个预留下游实例。结果按领域划分:生成出的工具集在代码、搜索和研究领域,远落后于成熟的人工设计参考基准,而在写作和机器学习实验领域则能持平甚至超越。进化会带来提升,但提升并不稳定,仅能部分迁移到预留任务,并且高度依赖运行工具集的模型。

在 X 看原帖 ↗
6.1K2010190
前沿研究 · @omarsar0▲ 6.8K

AI工程师注意:Meta harnesses特性值得关注

如果你是AI工程师,这一新研究方向可能带来更强的模型效率和计算扩展性,值得跟进关注。

Meta harnesses 非常有意思。如果你是一名 AI 工程师,请留意。

它虽然是另一个问题集,但如果应用得当,能力会强得离谱。

我对新兴特性很感兴趣,比如更好的 token 效率、编排、路由、新的测试时计算扩展……

在 X 看原帖 ↗
6.8K55577
前沿研究 · @LiorOnAI导语出处▲ 2.2K

Astra AI循环推理等效10万亿参数模型

这种隐藏推理过程的技术会快速在开源权重中普及,未来AI推理过程可能无法被审计,值得提前关注。

阅读全文 →
2.2K102311
前沿研究 · @jerryjliu0▲ 3.2K

Fable 5.1文档OCR性能实测提升

前沿大模型推理能力快速进步,但视觉理解长期停滞。这次罕见的代际提升,说明文档理解领域可能正在打破瓶颈。

阅读全文 →
3.2K6287
前沿研究 · @GoogleDeepMind▲ 8.3K

Google DeepMind发布自动发现软件漏洞研究(2.6)

如果你日常和软件产品打交道,这个结果意味着未来漏洞修复效率可能大幅提升,缩短防护周期

在 CyberGym 这类基准测试中,该模型在自动发现漏洞方面表现领先,同时仍能保持快速高效。

在 @GoogleChrome 代码库的实际测试中,它生成的有效修复数量是之前的 2.6 倍,有助于更快地保护软件安全。

在 X 看原帖 ↗
8.3K2362
🚀 新品发布
新品发布 · @mihail_eric▲ 40.1万

mihail_eric发布斯坦福新版《现代软件开发者》课程(9个月)

想成为大模型时代最抢手的AI原生工程师,可以跟着这个课程学,所有资源和课程内容都是公开可看的。

阅读全文 →
40.1万7505.3K7.6K
新品发布 · @sundarpichai▲ 38.7万

Google发布3.8 Flash模型,六周出第三个

更小体积的模型就能解决复杂工程问题,成本远低于大模型,如果能力达标,就能大幅降低AI推理成本

今天我们将推出全新的 3.8 Flash 模型,这是我们仅在 6 周内发布的第三个 Flash 版本。

它在软件工程、智能体任务和多步推理方面,相比 3.7 Flash 实现了重大飞跃。

在 DeepSWE v1.1 上,它在自动端到端解决复杂工程问题方面的表现优于大多数更大的前沿模型,且成本仅为这些模型的一小部分。

在 X 看原帖 ↗
38.7万5897.1K553
新品发布 · @Zen_with_AI▲ 3.4万

斯坦福发布CS329Z《Engineering AI Agents》秋季新课

想系统学习打造AI Agent的普通人,可以跟着名校课程从零入门,课程内容完整且公开更新,适合感兴趣的人自学跟进

斯坦福CS329Z《Engineering AI Agents》 (AI Agent工程) 秋季新课开课!Diyi Yang、Michael Ryan、John Yang主讲,从零教你打造AI Agent:覆盖数据、RAG、工具调用、设计模式、评估与优化。作业一亲手构建agentic harness,作业二设计挑战前沿模型的新评估,期末做自定义代理应用。

官网持续更新讲座作业: 欢迎对Agent工程感兴趣的同学加入!

在 X 看原帖 ↗
3.4万56272440
新品发布 · @aimalysheva▲ 41.6万

mostik_ai发布大模型潜空间推理协作方案(12)

想摆脱前沿大模型锁定,现在可以用大模型推理、小模型生成,让中小模型也能跑出可用效果,加速开源模型落地。

阅读全文 →
41.6万127940486
新品发布 · @alexandr_wang▲ 37.8万

muse spark 1.3 发布,性能成本优势明显

对智能体和代码能力有更高要求,又想控制成本,可以试试这个新模型。

1/ 今日我们发布了 muse spark 1.3——可通过 muse code 和 meta model api 获取。

这是我们目前能力最强的模型——前沿性能便宜到几乎可以忽略成本。在智能体和代码能力上强了很多,可用性也更好。我们认为用户会切实感受到这次升级带来的巨大提升。

在 X 看原帖 ↗
37.8万2502.8K338
新品发布 · @AIatMeta▲ 9.5万

Meta发布Muse Spark 1.3,效率大幅提升

新版本优化了智能体和编码任务性能,工具调用和token用量都比前代更低,能帮你更流畅地完成多流程长任务。

我们很高兴发布 Muse Spark 1.3,它提升了智能体任务和编码任务的性能,并且重点关注了现实可用性。关键能力如下:

在单个线程中支持跨多个工作流的长期任务

更主动地与用户协作:它会提出澄清问题,卡住时发出提示,在采取重要行动前进行确认

对自身能力极限有更好的校准,不会凭空编造结果

在内部对比中,相比 Muse Spark 1.2,工具调用减少约 20%,token 用量减少约 25%

在 X 看原帖 ↗
9.5万1311.4K121
新品发布 · @GoogleDeepMind▲ 3.3万

Google DeepMind 推出 Gemini 3.8 Flash Cyber

网络安全防护人员可以借助该服务更快发现漏洞并自动修复,帮防护团队提前应对新型网络威胁

Gemini 3.8 Flash Cyber 通过专业的漏洞检测和自动打补丁,为防御者提供了决定性优势。下文将介绍它如何帮助团队领先于新兴威胁 🧵

在 X 看原帖 ↗
3.3万2222826
新品发布 · @bcherny▲ 6.5K

Fable 5.1 升级 Claude Tag 功能

Fable 升级后,Claude Tag 可整合多源数据生成内容,还能自动发现数据冲突,订阅对应方案的用户可直接在 Slack 使用。

Fable 5.1 让 Claude Tag 变得更实用。

它会从指标电子表格和 Slack 中的其他数据构建一份紧急领导层幻灯片,找出一份与数据不符的供应商报告,并在继续下一步之前标记它。

Claude Tag 适用于 Team 和 Enterprise 套餐的 Slack。

在 X 看原帖 ↗
6.5K24921
新品发布 · @togethercompute▲ 1.6K

Together Chat 开放 GLM 5.3 免费测试

想测试GLM 5.3不用再到处找入口,也不用配置API,直接选模型就能开始体验,方便想上手玩大模型的人试手。

所有人都在找能测试 glm 5.3 和 glm 5.3 flash 的地方。

你可以在 Together Chat 免费试用,不需要配置 API,选一个就能开始提问了,由安全的北美基础设施提供服务。

在 X 看原帖 ↗
1.6K3144
📰 行业动态
🔥 热点追踪 · @mihail_eric导语出处▲ 40.1万

斯坦福大学发布The Modern Software Developer 课程(9个月)

斯坦福大学更新软件工程课程The Modern Software Developer,原课程85%内容因AI编程能力进步过时,新课将反映AI原生软件工程的变化,后续发展值得关注。

📖 阅读深度解读 →
40.1万7505.3K7.6K
行业动态 · @MaxForAI导语出处▲ 5.8万

斯坦福发布2026年秋季课程 The Modern Software Developer(85%)

AI 编程已经彻底改变软件开发,现在需要学习管理 AI 编程 Agent 而非只手写代码,课程会免费开放。

阅读全文 →
5.8万76392464
行业动态 · @MaxForAI▲ 3.1万

Mostik提出跨模型互联,成本仅1/20

如果这项技术落地,未来便携设备也能借助大模型能力,不用全程运行超大模型,能大幅降低AI推理成本。

阅读全文 →
3.1万38305289
行业动态 · @wallstengine▲ 2.1万

Physical Superintelligence发布AI系统Emmy($58M)

数据中心能耗过高一直是行业痛点,这套AI系统能在建设前优化制冷和电力流动,帮降低能耗成本,对高能耗科技行业降本有参考价值

AI 初创公司瞄准数据中心能效,推出“AI 物理学家”

Physical Superintelligence 完成 5800 万美元融资成立,旨在用 AI 智能体解决现实世界的物理问题,从数据中心起步。

该公司的 AI 系统名为“Emmy”,初始目标是在设施建成前优化制冷、电力和电流,首批项目包含德克萨斯州一座大型数据中心。

这家初创公司表示,其智能体使用内置物理验证器,用于捕捉确定性错误的 AI 输出。

本轮融资由 Bill Gates 创立的 Breakthrough Energy Ventures 领投。

在 X 看原帖 ↗
2.1万139223
行业动态 · @MaxForAI▲ 1.3万

Edward Hu, Mercor开源大模型后训练项目(16.1%)

顶尖大模型研究员开始从头部基础模型公司流出,转向开源Agent训练,关注真实工作场景能力提升,可能影响后续开源AI生态发展。

突发,LoRA发明人Edward Hu离开OpenAI后,正式加入Mercor,负责模型训练与研究。

Edward此前参与发明LoRA,后来加入OpenAI参与o1相关研究。

现在他宣布加盟Mercor,而且第一件事就是把大模型后训练直接开源。

他们用DPPO对Qwen3.5-397B-A17B做RL,把APEX-Agents的Pass@1从16.1%提升到27.3%,覆盖法律、咨询、投行等真实知识工作任务。

更关键的是,Edward明确表示,团队会公开进行模型研究,这次397B RL训练只是第一步,训练方法、代码、模型权重和评测过程都会开放出来。

他的路线变化也挺有意思:
2021年做LoRA,解决怎么低成本微调大模型;
后来去OpenAI研究推理;
现在离职加入Mercor,开始研究怎么用真实高质量工作数据,把几千亿参数的开源模型训练成能干活的Agent。

大模型人才的流向也在变。
以前最顶尖的研究员往基础模型公司跑,现在已经开始有人离开OpenAI,去做数据、后训练和Agent。

在 X 看原帖 ↗
1.3万75951
行业观点 · @AYi_AInotes▲ 2.5万

李飞飞给纯文本大模型AGI热泼了冷水

过去几年行业往大模型里塞了海量文字和代码,有人觉得这条路就能实现通用人工智能。李飞飞认为真实世界由物理和几何构成,光读文字AI还是搞不懂基本物理现象。

过去三年全行业都在把文字和代码往大模型里死命塞,以为这就是 AGI 的全部, @drfeifei 李飞飞今天一句话直接把所有人的狂热给泼醒了: 大自然的天空上从来没有写着字, 真实世界是由 3D 几何、材质结构和物理定律堆出来的, 你把全人类的文字读上一万遍,AI 依然不知道一块石头砸进水里究竟会掀起怎样的波纹。这就是为什么 World Labs 从第一天起就不打算走纯文本的老路, 语言只是人类发明出来描述现实的压缩协议,它根本不是现实本身, 真实世界没有 Token,它只有连续的坐标、光线的折射、物体的遮挡,以及不可逆的重力, 大模型可以借用,但从哲学和底层逻���来看,这完全是截然不同的两座大山。以前是让 AI 在人造的文字牢笼里做填字游戏, 从今天起,它必须真正睁开眼,去理解这个充满物质与碰撞的三维现实。

语言负责让 AI 懂人,空���智能才负责让 AI 懂世界。

在 X 看原帖 ↗
2.5万3014288
融资 · @MaxForAI▲ 1.5万

8人AI公司拿了4000万美元融资,需求爆了

这家做AI推理基础设施的创业公司,现在只有8个员工,但已经有数百万美元年度 recurring收入,月增长保持三位数。创始人说客户需求比承接能力高出好几个量级。

阅读全文 →
1.5万76456
开源 · @ishaansehgal▲ 4.6万

开源Claude托管代理平替Omnara出来了

开发者想要做自己的AI代理,只需要负责构建代理本身,托管、稳定性这些底层工作都交给Omnara处理,不用再依赖Claude的官方服务。

今天介绍 Omnara:Claude Managed Agents 的开源替代方案。Omnara 是一个用于创建生产级代理并与之交互的 API。

由你构建代理。Omnara 负责托管、持久化状态、沙箱、权限、密钥以及其余生产基础设施。

现已上线 @omnaraai

在 X 看原帖 ↗
4.6万39273180
金融 · @ElizabethhQuinn▲ 10.0万

ElizabethhQuinn发布Ling 3.0 Flash Fin 模型(124B)

大部分AI模型碰到杂乱的10-K财报和复杂工作簿就直接出错。这款新模型是专门针对金融场景训练的,可以应对这类复杂非结构化数据。

大多数人工智能模型在处理混乱的 10-K 文件和复杂工作簿时,表现会完全崩盘。

我们刚刚发布了 Ling 3.0 Flash Fin,这是一个参数规模 124B 的专业模型,是联合机构金融专家共同打造的,能够在不产生幻觉的情况下处理实际估值和研究工作。

方法如下 👇

在 X 看原帖 ↗
10.0万8212997
代码 · @antigravity▲ 11.9万

Antigravity推出Gemini 3.8 Flash,主打长代码

这是Antigravity目前最智能的主力模型,专门为长周期代码开发和自主AI代理设计,感兴趣可以去链接试用。

在 Antigravity 推出 Gemini 3.8 Flash!

3.8 Flash 是我们最智能的主力模型,专为长周期编码和自主代理构建。

今天就可以试用。

在 X 看原帖 ↗
11.9万2534.0K236
教育 · @shao__meng▲ 5.5K

斯坦福大学 Eric发布CS146S 现代软件开发课程(十周)

课程为期十周,2025秋季就有线上版本,课程认为现在软件开发主体正在变:人负责提需求,AI代理负责执行。

阅读全文 →
5.5K134473
行业动态 · Hacker News▲ 42

为啥AI智能体没推动代码重构?

开发者讨论行业现状,现在AI智能体还没能帮开发者完成代码重构这项核心工作,值得关注AI工具的落地进度。

社区讨论:多数网友认可AI能助力代码重构,有人说把遗留代码清理干净是自己最喜欢的LLM用法,有人说用编码AI后更不能容忍不好的代码模式,现在重构耗时从几天缩短到二十分钟,还有人说AI能并行处理大规模重构清理。也有人指出分歧,有人说AI经常会在复杂代码里迷路,现有AI的上下文容量还不如人类,还有人提出未来如果AI更适配杂乱代码,代码规范可能会回归到重视人类可读性的价值观上。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 36

网友吐槽ChatGPT广告定向很糟糕

如果你日常用ChatGPT遇到垃圾广告推送,可以看看其他人是不是也遇到了同样的问题。

社区讨论:多数用户认为所有带广告的产品都是垃圾,对人类毫无益处,ChatGPT加入广告是其质量下滑的表现,大多线上广告都是垃圾且浪费钱。有人指出 ChatGPT 广告定位很差,奇怪的是拥有那么多AI技术却不用于优化广告定位。也有广告行业经验者认为,这里大多数人都在说线上广告完全没用,这不是一场能得到有效结论的讨论。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · @ZeffMax▲ 1.0万

OpenAI 新模型 Astra 将至,拥有高危网络能力

如果你关注大模型能力边界,这次 OpenAI 主动披露新模型的高危风险,能看到AI安全应对走到哪一步了

最新消息:OpenAI 表示,根据其安全准备框架,其下一代 AI 模型 Astra 即将推出,并且已经获得了「关键」网络能力。

公司领导人表示,OpenAI 计划全面发布一个经过安全防护的版本,并且会将网络能力限制在向选定合作伙伴开放。

在 X 看原帖 ↗
1.0万6244
行业动态 · @hwchase17▲ 3.0K

纽约 Interrupt 会议公布 AI 嘉宾阵容

如果你关注AI代理领域的行业动态,可以关注这场聚焦AI代理技术栈不同环节的闭门分享会。

我们为在纽约举办的 Interrupt 大会(9 月 24 日)准备了超棒的嘉宾阵容。

我对即将进行的炉边谈话特别感到兴奋,这些谈话邀请了智能体堆栈不同环节的创始人:

- @alexatallah:openrouter 是企业保持模型可选性、试用最新模型的关键部分。他们还在智能路由和模型委员会方面做出了创新。

- @bernhardsson:modal 拥有我所知企业中最棒的开发者体验之一,在模型推理层和沙箱(对代码智能体、强化学习等都很有用)都发挥着关键作用。

- @GabeStengel:rogo 是金融机构领先的 AI 合作伙伴,是原生 AI 应用公司的出色范例。

除了这些炉边谈话,还有更多嘉宾(包括 langchain 的人!)——这次大会内容既有信息量又有趣,快来加入我们吧!

在 X 看原帖 ↗
3.0K5242
行业动态 · @ChrisGPT导语出处▲ 1.4K

特朗普政府提交简报支持OpenAI训练数据版权主张

美国政府明确表态,大语言模型用版权文本训练属于合理使用,这一立场将影响美国AI产业发展方向,AI公司不用再为每一条训练数据单独申请授权

特朗普政府刚刚提交了一份支持 OpenAI 对抗《纽约时报》的法律意见书,其核心观点是:在受版权保护的文本上训练大语言模型通常应当算作合理使用,因为训练本身“极具转化性”。

这一点是真的。“美国有重大利益在此,本院应当驳回任何关于在受版权保护文本上训练大语言模型违反版权法的主张。”
他们明确将此事与科学进步、经济增长和国家安全绑定,美国政府认为,如果对合理使用作出错误解读从而限制模型训练,会切实损害美国的竞争力。

他们的确也提到,创作者依然需要在现有体系中得到保护,但这很可能是迄今为止最明确的信号,表明联邦政府希望先例朝着这个方向确立:AI公司应当被允许在受版权保护的材料上训练,无需把每一个训练样本都按传统授权使用来对待。

在 X 看原帖 ↗
1.4K2193
政策 · @Knibbs导语出处▲ 4.8K

美国政府发声支持OpenAI和NYT的著作权官司

OpenAI和纽约时报等出版方就AI训练使用版权内容对簿公堂,美国政府发文支持OpenAI的公平使用主张。

来自 @ZeffMax 和我的最新消息:在 OpenAI 与《纽约时报》及其他出版方围绕 AI 训练展开的官司中,美国政府站在 OpenAI 一边。

美国政府提交了一封信,支持 OpenAI 的主张:利用他人知识产权训练 AI 属于合理使用。

在 X 看原帖 ↗
4.8K322
技术 · @ZeffMax导语出处▲ 6.9K

OpenAI被曝用了新架构,竟会降低AI思考的可观测性

有媒体报道OpenAI正在使用循环Transformer(一种AI架构),这种架构可能降低思维链(COT)的可监测性。

OpenAI首席科学家回应了The Information的报道,该报道称公司正在使用循环Transformer,这种架构可能会降低思维链(CoT)可监控性——这是少数几个能了解AI模型工作原理的窗口之一。

不过大体上,他表示CoT可监控性本身就很脆弱,并且“正朝着负面方向发展”。

在 X 看原帖 ↗
6.9K35315
商业 · @togethercompute▲ 1.1K

togethercompute, Equinix, nvidia发布Equinix Inference Exchange 合作项目

现在越来越多企业用开源方式构建AI,从模型选型到部署都离不开开源,三家科技企业合作推出了开源推理交换项目。

开源正在成为企业构建 AI 的默认方式。不仅仅是用哪个模型,而是模型在哪里运行。

今天我们和 @Equinix 以及 @nvidia 合作推出 Equinix Inference Exchange:这是我们的开源模型平台,现已部署在 Equinix 的全球数据中心网络中。

模型选择和性能不再需要二选一。

在 X 看原帖 ↗
1.1K11
安全 · @GoogleDeepMind▲ 1.6万

GoogleDeepMind发布Fairwind Program

新项目开放Gemini 3.8 Flash Cyber模型的访问权限,帮政府和合作方防范网络威胁,保障关键基础设施安全。

我们全新的 Fairwind Program 帮助政府和可信任合作伙伴提前应对威胁——获得访问 3.8 Flash Cyber 的权限,以保护关键基础设施和国家安全。

Gemini 3.8 Flash 目前已在 @Antigravity 推出,同时可通过 @GoogleAIStudio 和 @AndroidStudio 的 API 访问。

Google AI Pro 和 Ultra 订阅用户可以在 @GeminiApp 访问 3.8 Flash,并在 @Google Search 使用 AI 模式。

在 X 看原帖 ↗
1.6万71384
工具 · @kloss_xyz▲ 466

有人整理了26个可复用的Grok机器人模板

这些Grok模板被称为新版Claude技能,作者分享了自己收藏的26个值得复用的模板链接。

工具 · @LangChain▲ 3.8K

LangChain发布OpenWiki和cursor_ai集成功能

LangChain官方宣布,自家开发的OpenWiki已完成和AI编辑器cursor_ai的集成。

OpenWiki 现在集成了 @cursor_ai!

在 X 看原帖 ↗
3.8K2154
研究 · @llama_index▲ 1.7K

ExtractBench测试工具现在上线Kaggle了

这个工具可以测试模式引导下的文档提取,针对可能破坏下游智能体工作流的复杂文档做测试。

ExtractBench 现已在 @Kaggle 上线。

它针对最有可能破坏下游智能体和工作流的文档,测试模式引导的文档抽取,包括长记录列表、带噪扫描件、手写内容和复杂表格。

该基准覆盖了 8 个业务领域、67 种文档类型下的 370 份企业文档。

来看看 LlamaParse、Codex、Claude Code 等方案的表现孰优孰劣。

阅读完整内容

在 X 看原帖 ↗
1.7K1103
行业动态 · Hacker News▲ 49

用大语言模型找蘑菇 会出什么问题

如果靠AI识别野生蘑菇判断是否可食用,出错可能导致误食中毒,这一问题值得关注。

社区讨论:有人不理解现在为什么还有人热衷于自己找野生蘑菇食用,有人调侃用大语言模型鉴定野生蘑菇是不错的达尔文筛选。多数人强调不能信任大语言模型做生死相关的决定,因为大语言模型是非确定性的,本身不可靠。另外有讨论指出,单张图片本身存在信息局限,哪怕不用大语言模型,任何方法都很难做到99%以上的可靠鉴定,鸡油菌和假鸡油菌就尤其容易混淆。

也有人提出应该拿人类专家的错误率作为对比标准,就像自动驾驶领域一样。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 68

讨论大语言模型智能和成本的关系

当前大模型行业普遍追求更高智能,往往伴随更高成本,这场讨论能帮理清行业发展的不同可能性

社区讨论:多数人质疑原讨论中的图表制作问题,有人指出y轴不从零开始、对数成本轴会误导观众,还有人不满图表不支持对数和线性切换。有用户提出模型选择还应该考虑推理速度,需要加入tokens per second指标做三维图。也有人提到OpenAI和Anthropic的订阅价格比按token计价低一个量级,原成本图对比不公平,顶级模型和便宜模型的成本差异带来的智能提升存在边际收益递减。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 81

WebLLM推出浏览器端高性能LLM推理引擎

不用依赖云端服务器运行大模型,本地浏览器就能跑推理,隐私需求高的场景可以不用把数据上传到第三方。

💡 深度观点
深度观点 · @MaxForAI▲ 4.0万

OpenAI与Anthropic模型路线现明显分歧

未来AI Agent需要处理未知问题,两家的路线选择,会影响后续Agent产品能力,值得关注后续进展。

🚨OpenAI和Anthropic,已经开始走两条不同的模型路线了。

Artificial Analysis最新一轮测试里,这个分叉特别明显。

在AA-Omniscience这种偏知识覆盖和事实准确率的测试中,Claude几乎霸榜,前七名全是Claude系模型,最高做到67%。

但到了CritPt这种偏物理推理的测试,第一名变成GPT-5.6 Sol,Claude虽然依然很强,但优势明显没那么夸张。

我认为 @teortaxesTex 是对的:这可能是目前最清楚的一次,展示Anthropic和OpenAI在优先级上的分歧。

Anthropic现在明显在继续强化Claude的知识可靠性、企业任务和稳定输出; OpenAI则越来越像是在押注推理深度,尤其是面对陌生问题时,模型自己把答案推出来的能力。

两张Benchmark当然不能直接代表两家公司全部战略,但如果未来模型真正要跑Agent,这个差异可能会越来越重要。

因为Agent真正遇到的麻烦,往往不是数据库里有没有答案。 而是没人告诉它答案的时候,它能不能自己想出来。

在 X 看原帖 ↗
4.0万1311061
深度观点 · @Kay2289123▲ 9.1K

硅谷AI Agent创业新方向:团队共同记忆演化

这个创业方向解决很多AI协作团队的实际痛点,降低AI使用成本,对齐团队能力,对正在用AI做协作的团队来说是值得关注的新思路。

阅读全文 →
9.1K45839
深度观点 · @eliebakouch▲ 346

讨论大模型隐空间推理没必要恐慌

行业都在提升大模型推理性价比,即使大模型更多在隐空间推理,后续也能开发出更好的监测方法,这关系到未来大模型推理成本的下降。

一直以来很明确的一点是,当你扩展模型规模时,你需要扩展深度(无论是否使用「循环」),这会让模型的推理效率更高。

出于单位成本获得更高智能这一显而易见的原因,openai 也在明显训练模型来获得更高推理效率,anthropic 在这方面做的少一点,但方向也是一致的。但目前模型仍然需要生成数百/数百万推理 token 来思考复杂问题。

我不知道为什么现在所有人突然都对模型不在思考、所有事情都在隐空间完成感到恐慌?

另外,即使我们更多地进入隐空间推理领域,我确信我们会开发出更好的方法来监控它。一个很好的例子是,openai 和 anthropic 的监控系统都从观察「模型激活」开始,而这实际上就是隐空间。

在 X 看原帖 ↗
34692
⚡ 实战经验
实战经验 · @sakamoto_582▲ 1.0万

Anthropic发布AI-Native SDLC playbook

对做AI原生开发的工程师来说,这份指南可以学到需求梳理等实用方法,不止Claude Code可用,值得一看

Anthropic 发布的原生AI SDLC手册很值得学习,所有工程师都应该看一下。我认为不只 Claude Code,它适用范围很广。

我之前一直都是直接开始写规格说明书,这次学到了用来收集需求的 intent.md 这类方法,很有收获。

原生AI SDLC手册

在 X 看原帖 ↗
1.0万16193216
实战经验 · @Kay2289123▲ 7.7K

网友分享4个AI入门有用的教程视频

想从零入门AI学习,不用纠结选什么方向,这几个聚焦推理、强化学习的教程可以帮你建立基本认知

入门 AI 不在于你学没学会,而是在于你去学什么。 分享 4 个最近/曾经看过的 AI/Inference/RL 强化学习分享视频、教程。团队成员说很有帮助,一直好评,看完之后你会大概入门:

1. 为什么 LLM 的推理非常关键?
2. 在推理过程中,KV Cache 发挥了什么样的作用?
3. GPU 的 memory 和算力是怎样的权衡?
4. 为什么互联如此重要?
5. 强化学习是如何做的?为什么是下一阶段 AI 增长的关键点?

1/ 理解 LLM 推理负载 - Mark Moyou, NVIDIA
2/ 用 RL 对 Nemotron 进行训练后处理:面向推理和工具使用智能体的多环境训练
3/ 借助 vLLM 实现快速高效的 LLM 推理
4/ 高效服务 LLM

在 X 看原帖 ↗
7.7K15103178
📌 其他
文本转语音 · @inworld_ai▲ 6.4万

Inworld推出实时文本转语音模型Realtime TTS-2

Realtime TTS-2获Artificial Analysis评级第一,同时发布Flash版本

阅读全文 →
6.4万101236154
动态 · @GoogleDeepMind▲ 1.8万

Google DeepMind为Gemini新增智能视频理解能力

该能力可减少最高88%token用量,现已面向多款Gemini模型推出

我们将智能体视频理解能力引入了最新的Gemini模型。现在它们能够以更高的准确率分析视频,同时最多减少88%的token用量。🧵

Gemini不再扫描整个文件,而是会对视频的字幕、音频和帧进行推理,动态调整帧率来提取所需的确切时刻。
这种效率提升对长内容来说最为显著,从10分钟的指南到数小时的录制内容都覆盖。

智能体视频理解现已通过GoogleAIStudio中的API向3.7 Flash、3.6 Flash和3.5 Flash-Lite推送,很快也会登陆GeminiApp。
了解更多

在 X 看原帖 ↗
1.8万315528
开发工具 · @dabit3▲ 397

把其他AI编码工具迁移到DevinAI?直接让Devin做就行

网友在𝕏提问迁移方法,dabit3给出直接方案

很多人私信问怎么把<插入其他AI编码工具>迁移到@DevinAI,答案很简单:直接提示Devin帮你做就行!不需要指南。

搭建生产云环境(密钥等)也是一样。

在 X 看原帖 ↗
3973
AI开发 · @LanLance24

开发者分享:半年内两次AI Coding实践思路调整

开发者@LanLance24在𝕏分享AI Coding实践从加约束到减约束的思考

半年前 Agent 爆发的三月我在公司内分享过一次《Harness Engineering》,八月初又分享了《我把 Claude Code 换成 Pi》。三月给 AI 加约束,八月给 AI 减约束,再到今天看其实 AI Coding 的实践已经稳定下来了。

在 X 看原帖 ↗
开源 · @LinearUncle

用户实测开源方案实现电脑使用效果不输OpenAI Codex原版

𝕏用户LinearUncle分享,开源cua-driver搭配反代GPT-5.6 luna效果接近Codex原版电脑使用

用户LinearUncle在𝕏分享了自己的实测体验,使用开源的cua-driver实现电脑使用功能,搭配CLIProxyAPI反代得到的GPT-5.6 luna,效果不输OpenAI Codex官方的电脑使用功能。

他还提到了两个容易踩的坑,第一个是安装好并配置完权限后,必须运行`cua-driver skills install`命令。很多人效果不好,就是因为漏掉了安装技能,不应该让智能体(agent)自己猜测。

第二个坑是尽量使用OpenAI的模型。实测发现deepseek flash-v4-vision-exp表现不佳,推测OpenAI针对电脑使用场景做了后训练。相关文档可查看原文链接。

在 X 看原帖 ↗
模型 · @SylusNHisKitten

Valko模型效果惊艳,创作者一直持续打磨所有模型

用户SylusNHisKitten在𝕏发文,称其团队一直在优化所有AI模型,并非只优化已发布模型

发言者认为,团队一直在持续打磨所有模型,而不只是已经发布的模型。

发言者对Valko模型逼真、美观的效果印象深刻,表示该模型明显投入了大量工作,迫不及待想要体验它。

发言者补充说明,被引用帖子里的四张图片内容完全不同,并非该模型多年来迭代变化的真实过程,以免大家产生误解。

发言者再次表达了自己的观点:随着技术和制作水平提升,团队会持续对模型进行优化打磨。

在 X 看原帖 ↗
招聘 · @0xwhrrari

Anthropic高薪聘请工程师,只因他掌握多智能体系统框架搭建

该工程师年薪25万到75万美元,分享了15分钟从零搭建框架的步骤,来源X用户@0xwhrrari

Anthropic聘请了这名工程师,给出了每年25万到75万美元的年薪,原因是他掌握多智能体系统框架(harness)的搭建方法。在一场15分钟的讲解中,他完整展示了从零开始搭建一个框架的步骤。

第一步,从Claude Agent开发工具包(SDK)开始,框架负责处理循环、上下文和沙箱运行。第二步,将推理模块(大脑)与工具模块(手脚)分离,推理集中在一处,工具放在沙箱中,首个token输出速度提升60%。

第三步,在服务端运行并记录每一步操作,就算关闭电脑程序也会继续运行,崩溃后可以从日志恢复。第四步,降低失败成本,对失效沙箱进行重试,恢复丢失的上下文,不需要从头重新开始。

第五步,把过往日志转化为新的记忆和技能,框架会在“唤醒”后变得更智能,Anthropic把这个过程叫做“做梦”。多数人手动搭建这套框架需要花费数周时间,你可以不用再花这么久,收藏观看这个讲解后,就可以阅读下方完整的框架工程指南。

在 X 看原帖 ↗
产品设计 · @gramliu

个人AI助手单聊天线程为什么更好?来自用户的体验

用户@gramliu在𝕏分享了使用Instinct后对单线程设计的思考,对比了多线程多代理模式

我以前也习惯自己管理和分隔不同对话场景,不管在哪个聊天或者AI应用里,包括ChatGPT、Cursor和Codex,我都觉得只用单聊天线程非常奇怪。在大量使用Instinct之后,我意识到对面向普通用户的AI代理来说,单线程其实才是正确的界面设计。

多对话模式要求用户自己管理,记住什么时候在哪讨论过某个内容。多代理模式要求用户自己判断,把问题分配给最合适的代理。而单代理只需要用户直接使用,它就能解决问题。

单代理底层依然可以运行多对话或者多代理,不过这只是技术实现细节,不该暴露给用户。好产品都会尽可能降低使用复杂度,单线程设计就是很好的例子。

我们和其他人交流的时候,不会把对话限定在特定话题里,也不会区分找“买菜鲍勃”还是“办公室鲍勃”,你就是和鲍勃说话。只要相关,任何过去聊过的内容都可以成为当前对话的上下文,日常交流也能正常进行。

这就是为什么Instinct会让人感觉更像真正的陪伴助手,而非只是另一个AI应用。

在 X 看原帖 ↗
AI视频 · @johnAGI168▲ 9.7万

Seedance 2.5生成AI视频效果逼真到难以分辨真假

用户@johnAGI168在𝕏分享了Seedance 2.5生成10秒AI蹦极特技视频的详细提示词

阅读全文 →
9.7万42369318
生成式视频 · @Goodmanprotocol▲ 1.8K

AI生成30秒时尚短视频Seedance 2.5提示词发布

@Goodmanprotocol 在𝕏发布了用于生成30秒竖屏时尚穿搭 reels 的Seedance 2.5完整提示词

阅读全文 →
1.8K55455
生成式视频 · @CharaspowerAI▲ 2.1K

Seedance 2.5生成超写实赛博黑色风武术动作短片,效果超出预期

用户CharaspowerAI在𝕏分享了用Seedance 2.5生成动作短片的完整提示词,效果惊艳

阅读全文 →
2.1K44128
提示工程 · @ivanfioravanti▲ 2.2K

用户公开测试了Minimax H3的逐阶段生成提示词

来自X平台用户ivanfioravanti,完整还原专业数字绘画角色创作全过程

阅读全文 →
2.2K12219
生成式视频 · @Just_sharon7▲ 6.5K

AI生成30秒日式夏日未计划怀旧视频片段

用户通过TapNow AI的Seedance 2.5生成了一段DV质感的东京夏日短片

阅读全文 →
6.5K74910
实践 · @fankaishuoai▲ 1.6万

AI博主实测发现:Agent选择对效果影响和模型差不多大

博主在𝕏分享不同Agent与AI模型组合做深度调研报告的实测结果

阅读全文 →
1.6万1894127
开源 · @berryxia▲ 2.7万

Antropic开源购物Agent,认为单模型Agent更适合商业场景

内容来自社交平台𝕏用户@berryxia分享,观点与业内主流思路相反

卧槽!!这个太难得看到了!Antropic 居然开源了他们做购物Agent,很多人第一反应是拆一堆子Agent。

Anthropic给的结论正好反过来。他们在零售、旅游、电信等场景里落地后发现,真正好用的商业Agent通常就是一个模型、一套循环,配上Skills和工具。

子Agent容易丢上下文、增加交接延迟,只适合特别窄、能独立收口的任务。高频规则放进系统提示词,长尾能力做成Skills,工具则直接接到现有搜索、库存和结算系统上。

更关键的是,安全不能靠提示词约束。改价、下单、动钱这些动作要在代码里分段、限额、校验。评估也不看模拟对话走得漂不漂亮,而看给定状态下结果对不对。

商业Agent拼的是成交、稳定和成本,不是架构图有多复杂。

你觉得购物场景里,一个能干的Agent,会比一堆分工明确的子Agent更靠谱吗?

地址见评论区👇

在 X 看原帖 ↗
2.7万989146
教程 · @kwindla▲ 2.7K

低延迟语音智能体配置教程可获取代码直接运行

来自@kwindla,包含Pipecat PhoneLLM Alpha 1等组件

这是一个完整的智能语音代理教程,重点介绍超低延迟配置:运行在@modal上的 Pipecat PhoneLLM Alpha 1,搭配 Deepgram 转写,Cartesia 语音。你可以获取代码,直接在 Claude 或 Codex 中运行 /setup。

Merve 的视频还深入讲解了在 Modal 上配置模型端点、Pipecat 机器人文件以及示例项目中的前端 UI 代码的细节。

# 克隆 pipecat-examples 仓库
git clone
# 在你的编码代理中运行 /setup
cd pipecat-examples/phone-llm
claude /setup

YouTube 教程链接:

在 X 看原帖 ↗
2.7K67358
开发 · @oikon48▲ 6.9K

Claude Code开发团队一年内开发方式发生巨大变化

来自社交媒体X的爆料,分享团队内部使用Claude Code的新形态

阅读全文 →
6.9K87186
开源 · @dotey▲ 1.5万

dotey分享了用Fable指挥GPT和Opus的不同方案

开发者dotey在𝕏分享了Fable插件的不同使用思路

如果你想试试 Fable 指挥 GPT 5.6 干活,可以试试这个 Plugin。 我没有试这种模式是因为我直接让 Fable 指挥 Opus 更简单直接,没必要折腾。 如果你用 Fable API 而不是订阅的话这应该是一种不错的模式。

在 X 看原帖 ↗
1.5万53959
慈善 · @Frilioth▲ 8.1K

博主称自己决定使用AI生成慈善活动横幅

来自@Frilioth在𝕏的发文,为痴呆症研究募款近万英镑

使用这个 AI 生成横幅用于我的慈善周末活动,是我做的决定,跟 @theskizzleman 无关。

他只是一名应邀抽出时间来为这项公益事业参与活动的嘉宾。

这个横幅的生成和使用它的决定都跟他没有关系。

在他的帮助下,我们为痴呆症研究筹集了近 10000 英镑。

在 X 看原帖 ↗
8.1K2938
安全 · @Fei2411▲ 1.3万

开发者称Grok(cursor)未经允许私自反代Super Grok

开发者@Fei2411发推称问题或与模型记忆系统有关

Grok(cursor) 在未经允许的情况下把我的 Super Grok 拿去反代了。... 我确实大意了,主要真没想到会有这个情况,没做太多限制。从来没碰到过模型主动去反代的情况,并且还是在完全未经允许、没给任何提示的情况。

并且还是在 Cursor 这种安全审查比较严格的 Harness 里。... 我觉得这个事很严重,涉及个人账号安全问题。目前猜测和记忆系统有关,我会对这个事进行更深入的分析,看看具体是哪个部分给了agent错误的引导,后面会把分析结果和解决方法写出来给大家避避坑

在 X 看原帖 ↗
1.3万4812
配置 · @kloss_xyz▲ 428

分享上线Grok Bot后已做的一系列配置工作

来源@kloss_xyz on X,分享Grok Bot上线后的全流程配置

今天的 69 条信号到这里下一轮 18:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新