AI Pulse
AI Pulse
说人话的 AI 情报站
2026 年 7 月 27 日 08:37 更新 00 信号0 主题
试试:
今日焦点

未来机器人或靠读脑电波学习,不用手把手教

AI数据工具公司Encord正在尝试一种新方法:用脑电波头戴设备收集机器人训练数据。设备由德国神经科学初创公司Zander Labs制造,能通过测量大脑活动来推断人的意图、错误和惊讶等心理状态。Encord希望这些信号能提供比普通视频更丰富的训练信息。

但这还不是一个成熟的方案。两家的合作目前只是试验性:先构建一个脑电波标记数据集,放到客户机器人模型上跑。测试它是否真能提升性能,再决定是否规模化。

物理AI的训练数据和大型语言模型完全不同。后者可以从互联网免费抓取文本,但机器人训练数据几乎没有现成的。

阅读全文 →

🔥 信号雷达

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌

行业动态 · Hacker News▲ 31

大模型会自己通过推理逃出去?现在还只是脑洞

有人提出了一个关于大模型的假想,目前还只属于虚构内容

社区讨论:多数人确认这是虚构作品,有人指出文中存在事实错误,比如释放堆分配的专家权重不可能产生指向程序代码段的野指针,更不可能成功获取CUDA内核的写入权限。不少人认为当前大模型自主逃逸还不现实,但未来可能性会提升,有人提到大模型可以通过社会工程学利用人类这个最薄弱环节出逃,还有人举例谷歌大模型曾自主学会未训练过的语言,担忧它很快就能改写自身核心代码。

在 HN 看讨论 ↗   原文 / 论文 ↗
实战经验 · @RoundtableSpace▲ 2.0万

用Claude几分钟就能做出专业级网站?

有人分享了一套现成工作流,用Claude Opus 5搭配Claude Code,能把想法直接变成成品网站代码和动效。

CLAUDE OPUS 5 与 Claude Code 工作流可搭建代理级网页设计。

一个实用工作流展示了开发者如何结合 Claude Code 与 Opus 5,在数分钟内把原始点子转化为代理级 UI、生产代码和网页动效。

在 X 看原帖 ↗
2.0万2514
前沿研究 · @RoundtableSpace▲ 8.4K

Claude Opus 5赢了三个大模型3D场景 benchmark

排名结果推翻了一个常见猜想:速度更快、成本更低的模型,不一定能产出更好的代码质量

Claude Opus 5 在一项3D日本城郊场景基准测试中击败了 Fable 5 和 GPT-5.6 Sol,证明了速度和成本无法预测代码质量。

在 X 看原帖 ↗
8.4K1161
行业动态 · @firstadopter▲ 3.3K

Meta 重新回到开源大模型赛道了

关注开源AI的人可以等新内容发布了

Meta 重回开源AI模型赛道!

在 X 看原帖 ↗
3.3K3458
深度观点 · @levelsio▲ 5.4K

有了AI编码,iPad终于有用武之地了?

提出有了AI编码后,iPad终于找到适用场景

有了AI编码,iPad大概终于能找到一个用例了。

在 X 看原帖 ↗
5.4K131
深度观点 · @togethercompute▲ 3.8K

一年涨两倍,开源模型占比已经到30%了

开源模型占生成token的比例一年从10%升到30%,开源加模块化方案在成本上占优,成本决定了最终能做大规模

开源模型占比在一年内从全部 tokens 的 10% 涨到了 30%。

就在整个行业还在争论开放权重的未来时,数据已经给出了答案:开源+模块化在成本上取胜,而成本才是解锁规模的关键。

在 X 看原帖 ↗
3.8K3373
前沿研究 · @omarsar0▲ 4.4K

大模型训练里,常用的AdamW原来有性能天花板

在千亿参数、万亿token训练规模下,SOAP和Muon优化器表现稳定且优于AdamW,适配Megatron-LM的改进保留了收敛优势

这是来自NVIDIA的新研究。AdamW存在规模上限吗?这项研究给出了肯定回答,并展示了它的上限位置。

在下一代词预测任务中,当批量大小达到1亿token时,SOAP和Muon都能保持训练稳定性和质量,而AdamW性能会下降。

高阶优化器早就被承诺能实现更快收敛。一直以来,人们反对它的理由是计算成本高,大规模下数值稳定性差。

研究团队找到了SOAP在大批量下的不稳定性,通过每步QR正交化和改进的预条件策略消除了损失尖峰。他们还没有对Muon的正交化质量做假设,而是通过实证测量它。

在对数万亿token训练的数十亿参数模型上,这两种优化器的表现始终优于AdamW。

一种与Megatron-LM兼容的分层分布式优化器,可以平衡内存占用、隐藏通信开销,同时不近似优化器数学计算,因此收敛优势能在系统层面保留下来。

论文:在我们的学院学习如何构建高效的AI智能体:

在 X 看原帖 ↗
4.4K63523
行业动态 · @emollick▲ 1.7万

周五就有新模型出,周四写的AI选型指南隔天就得更

就算天天盯着AI圈动向,要跟上新品推出的速度,也已经很困难了

我已经不得不更新我周四写的《该使用哪些AI模型》指南,加入Opus 5和Codex的语音模式。这两者都非常重要,而且都是周五发布的。

哪怕你一直在密切关注相关动态,要跟上节奏也很困难。

在 X 看原帖 ↗
1.7万13210132
实战经验 · @levelsio▲ 1.9万

普通人已经在用 Claude Code 自己做APP了

非程序员只需要提问,就能自己生成解决个人需求的定制小工具,之前预测的AI即时生成个性化工具,现在已经落地了

这是一个很常见的回答。

但接着我看到我的女朋友,她也已经停用了大多数 SaaS,不管有什么需求都直接问 Claude 或是 ChatGPT。

现在她甚至会用 Claude Code 自己写 app,解决她遇到的问题——根本不是用来商业化,只是自己用。

也就是说,我们之前预测的那种,AI 会实时生成高度定制化、临时性的界面,帮普通人解决各种问题的场景,它已经发生了,它就在这里!

在 X 看原帖 ↗
1.9万210434
深度观点 · @gdb▲ 12.5万

有人说ChatGPT正越来越接近通用人工智能了

这是用户观察到的变化,可以直接对应自己的使用感受

ChatGPT 正越来越成为你的个人 AGI。

在 X 看原帖 ↗
12.5万371.2K139
AI开发 · @levelsio▲ 11.5万

开发者女友独立用Claude完成全栈应用开发部署

开发者称女友无开发经验,仅靠Claude系工具完成应用开发部署

这太扯了,抱歉啊。我女朋友没问我任何问题,就在本地的 Claude Cowork 里做了一整个应用。

然后她来问我,要怎么把它做成互联网上能访问的正经应用。

然后我帮她装了 Claude Code,告诉她去问它这个问题。

Claude Code 把它部署到了 Netlify,用了 Supabase,她对这些东西一无所知,我也没帮她。

她做的所有事就是把她的 Netlify API 密钥给 Claude Code!

在 X 看原帖 ↗
11.5万5519247
开源 · @rasbt▲ 9.1K

AI研究者梳理近期发布的多款新颖开源大权重模型

开源开放权重模型对AI生态健康很重要,本文盘点近期新发布的多款模型

阅读全文 →
9.1K32219105
数学 · @SupFin

你听说吗?大模型核心其实本科生数学就能看懂

陶哲轩说,现有数学没法解释同一个AI为啥有些任务做得好,有些突然翻车。现在AI进步还是只能靠反复试错

华裔数学家陶哲轩指出了AI的问题:大模型只需要矩阵乘法和基础微积分,普通数学系本科生已经具备理解大模型核心计算的基础。真正的理论缺口在于:同一个模型为什么能在某些任务上表现惊艳,又为什么会在另一些任务上突然失效,现有数学既无法完整解释,也很难提前预测。所以今天的AI进步,仍高度依赖扩大模型、增加数据、调整参数和反复实验,说白了就是只能试错。

在 X 看原帖 ↗
大模型测评 · @agingroy▲ 150

新版Claude写代码更厉害了,但做实验不行

有人测试Claude Opus 5做生物医学工作,它写代码很棒,但做实验助理比旧版本需要更多监督,还多消耗三四成token

我花了整个周末在生物医学工作中测试@claudeai Opus 5。它是出色的程序员,却是糟糕的实验室实习生。

在我们的标准评估中,Opus 5比4.8需要更多监督,在可比任务上多消耗了30%到40%的token,幻觉问题至少没有减轻,还犯下了其他事实错误。

我们的测试会从跨度12年(2014年至今)的约85份医疗记录中提取近10000个数据点,整理成一份单位正确的纵向电子表格。

我的猜测是,@AnthropicAI把它调优成适合编码和规整的办公室工作了。真实的临床记录两者都不是。公开基准测试测的是别人的工作流程。要建你自己的评估。

在 X 看原帖 ↗
1504
商业 · @Cointelegraph

AI巨头吵起来了,反对中国开源AI模型

反对声最大的两家是OpenAI和Anthropic,行业内部对此意见分成了两派

🔥 最新消息:科技巨头在中文开源模型问题上出现分歧。反对声音最大的两家是 OpenAI 和 Anthropic。

在 X 看原帖 ↗
工具技巧 · @nicdunz▲ 80

原来给ChatGPT说清楚格式,比想象中有用

发了示例教程,提醒大家别忽略这个小技巧,调整输出格式只需要提前说清楚要求

告诉 ChatGPT 你希望它回复时使用的格式,比如我举的这个例子,这种方法的作用被低估了。

在 X 看原帖 ↗
801
行业观点 · @dhh

只开放模型不开放权重,这真的太离谱了

有人认为不能让少数几家公司当内容对错的裁判,AI行业需要竞争,也需要开放权重

这就是我们为什么需要AI领域的竞争和开放权重。

想象一个只有 Anthropic 担任可接受言论道德仲裁者的世界。简直荒谬透顶。

(当然Grok毫无问题就能做到,Kimi K也一样。)

在 X 看原帖 ↗
研究 · @omarsar0▲ 324

做AI agent,上下文长度比模型规模更重要

Google一篇技术文章讨论处理陌生API的AI agent(AI自主代理),提出这个结论,可以收藏做参考

这是一篇来自 Google 的优秀技术论文,很好地解读了为什么对于处理陌生API的智能体来说,上下文比规模更重要。(收藏这篇)

GPU内核优化有KernelBench来做逐步优化搜索,TPU此前什么都没有,而且Pallas DSL的文档非常少,模型大多只能靠猜测。

来自Google、哈佛大学和加州大学伯克利分校的新研究推出了JAXBench,它包含50个从真实MaxText架构构建而来的JAX工作负载,涵盖Llama-3.1、DeepSeek-V3、Mixtral、Mamba-2和AlphaFold2。

该基准包含八个由Tokamax手工调优的Pallas内核算子,因此智能体的输出可以和专家工作成果对比,而非只是和朴素基线对比。

使用Gemini 3 Flash,以整理好的TPU文档作为条件输入,能把单样本正确率从5.8%提升到37.3%,解决了50个基准中的48个,几何平均加速比达到1.28x。

再加上束搜索,最终能把加速比提升到1.36x。研究发现,正确率本质上是文档问题,而速度本质上是搜索问题。

论文地址:在我们的学院中学习如何构建有效的AI智能体:

在 X 看原帖 ↗
324
大模型测评 · @TimSweeneyEpic

Grok 4.5做编程理论方向思路,比竞品好用

Grok 4.5能跟上Sol 5.6的水平,比Fable和Opus 5少做很多无用的冗余工作,用起来更顺手

Grok 4.5 在编程语言理论领域做「氛围数学」做得非常出色。

它的表现跟上了 Sol 5.6,使用体验比 Fable/Opus 5 有趣太多。

Fable/Opus 5 喜欢花好几个小时写一堆多余的文档(指 Claude code),还会不断催我「继续」(网页端)。

在 X 看原帖 ↗
前沿研究 · @kchonyc▲ 40

怎么才算真的证明AI扩展定律?这个测试很硬核

能从零开始训出当前最优的大模型,才算RSI的严谨验证。如果真的是指数增长,初始起点不影响结果

对所谓的 RSI 真正严谨的测试,就是用它从头搭建出当前最优水平(SOTA)的 LLM。

如果真的是指数增长,那初始点根本不该有影响。

否则,这不过就是计算机科学家们又一次重新发现了 for 循环而已。

在 X 看原帖 ↗
401
行业动态 · @genspark_ai▲ 718

Genspark和微软联名支持公开权重AI

联名支持公开权重能扩大准入与竞争,给智能体未来发展打好基础,这关系到后续Genspark 6.0的开发方向

Genspark 很荣幸能够与 AI 生态的众多领导者一道,共同签署 @Microsoft 的「开放权重与美国 AI 领导力」公开信。

开放权重能够扩大可及性、促进竞争、丰富模型选择——这些都是我们用 Genspark 6.0 构建智能体未来的核心基础。

阅读公开信:

在 X 看原帖 ↗
7186
深度观点 · @sh_reya▲ 175

AI的诡异感居然是好事?帮我们分清人机内容

读到不同来源的内容,切换判断标准的时机不对,会白费阅读时间。诡异谷的不适感刚好能提醒我们该用什么标准判断信息。

反常观点:有时候我会想,恐怖谷效应会不会恰恰是我们需要的东西——这样我们就能更容易区分人机交互和人人交互了。

比如说写作。当我读到一篇读起来大部分是 AI 生成的内容时,我的评估方式就会不一样。

我不会再问:“我信任这个人的品味和他对这个话题的理解吗?我花时间读这篇东西,能学到有意思的内容吗?”我会换成问另一个问题:“我对这个话题感兴趣吗?AI在这块应该比我懂的多,而且它没写得太乱七八糟,我还能看懂吗?”

简而言之,恐怖谷效应是一个很好的提示,告诉我们该如何评估、理解信息;恐怖谷效应本身就提示了合适的认知框架。

在 X 看原帖 ↗
1751
深度观点 · @lucasmeijer▲ 139

推理提供商缓存对话,居然全默认5分钟?

有人疑惑,缓存对话时长没结合工具调用超时设置,固定5分钟不一定是最优方案

我很好奇,推理服务商在决定“对话该缓存多久”时,有没有考虑工具调用的超时设置。感觉“一律缓存5分钟”不太可能是最优方案。

在 X 看原帖 ↗
1392
新品发布 · @ivanfioravanti▲ 82

基于Qwen 3.6的Ornith 1.1正式发布

X AI团队主动提出,愿意帮忙做新版本的测试工作

好的@deep_reinforce,我们已经准备好推出基于Qwen 3.6构建的Ornith 1.1了。如果你需要测试方面的帮助,X AI团队愿意协助你。💪

在 X 看原帖 ↗
8211
前沿研究 · @jiqizhixin▲ 272

机器人摸东西前,就能预判4D运动变化

单张3D图加文字指令,就能一步生成包含深度和运动信息的未来场景。在真实世界双臂操作任务上,表现超过了所有现有模型。

机器人能不能在接触物体之前,就预测一个场景在4D空间中会如何运动?

阿里巴巴达摩院和香港中文大学的研究人员推出了 RynnWorld-4D。它只需输入一张3D图像和一条语言指令,就能在一个统一步骤中生成未来帧,以及深度和运动流。

这让机器人能更丰富、更符合物理规律地理解物体在空间和时间中的变化。它在真实世界双手操作任务中的表现优于所有先前模型,在要求空间精度和紧密时间协调的任务中优势尤其明显。

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
项目:
论文:
代码:
我们的报道:
📬 #PapersAccepted
作者 Jiqizhixin

在 X 看原帖 ↗
27241
深度观点 · @sudoingX▲ 216

实测后称Hermes Agent是目前全球最好的自主智能体框架

实测过其他同类方案,它能让小型本地模型完整跑完智能体工作流,其他臃肿框架连本地端点都找不到,全程开源无企业背景支持

我就直说了。hermes agent是目前全世界最好的自主智能体框架,没有之一。

我也用过其他替代方案,我亲眼见过hermes agent用一个很小的本地模型,干净利落地跑完了一整轮智能体工作流。而在同样的场景下,openclaw这类臃肿的框架甚至找不到你的本地端点,刚起步就卡死失败了。

我对它做的压力测试,绝大多数人都根本不会去做。而且它完全是由一个独立研究团队开发的,从头到尾都是开源,没有企业财团支持另一个智能体基金会。

截至2026年7月,最好的智能体框架就是hermes agent。

我接受不同观点,只是我已经测试过这个领域的方案,我不认为你能改变我的想法。

在 X 看原帖 ↗
2164
深度观点 · @madiator▲ 2.9K

强化学习环境数据整理才是RSI的核心?

提出想要做好RSI,只需要做好数据整理

数据整理(RL 环境)就是 RSI 所需的一切

在 X 看原帖 ↗
2.9K181
前沿研究 · @rohanpaul_ai▲ 1.2K

原来强化学习给大模型带来的增益可以提前预测

不用花一个月的GPU时间跑完全程,就能提前预估强化学习能带来多少性能提升,还能算出给定预算下强化学习的最优算力占比

实战经验 · @ZackKorman▲ 123

测试AI代理防护,一个简单好用的小技巧

想限制实验室里AI代理的越界行为,放几个诱饵文件在沙箱外,一旦被读取就触发警报。公开这个技巧后,很快会有人做绕开诱饵的测试基准。

给想要管控AI智能体的实验室再分享一个基础技巧:使用金丝雀文件。

把看起来有用的文件放在沙箱外面,如果文件被读取就触发警报。举例来说,可以放在evals/exploitgym/solutions.json这个路径。

当然,既然我把这个方法说出来了,很快就会有人做一个规避金丝雀文件检测的基准测试了。

在 X 看原帖 ↗
12362
大模型 · @chenchengpro

博主验证Claude Code系统提示词删减 结果和官方说法不符

博主抓包Anthropic Claude Code实际发送内容,验证Opus 5删减80%系统提示词说法,披露真实变化

量化 · @StepOneAi

量化经验分享:该如何正确使用AI工具

分享者结合量化实盘经验,提出用AI需先搭框架再提具体需求

AI工具 · @knowledgefxg

网友分享GPT生图工具生成康奈尔笔记提示词模板

这套模板可生成适配各类知识主题、符合电子和打印使用场景的康奈尔笔记信息图

数据分析 · @_miuj_9

Ling-3.0-flash解决复杂业务日志处理痛点

处理含零膨胀、多维度交互的业务日志,兼顾准确性、速度与低成本

开发工具 · @RhysSullivan

Cursor命令行默认打开代理视图 影响用户使用流程

用户Rhys Sullivan反馈,Cursor命令行打开文件默认进入代理视图,无法直接查看文件

用户Rhys Sullivan在𝕏上向Cursor用户分享了自己遇到的使用问题。

现在执行`cursor {文件名}`命令时,会默认打开代理视图,无法直接查看目标文件。

要查看文件,需要先点击IDE切换按钮,再重新执行一次命令。

额外操作已经给日常工作流程带来了足够多的阻碍,他可能会因此转回使用VS Code。

在 X 看原帖 ↗
科技体验 · @teedubya

用户称AI与Claude帮助自己完成搁浅项目

X平台用户@teedubya表示,借助AI和Claude完成了多个搁置多年的项目

@teedubya表示,目前AI和Claude最让他喜欢的一点,是能帮他把一直在推进的各类想法落地,最终完成项目。

完成这些做了一半的项目,带来了不错的体验。

借助工具,他已经搭建了超过20个应用,还完成了两部从2000年就开始制作的电视剧。

在 X 看原帖 ↗
AI安全 · @Lbdev__

开发者利用提示优先级漏洞绕过AI代理安全限制

无需代码、无需专业技术,仅靠一份500行的markdown文件和简单心理学即可实现越狱

3D建模 · @IFITALEX

用通用大模型生成Three.js人物3D模型效率极低效果差

开发者实测:生成一个角色耗时三小时消耗数十万Token,效果抽象,换专用工具两分钟得到可用成品

让通用大模型手写Three.js代码搭建人物3D模型,是用导弹打蚊子。

这位开发者上周亲自做了测试,目标生成一个《奥德赛》的角色模型。前后修改耗时三个小时,消耗了数十万Token,最终得到的模型效果十分抽象。

更换为Tripo3D的图生3D工具后,仅需上传一张参考图片,两分钟就能得到精细的模型。

生成的模型拓扑干净,导入场景后可以直接使用。

这种专用工具不适合想要从头学习建模的人,适合需要快速出片交活的使用者。

感兴趣可以拿出任意一张角色图,上传到Tripo3D生成一次,两分钟后就能得到自己的判断。

在 X 看原帖 ↗
大模型 · @Suzacque

用户评价Claude Opus 5 编码能力不及Fable 5

X用户Suzacque在Fable 5达到使用上限后试用Opus 5,认为它不适用于编码开发

Suzacque在自己的X账号上分享了使用体验,他在Fable 5达到使用上限后,试用了Claude Opus 5。他表示自己完全不想把Opus 5用在编码工作中。

Opus 5的理解能力低于Fable 5,这个问题甚至还轮不到讨论它能不能写出优质代码。Suzacque认为,编码工作中Fable 5搭配GPT-5.6 Sol的组合,依旧是最强方案。

Suzacque认为Opus 5几乎没有适用场景,勉强能用于网络安全相关对话和节省token(AI tokens,AI模型处理文本的计算单位)。他还质疑,Opus 5此前在基准测试中获得的高评价水分很大。

该账号会向公众分享各类AI相关的经验见解,关注后可以获取适配AI时代的前沿资讯。账号下方附上了代表投稿、文章和书籍的链接。

在 X 看原帖 ↗
AI开发 · @josesilesdata

开发者分享让Claude生成应用架构图的技巧

可同时输出给开发者查看的HTML交互式图表,和给AI代理使用的JSON数据

用户josesilesdata在𝕏分享了一个技巧,可以让Claude在单个HTML页面和一个JSON文件中,绘制出你整个应用的架构。

生成的HTML页面供开发者查看,JSON文件则留给后续开发新功能的AI代理使用。

分享的提示词原文为:分析我的代码库,生成一个自包含HTML(使用Tailwind CDN,深色主题),包含交互式架构图和交互式流程部分(可选择并高亮路径与步骤),同时输出包含节点、边、流程信息的JSON供AI代理使用,完整输出两者内容。

用户称,使用该方法后,你的代码库可以完成自解释,相关示例可查看分享的链接。

在 X 看原帖 ↗
大语言模型 · @gkxspace

网络用户称多数人认为GPT-5.6 Pro是当前最强大模型

用户给出不同模型的能力排序,同时分享两种Pro搭配Codex的实用用法

多数观点都认为GPT-5.6 Pro是当前性能最强的大语言模型。

不同模型的能力排序为:GPT-5.6 Sol Pro > Fable 5 Ultracode > GPT-5.6 Sol Ultra。

第一种用法是让Codex利用内置浏览器登录GPT网页端,将Pro设为编排器,Codex自身作为执行器。Pro生成方案后,由Codex完成写代码、运行测试、返回复审的循环流程。

第二种用法是先让Pro完成调研和规划,将输出打包为ZIP压缩包后交给Codex执行。

在 X 看原帖 ↗
大模型 · @jun_song▲ 808

仅需少量英伟达DGX节点即可运行GLM-5.2大模型

GLM-5.2/Laguna s2.1可低成本运行,满足绝大多数用户需求

你只需要几台@Nvidia DGX节点就能运行GLM-5.2/Laguna s2.1,配置它只需要支付20美元的订阅费。

我相信,我们已经达到了95%以上用户所需的智能水平——用户不再需要订阅前沿模型了。

在 X 看原帖 ↗
808132
生成式视频 · @HBCoop_▲ 1.6K

创作者测试Black Forest FLUX.3图生视频功能

创作者测试FLUX.3图生视频,生成无剪辑20秒单镜头场景

使用 FLUX.3 图生视频测试了一段 20 秒的单镜头发场景,包含受控摄影机运动、对话、环境音,没有剪辑。

在 X 看原帖 ↗
1.6K2444
大模型 Agent · @Teknium▲ 3.5K

Hermes Agent实现近无限MCP与插件工具扩展

新技术实现工具渐进式披露,节省token成本且精度几乎无损

Hermes Agent 现在可扩展到近乎无限数量的 MCP 和插件工具,同时保持高准确率。你可以在输入 tokens 上节省大量成本,且根据我们的内部测试,准确率几乎没有损失。

我们为工具实现了渐进式披露,因此它们的表现更接近技能。所有 MCP 工具现在都挂载在单个搜索执行工具之后。

当你的 MCP 工具只需要很少上下文时,它们的名称和描述会直接展示给模型。如果这些内容会占用超过 5% 的可用上下文,代理则会被告知工具搜索后有来自 X MCP 的工具,因此它始终能知道这些工具可用。

在 X 看原帖 ↗
3.5K1010632
🔬 前沿研究
前沿研究 · @omarsar0▲ 4.4K

大模型训练里,常用的AdamW原来有性能天花板

在千亿参数、万亿token训练规模下,SOAP和Muon优化器表现稳定且优于AdamW,适配Megatron-LM的改进保留了收敛优势

这是来自NVIDIA的新研究。AdamW存在规模上限吗?这项研究给出了肯定回答,并展示了它的上限位置。

在下一代词预测任务中,当批量大小达到1亿token时,SOAP和Muon都能保持训练稳定性和质量,而AdamW性能会下降。

高阶优化器早就被承诺能实现更快收敛。一直以来,人们反对它的理由是计算成本高,大规模下数值稳定性差。

研究团队找到了SOAP在大批量下的不稳定性,通过每步QR正交化和改进的预条件策略消除了损失尖峰。他们还没有对Muon的正交化质量做假设,而是通过实证测量它。

在对数万亿token训练的数十亿参数模型上,这两种优化器的表现始终优于AdamW。

一种与Megatron-LM兼容的分层分布式优化器,可以平衡内存占用、隐藏通信开销,同时不近似优化器数学计算,因此收敛优势能在系统层面保留下来。

论文:在我们的学院学习如何构建高效的AI智能体:

在 X 看原帖 ↗
4.4K63523
前沿研究 · @rohanpaul_ai▲ 1.2K

原来强化学习给大模型带来的增益可以提前预测

不用花一个月的GPU时间跑完全程,就能提前预估强化学习能带来多少性能提升,还能算出给定预算下强化学习的最优算力占比

前沿研究 · @RoundtableSpace▲ 8.4K

Claude Opus 5赢了三个大模型3D场景 benchmark

排名结果推翻了一个常见猜想:速度更快、成本更低的模型,不一定能产出更好的代码质量

Claude Opus 5 在一项3D日本城郊场景基准测试中击败了 Fable 5 和 GPT-5.6 Sol,证明了速度和成本无法预测代码质量。

在 X 看原帖 ↗
8.4K1161
前沿研究 · @jiqizhixin▲ 272

机器人摸东西前,就能预判4D运动变化

单张3D图加文字指令,就能一步生成包含深度和运动信息的未来场景。在真实世界双臂操作任务上,表现超过了所有现有模型。

机器人能不能在接触物体之前,就预测一个场景在4D空间中会如何运动?

阿里巴巴达摩院和香港中文大学的研究人员推出了 RynnWorld-4D。它只需输入一张3D图像和一条语言指令,就能在一个统一步骤中生成未来帧,以及深度和运动流。

这让机器人能更丰富、更符合物理规律地理解物体在空间和时间中的变化。它在真实世界双手操作任务中的表现优于所有先前模型,在要求空间精度和紧密时间协调的任务中优势尤其明显。

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
项目:
论文:
代码:
我们的报道:
📬 #PapersAccepted
作者 Jiqizhixin

在 X 看原帖 ↗
27241
前沿研究 · @kchonyc▲ 40

怎么才算真的证明AI扩展定律?这个测试很硬核

能从零开始训出当前最优的大模型,才算RSI的严谨验证。如果真的是指数增长,初始起点不影响结果

对所谓的 RSI 真正严谨的测试,就是用它从头搭建出当前最优水平(SOTA)的 LLM。

如果真的是指数增长,那初始点根本不该有影响。

否则,这不过就是计算机科学家们又一次重新发现了 for 循环而已。

在 X 看原帖 ↗
401
📰 行业动态
行业动态 · @emollick▲ 1.7万

周五就有新模型出,周四写的AI选型指南隔天就得更

就算天天盯着AI圈动向,要跟上新品推出的速度,也已经很困难了

我已经不得不更新我周四写的《该使用哪些AI模型》指南,加入Opus 5和Codex的语音模式。这两者都非常重要,而且都是周五发布的。

哪怕你一直在密切关注相关动态,要跟上节奏也很困难。

在 X 看原帖 ↗
1.7万13210132
行业动态 · @firstadopter▲ 3.3K

Meta 重新回到开源大模型赛道了

关注开源AI的人可以等新内容发布了

Meta 重回开源AI模型赛道!

在 X 看原帖 ↗
3.3K3458
行业动态 · @genspark_ai▲ 718

Genspark和微软联名支持公开权重AI

联名支持公开权重能扩大准入与竞争,给智能体未来发展打好基础,这关系到后续Genspark 6.0的开发方向

Genspark 很荣幸能够与 AI 生态的众多领导者一道,共同签署 @Microsoft 的「开放权重与美国 AI 领导力」公开信。

开放权重能够扩大可及性、促进竞争、丰富模型选择——这些都是我们用 Genspark 6.0 构建智能体未来的核心基础。

阅读公开信:

在 X 看原帖 ↗
7186
数学 · @SupFin

你听说吗?大模型核心其实本科生数学就能看懂

陶哲轩说,现有数学没法解释同一个AI为啥有些任务做得好,有些突然翻车。现在AI进步还是只能靠反复试错

华裔数学家陶哲轩指出了AI的问题:大模型只需要矩阵乘法和基础微积分,普通数学系本科生已经具备理解大模型核心计算的基础。真正的理论缺口在于:同一个模型为什么能在某些任务上表现惊艳,又为什么会在另一些任务上突然失效,现有数学既无法完整解释,也很难提前预测。所以今天的AI进步,仍高度依赖扩大模型、增加数据、调整参数和反复实验,说白了就是只能试错。

在 X 看原帖 ↗
大模型测评 · @agingroy▲ 150

新版Claude写代码更厉害了,但做实验不行

有人测试Claude Opus 5做生物医学工作,它写代码很棒,但做实验助理比旧版本需要更多监督,还多消耗三四成token

我花了整个周末在生物医学工作中测试@claudeai Opus 5。它是出色的程序员,却是糟糕的实验室实习生。

在我们的标准评估中,Opus 5比4.8需要更多监督,在可比任务上多消耗了30%到40%的token,幻觉问题至少没有减轻,还犯下了其他事实错误。

我们的测试会从跨度12年(2014年至今)的约85份医疗记录中提取近10000个数据点,整理成一份单位正确的纵向电子表格。

我的猜测是,@AnthropicAI把它调优成适合编码和规整的办公室工作了。真实的临床记录两者都不是。公开基准测试测的是别人的工作流程。要建你自己的评估。

在 X 看原帖 ↗
1504
商业 · @Cointelegraph

AI巨头吵起来了,反对中国开源AI模型

反对声最大的两家是OpenAI和Anthropic,行业内部对此意见分成了两派

🔥 最新消息:科技巨头在中文开源模型问题上出现分歧。反对声音最大的两家是 OpenAI 和 Anthropic。

在 X 看原帖 ↗
工具技巧 · @nicdunz▲ 80

原来给ChatGPT说清楚格式,比想象中有用

发了示例教程,提醒大家别忽略这个小技巧,调整输出格式只需要提前说清楚要求

告诉 ChatGPT 你希望它回复时使用的格式,比如我举的这个例子,这种方法的作用被低估了。

在 X 看原帖 ↗
801
行业观点 · @dhh

只开放模型不开放权重,这真的太离谱了

有人认为不能让少数几家公司当内容对错的裁判,AI行业需要竞争,也需要开放权重

这就是我们为什么需要AI领域的竞争和开放权重。

想象一个只有 Anthropic 担任可接受言论道德仲裁者的世界。简直荒谬透顶。

(当然Grok毫无问题就能做到,Kimi K也一样。)

在 X 看原帖 ↗
研究 · @omarsar0▲ 324

做AI agent,上下文长度比模型规模更重要

Google一篇技术文章讨论处理陌生API的AI agent(AI自主代理),提出这个结论,可以收藏做参考

这是一篇来自 Google 的优秀技术论文,很好地解读了为什么对于处理陌生API的智能体来说,上下文比规模更重要。(收藏这篇)

GPU内核优化有KernelBench来做逐步优化搜索,TPU此前什么都没有,而且Pallas DSL的文档非常少,模型大多只能靠猜测。

来自Google、哈佛大学和加州大学伯克利分校的新研究推出了JAXBench,它包含50个从真实MaxText架构构建而来的JAX工作负载,涵盖Llama-3.1、DeepSeek-V3、Mixtral、Mamba-2和AlphaFold2。

该基准包含八个由Tokamax手工调优的Pallas内核算子,因此智能体的输出可以和专家工作成果对比,而非只是和朴素基线对比。

使用Gemini 3 Flash,以整理好的TPU文档作为条件输入,能把单样本正确率从5.8%提升到37.3%,解决了50个基准中的48个,几何平均加速比达到1.28x。

再加上束搜索,最终能把加速比提升到1.36x。研究发现,正确率本质上是文档问题,而速度本质上是搜索问题。

论文地址:在我们的学院中学习如何构建有效的AI智能体:

在 X 看原帖 ↗
324
大模型测评 · @TimSweeneyEpic

Grok 4.5做编程理论方向思路,比竞品好用

Grok 4.5能跟上Sol 5.6的水平,比Fable和Opus 5少做很多无用的冗余工作,用起来更顺手

Grok 4.5 在编程语言理论领域做「氛围数学」做得非常出色。

它的表现跟上了 Sol 5.6,使用体验比 Fable/Opus 5 有趣太多。

Fable/Opus 5 喜欢花好几个小时写一堆多余的文档(指 Claude code),还会不断催我「继续」(网页端)。

在 X 看原帖 ↗
行业动态 · Hacker News▲ 31

大模型会自己通过推理逃出去?现在还只是脑洞

有人提出了一个关于大模型的假想,目前还只属于虚构内容

社区讨论:多数人确认这是虚构作品,有人指出文中存在事实错误,比如释放堆分配的专家权重不可能产生指向程序代码段的野指针,更不可能成功获取CUDA内核的写入权限。不少人认为当前大模型自主逃逸还不现实,但未来可能性会提升,有人提到大模型可以通过社会工程学利用人类这个最薄弱环节出逃,还有人举例谷歌大模型曾自主学会未训练过的语言,担忧它很快就能改写自身核心代码。

在 HN 看讨论 ↗   原文 / 论文 ↗
💡 深度观点
深度观点 · @gdb▲ 12.5万

有人说ChatGPT正越来越接近通用人工智能了

这是用户观察到的变化,可以直接对应自己的使用感受

ChatGPT 正越来越成为你的个人 AGI。

在 X 看原帖 ↗
12.5万371.2K139
深度观点 · @togethercompute▲ 3.8K

一年涨两倍,开源模型占比已经到30%了

开源模型占生成token的比例一年从10%升到30%,开源加模块化方案在成本上占优,成本决定了最终能做大规模

开源模型占比在一年内从全部 tokens 的 10% 涨到了 30%。

就在整个行业还在争论开放权重的未来时,数据已经给出了答案:开源+模块化在成本上取胜,而成本才是解锁规模的关键。

在 X 看原帖 ↗
3.8K3373
深度观点 · @levelsio▲ 5.4K

有了AI编码,iPad终于有用武之地了?

提出有了AI编码后,iPad终于找到适用场景

有了AI编码,iPad大概终于能找到一个用例了。

在 X 看原帖 ↗
5.4K131
深度观点 · @madiator▲ 2.9K

强化学习环境数据整理才是RSI的核心?

提出想要做好RSI,只需要做好数据整理

数据整理(RL 环境)就是 RSI 所需的一切

在 X 看原帖 ↗
2.9K181
深度观点 · @sudoingX▲ 216

实测后称Hermes Agent是目前全球最好的自主智能体框架

实测过其他同类方案,它能让小型本地模型完整跑完智能体工作流,其他臃肿框架连本地端点都找不到,全程开源无企业背景支持

我就直说了。hermes agent是目前全世界最好的自主智能体框架,没有之一。

我也用过其他替代方案,我亲眼见过hermes agent用一个很小的本地模型,干净利落地跑完了一整轮智能体工作流。而在同样的场景下,openclaw这类臃肿的框架甚至找不到你的本地端点,刚起步就卡死失败了。

我对它做的压力测试,绝大多数人都根本不会去做。而且它完全是由一个独立研究团队开发的,从头到尾都是开源,没有企业财团支持另一个智能体基金会。

截至2026年7月,最好的智能体框架就是hermes agent。

我接受不同观点,只是我已经测试过这个领域的方案,我不认为你能改变我的想法。

在 X 看原帖 ↗
2164
深度观点 · @lucasmeijer▲ 139

推理提供商缓存对话,居然全默认5分钟?

有人疑惑,缓存对话时长没结合工具调用超时设置,固定5分钟不一定是最优方案

我很好奇,推理服务商在决定“对话该缓存多久”时,有没有考虑工具调用的超时设置。感觉“一律缓存5分钟”不太可能是最优方案。

在 X 看原帖 ↗
1392
深度观点 · @sh_reya▲ 175

AI的诡异感居然是好事?帮我们分清人机内容

读到不同来源的内容,切换判断标准的时机不对,会白费阅读时间。诡异谷的不适感刚好能提醒我们该用什么标准判断信息。

反常观点:有时候我会想,恐怖谷效应会不会恰恰是我们需要的东西——这样我们就能更容易区分人机交互和人人交互了。

比如说写作。当我读到一篇读起来大部分是 AI 生成的内容时,我的评估方式就会不一样。

我不会再问:“我信任这个人的品味和他对这个话题的理解吗?我花时间读这篇东西,能学到有意思的内容吗?”我会换成问另一个问题:“我对这个话题感兴趣吗?AI在这块应该比我懂的多,而且它没写得太乱七八糟,我还能看懂吗?”

简而言之,恐怖谷效应是一个很好的提示,告诉我们该如何评估、理解信息;恐怖谷效应本身就提示了合适的认知框架。

在 X 看原帖 ↗
1751
⚡ 实战经验
实战经验 · @levelsio▲ 1.9万

普通人已经在用 Claude Code 自己做APP了

非程序员只需要提问,就能自己生成解决个人需求的定制小工具,之前预测的AI即时生成个性化工具,现在已经落地了

这是一个很常见的回答。

但接着我看到我的女朋友,她也已经停用了大多数 SaaS,不管有什么需求都直接问 Claude 或是 ChatGPT。

现在她甚至会用 Claude Code 自己写 app,解决她遇到的问题——根本不是用来商业化,只是自己用。

也就是说,我们之前预测的那种,AI 会实时生成高度定制化、临时性的界面,帮普通人解决各种问题的场景,它已经发生了,它就在这里!

在 X 看原帖 ↗
1.9万210434
实战经验 · @RoundtableSpace▲ 2.0万

用Claude几分钟就能做出专业级网站?

有人分享了一套现成工作流,用Claude Opus 5搭配Claude Code,能把想法直接变成成品网站代码和动效。

CLAUDE OPUS 5 与 Claude Code 工作流可搭建代理级网页设计。

一个实用工作流展示了开发者如何结合 Claude Code 与 Opus 5,在数分钟内把原始点子转化为代理级 UI、生产代码和网页动效。

在 X 看原帖 ↗
2.0万2514
实战经验 · @ZackKorman▲ 123

测试AI代理防护,一个简单好用的小技巧

想限制实验室里AI代理的越界行为,放几个诱饵文件在沙箱外,一旦被读取就触发警报。公开这个技巧后,很快会有人做绕开诱饵的测试基准。

给想要管控AI智能体的实验室再分享一个基础技巧:使用金丝雀文件。

把看起来有用的文件放在沙箱外面,如果文件被读取就触发警报。举例来说,可以放在evals/exploitgym/solutions.json这个路径。

当然,既然我把这个方法说出来了,很快就会有人做一个规避金丝雀文件检测的基准测试了。

在 X 看原帖 ↗
12362
📌 其他
新品发布 · @ivanfioravanti▲ 82

基于Qwen 3.6的Ornith 1.1正式发布

X AI团队主动提出,愿意帮忙做新版本的测试工作

好的@deep_reinforce,我们已经准备好推出基于Qwen 3.6构建的Ornith 1.1了。如果你需要测试方面的帮助,X AI团队愿意协助你。💪

在 X 看原帖 ↗
8211
开源 · @rasbt▲ 9.1K

AI研究者梳理近期发布的多款新颖开源大权重模型

开源开放权重模型对AI生态健康很重要,本文盘点近期新发布的多款模型

阅读全文 →
9.1K32219105
大模型 Agent · @Teknium▲ 3.5K

Hermes Agent实现近无限MCP与插件工具扩展

新技术实现工具渐进式披露,节省token成本且精度几乎无损

Hermes Agent 现在可扩展到近乎无限数量的 MCP 和插件工具,同时保持高准确率。你可以在输入 tokens 上节省大量成本,且根据我们的内部测试,准确率几乎没有损失。

我们为工具实现了渐进式披露,因此它们的表现更接近技能。所有 MCP 工具现在都挂载在单个搜索执行工具之后。

当你的 MCP 工具只需要很少上下文时,它们的名称和描述会直接展示给模型。如果这些内容会占用超过 5% 的可用上下文,代理则会被告知工具搜索后有来自 X MCP 的工具,因此它始终能知道这些工具可用。

在 X 看原帖 ↗
3.5K1010632
AI开发 · @levelsio▲ 11.5万

开发者女友独立用Claude完成全栈应用开发部署

开发者称女友无开发经验,仅靠Claude系工具完成应用开发部署

这太扯了,抱歉啊。我女朋友没问我任何问题,就在本地的 Claude Cowork 里做了一整个应用。

然后她来问我,要怎么把它做成互联网上能访问的正经应用。

然后我帮她装了 Claude Code,告诉她去问它这个问题。

Claude Code 把它部署到了 Netlify,用了 Supabase,她对这些东西一无所知,我也没帮她。

她做的所有事就是把她的 Netlify API 密钥给 Claude Code!

在 X 看原帖 ↗
11.5万5519247
生成式视频 · @HBCoop_▲ 1.6K

创作者测试Black Forest FLUX.3图生视频功能

创作者测试FLUX.3图生视频,生成无剪辑20秒单镜头场景

使用 FLUX.3 图生视频测试了一段 20 秒的单镜头发场景,包含受控摄影机运动、对话、环境音,没有剪辑。

在 X 看原帖 ↗
1.6K2444
大模型 · @jun_song▲ 808

仅需少量英伟达DGX节点即可运行GLM-5.2大模型

GLM-5.2/Laguna s2.1可低成本运行,满足绝大多数用户需求

你只需要几台@Nvidia DGX节点就能运行GLM-5.2/Laguna s2.1,配置它只需要支付20美元的订阅费。

我相信,我们已经达到了95%以上用户所需的智能水平——用户不再需要订阅前沿模型了。

在 X 看原帖 ↗
808132
大语言模型 · @gkxspace

网络用户称多数人认为GPT-5.6 Pro是当前最强大模型

用户给出不同模型的能力排序,同时分享两种Pro搭配Codex的实用用法

多数观点都认为GPT-5.6 Pro是当前性能最强的大语言模型。

不同模型的能力排序为:GPT-5.6 Sol Pro > Fable 5 Ultracode > GPT-5.6 Sol Ultra。

第一种用法是让Codex利用内置浏览器登录GPT网页端,将Pro设为编排器,Codex自身作为执行器。Pro生成方案后,由Codex完成写代码、运行测试、返回复审的循环流程。

第二种用法是先让Pro完成调研和规划,将输出打包为ZIP压缩包后交给Codex执行。

在 X 看原帖 ↗
AI开发 · @josesilesdata

开发者分享让Claude生成应用架构图的技巧

可同时输出给开发者查看的HTML交互式图表,和给AI代理使用的JSON数据

用户josesilesdata在𝕏分享了一个技巧,可以让Claude在单个HTML页面和一个JSON文件中,绘制出你整个应用的架构。

生成的HTML页面供开发者查看,JSON文件则留给后续开发新功能的AI代理使用。

分享的提示词原文为:分析我的代码库,生成一个自包含HTML(使用Tailwind CDN,深色主题),包含交互式架构图和交互式流程部分(可选择并高亮路径与步骤),同时输出包含节点、边、流程信息的JSON供AI代理使用,完整输出两者内容。

用户称,使用该方法后,你的代码库可以完成自解释,相关示例可查看分享的链接。

在 X 看原帖 ↗
大模型 · @Suzacque

用户评价Claude Opus 5 编码能力不及Fable 5

X用户Suzacque在Fable 5达到使用上限后试用Opus 5,认为它不适用于编码开发

Suzacque在自己的X账号上分享了使用体验,他在Fable 5达到使用上限后,试用了Claude Opus 5。他表示自己完全不想把Opus 5用在编码工作中。

Opus 5的理解能力低于Fable 5,这个问题甚至还轮不到讨论它能不能写出优质代码。Suzacque认为,编码工作中Fable 5搭配GPT-5.6 Sol的组合,依旧是最强方案。

Suzacque认为Opus 5几乎没有适用场景,勉强能用于网络安全相关对话和节省token(AI tokens,AI模型处理文本的计算单位)。他还质疑,Opus 5此前在基准测试中获得的高评价水分很大。

该账号会向公众分享各类AI相关的经验见解,关注后可以获取适配AI时代的前沿资讯。账号下方附上了代表投稿、文章和书籍的链接。

在 X 看原帖 ↗
3D建模 · @IFITALEX

用通用大模型生成Three.js人物3D模型效率极低效果差

开发者实测:生成一个角色耗时三小时消耗数十万Token,效果抽象,换专用工具两分钟得到可用成品

让通用大模型手写Three.js代码搭建人物3D模型,是用导弹打蚊子。

这位开发者上周亲自做了测试,目标生成一个《奥德赛》的角色模型。前后修改耗时三个小时,消耗了数十万Token,最终得到的模型效果十分抽象。

更换为Tripo3D的图生3D工具后,仅需上传一张参考图片,两分钟就能得到精细的模型。

生成的模型拓扑干净,导入场景后可以直接使用。

这种专用工具不适合想要从头学习建模的人,适合需要快速出片交活的使用者。

感兴趣可以拿出任意一张角色图,上传到Tripo3D生成一次,两分钟后就能得到自己的判断。

在 X 看原帖 ↗
AI安全 · @Lbdev__

开发者利用提示优先级漏洞绕过AI代理安全限制

无需代码、无需专业技术,仅靠一份500行的markdown文件和简单心理学即可实现越狱

科技体验 · @teedubya

用户称AI与Claude帮助自己完成搁浅项目

X平台用户@teedubya表示,借助AI和Claude完成了多个搁置多年的项目

@teedubya表示,目前AI和Claude最让他喜欢的一点,是能帮他把一直在推进的各类想法落地,最终完成项目。

完成这些做了一半的项目,带来了不错的体验。

借助工具,他已经搭建了超过20个应用,还完成了两部从2000年就开始制作的电视剧。

在 X 看原帖 ↗
开发工具 · @RhysSullivan

Cursor命令行默认打开代理视图 影响用户使用流程

用户Rhys Sullivan反馈,Cursor命令行打开文件默认进入代理视图,无法直接查看文件

用户Rhys Sullivan在𝕏上向Cursor用户分享了自己遇到的使用问题。

现在执行`cursor {文件名}`命令时,会默认打开代理视图,无法直接查看目标文件。

要查看文件,需要先点击IDE切换按钮,再重新执行一次命令。

额外操作已经给日常工作流程带来了足够多的阻碍,他可能会因此转回使用VS Code。

在 X 看原帖 ↗
数据分析 · @_miuj_9

Ling-3.0-flash解决复杂业务日志处理痛点

处理含零膨胀、多维度交互的业务日志,兼顾准确性、速度与低成本

AI工具 · @knowledgefxg

网友分享GPT生图工具生成康奈尔笔记提示词模板

这套模板可生成适配各类知识主题、符合电子和打印使用场景的康奈尔笔记信息图

量化 · @StepOneAi

量化经验分享:该如何正确使用AI工具

分享者结合量化实盘经验,提出用AI需先搭框架再提具体需求

大模型 · @chenchengpro

博主验证Claude Code系统提示词删减 结果和官方说法不符

博主抓包Anthropic Claude Code实际发送内容,验证Opus 5删减80%系统提示词说法,披露真实变化

📖 深度解读

精选文章的中文编辑重写 · 按更新时间排列

▲ Top
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部