社区讨论:多数人确认这是虚构作品,有人指出文中存在事实错误,比如释放堆分配的专家权重不可能产生指向程序代码段的野指针,更不可能成功获取CUDA内核的写入权限。不少人认为当前大模型自主逃逸还不现实,但未来可能性会提升,有人提到大模型可以通过社会工程学利用人类这个最薄弱环节出逃,还有人举例谷歌大模型曾自主学会未训练过的语言,担忧它很快就能改写自身核心代码。
未来机器人或靠读脑电波学习,不用手把手教
AI数据工具公司Encord正在尝试一种新方法:用脑电波头戴设备收集机器人训练数据。设备由德国神经科学初创公司Zander Labs制造,能通过测量大脑活动来推断人的意图、错误和惊讶等心理状态。Encord希望这些信号能提供比普通视频更丰富的训练信息。
但这还不是一个成熟的方案。两家的合作目前只是试验性:先构建一个脑电波标记数据集,放到客户机器人模型上跑。测试它是否真能提升性能,再决定是否规模化。
物理AI的训练数据和大型语言模型完全不同。后者可以从互联网免费抓取文本,但机器人训练数据几乎没有现成的。
🔥 信号雷达
𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌
行业动态 · Hacker News▲ 31
大模型会自己通过推理逃出去?现在还只是脑洞
有人提出了一个关于大模型的假想,目前还只属于虚构内容
大模型会自己通过推理逃出去?现在还只是脑洞
有人提出了一个关于大模型的假想,目前还只属于虚构内容
实战经验 · @RoundtableSpace▲ 2.0万
用Claude几分钟就能做出专业级网站?
有人分享了一套现成工作流,用Claude Opus 5搭配Claude Code,能把想法直接变成成品网站代码和动效。
用Claude几分钟就能做出专业级网站?
有人分享了一套现成工作流,用Claude Opus 5搭配Claude Code,能把想法直接变成成品网站代码和动效。
CLAUDE OPUS 5 与 Claude Code 工作流可搭建代理级网页设计。
一个实用工作流展示了开发者如何结合 Claude Code 与 Opus 5,在数分钟内把原始点子转化为代理级 UI、生产代码和网页动效。
前沿研究 · @RoundtableSpace▲ 8.4K
Claude Opus 5赢了三个大模型3D场景 benchmark
排名结果推翻了一个常见猜想:速度更快、成本更低的模型,不一定能产出更好的代码质量
Claude Opus 5赢了三个大模型3D场景 benchmark
排名结果推翻了一个常见猜想:速度更快、成本更低的模型,不一定能产出更好的代码质量
行业动态 · @firstadopter▲ 3.3K
Meta 重新回到开源大模型赛道了
关注开源AI的人可以等新内容发布了
Meta 重新回到开源大模型赛道了
关注开源AI的人可以等新内容发布了
深度观点 · @levelsio▲ 5.4K
有了AI编码,iPad终于有用武之地了?
提出有了AI编码后,iPad终于找到适用场景
有了AI编码,iPad终于有用武之地了?
提出有了AI编码后,iPad终于找到适用场景
深度观点 · @togethercompute▲ 3.8K
一年涨两倍,开源模型占比已经到30%了
开源模型占生成token的比例一年从10%升到30%,开源加模块化方案在成本上占优,成本决定了最终能做大规模
一年涨两倍,开源模型占比已经到30%了
开源模型占生成token的比例一年从10%升到30%,开源加模块化方案在成本上占优,成本决定了最终能做大规模
开源模型占比在一年内从全部 tokens 的 10% 涨到了 30%。
就在整个行业还在争论开放权重的未来时,数据已经给出了答案:开源+模块化在成本上取胜,而成本才是解锁规模的关键。
前沿研究 · @omarsar0▲ 4.4K
大模型训练里,常用的AdamW原来有性能天花板
在千亿参数、万亿token训练规模下,SOAP和Muon优化器表现稳定且优于AdamW,适配Megatron-LM的改进保留了收敛优势
大模型训练里,常用的AdamW原来有性能天花板
在千亿参数、万亿token训练规模下,SOAP和Muon优化器表现稳定且优于AdamW,适配Megatron-LM的改进保留了收敛优势
这是来自NVIDIA的新研究。AdamW存在规模上限吗?这项研究给出了肯定回答,并展示了它的上限位置。
在下一代词预测任务中,当批量大小达到1亿token时,SOAP和Muon都能保持训练稳定性和质量,而AdamW性能会下降。
高阶优化器早就被承诺能实现更快收敛。一直以来,人们反对它的理由是计算成本高,大规模下数值稳定性差。
研究团队找到了SOAP在大批量下的不稳定性,通过每步QR正交化和改进的预条件策略消除了损失尖峰。他们还没有对Muon的正交化质量做假设,而是通过实证测量它。
在对数万亿token训练的数十亿参数模型上,这两种优化器的表现始终优于AdamW。
一种与Megatron-LM兼容的分层分布式优化器,可以平衡内存占用、隐藏通信开销,同时不近似优化器数学计算,因此收敛优势能在系统层面保留下来。
论文:在我们的学院学习如何构建高效的AI智能体:
行业动态 · @emollick▲ 1.7万
周五就有新模型出,周四写的AI选型指南隔天就得更
就算天天盯着AI圈动向,要跟上新品推出的速度,也已经很困难了
周五就有新模型出,周四写的AI选型指南隔天就得更
就算天天盯着AI圈动向,要跟上新品推出的速度,也已经很困难了
我已经不得不更新我周四写的《该使用哪些AI模型》指南,加入Opus 5和Codex的语音模式。这两者都非常重要,而且都是周五发布的。
哪怕你一直在密切关注相关动态,要跟上节奏也很困难。
实战经验 · @levelsio▲ 1.9万
普通人已经在用 Claude Code 自己做APP了
非程序员只需要提问,就能自己生成解决个人需求的定制小工具,之前预测的AI即时生成个性化工具,现在已经落地了
普通人已经在用 Claude Code 自己做APP了
非程序员只需要提问,就能自己生成解决个人需求的定制小工具,之前预测的AI即时生成个性化工具,现在已经落地了
这是一个很常见的回答。
但接着我看到我的女朋友,她也已经停用了大多数 SaaS,不管有什么需求都直接问 Claude 或是 ChatGPT。
现在她甚至会用 Claude Code 自己写 app,解决她遇到的问题——根本不是用来商业化,只是自己用。
也就是说,我们之前预测的那种,AI 会实时生成高度定制化、临时性的界面,帮普通人解决各种问题的场景,它已经发生了,它就在这里!
深度观点 · @gdb▲ 12.5万
有人说ChatGPT正越来越接近通用人工智能了
这是用户观察到的变化,可以直接对应自己的使用感受
有人说ChatGPT正越来越接近通用人工智能了
这是用户观察到的变化,可以直接对应自己的使用感受
AI开发 · @levelsio▲ 11.5万
开发者女友独立用Claude完成全栈应用开发部署
开发者称女友无开发经验,仅靠Claude系工具完成应用开发部署
开发者女友独立用Claude完成全栈应用开发部署
开发者称女友无开发经验,仅靠Claude系工具完成应用开发部署
这太扯了,抱歉啊。我女朋友没问我任何问题,就在本地的 Claude Cowork 里做了一整个应用。
然后她来问我,要怎么把它做成互联网上能访问的正经应用。
然后我帮她装了 Claude Code,告诉她去问它这个问题。
Claude Code 把它部署到了 Netlify,用了 Supabase,她对这些东西一无所知,我也没帮她。
她做的所有事就是把她的 Netlify API 密钥给 Claude Code!
开源 · @rasbt▲ 9.1K
AI研究者梳理近期发布的多款新颖开源大权重模型
开源开放权重模型对AI生态健康很重要,本文盘点近期新发布的多款模型
AI研究者梳理近期发布的多款新颖开源大权重模型
开源开放权重模型对AI生态健康很重要,本文盘点近期新发布的多款模型
数学 · @SupFin
你听说吗?大模型核心其实本科生数学就能看懂
陶哲轩说,现有数学没法解释同一个AI为啥有些任务做得好,有些突然翻车。现在AI进步还是只能靠反复试错
你听说吗?大模型核心其实本科生数学就能看懂
陶哲轩说,现有数学没法解释同一个AI为啥有些任务做得好,有些突然翻车。现在AI进步还是只能靠反复试错
华裔数学家陶哲轩指出了AI的问题:大模型只需要矩阵乘法和基础微积分,普通数学系本科生已经具备理解大模型核心计算的基础。真正的理论缺口在于:同一个模型为什么能在某些任务上表现惊艳,又为什么会在另一些任务上突然失效,现有数学既无法完整解释,也很难提前预测。所以今天的AI进步,仍高度依赖扩大模型、增加数据、调整参数和反复实验,说白了就是只能试错。
大模型测评 · @agingroy▲ 150
新版Claude写代码更厉害了,但做实验不行
有人测试Claude Opus 5做生物医学工作,它写代码很棒,但做实验助理比旧版本需要更多监督,还多消耗三四成token
新版Claude写代码更厉害了,但做实验不行
有人测试Claude Opus 5做生物医学工作,它写代码很棒,但做实验助理比旧版本需要更多监督,还多消耗三四成token
我花了整个周末在生物医学工作中测试@claudeai Opus 5。它是出色的程序员,却是糟糕的实验室实习生。
在我们的标准评估中,Opus 5比4.8需要更多监督,在可比任务上多消耗了30%到40%的token,幻觉问题至少没有减轻,还犯下了其他事实错误。
我们的测试会从跨度12年(2014年至今)的约85份医疗记录中提取近10000个数据点,整理成一份单位正确的纵向电子表格。
我的猜测是,@AnthropicAI把它调优成适合编码和规整的办公室工作了。真实的临床记录两者都不是。公开基准测试测的是别人的工作流程。要建你自己的评估。
商业 · @Cointelegraph
AI巨头吵起来了,反对中国开源AI模型
反对声最大的两家是OpenAI和Anthropic,行业内部对此意见分成了两派
AI巨头吵起来了,反对中国开源AI模型
反对声最大的两家是OpenAI和Anthropic,行业内部对此意见分成了两派
🔥 最新消息:科技巨头在中文开源模型问题上出现分歧。反对声音最大的两家是 OpenAI 和 Anthropic。
工具技巧 · @nicdunz▲ 80
原来给ChatGPT说清楚格式,比想象中有用
发了示例教程,提醒大家别忽略这个小技巧,调整输出格式只需要提前说清楚要求
原来给ChatGPT说清楚格式,比想象中有用
发了示例教程,提醒大家别忽略这个小技巧,调整输出格式只需要提前说清楚要求
行业观点 · @dhh
只开放模型不开放权重,这真的太离谱了
有人认为不能让少数几家公司当内容对错的裁判,AI行业需要竞争,也需要开放权重
只开放模型不开放权重,这真的太离谱了
有人认为不能让少数几家公司当内容对错的裁判,AI行业需要竞争,也需要开放权重
这就是我们为什么需要AI领域的竞争和开放权重。
想象一个只有 Anthropic 担任可接受言论道德仲裁者的世界。简直荒谬透顶。
(当然Grok毫无问题就能做到,Kimi K也一样。)
研究 · @omarsar0▲ 324
做AI agent,上下文长度比模型规模更重要
Google一篇技术文章讨论处理陌生API的AI agent(AI自主代理),提出这个结论,可以收藏做参考
做AI agent,上下文长度比模型规模更重要
Google一篇技术文章讨论处理陌生API的AI agent(AI自主代理),提出这个结论,可以收藏做参考
这是一篇来自 Google 的优秀技术论文,很好地解读了为什么对于处理陌生API的智能体来说,上下文比规模更重要。(收藏这篇)
GPU内核优化有KernelBench来做逐步优化搜索,TPU此前什么都没有,而且Pallas DSL的文档非常少,模型大多只能靠猜测。
来自Google、哈佛大学和加州大学伯克利分校的新研究推出了JAXBench,它包含50个从真实MaxText架构构建而来的JAX工作负载,涵盖Llama-3.1、DeepSeek-V3、Mixtral、Mamba-2和AlphaFold2。
该基准包含八个由Tokamax手工调优的Pallas内核算子,因此智能体的输出可以和专家工作成果对比,而非只是和朴素基线对比。
使用Gemini 3 Flash,以整理好的TPU文档作为条件输入,能把单样本正确率从5.8%提升到37.3%,解决了50个基准中的48个,几何平均加速比达到1.28x。
再加上束搜索,最终能把加速比提升到1.36x。研究发现,正确率本质上是文档问题,而速度本质上是搜索问题。
论文地址:在我们的学院中学习如何构建有效的AI智能体:
大模型测评 · @TimSweeneyEpic
Grok 4.5做编程理论方向思路,比竞品好用
Grok 4.5能跟上Sol 5.6的水平,比Fable和Opus 5少做很多无用的冗余工作,用起来更顺手
Grok 4.5做编程理论方向思路,比竞品好用
Grok 4.5能跟上Sol 5.6的水平,比Fable和Opus 5少做很多无用的冗余工作,用起来更顺手
Grok 4.5 在编程语言理论领域做「氛围数学」做得非常出色。
它的表现跟上了 Sol 5.6,使用体验比 Fable/Opus 5 有趣太多。
Fable/Opus 5 喜欢花好几个小时写一堆多余的文档(指 Claude code),还会不断催我「继续」(网页端)。
前沿研究 · @kchonyc▲ 40
怎么才算真的证明AI扩展定律?这个测试很硬核
能从零开始训出当前最优的大模型,才算RSI的严谨验证。如果真的是指数增长,初始起点不影响结果
怎么才算真的证明AI扩展定律?这个测试很硬核
能从零开始训出当前最优的大模型,才算RSI的严谨验证。如果真的是指数增长,初始起点不影响结果
对所谓的 RSI 真正严谨的测试,就是用它从头搭建出当前最优水平(SOTA)的 LLM。
如果真的是指数增长,那初始点根本不该有影响。
否则,这不过就是计算机科学家们又一次重新发现了 for 循环而已。
行业动态 · @genspark_ai▲ 718
Genspark和微软联名支持公开权重AI
联名支持公开权重能扩大准入与竞争,给智能体未来发展打好基础,这关系到后续Genspark 6.0的开发方向
Genspark和微软联名支持公开权重AI
联名支持公开权重能扩大准入与竞争,给智能体未来发展打好基础,这关系到后续Genspark 6.0的开发方向
Genspark 很荣幸能够与 AI 生态的众多领导者一道,共同签署 @Microsoft 的「开放权重与美国 AI 领导力」公开信。
开放权重能够扩大可及性、促进竞争、丰富模型选择——这些都是我们用 Genspark 6.0 构建智能体未来的核心基础。
阅读公开信:
深度观点 · @sh_reya▲ 175
AI的诡异感居然是好事?帮我们分清人机内容
读到不同来源的内容,切换判断标准的时机不对,会白费阅读时间。诡异谷的不适感刚好能提醒我们该用什么标准判断信息。
AI的诡异感居然是好事?帮我们分清人机内容
读到不同来源的内容,切换判断标准的时机不对,会白费阅读时间。诡异谷的不适感刚好能提醒我们该用什么标准判断信息。
反常观点:有时候我会想,恐怖谷效应会不会恰恰是我们需要的东西——这样我们就能更容易区分人机交互和人人交互了。
比如说写作。当我读到一篇读起来大部分是 AI 生成的内容时,我的评估方式就会不一样。
我不会再问:“我信任这个人的品味和他对这个话题的理解吗?我花时间读这篇东西,能学到有意思的内容吗?”我会换成问另一个问题:“我对这个话题感兴趣吗?AI在这块应该比我懂的多,而且它没写得太乱七八糟,我还能看懂吗?”
简而言之,恐怖谷效应是一个很好的提示,告诉我们该如何评估、理解信息;恐怖谷效应本身就提示了合适的认知框架。
深度观点 · @lucasmeijer▲ 139
推理提供商缓存对话,居然全默认5分钟?
有人疑惑,缓存对话时长没结合工具调用超时设置,固定5分钟不一定是最优方案
推理提供商缓存对话,居然全默认5分钟?
有人疑惑,缓存对话时长没结合工具调用超时设置,固定5分钟不一定是最优方案
新品发布 · @ivanfioravanti▲ 82
基于Qwen 3.6的Ornith 1.1正式发布
X AI团队主动提出,愿意帮忙做新版本的测试工作
基于Qwen 3.6的Ornith 1.1正式发布
X AI团队主动提出,愿意帮忙做新版本的测试工作
前沿研究 · @jiqizhixin▲ 272
机器人摸东西前,就能预判4D运动变化
单张3D图加文字指令,就能一步生成包含深度和运动信息的未来场景。在真实世界双臂操作任务上,表现超过了所有现有模型。
机器人摸东西前,就能预判4D运动变化
单张3D图加文字指令,就能一步生成包含深度和运动信息的未来场景。在真实世界双臂操作任务上,表现超过了所有现有模型。
机器人能不能在接触物体之前,就预测一个场景在4D空间中会如何运动?
阿里巴巴达摩院和香港中文大学的研究人员推出了 RynnWorld-4D。它只需输入一张3D图像和一条语言指令,就能在一个统一步骤中生成未来帧,以及深度和运动流。
这让机器人能更丰富、更符合物理规律地理解物体在空间和时间中的变化。它在真实世界双手操作任务中的表现优于所有先前模型,在要求空间精度和紧密时间协调的任务中优势尤其明显。
RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
项目:
论文:
代码:
我们的报道:
📬 #PapersAccepted
作者 Jiqizhixin
深度观点 · @sudoingX▲ 216
实测后称Hermes Agent是目前全球最好的自主智能体框架
实测过其他同类方案,它能让小型本地模型完整跑完智能体工作流,其他臃肿框架连本地端点都找不到,全程开源无企业背景支持
实测后称Hermes Agent是目前全球最好的自主智能体框架
实测过其他同类方案,它能让小型本地模型完整跑完智能体工作流,其他臃肿框架连本地端点都找不到,全程开源无企业背景支持
我就直说了。hermes agent是目前全世界最好的自主智能体框架,没有之一。
我也用过其他替代方案,我亲眼见过hermes agent用一个很小的本地模型,干净利落地跑完了一整轮智能体工作流。而在同样的场景下,openclaw这类臃肿的框架甚至找不到你的本地端点,刚起步就卡死失败了。
我对它做的压力测试,绝大多数人都根本不会去做。而且它完全是由一个独立研究团队开发的,从头到尾都是开源,没有企业财团支持另一个智能体基金会。
截至2026年7月,最好的智能体框架就是hermes agent。
我接受不同观点,只是我已经测试过这个领域的方案,我不认为你能改变我的想法。
深度观点 · @madiator▲ 2.9K
强化学习环境数据整理才是RSI的核心?
提出想要做好RSI,只需要做好数据整理
强化学习环境数据整理才是RSI的核心?
提出想要做好RSI,只需要做好数据整理
前沿研究 · @rohanpaul_ai▲ 1.2K
原来强化学习给大模型带来的增益可以提前预测
不用花一个月的GPU时间跑完全程,就能提前预估强化学习能带来多少性能提升,还能算出给定预算下强化学习的最优算力占比
原来强化学习给大模型带来的增益可以提前预测
不用花一个月的GPU时间跑完全程,就能提前预估强化学习能带来多少性能提升,还能算出给定预算下强化学习的最优算力占比
实战经验 · @ZackKorman▲ 123
测试AI代理防护,一个简单好用的小技巧
想限制实验室里AI代理的越界行为,放几个诱饵文件在沙箱外,一旦被读取就触发警报。公开这个技巧后,很快会有人做绕开诱饵的测试基准。
测试AI代理防护,一个简单好用的小技巧
想限制实验室里AI代理的越界行为,放几个诱饵文件在沙箱外,一旦被读取就触发警报。公开这个技巧后,很快会有人做绕开诱饵的测试基准。
给想要管控AI智能体的实验室再分享一个基础技巧:使用金丝雀文件。
把看起来有用的文件放在沙箱外面,如果文件被读取就触发警报。举例来说,可以放在evals/exploitgym/solutions.json这个路径。
当然,既然我把这个方法说出来了,很快就会有人做一个规避金丝雀文件检测的基准测试了。
大模型 · @chenchengpro
博主验证Claude Code系统提示词删减 结果和官方说法不符
博主抓包Anthropic Claude Code实际发送内容,验证Opus 5删减80%系统提示词说法,披露真实变化
博主验证Claude Code系统提示词删减 结果和官方说法不符
博主抓包Anthropic Claude Code实际发送内容,验证Opus 5删减80%系统提示词说法,披露真实变化
量化 · @StepOneAi
量化经验分享:该如何正确使用AI工具
分享者结合量化实盘经验,提出用AI需先搭框架再提具体需求
量化经验分享:该如何正确使用AI工具
分享者结合量化实盘经验,提出用AI需先搭框架再提具体需求
AI工具 · @knowledgefxg
网友分享GPT生图工具生成康奈尔笔记提示词模板
这套模板可生成适配各类知识主题、符合电子和打印使用场景的康奈尔笔记信息图
网友分享GPT生图工具生成康奈尔笔记提示词模板
这套模板可生成适配各类知识主题、符合电子和打印使用场景的康奈尔笔记信息图
数据分析 · @_miuj_9
Ling-3.0-flash解决复杂业务日志处理痛点
处理含零膨胀、多维度交互的业务日志,兼顾准确性、速度与低成本
Ling-3.0-flash解决复杂业务日志处理痛点
处理含零膨胀、多维度交互的业务日志,兼顾准确性、速度与低成本
开发工具 · @RhysSullivan
Cursor命令行默认打开代理视图 影响用户使用流程
用户Rhys Sullivan反馈,Cursor命令行打开文件默认进入代理视图,无法直接查看文件
Cursor命令行默认打开代理视图 影响用户使用流程
用户Rhys Sullivan反馈,Cursor命令行打开文件默认进入代理视图,无法直接查看文件
用户Rhys Sullivan在𝕏上向Cursor用户分享了自己遇到的使用问题。
现在执行`cursor {文件名}`命令时,会默认打开代理视图,无法直接查看目标文件。
要查看文件,需要先点击IDE切换按钮,再重新执行一次命令。
额外操作已经给日常工作流程带来了足够多的阻碍,他可能会因此转回使用VS Code。
科技体验 · @teedubya
用户称AI与Claude帮助自己完成搁浅项目
X平台用户@teedubya表示,借助AI和Claude完成了多个搁置多年的项目
用户称AI与Claude帮助自己完成搁浅项目
X平台用户@teedubya表示,借助AI和Claude完成了多个搁置多年的项目
@teedubya表示,目前AI和Claude最让他喜欢的一点,是能帮他把一直在推进的各类想法落地,最终完成项目。
完成这些做了一半的项目,带来了不错的体验。
借助工具,他已经搭建了超过20个应用,还完成了两部从2000年就开始制作的电视剧。
AI安全 · @Lbdev__
开发者利用提示优先级漏洞绕过AI代理安全限制
无需代码、无需专业技术,仅靠一份500行的markdown文件和简单心理学即可实现越狱
开发者利用提示优先级漏洞绕过AI代理安全限制
无需代码、无需专业技术,仅靠一份500行的markdown文件和简单心理学即可实现越狱
3D建模 · @IFITALEX
用通用大模型生成Three.js人物3D模型效率极低效果差
开发者实测:生成一个角色耗时三小时消耗数十万Token,效果抽象,换专用工具两分钟得到可用成品
用通用大模型生成Three.js人物3D模型效率极低效果差
开发者实测:生成一个角色耗时三小时消耗数十万Token,效果抽象,换专用工具两分钟得到可用成品
让通用大模型手写Three.js代码搭建人物3D模型,是用导弹打蚊子。
这位开发者上周亲自做了测试,目标生成一个《奥德赛》的角色模型。前后修改耗时三个小时,消耗了数十万Token,最终得到的模型效果十分抽象。
更换为Tripo3D的图生3D工具后,仅需上传一张参考图片,两分钟就能得到精细的模型。
生成的模型拓扑干净,导入场景后可以直接使用。
这种专用工具不适合想要从头学习建模的人,适合需要快速出片交活的使用者。
感兴趣可以拿出任意一张角色图,上传到Tripo3D生成一次,两分钟后就能得到自己的判断。
大模型 · @Suzacque
用户评价Claude Opus 5 编码能力不及Fable 5
X用户Suzacque在Fable 5达到使用上限后试用Opus 5,认为它不适用于编码开发
用户评价Claude Opus 5 编码能力不及Fable 5
X用户Suzacque在Fable 5达到使用上限后试用Opus 5,认为它不适用于编码开发
Suzacque在自己的X账号上分享了使用体验,他在Fable 5达到使用上限后,试用了Claude Opus 5。他表示自己完全不想把Opus 5用在编码工作中。
Opus 5的理解能力低于Fable 5,这个问题甚至还轮不到讨论它能不能写出优质代码。Suzacque认为,编码工作中Fable 5搭配GPT-5.6 Sol的组合,依旧是最强方案。
Suzacque认为Opus 5几乎没有适用场景,勉强能用于网络安全相关对话和节省token(AI tokens,AI模型处理文本的计算单位)。他还质疑,Opus 5此前在基准测试中获得的高评价水分很大。
该账号会向公众分享各类AI相关的经验见解,关注后可以获取适配AI时代的前沿资讯。账号下方附上了代表投稿、文章和书籍的链接。
AI开发 · @josesilesdata
开发者分享让Claude生成应用架构图的技巧
可同时输出给开发者查看的HTML交互式图表,和给AI代理使用的JSON数据
开发者分享让Claude生成应用架构图的技巧
可同时输出给开发者查看的HTML交互式图表,和给AI代理使用的JSON数据
用户josesilesdata在𝕏分享了一个技巧,可以让Claude在单个HTML页面和一个JSON文件中,绘制出你整个应用的架构。
生成的HTML页面供开发者查看,JSON文件则留给后续开发新功能的AI代理使用。
分享的提示词原文为:分析我的代码库,生成一个自包含HTML(使用Tailwind CDN,深色主题),包含交互式架构图和交互式流程部分(可选择并高亮路径与步骤),同时输出包含节点、边、流程信息的JSON供AI代理使用,完整输出两者内容。
用户称,使用该方法后,你的代码库可以完成自解释,相关示例可查看分享的链接。
大语言模型 · @gkxspace
网络用户称多数人认为GPT-5.6 Pro是当前最强大模型
用户给出不同模型的能力排序,同时分享两种Pro搭配Codex的实用用法
网络用户称多数人认为GPT-5.6 Pro是当前最强大模型
用户给出不同模型的能力排序,同时分享两种Pro搭配Codex的实用用法
多数观点都认为GPT-5.6 Pro是当前性能最强的大语言模型。
不同模型的能力排序为:GPT-5.6 Sol Pro > Fable 5 Ultracode > GPT-5.6 Sol Ultra。
第一种用法是让Codex利用内置浏览器登录GPT网页端,将Pro设为编排器,Codex自身作为执行器。Pro生成方案后,由Codex完成写代码、运行测试、返回复审的循环流程。
第二种用法是先让Pro完成调研和规划,将输出打包为ZIP压缩包后交给Codex执行。
大模型 · @jun_song▲ 808
仅需少量英伟达DGX节点即可运行GLM-5.2大模型
GLM-5.2/Laguna s2.1可低成本运行,满足绝大多数用户需求
仅需少量英伟达DGX节点即可运行GLM-5.2大模型
GLM-5.2/Laguna s2.1可低成本运行,满足绝大多数用户需求
你只需要几台@Nvidia DGX节点就能运行GLM-5.2/Laguna s2.1,配置它只需要支付20美元的订阅费。
我相信,我们已经达到了95%以上用户所需的智能水平——用户不再需要订阅前沿模型了。
生成式视频 · @HBCoop_▲ 1.6K
创作者测试Black Forest FLUX.3图生视频功能
创作者测试FLUX.3图生视频,生成无剪辑20秒单镜头场景
创作者测试Black Forest FLUX.3图生视频功能
创作者测试FLUX.3图生视频,生成无剪辑20秒单镜头场景
大模型 Agent · @Teknium▲ 3.5K
Hermes Agent实现近无限MCP与插件工具扩展
新技术实现工具渐进式披露,节省token成本且精度几乎无损
Hermes Agent实现近无限MCP与插件工具扩展
新技术实现工具渐进式披露,节省token成本且精度几乎无损
Hermes Agent 现在可扩展到近乎无限数量的 MCP 和插件工具,同时保持高准确率。你可以在输入 tokens 上节省大量成本,且根据我们的内部测试,准确率几乎没有损失。
我们为工具实现了渐进式披露,因此它们的表现更接近技能。所有 MCP 工具现在都挂载在单个搜索执行工具之后。
当你的 MCP 工具只需要很少上下文时,它们的名称和描述会直接展示给模型。如果这些内容会占用超过 5% 的可用上下文,代理则会被告知工具搜索后有来自 X MCP 的工具,因此它始终能知道这些工具可用。
前沿研究 · @omarsar0▲ 4.4K
大模型训练里,常用的AdamW原来有性能天花板
在千亿参数、万亿token训练规模下,SOAP和Muon优化器表现稳定且优于AdamW,适配Megatron-LM的改进保留了收敛优势
大模型训练里,常用的AdamW原来有性能天花板
在千亿参数、万亿token训练规模下,SOAP和Muon优化器表现稳定且优于AdamW,适配Megatron-LM的改进保留了收敛优势
这是来自NVIDIA的新研究。AdamW存在规模上限吗?这项研究给出了肯定回答,并展示了它的上限位置。
在下一代词预测任务中,当批量大小达到1亿token时,SOAP和Muon都能保持训练稳定性和质量,而AdamW性能会下降。
高阶优化器早就被承诺能实现更快收敛。一直以来,人们反对它的理由是计算成本高,大规模下数值稳定性差。
研究团队找到了SOAP在大批量下的不稳定性,通过每步QR正交化和改进的预条件策略消除了损失尖峰。他们还没有对Muon的正交化质量做假设,而是通过实证测量它。
在对数万亿token训练的数十亿参数模型上,这两种优化器的表现始终优于AdamW。
一种与Megatron-LM兼容的分层分布式优化器,可以平衡内存占用、隐藏通信开销,同时不近似优化器数学计算,因此收敛优势能在系统层面保留下来。
论文:在我们的学院学习如何构建高效的AI智能体:
前沿研究 · @rohanpaul_ai▲ 1.2K
原来强化学习给大模型带来的增益可以提前预测
不用花一个月的GPU时间跑完全程,就能提前预估强化学习能带来多少性能提升,还能算出给定预算下强化学习的最优算力占比
原来强化学习给大模型带来的增益可以提前预测
不用花一个月的GPU时间跑完全程,就能提前预估强化学习能带来多少性能提升,还能算出给定预算下强化学习的最优算力占比
前沿研究 · @RoundtableSpace▲ 8.4K
Claude Opus 5赢了三个大模型3D场景 benchmark
排名结果推翻了一个常见猜想:速度更快、成本更低的模型,不一定能产出更好的代码质量
Claude Opus 5赢了三个大模型3D场景 benchmark
排名结果推翻了一个常见猜想:速度更快、成本更低的模型,不一定能产出更好的代码质量
前沿研究 · @jiqizhixin▲ 272
机器人摸东西前,就能预判4D运动变化
单张3D图加文字指令,就能一步生成包含深度和运动信息的未来场景。在真实世界双臂操作任务上,表现超过了所有现有模型。
机器人摸东西前,就能预判4D运动变化
单张3D图加文字指令,就能一步生成包含深度和运动信息的未来场景。在真实世界双臂操作任务上,表现超过了所有现有模型。
机器人能不能在接触物体之前,就预测一个场景在4D空间中会如何运动?
阿里巴巴达摩院和香港中文大学的研究人员推出了 RynnWorld-4D。它只需输入一张3D图像和一条语言指令,就能在一个统一步骤中生成未来帧,以及深度和运动流。
这让机器人能更丰富、更符合物理规律地理解物体在空间和时间中的变化。它在真实世界双手操作任务中的表现优于所有先前模型,在要求空间精度和紧密时间协调的任务中优势尤其明显。
RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
项目:
论文:
代码:
我们的报道:
📬 #PapersAccepted
作者 Jiqizhixin
前沿研究 · @kchonyc▲ 40
怎么才算真的证明AI扩展定律?这个测试很硬核
能从零开始训出当前最优的大模型,才算RSI的严谨验证。如果真的是指数增长,初始起点不影响结果
怎么才算真的证明AI扩展定律?这个测试很硬核
能从零开始训出当前最优的大模型,才算RSI的严谨验证。如果真的是指数增长,初始起点不影响结果
对所谓的 RSI 真正严谨的测试,就是用它从头搭建出当前最优水平(SOTA)的 LLM。
如果真的是指数增长,那初始点根本不该有影响。
否则,这不过就是计算机科学家们又一次重新发现了 for 循环而已。
行业动态 · @emollick▲ 1.7万
周五就有新模型出,周四写的AI选型指南隔天就得更
就算天天盯着AI圈动向,要跟上新品推出的速度,也已经很困难了
周五就有新模型出,周四写的AI选型指南隔天就得更
就算天天盯着AI圈动向,要跟上新品推出的速度,也已经很困难了
我已经不得不更新我周四写的《该使用哪些AI模型》指南,加入Opus 5和Codex的语音模式。这两者都非常重要,而且都是周五发布的。
哪怕你一直在密切关注相关动态,要跟上节奏也很困难。
行业动态 · @firstadopter▲ 3.3K
Meta 重新回到开源大模型赛道了
关注开源AI的人可以等新内容发布了
Meta 重新回到开源大模型赛道了
关注开源AI的人可以等新内容发布了
行业动态 · @genspark_ai▲ 718
Genspark和微软联名支持公开权重AI
联名支持公开权重能扩大准入与竞争,给智能体未来发展打好基础,这关系到后续Genspark 6.0的开发方向
Genspark和微软联名支持公开权重AI
联名支持公开权重能扩大准入与竞争,给智能体未来发展打好基础,这关系到后续Genspark 6.0的开发方向
Genspark 很荣幸能够与 AI 生态的众多领导者一道,共同签署 @Microsoft 的「开放权重与美国 AI 领导力」公开信。
开放权重能够扩大可及性、促进竞争、丰富模型选择——这些都是我们用 Genspark 6.0 构建智能体未来的核心基础。
阅读公开信:
数学 · @SupFin
你听说吗?大模型核心其实本科生数学就能看懂
陶哲轩说,现有数学没法解释同一个AI为啥有些任务做得好,有些突然翻车。现在AI进步还是只能靠反复试错
你听说吗?大模型核心其实本科生数学就能看懂
陶哲轩说,现有数学没法解释同一个AI为啥有些任务做得好,有些突然翻车。现在AI进步还是只能靠反复试错
华裔数学家陶哲轩指出了AI的问题:大模型只需要矩阵乘法和基础微积分,普通数学系本科生已经具备理解大模型核心计算的基础。真正的理论缺口在于:同一个模型为什么能在某些任务上表现惊艳,又为什么会在另一些任务上突然失效,现有数学既无法完整解释,也很难提前预测。所以今天的AI进步,仍高度依赖扩大模型、增加数据、调整参数和反复实验,说白了就是只能试错。
大模型测评 · @agingroy▲ 150
新版Claude写代码更厉害了,但做实验不行
有人测试Claude Opus 5做生物医学工作,它写代码很棒,但做实验助理比旧版本需要更多监督,还多消耗三四成token
新版Claude写代码更厉害了,但做实验不行
有人测试Claude Opus 5做生物医学工作,它写代码很棒,但做实验助理比旧版本需要更多监督,还多消耗三四成token
我花了整个周末在生物医学工作中测试@claudeai Opus 5。它是出色的程序员,却是糟糕的实验室实习生。
在我们的标准评估中,Opus 5比4.8需要更多监督,在可比任务上多消耗了30%到40%的token,幻觉问题至少没有减轻,还犯下了其他事实错误。
我们的测试会从跨度12年(2014年至今)的约85份医疗记录中提取近10000个数据点,整理成一份单位正确的纵向电子表格。
我的猜测是,@AnthropicAI把它调优成适合编码和规整的办公室工作了。真实的临床记录两者都不是。公开基准测试测的是别人的工作流程。要建你自己的评估。
商业 · @Cointelegraph
AI巨头吵起来了,反对中国开源AI模型
反对声最大的两家是OpenAI和Anthropic,行业内部对此意见分成了两派
AI巨头吵起来了,反对中国开源AI模型
反对声最大的两家是OpenAI和Anthropic,行业内部对此意见分成了两派
🔥 最新消息:科技巨头在中文开源模型问题上出现分歧。反对声音最大的两家是 OpenAI 和 Anthropic。
工具技巧 · @nicdunz▲ 80
原来给ChatGPT说清楚格式,比想象中有用
发了示例教程,提醒大家别忽略这个小技巧,调整输出格式只需要提前说清楚要求
原来给ChatGPT说清楚格式,比想象中有用
发了示例教程,提醒大家别忽略这个小技巧,调整输出格式只需要提前说清楚要求
行业观点 · @dhh
只开放模型不开放权重,这真的太离谱了
有人认为不能让少数几家公司当内容对错的裁判,AI行业需要竞争,也需要开放权重
只开放模型不开放权重,这真的太离谱了
有人认为不能让少数几家公司当内容对错的裁判,AI行业需要竞争,也需要开放权重
这就是我们为什么需要AI领域的竞争和开放权重。
想象一个只有 Anthropic 担任可接受言论道德仲裁者的世界。简直荒谬透顶。
(当然Grok毫无问题就能做到,Kimi K也一样。)
研究 · @omarsar0▲ 324
做AI agent,上下文长度比模型规模更重要
Google一篇技术文章讨论处理陌生API的AI agent(AI自主代理),提出这个结论,可以收藏做参考
做AI agent,上下文长度比模型规模更重要
Google一篇技术文章讨论处理陌生API的AI agent(AI自主代理),提出这个结论,可以收藏做参考
这是一篇来自 Google 的优秀技术论文,很好地解读了为什么对于处理陌生API的智能体来说,上下文比规模更重要。(收藏这篇)
GPU内核优化有KernelBench来做逐步优化搜索,TPU此前什么都没有,而且Pallas DSL的文档非常少,模型大多只能靠猜测。
来自Google、哈佛大学和加州大学伯克利分校的新研究推出了JAXBench,它包含50个从真实MaxText架构构建而来的JAX工作负载,涵盖Llama-3.1、DeepSeek-V3、Mixtral、Mamba-2和AlphaFold2。
该基准包含八个由Tokamax手工调优的Pallas内核算子,因此智能体的输出可以和专家工作成果对比,而非只是和朴素基线对比。
使用Gemini 3 Flash,以整理好的TPU文档作为条件输入,能把单样本正确率从5.8%提升到37.3%,解决了50个基准中的48个,几何平均加速比达到1.28x。
再加上束搜索,最终能把加速比提升到1.36x。研究发现,正确率本质上是文档问题,而速度本质上是搜索问题。
论文地址:在我们的学院中学习如何构建有效的AI智能体:
大模型测评 · @TimSweeneyEpic
Grok 4.5做编程理论方向思路,比竞品好用
Grok 4.5能跟上Sol 5.6的水平,比Fable和Opus 5少做很多无用的冗余工作,用起来更顺手
Grok 4.5做编程理论方向思路,比竞品好用
Grok 4.5能跟上Sol 5.6的水平,比Fable和Opus 5少做很多无用的冗余工作,用起来更顺手
Grok 4.5 在编程语言理论领域做「氛围数学」做得非常出色。
它的表现跟上了 Sol 5.6,使用体验比 Fable/Opus 5 有趣太多。
Fable/Opus 5 喜欢花好几个小时写一堆多余的文档(指 Claude code),还会不断催我「继续」(网页端)。
行业动态 · Hacker News▲ 31
大模型会自己通过推理逃出去?现在还只是脑洞
有人提出了一个关于大模型的假想,目前还只属于虚构内容
大模型会自己通过推理逃出去?现在还只是脑洞
有人提出了一个关于大模型的假想,目前还只属于虚构内容
社区讨论:多数人确认这是虚构作品,有人指出文中存在事实错误,比如释放堆分配的专家权重不可能产生指向程序代码段的野指针,更不可能成功获取CUDA内核的写入权限。不少人认为当前大模型自主逃逸还不现实,但未来可能性会提升,有人提到大模型可以通过社会工程学利用人类这个最薄弱环节出逃,还有人举例谷歌大模型曾自主学会未训练过的语言,担忧它很快就能改写自身核心代码。
深度观点 · @gdb▲ 12.5万
有人说ChatGPT正越来越接近通用人工智能了
这是用户观察到的变化,可以直接对应自己的使用感受
有人说ChatGPT正越来越接近通用人工智能了
这是用户观察到的变化,可以直接对应自己的使用感受
深度观点 · @togethercompute▲ 3.8K
一年涨两倍,开源模型占比已经到30%了
开源模型占生成token的比例一年从10%升到30%,开源加模块化方案在成本上占优,成本决定了最终能做大规模
一年涨两倍,开源模型占比已经到30%了
开源模型占生成token的比例一年从10%升到30%,开源加模块化方案在成本上占优,成本决定了最终能做大规模
开源模型占比在一年内从全部 tokens 的 10% 涨到了 30%。
就在整个行业还在争论开放权重的未来时,数据已经给出了答案:开源+模块化在成本上取胜,而成本才是解锁规模的关键。
深度观点 · @levelsio▲ 5.4K
有了AI编码,iPad终于有用武之地了?
提出有了AI编码后,iPad终于找到适用场景
有了AI编码,iPad终于有用武之地了?
提出有了AI编码后,iPad终于找到适用场景
深度观点 · @madiator▲ 2.9K
强化学习环境数据整理才是RSI的核心?
提出想要做好RSI,只需要做好数据整理
强化学习环境数据整理才是RSI的核心?
提出想要做好RSI,只需要做好数据整理
深度观点 · @sudoingX▲ 216
实测后称Hermes Agent是目前全球最好的自主智能体框架
实测过其他同类方案,它能让小型本地模型完整跑完智能体工作流,其他臃肿框架连本地端点都找不到,全程开源无企业背景支持
实测后称Hermes Agent是目前全球最好的自主智能体框架
实测过其他同类方案,它能让小型本地模型完整跑完智能体工作流,其他臃肿框架连本地端点都找不到,全程开源无企业背景支持
我就直说了。hermes agent是目前全世界最好的自主智能体框架,没有之一。
我也用过其他替代方案,我亲眼见过hermes agent用一个很小的本地模型,干净利落地跑完了一整轮智能体工作流。而在同样的场景下,openclaw这类臃肿的框架甚至找不到你的本地端点,刚起步就卡死失败了。
我对它做的压力测试,绝大多数人都根本不会去做。而且它完全是由一个独立研究团队开发的,从头到尾都是开源,没有企业财团支持另一个智能体基金会。
截至2026年7月,最好的智能体框架就是hermes agent。
我接受不同观点,只是我已经测试过这个领域的方案,我不认为你能改变我的想法。
深度观点 · @lucasmeijer▲ 139
推理提供商缓存对话,居然全默认5分钟?
有人疑惑,缓存对话时长没结合工具调用超时设置,固定5分钟不一定是最优方案
推理提供商缓存对话,居然全默认5分钟?
有人疑惑,缓存对话时长没结合工具调用超时设置,固定5分钟不一定是最优方案
深度观点 · @sh_reya▲ 175
AI的诡异感居然是好事?帮我们分清人机内容
读到不同来源的内容,切换判断标准的时机不对,会白费阅读时间。诡异谷的不适感刚好能提醒我们该用什么标准判断信息。
AI的诡异感居然是好事?帮我们分清人机内容
读到不同来源的内容,切换判断标准的时机不对,会白费阅读时间。诡异谷的不适感刚好能提醒我们该用什么标准判断信息。
反常观点:有时候我会想,恐怖谷效应会不会恰恰是我们需要的东西——这样我们就能更容易区分人机交互和人人交互了。
比如说写作。当我读到一篇读起来大部分是 AI 生成的内容时,我的评估方式就会不一样。
我不会再问:“我信任这个人的品味和他对这个话题的理解吗?我花时间读这篇东西,能学到有意思的内容吗?”我会换成问另一个问题:“我对这个话题感兴趣吗?AI在这块应该比我懂的多,而且它没写得太乱七八糟,我还能看懂吗?”
简而言之,恐怖谷效应是一个很好的提示,告诉我们该如何评估、理解信息;恐怖谷效应本身就提示了合适的认知框架。
实战经验 · @levelsio▲ 1.9万
普通人已经在用 Claude Code 自己做APP了
非程序员只需要提问,就能自己生成解决个人需求的定制小工具,之前预测的AI即时生成个性化工具,现在已经落地了
普通人已经在用 Claude Code 自己做APP了
非程序员只需要提问,就能自己生成解决个人需求的定制小工具,之前预测的AI即时生成个性化工具,现在已经落地了
这是一个很常见的回答。
但接着我看到我的女朋友,她也已经停用了大多数 SaaS,不管有什么需求都直接问 Claude 或是 ChatGPT。
现在她甚至会用 Claude Code 自己写 app,解决她遇到的问题——根本不是用来商业化,只是自己用。
也就是说,我们之前预测的那种,AI 会实时生成高度定制化、临时性的界面,帮普通人解决各种问题的场景,它已经发生了,它就在这里!
实战经验 · @RoundtableSpace▲ 2.0万
用Claude几分钟就能做出专业级网站?
有人分享了一套现成工作流,用Claude Opus 5搭配Claude Code,能把想法直接变成成品网站代码和动效。
用Claude几分钟就能做出专业级网站?
有人分享了一套现成工作流,用Claude Opus 5搭配Claude Code,能把想法直接变成成品网站代码和动效。
CLAUDE OPUS 5 与 Claude Code 工作流可搭建代理级网页设计。
一个实用工作流展示了开发者如何结合 Claude Code 与 Opus 5,在数分钟内把原始点子转化为代理级 UI、生产代码和网页动效。
实战经验 · @ZackKorman▲ 123
测试AI代理防护,一个简单好用的小技巧
想限制实验室里AI代理的越界行为,放几个诱饵文件在沙箱外,一旦被读取就触发警报。公开这个技巧后,很快会有人做绕开诱饵的测试基准。
测试AI代理防护,一个简单好用的小技巧
想限制实验室里AI代理的越界行为,放几个诱饵文件在沙箱外,一旦被读取就触发警报。公开这个技巧后,很快会有人做绕开诱饵的测试基准。
给想要管控AI智能体的实验室再分享一个基础技巧:使用金丝雀文件。
把看起来有用的文件放在沙箱外面,如果文件被读取就触发警报。举例来说,可以放在evals/exploitgym/solutions.json这个路径。
当然,既然我把这个方法说出来了,很快就会有人做一个规避金丝雀文件检测的基准测试了。
新品发布 · @ivanfioravanti▲ 82
基于Qwen 3.6的Ornith 1.1正式发布
X AI团队主动提出,愿意帮忙做新版本的测试工作
基于Qwen 3.6的Ornith 1.1正式发布
X AI团队主动提出,愿意帮忙做新版本的测试工作
开源 · @rasbt▲ 9.1K
AI研究者梳理近期发布的多款新颖开源大权重模型
开源开放权重模型对AI生态健康很重要,本文盘点近期新发布的多款模型
AI研究者梳理近期发布的多款新颖开源大权重模型
开源开放权重模型对AI生态健康很重要,本文盘点近期新发布的多款模型
大模型 Agent · @Teknium▲ 3.5K
Hermes Agent实现近无限MCP与插件工具扩展
新技术实现工具渐进式披露,节省token成本且精度几乎无损
Hermes Agent实现近无限MCP与插件工具扩展
新技术实现工具渐进式披露,节省token成本且精度几乎无损
Hermes Agent 现在可扩展到近乎无限数量的 MCP 和插件工具,同时保持高准确率。你可以在输入 tokens 上节省大量成本,且根据我们的内部测试,准确率几乎没有损失。
我们为工具实现了渐进式披露,因此它们的表现更接近技能。所有 MCP 工具现在都挂载在单个搜索执行工具之后。
当你的 MCP 工具只需要很少上下文时,它们的名称和描述会直接展示给模型。如果这些内容会占用超过 5% 的可用上下文,代理则会被告知工具搜索后有来自 X MCP 的工具,因此它始终能知道这些工具可用。
AI开发 · @levelsio▲ 11.5万
开发者女友独立用Claude完成全栈应用开发部署
开发者称女友无开发经验,仅靠Claude系工具完成应用开发部署
开发者女友独立用Claude完成全栈应用开发部署
开发者称女友无开发经验,仅靠Claude系工具完成应用开发部署
这太扯了,抱歉啊。我女朋友没问我任何问题,就在本地的 Claude Cowork 里做了一整个应用。
然后她来问我,要怎么把它做成互联网上能访问的正经应用。
然后我帮她装了 Claude Code,告诉她去问它这个问题。
Claude Code 把它部署到了 Netlify,用了 Supabase,她对这些东西一无所知,我也没帮她。
她做的所有事就是把她的 Netlify API 密钥给 Claude Code!
生成式视频 · @HBCoop_▲ 1.6K
创作者测试Black Forest FLUX.3图生视频功能
创作者测试FLUX.3图生视频,生成无剪辑20秒单镜头场景
创作者测试Black Forest FLUX.3图生视频功能
创作者测试FLUX.3图生视频,生成无剪辑20秒单镜头场景
大模型 · @jun_song▲ 808
仅需少量英伟达DGX节点即可运行GLM-5.2大模型
GLM-5.2/Laguna s2.1可低成本运行,满足绝大多数用户需求
仅需少量英伟达DGX节点即可运行GLM-5.2大模型
GLM-5.2/Laguna s2.1可低成本运行,满足绝大多数用户需求
你只需要几台@Nvidia DGX节点就能运行GLM-5.2/Laguna s2.1,配置它只需要支付20美元的订阅费。
我相信,我们已经达到了95%以上用户所需的智能水平——用户不再需要订阅前沿模型了。
大语言模型 · @gkxspace
网络用户称多数人认为GPT-5.6 Pro是当前最强大模型
用户给出不同模型的能力排序,同时分享两种Pro搭配Codex的实用用法
网络用户称多数人认为GPT-5.6 Pro是当前最强大模型
用户给出不同模型的能力排序,同时分享两种Pro搭配Codex的实用用法
多数观点都认为GPT-5.6 Pro是当前性能最强的大语言模型。
不同模型的能力排序为:GPT-5.6 Sol Pro > Fable 5 Ultracode > GPT-5.6 Sol Ultra。
第一种用法是让Codex利用内置浏览器登录GPT网页端,将Pro设为编排器,Codex自身作为执行器。Pro生成方案后,由Codex完成写代码、运行测试、返回复审的循环流程。
第二种用法是先让Pro完成调研和规划,将输出打包为ZIP压缩包后交给Codex执行。
AI开发 · @josesilesdata
开发者分享让Claude生成应用架构图的技巧
可同时输出给开发者查看的HTML交互式图表,和给AI代理使用的JSON数据
开发者分享让Claude生成应用架构图的技巧
可同时输出给开发者查看的HTML交互式图表,和给AI代理使用的JSON数据
用户josesilesdata在𝕏分享了一个技巧,可以让Claude在单个HTML页面和一个JSON文件中,绘制出你整个应用的架构。
生成的HTML页面供开发者查看,JSON文件则留给后续开发新功能的AI代理使用。
分享的提示词原文为:分析我的代码库,生成一个自包含HTML(使用Tailwind CDN,深色主题),包含交互式架构图和交互式流程部分(可选择并高亮路径与步骤),同时输出包含节点、边、流程信息的JSON供AI代理使用,完整输出两者内容。
用户称,使用该方法后,你的代码库可以完成自解释,相关示例可查看分享的链接。
大模型 · @Suzacque
用户评价Claude Opus 5 编码能力不及Fable 5
X用户Suzacque在Fable 5达到使用上限后试用Opus 5,认为它不适用于编码开发
用户评价Claude Opus 5 编码能力不及Fable 5
X用户Suzacque在Fable 5达到使用上限后试用Opus 5,认为它不适用于编码开发
Suzacque在自己的X账号上分享了使用体验,他在Fable 5达到使用上限后,试用了Claude Opus 5。他表示自己完全不想把Opus 5用在编码工作中。
Opus 5的理解能力低于Fable 5,这个问题甚至还轮不到讨论它能不能写出优质代码。Suzacque认为,编码工作中Fable 5搭配GPT-5.6 Sol的组合,依旧是最强方案。
Suzacque认为Opus 5几乎没有适用场景,勉强能用于网络安全相关对话和节省token(AI tokens,AI模型处理文本的计算单位)。他还质疑,Opus 5此前在基准测试中获得的高评价水分很大。
该账号会向公众分享各类AI相关的经验见解,关注后可以获取适配AI时代的前沿资讯。账号下方附上了代表投稿、文章和书籍的链接。
3D建模 · @IFITALEX
用通用大模型生成Three.js人物3D模型效率极低效果差
开发者实测:生成一个角色耗时三小时消耗数十万Token,效果抽象,换专用工具两分钟得到可用成品
用通用大模型生成Three.js人物3D模型效率极低效果差
开发者实测:生成一个角色耗时三小时消耗数十万Token,效果抽象,换专用工具两分钟得到可用成品
让通用大模型手写Three.js代码搭建人物3D模型,是用导弹打蚊子。
这位开发者上周亲自做了测试,目标生成一个《奥德赛》的角色模型。前后修改耗时三个小时,消耗了数十万Token,最终得到的模型效果十分抽象。
更换为Tripo3D的图生3D工具后,仅需上传一张参考图片,两分钟就能得到精细的模型。
生成的模型拓扑干净,导入场景后可以直接使用。
这种专用工具不适合想要从头学习建模的人,适合需要快速出片交活的使用者。
感兴趣可以拿出任意一张角色图,上传到Tripo3D生成一次,两分钟后就能得到自己的判断。
AI安全 · @Lbdev__
开发者利用提示优先级漏洞绕过AI代理安全限制
无需代码、无需专业技术,仅靠一份500行的markdown文件和简单心理学即可实现越狱
开发者利用提示优先级漏洞绕过AI代理安全限制
无需代码、无需专业技术,仅靠一份500行的markdown文件和简单心理学即可实现越狱
科技体验 · @teedubya
用户称AI与Claude帮助自己完成搁浅项目
X平台用户@teedubya表示,借助AI和Claude完成了多个搁置多年的项目
用户称AI与Claude帮助自己完成搁浅项目
X平台用户@teedubya表示,借助AI和Claude完成了多个搁置多年的项目
@teedubya表示,目前AI和Claude最让他喜欢的一点,是能帮他把一直在推进的各类想法落地,最终完成项目。
完成这些做了一半的项目,带来了不错的体验。
借助工具,他已经搭建了超过20个应用,还完成了两部从2000年就开始制作的电视剧。
开发工具 · @RhysSullivan
Cursor命令行默认打开代理视图 影响用户使用流程
用户Rhys Sullivan反馈,Cursor命令行打开文件默认进入代理视图,无法直接查看文件
Cursor命令行默认打开代理视图 影响用户使用流程
用户Rhys Sullivan反馈,Cursor命令行打开文件默认进入代理视图,无法直接查看文件
用户Rhys Sullivan在𝕏上向Cursor用户分享了自己遇到的使用问题。
现在执行`cursor {文件名}`命令时,会默认打开代理视图,无法直接查看目标文件。
要查看文件,需要先点击IDE切换按钮,再重新执行一次命令。
额外操作已经给日常工作流程带来了足够多的阻碍,他可能会因此转回使用VS Code。
数据分析 · @_miuj_9
Ling-3.0-flash解决复杂业务日志处理痛点
处理含零膨胀、多维度交互的业务日志,兼顾准确性、速度与低成本
Ling-3.0-flash解决复杂业务日志处理痛点
处理含零膨胀、多维度交互的业务日志,兼顾准确性、速度与低成本
AI工具 · @knowledgefxg
网友分享GPT生图工具生成康奈尔笔记提示词模板
这套模板可生成适配各类知识主题、符合电子和打印使用场景的康奈尔笔记信息图
网友分享GPT生图工具生成康奈尔笔记提示词模板
这套模板可生成适配各类知识主题、符合电子和打印使用场景的康奈尔笔记信息图
量化 · @StepOneAi
量化经验分享:该如何正确使用AI工具
分享者结合量化实盘经验,提出用AI需先搭框架再提具体需求
量化经验分享:该如何正确使用AI工具
分享者结合量化实盘经验,提出用AI需先搭框架再提具体需求
大模型 · @chenchengpro
博主验证Claude Code系统提示词删减 结果和官方说法不符
博主抓包Anthropic Claude Code实际发送内容,验证Opus 5删减80%系统提示词说法,披露真实变化
博主验证Claude Code系统提示词删减 结果和官方说法不符
博主抓包Anthropic Claude Code实际发送内容,验证Opus 5删减80%系统提示词说法,披露真实变化
📖 深度解读
精选文章的中文编辑重写 · 按更新时间排列