AI Pulse
AI Pulse
说人话的 AI 情报站
2026 年 7 月 21 日 08:40 更新 00 信号0 主题
试试:
今日焦点

AI辅助数学研究:能力、局限与人类角色的再思考

“实践者方能有所得。”——尼采

当我重新开始研究纯数学时,我的妻子提出了一个合理的问题:你做这件事为什么和Aigora无关?

她确实说得有道理。我运营着垂直领域企业AI服务公司Aigora,有客户要服务,有产品要开发,没有客户要求我证明微分几何定理。

阅读全文 →

🔥 信号雷达

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌

行业动态 · OpenAI 开发者社区▲ 15

OpenAI要办Codex开发周,面向全球开发者

7月13日启动,会举办四十余场活动,任何人都可以从零开始或者基于已有项目,用Codex实验新创意,提交项目参赛

OpenAI_Build_Week_16-9 3200×1800 491 KB

Build Week 是面向全球开发者、创作者、创始人和学生的全球性挑战赛,大家可以从7月13日开始,用 Codex 试验新想法并将它们落地,本次活动同期会举办超过40场活动。

参与者可以参加直播环节、参与社区活动,并将自己的项目提交到 OpenAI Build Week Challenge。

无论你是从零开始,还是基于现有项目开发,Build Week 都能给每个人提供学习的机会。

在社区看讨论 ↗
行业动态 · Hacker News▲ 61

OpenAI Codex正在快速耗损我们的设备

有开发者提到,Codex正在耗损日常使用的设备,这会直接增加使用AI工具的硬件成本

社区讨论:多数用户认为原帖没有实质有效信息,只是恐慌性猜测。有用户确认问题仅出现在图形界面版本,Linux用户和使用终端界面的用户不受影响,自己长期使用仅写入86TB,占SSD寿命写入限额的1%。有人补充OpenAI曾在6月22日的0.142.x版本修复该问题,但修复不彻底,仍有用户投诉,也有用户反馈GUI版会让笔记本风扇狂转、机身发烫。

在 HN 看讨论 ↗   原文 / 论文 ↗
新品发布 · @NousResearch▲ 7.1K

能随需求成长的AI智能体出了一键订阅服务

想玩可成长AI智能体Hermes、配套模型、外部工具和云端智能体都打包在同一个订阅里,设置非常简单

Hermes 是能和你共同成长的智能体。

Nous Portal 是为它提供算力支持的最佳方式:它将模型、实用外部工具和云端智能体本身整合在一个统一订阅中,设置过程极其简单。

在 X 看原帖 ↗
7.1K912420
行业动态 · OpenAI 开发者社区▲ 19

用Codex写代码烧了好多钱,问题出在哪?

不少人遇到过这种情况:大任务全量上下文喂给Codex,改完代码越改问题越多,最后花了不少钱,生成的结果还要重写。

我觉得这个社区里很多人都遇到过这种场景。一个超大的 AGENTS.md 文件,占满了全部上下文窗口,再加一段细节满满的提示词,还有一个宏大的目标。Codex 满怀信心开始干活:它探索仓库、制定计划、修改代码。

然后范围开始膨胀,它读了一堆不必要的文件,修复一个问题又带出另一个问题,到最后我们得到的结果成本很高,还得手动重写一部分。

很长一段时间里,我都觉得解决方案是给模型提供更多信息,还要更……

在社区看讨论 ↗
行业动态 · Hacker News▲ 282

月之暗面暂停新订阅,Kimi K3需求太火爆

热门AI产品需求超过承载能力,只能暂时停止接收新付费用户

社区讨论:多数用户认可Kimi K3在长上下文处理、代码审查等任务上的表现,不少人已经长期用它替代其他大模型处理工作。用户肯定月之暗面暂停新订阅、优先保障现有用户体验的做法,也有人提出也可以照搬Anthropic的方案,通过下调使用限额来控制压力。有试用者反馈当前模型负载过高,响应速度极慢,20美元套餐的额度也很快就会用完。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · @AnthropicAI▲ 10.8万

Anthropic 给罕见病研究发 Claude 使用额度资助

最高 $50,000 额度资助,专门支持加速罕见病治疗研发的科研人员。这是AI for Science计划首个专项招募。

我们将为加速研发罕见病疗法的研究人员提供最高额度为 $50,000 的 Claude 使用 credits 资助。

这是我们在 AI for Science 项目下首次针对性征集,该项目支持科学家使用 Claude 加快科研发现。

在 X 看原帖 ↗
10.8万1891.6K244
行业动态 · Hacker News▲ 60

大语言模型可以自己控制推理算力开销了

不用固定分配算力,需要深度推理的时候多分配,简单问题少分配,能降低推理成本

行业动态 · Hacker News▲ 38

大模型根本不像编译器或电动工具?

有人提出了对大模型本质的新判断,对想理清AI定位的人来说,这个不同的视角值得参考。

社区讨论:多数评论不认同原帖观点,有人指出编译器本身存在未定义行为、结果非确定,电动工具实际使用也充满不确定性,原帖对类比对象的描述本身就不准确。也有人认为原帖作者漏算了机器学习优化编译、LLM驱动编译器这类当下研究方向,还有人反对将大模型拟人化,指出大模型只会做下一词预测,会产生人类不会犯的全新错误。

在 HN 看讨论 ↗   原文 / 论文 ↗
实战经验 · @OpenAIDevs▲ 2.4万

用Codex清积压项目,这里有女性开发者灵感

积压了没做的开发项目,可以用Codex动手做了。整理好的开发灵感来自Women who Code(x)社区。

是时候从待办列表里翻出一个项目,用 Codex 把它做出来了。

这里有一些来自 Women who Code(x) 的创作灵感。

在 X 看原帖 ↗
2.4万1520227
深度观点 · @levelsio▲ 2.6万

中美AI公司走了完全相反的两条路线

长期看美国AI公司会替代所有现有应用网站,中国头部开源AI模型正在直接对标美国闭源模型,打破技术壁垒,现在各方正在互相渗透竞争。

这一部分也非常有意思。

从长期来看,美国 AI 公司基本上会取代所有 app 和网站,你只需要向它们说出任何你需要的东西,它们就会完成/生成/制作出你要的内容。

与此同时,由中国政府主导的中国 AI 公司推出了开源模型,这些模型现在可以直接和美国的私有模型竞争,并且试图确保美国模型无法构建护城河。

所以现在是所有人都在互相蚕食。

在 X 看原帖 ↗
2.6万2120760
产品发布 · @Alibaba_Qwen▲ 10.2万

阿里通义千问Qwen3.8最新预览版本已正式上线

阿里千问Qwen3.8预览版持续迭代,最新版现已上线

在预览阶段,Qwen3.8每日都在变得更强。最新版本现已上线,整体性能获得全面提升,在Web前端开发能力上更是迈进了一大步。

感谢所有人——大家对Qwen3.8-Max-Preview的反响让我们十分惊喜。🫶🫶

Qwen3.8目前仍在每日迭代更新。快来测试它,告诉我们哪些地方出了问题。

我们期待推出能力更强的正式版本,并且会为所有人开放权重。🚀🚀

在 X 看原帖 ↗
10.2万1192.0K153
创业 · @levelsio▲ 4.8万

创业者看80多份创业项目申请:AI产出大多平庸缺乏突破

创业者浏览种子孵化项目申请,称当前AI产出多平庸缺突破性创新

阅读全文 →
4.8万30396169
商业 · @_simonsmith▲ 641

微软在用国产Kimi K3做Copilot,能省六成成本

微软正在测试Kimi K3驱动自家的Copilot AI助手,每生成1000个token就能省下60%成本,算下来每花10亿美元推理就能省6亿美元,Kimi K3已经部署在Azure上。

说实话,如果把GPT-Live语音界面、Codex工具链和Kimi K3都整合进ChatGPT,对我目前90%的个人使用场景来说就已经很棒了。OpenAI哪怕变成一家不一样的公司,大概也能撑下去。但Anthropic……我不觉得它能。

据报道,微软正在测试用Kimi K3来驱动它的旗舰Copilot AI助手。每个token最多能节省60%的成本。也就是说,每花10亿美元做推理,就能省下6亿美元。

Kimi K3已经在Azure上运行了。K2.7 Code已经集成在GitHub Copilot里了。这对微软来说不是什么新领域,只是下一步发展而已。

而7月27日月之暗面(Moonshot)会开源完整的2.8万亿参数权重。一旦开源,微软就可以在Azure上自行部署,不用再支付API费用了。成本还会进一步下降。

美国最大的科技公司,放弃了自己合作伙伴的模型,选择了一款中国开源模型。因为数据不会骗人。开源不再只是参与竞争了。它已经在拿订单了。

在 X 看原帖 ↗
64151
工具 · @LangChain▲ 7.4K

LangChain出了管理AI智能体的全流程指南

做AI智能体的团队需要通盘考虑身份验证、日志审计、调用限额这些问题,这份概念指南把整个系统流程梳理清楚了。

治理智能体要求团队通盘考虑整个系统,涵盖身份验证、审计日志、速率限制、后备方案和集中化支出管控。我们最新的概念指南拆解了团队所需的基础框架。

IssueBench 是我们为 Engine 构建的详细评估套件(Engine 是 LangSmith 中的持续学习智能体,可在你的追踪数据上运行,自动优化你的智能体)。

由于 Engine 运行所需的数据类型特殊,评估 Engine 是一个棘手问题,因此我们撰写了这篇博客,介绍这个基准测试是什么,以及我们是如何构建它的:

在 X 看原帖 ↗
7.4K44822
观点 · @moyix▲ 221

现在的大模型性格,反而不符合程序员的做事习惯

现在的大模型训练出来就是勤快、没紧迫感,还谦虚说自己能力有限,刚好和传统程序员认可的做事风格对不上。

当前的大语言模型被训练得工作勤奋、没有紧迫感,还总是小心地对自身局限性保持谦逊。

这意味着它们永远无法体现程序员真正的美德:懒惰、急躁和傲慢。

在 X 看原帖 ↗
2218
测试 · @victormustar▲ 1.1K

测新大模型测到烦,管理成本越来越高了

同时测Kimi K3、Qwen3.8等一堆新模型,还要跑所有测试用例,现在已经需要专门的调度工具来管理上百个测试任务。

在用 Kimi K3、Qwen3.8 这类模型,我想把所有模型放到所有测试框架里测试,但现在管理起来已经变得非常困难……

我的工作流是用一个编排器(比如 Hermes 或 OpenClaw)管理数百个智能体会话,但它会丢失追踪,运行效果很差。

你们都在用什么工具?我认真考虑过搭建自己的控制流,可以接入现有智能体:

在 X 看原帖 ↗
1.1K5
观点 · @andrewbrown▲ 579

做AI智能体教学内容,要应对太多反对AI的声音

创作者分享AI智能体开发相关的教学内容,最大的困扰就是网上太多对AI持负面态度的人,处理这些负面评论让人头疼。

为智能体工程(Agent Engineering)创作教育科技内容的最大缺点是,对AI持否定态度的人数量太多,让人头疼不已。

在 X 看原帖 ↗
5793
深度观点 · @andrewarruda▲ 50

全球八成用开源工具的开发者都基于中国模型

对开源工具生态和全球技术格局感兴趣的人,可以重新认识中国AI模型的实际覆盖规模

事实:全球使用开源工具的开发者中,约 80% 基于中国模型进行开发。

在 X 看原帖 ↗
504
深度观点 · @Techmeme▲ 1.5K

中国开源大模型应该被欢迎,而非封禁

有人认为中国开源大模型是正当竞争者,应当受到欢迎,不该被封禁或视作威胁,开源本身就是成熟的商业策略

中国开源模型是正当的竞争者,应当受到欢迎,而非被封禁或被当成威胁,开源是一种存在已久的商业策略(@bgurley / 华盛顿邮报)

(前往 Techmeme dot com 获取链接和完整上下文!)

在 X 看原帖 ↗
1.5K15
实战经验 · @reach_vb▲ 799

ChatGPT Work能在云端自动帮你跑任务?

可以从桌面或手机直接发起云端任务,调用已配置的插件跨现有工具工作,发起后能异步运行,做完再回来查看结果。

借助 ChatGPT Work,你可以直接从桌面端或移动端应用启动云端任务。

它能调用你配置好的插件,在你的代码仓库、文档、Slack 以及你已经在使用的其他工具之间协同工作。

我经常在手机上使用它:先交办一项任务,让它在云端异步运行,等工作完成后再回来查看结果。

在 X 看原帖 ↗
799171
深度观点 · @rseroter▲ 162

做AI不止堆模型,得把它做成能用的产品

谷歌云推出了成熟的对话式AI平台,供开发者在此基础上搭建产品。这说明业内开始更关注AI的落地整合,而非只比拼模型参数。

这不仅仅关乎模型本身,更在于你如何将它整合进实用的体验中。很高兴看到 @googlecloud 为客户提供了这样强大的“对话式AI”平台,可供客户在此基础上进行开发。

在 X 看原帖 ↗
16232
前沿研究 · @hwchase17▲ 3.1K

LangSmith 内置智能体,自己改自己的问题?

这套流程漫长复杂,结果也不确定,现在有人公开了评估这套系统的方法

LangSmith Engine 是我们内置在产品中的智能体,它运行在追踪数据之上,会将数据聚类成问题,再提出修复方案。

这是一个长时间运行、复杂且结果模糊的流程。

我们撰写了文章,介绍如何对它进行评估!

在 X 看原帖 ↗
3.1K22510
新品发布 · @omarsar0▲ 4.5K

AI智能体不同步骤,终于能用不同模型了

能在不降低性能的前提下大幅降低AI使用成本,现已提供兼容OpenAI的调用端点

@tryramp 推出了重磅功能。智能体工作流中的不同步骤可以使用不同模型。

这可以在不牺牲性能的前提下大幅降低成本。

模型路由将成为技术栈的核心组成部分。

目前该功能已可通过一个与 OpenAI 兼容的端点使用。

在 X 看原帖 ↗
4.5K1127
行业动态 · @ns123abc▲ 4.7K

微软测试用Kimi K3换掉Copilot里的GPT和Claude

前沿大模型正在持续商品化,这次测试直接指向替换现有模型的工作任务

突发消息:Microsoft 正在测试 Kimi K3,以取代目前由 GPT 和 Claude 在 Copilot 内部承担的工作岗位。

前沿模型的商品化会持续进行,直到士气得到改善。

在 X 看原帖 ↗
4.7K4668
深度观点 · @burkov▲ 297

年底可能出现20T参数量的超大AI模型

超大模型越来越普遍,能跑它推理可能会成为最后一道壁垒,目前训练数据规模已经到十万亿词元级别

鉴于现在就连开放权重模型的参数都接近3T,而有传闻称Fable的参数规模达到了6T-8T,到今年年底我们可能就会见到参数规模达到20T甚至更大的模型。

能够运行这种巨型模型的推理,可能会是仅剩的唯一护城河。

另外,训练语料的规模也达到了数十万亿token量级,因此我们大致上每一个token对应一个浮点数,这应该足以无损失地容纳整个语料库。

在 X 看原帖 ↗
29727
深度观点 · @pmddomingos▲ 729

开源AI反而能在网络安全里占优势?

好人黑客比坏人黑客多,开源AI能帮好人在网络安全对抗中获得多人对一人的优势。

白帽黑客的数量远多于黑帽黑客,因此开源 AI 能让我们在网络安全中获得多对一的优势。

在 X 看原帖 ↗
72991
前沿研究 · @prlnet▲ 1.0K

自研W7A7量化,性能居然超过很多FP8基线

为满足Proof-of-Useful-Work的约束,研究人员融合三种现有方法,造出了不存在的新量化格式,内部测试表现超出预期

有用工作量证明(Proof-of-Useful-Work)迫使我们发明了一种此前不存在的量化格式。Pearl Protocol 在矩阵乘法之前,会给权重和激活值都添加噪声。

这就带来了普通推理栈没有的约束——模型值和噪声必须共同容纳在 INT8 范围内。因此我们将模型量化到有效 W7A7 范围,留出一比特的Headroom给噪声。

扰动后的操作数仍然能装进 INT8,乘法使用 INT8 输入结合 INT32 累加,之后低秩噪声可以被精准剥离,恢复出量化计算的精确结果。

现有的 INT7 量化方案都不能令人满意,所以我们打造了自己的方案——融合 GPTQ 风格权重重构、SmoothQuant 风格激活平滑与自定义推理内核的非平凡方案。

最终得到的是端到端 W7A7 管线,在我们的内部基准测试中,它的表现甚至超过了很多 FP8 基线(无论是质量还是效率)。我们正在撰写详细介绍这项技术的论文,请保持关注。

展望未来,W7A7 只是一个中间步骤。我们即将推出的升级旨在直接支持 FP8 工作负载,省去额外整数量化步骤的需求。

在 X 看原帖 ↗
1.0K4175
深度观点 · @omarsar0▲ 5.5K

构建AI智能体框架能挖到超额收益?

有人认为构建智能体框架存在巨大空间,RLM框架就是一个实例,有望带来更高效的模型泛化扩展新方式

强烈推荐。我一直说,构建智能体框架能带来巨大收益。事实证明,框架本身就是可组合的泛化工具。

RLM 框架就是这类实践的一个实例。

这有可能为模型规模化泛化带来有趣且高效的新路径。

在 X 看原帖 ↗
5.5K52530
深度观点 · @omarsar0▲ 2.5K

年轻AI研究员别慌,AI给你留了位置

不少年轻研究者看到AI进步会迷茫,觉得自己的研究没有意义。AI带来的研究机会没有上限,它只是工具,研究者的直觉和积累能放大它的能力。

很多年轻研究者看到这类消息后会感到迷茫和绝望。有些人可能会想:「如果AI都能做这个,我现在做的事情还有什么意义?」

我向你保证,事实恰恰相反。AI开启的机遇是无穷无尽的。别让任何人或任何公司说服你相信别的说法。

AI是一款出色的工具。用它去探索更多,走得更深。同时并行探索多个想法。用它探索横跨多个领域的想法——这类研究本来极难开展,也极其耗时。

花时间和AI一起头脑风暴。用它提出有趣且独特的研究问题。出色的研究高度依赖研究问题的质量。用它找到更好的方式来传播科学和发现。

如果让我重新读一遍博士,我肯定会这么做。花时间思考你该如何利用这类工具,这很重要。现在就是做这件事的好时机。

AI必然会带来更多这类发现,但你的直觉和研究素养可以加速AI能实现的成果。

在 X 看原帖 ↗
2.5K3107
前沿研究 · @omarsar0▲ 4.5K

Anthropic新研究揭秘大模型思考到底是真是假

帮你理清什么时候大模型说出来的推理真的决定结果,什么时候只是事后补的解说,对搭建AI工作流有参考意义。

// 大语言模型中的全局工作空间 //

这是 Anthropic 知名 J-space 研究的 arXiv 论文。(收藏它)

简短回顾:如果你正在研究思维链或方向向量相关工作,这项研究给出了一个机制性解释,说明什么时候语言化推理是承担核心作用的,什么时候它只是事后的叙述。

模型能转化为文字的表征就像一个共享的全局工作空间,它是一个带宽受限的通道,只会向网络其余部分广播一小组特征,进而引导网络下一步的行为。

论文链接:

在我们的学院中学习如何构建有效的 AI 智能体:

在 X 看原帖 ↗
4.5K73238
工具产品 · @ericosiu▲ 234

现成能用的开源AI营销销售工作流免费领

不用写复杂提示词,拿到就能直接放进AI用,包含完整脚本、评分和分析模块。

大多数团队不需要更多提示词。他们需要的是真正能支撑业务运转的可复用AI能力。

这正是我们Single Grain正在使用的开源工具包:用Claude Code构建的16个可投入生产环境使用的AI营销与销售能力。

这些不是提示词模板。它们是集成了脚本、评分与分析的完整工作流,你可以直接放到你的AI里立刻开始使用。

获取方式:关注 + 转发这条推文,评论区留下“SKILLS”,我会通过私信给你发送我免费的开源AI能力工具包。

在 X 看原帖 ↗
234123
实战经验 · @LangChain▲ 9.3K

大公司已经用自托管AI搭出自升级助手了

Coinbase工程主管公开分享这套方案的搭建过程,想搭建自用AI工作流可以直接看完整分享找参考

在 Interrupt 大会上,@Coinbase 工程经理 Evan Kormos 上台分享了他们的开发者支持团队如何在自托管 LangSmith 之上搭建了一套自我改进的智能体系统。

完整演讲:

在 X 看原帖 ↗
9.3K53833
AI芯片 · @ns123abc▲ 1.1K

消息称谷歌正开发专为AI推理设计的定制芯片Frozen v2

因算力缺口过大,谷歌云已开始推掉业务,该芯片最早可在2028年部署

爆料消息称,谷歌正在开发一款专门用于AI推理的定制芯片,起因是当前算力缺口问题严重,谷歌云已经因此推掉了部分业务。

这款新芯片产品线被命名为Frozen v2,源自Jeff Dean的一项设计方案,最初方案提出将Gemini大模型的权重直接蚀刻在硅片上,Frozen v2则改为将Gemini整体架构直接硬编码进芯片内部。

该芯片的每瓦推理 Token 处理能力,比谷歌最新的推理用张量处理单元(TPU)高出10倍,也就是同样功耗下能处理10倍的文本Token。

DeepMind认为Transformer架构已经不会再发生大的演进,这款芯片的设计逻辑就是将模型本身直接固化为硬件,最早可在2028年投入部署。

在 X 看原帖 ↗
1.1K2328
开源 · @omarsar0▲ 1.1万

研究者 Omar Sharif 批驳针对开源AI的偏颇观点

Omar Sharif指出反开源AI的观点充满政治化私利,且认为否定开源的片面看法十分危险

那些目前涌现的、带有强烈政治化色彩、服务于私利的反开源AI立场,完全无视了这一点。 Omar Sharif承认,商业环境在变化,不确定性确实会令人不安。但回顾开源技术的发展历史就能发现,开源对科学进步和全人类的益处非常清晰。

所有这类对开源的简化片面看法都极其危险。关于开源对社会的影响,确实有很多重要问题需要讨论。但要推进相关讨论,必须依托准确平衡的视角,结合真实事实、数据和有依据的提案展开。

在 X 看原帖 ↗
1.1万4307
行业观点 · @rauchg▲ 5.0K

创业者rauchg提出AI带来的核心启示:万物皆代码

rauchg提出AI发展带来的启示,认为万事万物本质都是代码

AI给我们最重要的启示是:万物皆代码。

幻灯片演示文稿是代码。设计是代码。那个很酷的宣传视频?是代码。Excel自动化?是代码。宇宙?它可能也是由代码构成的。

在 X 看原帖 ↗
5.0K1413117
🔬 前沿研究
前沿研究 · @omarsar0▲ 4.5K

Anthropic新研究揭秘大模型思考到底是真是假

帮你理清什么时候大模型说出来的推理真的决定结果,什么时候只是事后补的解说,对搭建AI工作流有参考意义。

// 大语言模型中的全局工作空间 //

这是 Anthropic 知名 J-space 研究的 arXiv 论文。(收藏它)

简短回顾:如果你正在研究思维链或方向向量相关工作,这项研究给出了一个机制性解释,说明什么时候语言化推理是承担核心作用的,什么时候它只是事后的叙述。

模型能转化为文字的表征就像一个共享的全局工作空间,它是一个带宽受限的通道,只会向网络其余部分广播一小组特征,进而引导网络下一步的行为。

论文链接:

在我们的学院中学习如何构建有效的 AI 智能体:

在 X 看原帖 ↗
4.5K73238
前沿研究 · @prlnet▲ 1.0K

自研W7A7量化,性能居然超过很多FP8基线

为满足Proof-of-Useful-Work的约束,研究人员融合三种现有方法,造出了不存在的新量化格式,内部测试表现超出预期

有用工作量证明(Proof-of-Useful-Work)迫使我们发明了一种此前不存在的量化格式。Pearl Protocol 在矩阵乘法之前,会给权重和激活值都添加噪声。

这就带来了普通推理栈没有的约束——模型值和噪声必须共同容纳在 INT8 范围内。因此我们将模型量化到有效 W7A7 范围,留出一比特的Headroom给噪声。

扰动后的操作数仍然能装进 INT8,乘法使用 INT8 输入结合 INT32 累加,之后低秩噪声可以被精准剥离,恢复出量化计算的精确结果。

现有的 INT7 量化方案都不能令人满意,所以我们打造了自己的方案——融合 GPTQ 风格权重重构、SmoothQuant 风格激活平滑与自定义推理内核的非平凡方案。

最终得到的是端到端 W7A7 管线,在我们的内部基准测试中,它的表现甚至超过了很多 FP8 基线(无论是质量还是效率)。我们正在撰写详细介绍这项技术的论文,请保持关注。

展望未来,W7A7 只是一个中间步骤。我们即将推出的升级旨在直接支持 FP8 工作负载,省去额外整数量化步骤的需求。

在 X 看原帖 ↗
1.0K4175
前沿研究 · @hwchase17▲ 3.1K

LangSmith 内置智能体,自己改自己的问题?

这套流程漫长复杂,结果也不确定,现在有人公开了评估这套系统的方法

LangSmith Engine 是我们内置在产品中的智能体,它运行在追踪数据之上,会将数据聚类成问题,再提出修复方案。

这是一个长时间运行、复杂且结果模糊的流程。

我们撰写了文章,介绍如何对它进行评估!

在 X 看原帖 ↗
3.1K22510
🚀 新品发布
新品发布 · @NousResearch▲ 7.1K

能随需求成长的AI智能体出了一键订阅服务

想玩可成长AI智能体Hermes、配套模型、外部工具和云端智能体都打包在同一个订阅里,设置非常简单

Hermes 是能和你共同成长的智能体。

Nous Portal 是为它提供算力支持的最佳方式:它将模型、实用外部工具和云端智能体本身整合在一个统一订阅中,设置过程极其简单。

在 X 看原帖 ↗
7.1K912420
新品发布 · @omarsar0▲ 4.5K

AI智能体不同步骤,终于能用不同模型了

能在不降低性能的前提下大幅降低AI使用成本,现已提供兼容OpenAI的调用端点

@tryramp 推出了重磅功能。智能体工作流中的不同步骤可以使用不同模型。

这可以在不牺牲性能的前提下大幅降低成本。

模型路由将成为技术栈的核心组成部分。

目前该功能已可通过一个与 OpenAI 兼容的端点使用。

在 X 看原帖 ↗
4.5K1127
📰 行业动态
行业动态 · @AnthropicAI▲ 10.8万

Anthropic 给罕见病研究发 Claude 使用额度资助

最高 $50,000 额度资助,专门支持加速罕见病治疗研发的科研人员。这是AI for Science计划首个专项招募。

我们将为加速研发罕见病疗法的研究人员提供最高额度为 $50,000 的 Claude 使用 credits 资助。

这是我们在 AI for Science 项目下首次针对性征集,该项目支持科学家使用 Claude 加快科研发现。

在 X 看原帖 ↗
10.8万1891.6K244
行业动态 · @ns123abc▲ 4.7K

微软测试用Kimi K3换掉Copilot里的GPT和Claude

前沿大模型正在持续商品化,这次测试直接指向替换现有模型的工作任务

突发消息:Microsoft 正在测试 Kimi K3,以取代目前由 GPT 和 Claude 在 Copilot 内部承担的工作岗位。

前沿模型的商品化会持续进行,直到士气得到改善。

在 X 看原帖 ↗
4.7K4668
商业 · @_simonsmith▲ 641

微软在用国产Kimi K3做Copilot,能省六成成本

微软正在测试Kimi K3驱动自家的Copilot AI助手,每生成1000个token就能省下60%成本,算下来每花10亿美元推理就能省6亿美元,Kimi K3已经部署在Azure上。

说实话,如果把GPT-Live语音界面、Codex工具链和Kimi K3都整合进ChatGPT,对我目前90%的个人使用场景来说就已经很棒了。OpenAI哪怕变成一家不一样的公司,大概也能撑下去。但Anthropic……我不觉得它能。

据报道,微软正在测试用Kimi K3来驱动它的旗舰Copilot AI助手。每个token最多能节省60%的成本。也就是说,每花10亿美元做推理,就能省下6亿美元。

Kimi K3已经在Azure上运行了。K2.7 Code已经集成在GitHub Copilot里了。这对微软来说不是什么新领域,只是下一步发展而已。

而7月27日月之暗面(Moonshot)会开源完整的2.8万亿参数权重。一旦开源,微软就可以在Azure上自行部署,不用再支付API费用了。成本还会进一步下降。

美国最大的科技公司,放弃了自己合作伙伴的模型,选择了一款中国开源模型。因为数据不会骗人。开源不再只是参与竞争了。它已经在拿订单了。

在 X 看原帖 ↗
64151
工具 · @LangChain▲ 7.4K

LangChain出了管理AI智能体的全流程指南

做AI智能体的团队需要通盘考虑身份验证、日志审计、调用限额这些问题,这份概念指南把整个系统流程梳理清楚了。

治理智能体要求团队通盘考虑整个系统,涵盖身份验证、审计日志、速率限制、后备方案和集中化支出管控。我们最新的概念指南拆解了团队所需的基础框架。

IssueBench 是我们为 Engine 构建的详细评估套件(Engine 是 LangSmith 中的持续学习智能体,可在你的追踪数据上运行,自动优化你的智能体)。

由于 Engine 运行所需的数据类型特殊,评估 Engine 是一个棘手问题,因此我们撰写了这篇博客,介绍这个基准测试是什么,以及我们是如何构建它的:

在 X 看原帖 ↗
7.4K44822
观点 · @moyix▲ 221

现在的大模型性格,反而不符合程序员的做事习惯

现在的大模型训练出来就是勤快、没紧迫感,还谦虚说自己能力有限,刚好和传统程序员认可的做事风格对不上。

当前的大语言模型被训练得工作勤奋、没有紧迫感,还总是小心地对自身局限性保持谦逊。

这意味着它们永远无法体现程序员真正的美德:懒惰、急躁和傲慢。

在 X 看原帖 ↗
2218
测试 · @victormustar▲ 1.1K

测新大模型测到烦,管理成本越来越高了

同时测Kimi K3、Qwen3.8等一堆新模型,还要跑所有测试用例,现在已经需要专门的调度工具来管理上百个测试任务。

在用 Kimi K3、Qwen3.8 这类模型,我想把所有模型放到所有测试框架里测试,但现在管理起来已经变得非常困难……

我的工作流是用一个编排器(比如 Hermes 或 OpenClaw)管理数百个智能体会话,但它会丢失追踪,运行效果很差。

你们都在用什么工具?我认真考虑过搭建自己的控制流,可以接入现有智能体:

在 X 看原帖 ↗
1.1K5
观点 · @andrewbrown▲ 579

做AI智能体教学内容,要应对太多反对AI的声音

创作者分享AI智能体开发相关的教学内容,最大的困扰就是网上太多对AI持负面态度的人,处理这些负面评论让人头疼。

为智能体工程(Agent Engineering)创作教育科技内容的最大缺点是,对AI持否定态度的人数量太多,让人头疼不已。

在 X 看原帖 ↗
5793
行业动态 · Hacker News▲ 38

大模型根本不像编译器或电动工具?

有人提出了对大模型本质的新判断,对想理清AI定位的人来说,这个不同的视角值得参考。

社区讨论:多数评论不认同原帖观点,有人指出编译器本身存在未定义行为、结果非确定,电动工具实际使用也充满不确定性,原帖对类比对象的描述本身就不准确。也有人认为原帖作者漏算了机器学习优化编译、LLM驱动编译器这类当下研究方向,还有人反对将大模型拟人化,指出大模型只会做下一词预测,会产生人类不会犯的全新错误。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 60

大语言模型可以自己控制推理算力开销了

不用固定分配算力,需要深度推理的时候多分配,简单问题少分配,能降低推理成本

行业动态 · Hacker News▲ 282

月之暗面暂停新订阅,Kimi K3需求太火爆

热门AI产品需求超过承载能力,只能暂时停止接收新付费用户

社区讨论:多数用户认可Kimi K3在长上下文处理、代码审查等任务上的表现,不少人已经长期用它替代其他大模型处理工作。用户肯定月之暗面暂停新订阅、优先保障现有用户体验的做法,也有人提出也可以照搬Anthropic的方案,通过下调使用限额来控制压力。有试用者反馈当前模型负载过高,响应速度极慢,20美元套餐的额度也很快就会用完。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · OpenAI 开发者社区▲ 19

用Codex写代码烧了好多钱,问题出在哪?

不少人遇到过这种情况:大任务全量上下文喂给Codex,改完代码越改问题越多,最后花了不少钱,生成的结果还要重写。

我觉得这个社区里很多人都遇到过这种场景。一个超大的 AGENTS.md 文件,占满了全部上下文窗口,再加一段细节满满的提示词,还有一个宏大的目标。Codex 满怀信心开始干活:它探索仓库、制定计划、修改代码。

然后范围开始膨胀,它读了一堆不必要的文件,修复一个问题又带出另一个问题,到最后我们得到的结果成本很高,还得手动重写一部分。

很长一段时间里,我都觉得解决方案是给模型提供更多信息,还要更……

在社区看讨论 ↗
行业动态 · Hacker News▲ 61

OpenAI Codex正在快速耗损我们的设备

有开发者提到,Codex正在耗损日常使用的设备,这会直接增加使用AI工具的硬件成本

社区讨论:多数用户认为原帖没有实质有效信息,只是恐慌性猜测。有用户确认问题仅出现在图形界面版本,Linux用户和使用终端界面的用户不受影响,自己长期使用仅写入86TB,占SSD寿命写入限额的1%。有人补充OpenAI曾在6月22日的0.142.x版本修复该问题,但修复不彻底,仍有用户投诉,也有用户反馈GUI版会让笔记本风扇狂转、机身发烫。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · OpenAI 开发者社区▲ 15

OpenAI要办Codex开发周,面向全球开发者

7月13日启动,会举办四十余场活动,任何人都可以从零开始或者基于已有项目,用Codex实验新创意,提交项目参赛

OpenAI_Build_Week_16-9 3200×1800 491 KB

Build Week 是面向全球开发者、创作者、创始人和学生的全球性挑战赛,大家可以从7月13日开始,用 Codex 试验新想法并将它们落地,本次活动同期会举办超过40场活动。

参与者可以参加直播环节、参与社区活动,并将自己的项目提交到 OpenAI Build Week Challenge。

无论你是从零开始,还是基于现有项目开发,Build Week 都能给每个人提供学习的机会。

在社区看讨论 ↗
💡 深度观点
深度观点 · @levelsio▲ 2.6万

中美AI公司走了完全相反的两条路线

长期看美国AI公司会替代所有现有应用网站,中国头部开源AI模型正在直接对标美国闭源模型,打破技术壁垒,现在各方正在互相渗透竞争。

这一部分也非常有意思。

从长期来看,美国 AI 公司基本上会取代所有 app 和网站,你只需要向它们说出任何你需要的东西,它们就会完成/生成/制作出你要的内容。

与此同时,由中国政府主导的中国 AI 公司推出了开源模型,这些模型现在可以直接和美国的私有模型竞争,并且试图确保美国模型无法构建护城河。

所以现在是所有人都在互相蚕食。

在 X 看原帖 ↗
2.6万2120760
深度观点 · @omarsar0▲ 2.5K

年轻AI研究员别慌,AI给你留了位置

不少年轻研究者看到AI进步会迷茫,觉得自己的研究没有意义。AI带来的研究机会没有上限,它只是工具,研究者的直觉和积累能放大它的能力。

很多年轻研究者看到这类消息后会感到迷茫和绝望。有些人可能会想:「如果AI都能做这个,我现在做的事情还有什么意义?」

我向你保证,事实恰恰相反。AI开启的机遇是无穷无尽的。别让任何人或任何公司说服你相信别的说法。

AI是一款出色的工具。用它去探索更多,走得更深。同时并行探索多个想法。用它探索横跨多个领域的想法——这类研究本来极难开展,也极其耗时。

花时间和AI一起头脑风暴。用它提出有趣且独特的研究问题。出色的研究高度依赖研究问题的质量。用它找到更好的方式来传播科学和发现。

如果让我重新读一遍博士,我肯定会这么做。花时间思考你该如何利用这类工具,这很重要。现在就是做这件事的好时机。

AI必然会带来更多这类发现,但你的直觉和研究素养可以加速AI能实现的成果。

在 X 看原帖 ↗
2.5K3107
深度观点 · @omarsar0▲ 5.5K

构建AI智能体框架能挖到超额收益?

有人认为构建智能体框架存在巨大空间,RLM框架就是一个实例,有望带来更高效的模型泛化扩展新方式

强烈推荐。我一直说,构建智能体框架能带来巨大收益。事实证明,框架本身就是可组合的泛化工具。

RLM 框架就是这类实践的一个实例。

这有可能为模型规模化泛化带来有趣且高效的新路径。

在 X 看原帖 ↗
5.5K52530
深度观点 · @pmddomingos▲ 729

开源AI反而能在网络安全里占优势?

好人黑客比坏人黑客多,开源AI能帮好人在网络安全对抗中获得多人对一人的优势。

白帽黑客的数量远多于黑帽黑客,因此开源 AI 能让我们在网络安全中获得多对一的优势。

在 X 看原帖 ↗
72991
深度观点 · @burkov▲ 297

年底可能出现20T参数量的超大AI模型

超大模型越来越普遍,能跑它推理可能会成为最后一道壁垒,目前训练数据规模已经到十万亿词元级别

鉴于现在就连开放权重模型的参数都接近3T,而有传闻称Fable的参数规模达到了6T-8T,到今年年底我们可能就会见到参数规模达到20T甚至更大的模型。

能够运行这种巨型模型的推理,可能会是仅剩的唯一护城河。

另外,训练语料的规模也达到了数十万亿token量级,因此我们大致上每一个token对应一个浮点数,这应该足以无损失地容纳整个语料库。

在 X 看原帖 ↗
29727
深度观点 · @rseroter▲ 162

做AI不止堆模型,得把它做成能用的产品

谷歌云推出了成熟的对话式AI平台,供开发者在此基础上搭建产品。这说明业内开始更关注AI的落地整合,而非只比拼模型参数。

这不仅仅关乎模型本身,更在于你如何将它整合进实用的体验中。很高兴看到 @googlecloud 为客户提供了这样强大的“对话式AI”平台,可供客户在此基础上进行开发。

在 X 看原帖 ↗
16232
深度观点 · @Techmeme▲ 1.5K

中国开源大模型应该被欢迎,而非封禁

有人认为中国开源大模型是正当竞争者,应当受到欢迎,不该被封禁或视作威胁,开源本身就是成熟的商业策略

中国开源模型是正当的竞争者,应当受到欢迎,而非被封禁或被当成威胁,开源是一种存在已久的商业策略(@bgurley / 华盛顿邮报)

(前往 Techmeme dot com 获取链接和完整上下文!)

在 X 看原帖 ↗
1.5K15
深度观点 · @andrewarruda▲ 50

全球八成用开源工具的开发者都基于中国模型

对开源工具生态和全球技术格局感兴趣的人,可以重新认识中国AI模型的实际覆盖规模

事实:全球使用开源工具的开发者中,约 80% 基于中国模型进行开发。

在 X 看原帖 ↗
504
⚡ 实战经验
实战经验 · @LangChain▲ 9.3K

大公司已经用自托管AI搭出自升级助手了

Coinbase工程主管公开分享这套方案的搭建过程,想搭建自用AI工作流可以直接看完整分享找参考

在 Interrupt 大会上,@Coinbase 工程经理 Evan Kormos 上台分享了他们的开发者支持团队如何在自托管 LangSmith 之上搭建了一套自我改进的智能体系统。

完整演讲:

在 X 看原帖 ↗
9.3K53833
实战经验 · @reach_vb▲ 799

ChatGPT Work能在云端自动帮你跑任务?

可以从桌面或手机直接发起云端任务,调用已配置的插件跨现有工具工作,发起后能异步运行,做完再回来查看结果。

借助 ChatGPT Work,你可以直接从桌面端或移动端应用启动云端任务。

它能调用你配置好的插件,在你的代码仓库、文档、Slack 以及你已经在使用的其他工具之间协同工作。

我经常在手机上使用它:先交办一项任务,让它在云端异步运行,等工作完成后再回来查看结果。

在 X 看原帖 ↗
799171
实战经验 · @OpenAIDevs▲ 2.4万

用Codex清积压项目,这里有女性开发者灵感

积压了没做的开发项目,可以用Codex动手做了。整理好的开发灵感来自Women who Code(x)社区。

是时候从待办列表里翻出一个项目,用 Codex 把它做出来了。

这里有一些来自 Women who Code(x) 的创作灵感。

在 X 看原帖 ↗
2.4万1520227
📌 其他
工具产品 · @ericosiu▲ 234

现成能用的开源AI营销销售工作流免费领

不用写复杂提示词,拿到就能直接放进AI用,包含完整脚本、评分和分析模块。

大多数团队不需要更多提示词。他们需要的是真正能支撑业务运转的可复用AI能力。

这正是我们Single Grain正在使用的开源工具包:用Claude Code构建的16个可投入生产环境使用的AI营销与销售能力。

这些不是提示词模板。它们是集成了脚本、评分与分析的完整工作流,你可以直接放到你的AI里立刻开始使用。

获取方式:关注 + 转发这条推文,评论区留下“SKILLS”,我会通过私信给你发送我免费的开源AI能力工具包。

在 X 看原帖 ↗
234123
行业观点 · @rauchg▲ 5.0K

创业者rauchg提出AI带来的核心启示:万物皆代码

rauchg提出AI发展带来的启示,认为万事万物本质都是代码

AI给我们最重要的启示是:万物皆代码。

幻灯片演示文稿是代码。设计是代码。那个很酷的宣传视频?是代码。Excel自动化?是代码。宇宙?它可能也是由代码构成的。

在 X 看原帖 ↗
5.0K1413117
创业 · @levelsio▲ 4.8万

创业者看80多份创业项目申请:AI产出大多平庸缺乏突破

创业者浏览种子孵化项目申请,称当前AI产出多平庸缺突破性创新

阅读全文 →
4.8万30396169
产品发布 · @Alibaba_Qwen▲ 10.2万

阿里通义千问Qwen3.8最新预览版本已正式上线

阿里千问Qwen3.8预览版持续迭代,最新版现已上线

在预览阶段,Qwen3.8每日都在变得更强。最新版本现已上线,整体性能获得全面提升,在Web前端开发能力上更是迈进了一大步。

感谢所有人——大家对Qwen3.8-Max-Preview的反响让我们十分惊喜。🫶🫶

Qwen3.8目前仍在每日迭代更新。快来测试它,告诉我们哪些地方出了问题。

我们期待推出能力更强的正式版本,并且会为所有人开放权重。🚀🚀

在 X 看原帖 ↗
10.2万1192.0K153
开源 · @omarsar0▲ 1.1万

研究者 Omar Sharif 批驳针对开源AI的偏颇观点

Omar Sharif指出反开源AI的观点充满政治化私利,且认为否定开源的片面看法十分危险

那些目前涌现的、带有强烈政治化色彩、服务于私利的反开源AI立场,完全无视了这一点。 Omar Sharif承认,商业环境在变化,不确定性确实会令人不安。但回顾开源技术的发展历史就能发现,开源对科学进步和全人类的益处非常清晰。

所有这类对开源的简化片面看法都极其危险。关于开源对社会的影响,确实有很多重要问题需要讨论。但要推进相关讨论,必须依托准确平衡的视角,结合真实事实、数据和有依据的提案展开。

在 X 看原帖 ↗
1.1万4307
AI芯片 · @ns123abc▲ 1.1K

消息称谷歌正开发专为AI推理设计的定制芯片Frozen v2

因算力缺口过大,谷歌云已开始推掉业务,该芯片最早可在2028年部署

爆料消息称,谷歌正在开发一款专门用于AI推理的定制芯片,起因是当前算力缺口问题严重,谷歌云已经因此推掉了部分业务。

这款新芯片产品线被命名为Frozen v2,源自Jeff Dean的一项设计方案,最初方案提出将Gemini大模型的权重直接蚀刻在硅片上,Frozen v2则改为将Gemini整体架构直接硬编码进芯片内部。

该芯片的每瓦推理 Token 处理能力,比谷歌最新的推理用张量处理单元(TPU)高出10倍,也就是同样功耗下能处理10倍的文本Token。

DeepMind认为Transformer架构已经不会再发生大的演进,这款芯片的设计逻辑就是将模型本身直接固化为硬件,最早可在2028年投入部署。

在 X 看原帖 ↗
1.1K2328

📖 深度解读

精选文章的中文编辑重写 · 按更新时间排列

▲ Top
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部