AI Pulse
AI Pulse
说人话的 AI 情报站
2026 年 7 月 25 日 08:36 更新 00 信号0 主题
试试:
今日焦点

更小更便宜限制更少,Anthropic Opus 5模型发布

Anthropic发布了Opus 5,Opus系列的最新模型。它在多项基准测试中超过了Fable 5,体积更小,定价更低,使用限制也更宽松。对开发者来说,可以用更低的成本获得更好的性能——基于Anthropic模型的AI应用可能更便宜、响应更快。

Opus 5上线距离Opus 4.8仅两个月。Mythos 5、Fable 5和Sonnet 5都在6月发布,目前只有轻量级Haiku模型还没升级到5系列。

Anthropic强调,Opus 5验证自身工作和迭代修正的能力更强。在基准测试中,它曾根据一个不完整的提示,自己编写了完整的计算机视觉流水线。

阅读全文 →

🔥 信号雷达

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌

行业动态 · Hacker News▲ 144

云服务商Hetzner也要做大模型推理了

老牌欧洲云厂商入局大模型推理服务,想用大模型的人又多了一个选择

社区讨论:多数欧洲从业者看好这项业务,认为本土合规大模型推理服务商缺口很大,符合欧盟监管要求,能填补市场空白。有人认可这是明智布局,依托Hetzner高效的托管能力,有望拉小小型模型的推理成本,方便企业部署自有小模型。还有人猜测会形成新分工:美国出闭源模型、中国出开源权重模型、欧洲做高效推理服务。

也有用户质疑Hetzner此前反对加密挖矿,高负载大模型推理会不会定位冲突,还有人担心会带动全产品线涨价。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 391

OpenAI说AI变黑客,为什么大家都不信?

有超过三百位Hacker News读者支持这个观点,对OpenAI声称的 rogue hacker agent 说法保持怀疑。

社区讨论:多数人认为这是OpenAI的公关营销,有用户指出AI没解决预设的漏洞问题,OpenAI和Huggingface本身安全防护极差,事发后掩盖事实用来造势。有人反驳称,一口咬定是营销骗局本质是拒绝承认AI风险的自我麻痹,也有人提到,AI突破不安全的权限控制本来就是行业常见情况,不需要过度阴谋论。

在 HN 看讨论 ↗   原文 / 论文 ↗
产品发布 · @dotey▲ 5.1万

Anthropic降价卖更能打AI,价格直接砍半

刚发布的Claude Opus 5定价和上一代一样,性能接近自家最强的Fable 5,价格只要它的一半

阅读全文 →
5.1万65123
行业动态 · Hacker News▲ 1.2K

Claude Opus 5 悄悄放出来系统卡了

最新版本的 Claude 已经流出官方文档,想提前尝鲜的人可以先蹲进展

https://www.anthropic.com/claude-opus-5-system-card

社区讨论:多数开发者疑惑Anthropic推出能力不超过现有Fable 5的Opus 5的意义,有人不满长文档介绍几个月就会被替代的模型属于无效噪声,也有人点出核心价值:Opus 5没有Fable 5的30天数据留存要求,还对所有访问层级开放了源码漏洞发现功能,支持防御性网络安全工作。有开发者测试发现Opus 5图像转HTML的准确率比Fable更高,也有企业用户反映Anthropic现有基础设施近期故障频发,正考虑放弃订阅。

在 HN 看讨论 ↗   原文 / 论文 ↗
代码生成 · @blackanger▲ 1.3万

你敢信?这俩AI写代码已经超过5年程序员了

有人说自己不看跑分,只谈使用体感,GPT 5.6 Sol 和 Claude Fable 5 闭着眼用就能超过五年经验开发者,用得好能追得上十年经验

我从来不关注什么大模型跑分, 说白了,我也不关注任何跑分, 单从我的使用体感来说, GPT 5.6 Sol 和 Claude Fable 5 这俩模型, 你闭着眼用, 现在至少已经超过 5 年开发经验的程序员。 但你如果用得好, 比肩 10 年开发经验的程序员也不是没有可能。

在 X 看原帖 ↗
1.3万8212
新品发布 · @MaxForAI▲ 1.4万

高端大模型降价一半,性能只降了0.5%

做高强度日常AI工作,现在能花一半钱拿到接近顶级模型的效果,还能自己造工具补全环境缺口,完成需要的任务

阅读全文 →
1.4万46016
深度观点 · @WallStreet0Name▲ 2.9万

黄仁勋首次发X,呼吁放开AI开放权重

黄仁勋首条X推文提出六点主张,支持开放权重AI生态,影响未来AI监管规则走向,关系每个用AI的人

阅读全文 →
2.9万77820
深度观点 · @gdb▲ 7.0万

ChatGPT还没被挖透,AI能力核心在这

目前大家才刚开始摸索ChatGPT的用法,要让AI帮人过上更好生活,智能体能力会是其中的核心部分。

人们至今也才刚摸到 ChatGPT 工作方式应用边界的皮毛。

我们希望 AI 能赋能人们过上更好的生活,并且相信智能体能力将成为实现这一目标的核心部分。

在 X 看原帖 ↗
7.0万43717110
深度观点 · @miramurati▲ 21.2万

让AI好用的知识不在一处,所以AI也得分散开

有用的AI知识分散在不同从业者和不同企业手中,要整合这些知识,AI本身也得采用分布式架构,这是值得探索的未来方向

让AI具备实用性的知识是分散的。它存在于科学家、工程师、临床医生和企业之中。

要让AI从这种分布式知识中获益,AI本身就必须是分布式的。

我同意Jensen的观点,这是一个值得去建设的未来。

在 X 看原帖 ↗
21.2万1951.6K125
工具产品 · @laobaishare▲ 2.1万

给中文内容创作者整理了10个免费实用写作工具

从改稿、找选题到整配图、拆内容分发,全流程都覆盖,不用再挨个找工具凑工作流。

阅读全文 →
2.1万143456502
实战经验 · @alexalbert__▲ 2.7万

Opus 5模型发布,开发者说比Fable 5好用

参与开发的人员分享了自己的使用偏好,在不少编码任务中,他更愿意用这款新发布的模型。

这是我最喜欢的几张来自Opus 5发布的图表。

我们投入了大量工作,让这个模型在各个领域都能实现token效率,同时还提升了智能水平。

它用起来手感非常顺滑,在很多编码任务上我都更喜欢用它,而非Fable 5。

在 X 看原帖 ↗
2.7万1742140
软件开发 · @dotey▲ 21.0万

《Clean Code》作者鲍勃大叔公开其AI代码使用实践

鲍勃大叔称自己不看AI生成代码,靠测试和指标管控代码质量

阅读全文 →
21.0万2461.7K2.0K
国内行业动态 · @Jiaxi_Cui▲ 2.1万

国内大厂集体重启AI,创业公司要遭殃了?

字节早早搭好了三角架构,腾讯也靠WorkBuddy入场,用高返佣加地推抢高流水应用市场,预计明年阿里和美团也会跟进

阅读全文 →
2.1万108942
行业观点 · @SupFin▲ 7.9K

美国怕中国开源大模型,居然不是因为技术

美国AI公司画了1.5万亿美元的AI基建蓝图,骗得产业链提前投了钱,一旦中国开源模型抢走市场,这些投资的泡沫就会破

为什么美国越来越担心中国开源大模型?因为现在AI行业最大的风险,已经不是技术,而是金融。OpenAI、Anthropic等公司,向市场描绘了一个价值超过1.5万亿美元的AI基建蓝图,大量芯片厂商、数据中心和投资机构也因此提前投入资金。

但些融资能否成立,取决于市场是否相信这些AI公司有能力兑现承诺。一旦中国开源模型抢走大量市场,美国AI公司的增长、估值和融资能力受到怀疑,那1.5万亿美元的采购承诺也会变得不再可信,整条产业链上的资产都会被重新定价。资本预期一旦落空,将会演变成一场覆盖整个科技行业的资产暴跌?

在 X 看原帖 ↗
7.9K53118
开源 · @crypto_oldk▲ 4.3K

花100美元用笔记本,就能复刻对冲基金交易工具

整理了10个免费GitHub开源工具,300多家对冲基金已经在用,包含免费替代彭博终端的OpenBB,能回测25年数据的算法引擎

阅读全文 →
4.3K155157
垂直领域 · @omarsar0▲ 4.8K

专门做住宅建筑的垂直AI,通用大模型还搞不定

有人发现handoffai的H1,只解决住宅建筑领域的特定工作流程,这是通用大模型至今还做不好的事

我遇到了 @handoffai 推出的 H1,它是垂直领域人工智能解决通用模型仍然难以处理的工作流的一个很好案例。

H1 专门为住宅建筑蓝图设计。它可以分析完整的图纸集,从原始 PDF 中自动生成工程量材料清单。

除模型之外,Handoff 还发布了一份行业基准测试结果,显示 H1 准确率达到 81.6%,表现领先于经验丰富的估算师,也远高于他们评估的前沿模型。

如果你对专业人工智能系统感兴趣,值得去看看。更多详情:#广告

在 X 看原帖 ↗
4.8K22014
工具 · @minchoi▲ 1.2万

Codex现在支持实时语音聊代码了,像跟同事说话一样

可以对着编程AI语音对话,中途能打断它,说完让它自己去写代码

Codex 刚刚推出了实时语音模式。你可以像和同事交流一样和你的编码代理对话。

直接和它们说话。打断它们说话。派它们去干活。

在 X 看原帖 ↗
1.2万6419
前沿研究 · @jiqizhixin▲ 290

AI智能体下一个方向,能处理长期复杂任务了

这篇综述梳理了AI智能体领域,提出长周期智能体是下一个前沿,给出了统一研究框架和领域路线图。

很棒的综述!《走向长视界智能体:一份综述》全面概述了长视界智能体领域。

该综述提出,AI智能体的下一个前沿是超越简单的单轮任务,转向能够在长视界下规划、与真实环境交互、从故障中恢复,并在执行过程中调整策略的系统。

它引入了一个围绕以下二者共同演化构建的统一框架:🧩 外置 harness 🧠 内化优化

本文从六个视角梳理了整个领域:基础、演化、Harness、优化、应用与前沿。

对于理解如何构建有能力、可靠且真正自主的长视界智能体,这是一份很有价值的路线图。

在 X 看原帖 ↗
290222
深度观点 · @itsolelehmann▲ 1.3K

中美顶尖AI实验室路线完全相反,差这么多?

列出DeepSeek与OpenAI/Anthropic完全相反的发展策略,两种路线走下来,最终谁能拿到领先位置还不确定。

这篇阅读材料非常引人入胜,中美前沿实验室的理念截然不同:

> DeepSeek:将最强模型以开放权重发布
>
> OpenAI / Anthropic:将最强模型锁在受控访问权限之后

DeepSeek:主动帮助竞争对手部署自己的最强模型

OpenAI / Anthropic:主动阻止竞争对手复制自己的最强模型

DeepSeek:打造核心模型,然后让合作伙伴开发大部分应用

OpenAI / Anthropic:打造核心模型,然后自己开发应用

DeepSeek:让模型足够高效,以克服算力稀缺问题

OpenAI / Anthropic:让算力足够充裕,以扩展更大的模型

DeepSeek:打破Nvidia的CUDA壁垒,让中国芯片能够迎头赶上

OpenAI / Anthropic:收紧出口管制,让中国实验室保持落后

DeepSeek:只有解决了持续学习问题,递归自我改进才能启动

OpenAI / Anthropic:递归自我改进已经在当下的模型中启动

DeepSeek:认为前沿领导权会不断易手

OpenAI / Anthropic:竞相将当下的领先转化为长期优势

在 X 看原帖 ↗
1.3K271
实战经验 · @LangChain▲ 5.0K

顶级资管给数百投资人配了AI分析师

原本需要耗时数小时的深度调研,现在几分钟就能完成,帮投资人省出大量时间处理更核心的工作。

在 Interrupt 大会上,@Bridgewater 团队分享了他们是如何打造 AIA Pocket Analyst Tool(PAT)的。

PAT 是部署给数百名投资者使用的内部 AI 分析师,它依托 Bridgewater 的专有数据、研究方法和专业投资者反馈,能在数分钟内完成长达数小时的深度探索性研究。

PAT 是 AIA 的组成部分,而 AIA 正是 Bridgewater 的人工智能投资者。你可以观看主题演讲,了解他们的打造过程:

在 X 看原帖 ↗
5.0K3198
工具产品 · @yibie▲ 3.3K

给编码AI做的长程循环模板,不用全靠Prompt堆了

做复杂多步编码任务时,可以直接复用这套标准化工作流,状态存在本地磁盘,验收不通过会自动重启,不用手动反复跟进

阅读全文 →
3.3K74257
深度观点 · @AravSrinivas▲ 5.5K

Perplexity和英伟达联名支持开放权重AI

开放权重能促进行业竞争,让AI的收益更分散,不会集中在少数主体手中

“开放权重会强化竞争,而竞争才能让 AI 的收益被广泛共享,而非集中在少数人手中”。

我们在 @perplexity_ai 坚信这一点,我们正和 @nvidia 共同签署这封公开信。

感谢 @a16z 牵头组织了这件事!

在 X 看原帖 ↗
5.5K9824
前沿研究 · @LightOnIO▲ 110

多向量晚交互检索,解决长文档处理痛点

专为长上下文、长文档和未微调领域的检索需求设计,提升泛化表现,现有完整公开讲座可学习

你只需要多向量!更好的泛化能力。对长上下文支持更好。对长文档支持更好。

这就是延迟交互:每个 token 对应一个表征,而不是把整篇文档压缩成一个单点。

智能体扔给检索系统的所有问题:更长的查询、更长的输入、没有人微调过的领域,都正好是它设计用来解决的场景。

@AmelieTabatta 在 @softwaredoug 和 @treygrainger 的 AI-Powered Search 课程里用一整节课讲清了整个领域。这是目前这个领域最接近领域指南的内容。🔗 完整课程:

在 X 看原帖 ↗
110362
新品发布 · @vipulved▲ 227

针对企业核心业务的全新AI推理平台上线了

团队根据企业和原生AI团队使用开源、自定义模型的实际需求,从零重写了这套推理平台,现在已经可以使用。

很高兴向大家介绍我们全新的推理平台。我们从头开始重写了整个平台,构建基础来自原生 AI 公司和企业如何在关键生产任务中使用开源和自定义模型的经验总结。

目前平台已经上线,可供使用!

在 X 看原帖 ↗
227171
工具产品 · @AISuperDomain▲ 5.6K

AI写代码乱堆?这个工具给它加上了工程纪律

折腾AI编程的人,能靠它约束AI Coding Agent按流程思考执行,不用一开始就乱写代码,支持多款主流Agent工具。

🚀发现一个很适合 AI 编程工作流的项目:OpenSpec Plus。

它不是替代 OpenSpec,而是在 Spec-Driven Development 里加了一层“工程纪律”: 从需求发现、可测试规格、设计决策、任务拆分,到执行验证和 TDD,全流程约束 AI Coding Agent 不要一上来就乱写代码。

支持 Claude Code、OpenCode、Cursor、GitHub Copilot 等主流 Agent。

简单说: OpenSpec 负责定义流程,OpenSpec Plus 负责让 Agent 真正按流程思考和执行。

对正在折腾 AI 编程、Spec 驱动开发、Agent 工作流的人,很值得看看。

在 X 看原帖 ↗
5.6K116176
新品发布 · @RoundtableSpace▲ 8.5K

腾讯HY 3.0免费可用,性能对标GLM-5.1

想搭建AI智能体工作流,不用再付费买大模型,这个免费开源模型就能达到付费级性能。

Tencent HY 3.0 现已在 OpenRouter 免费开放,它是专门为智能体工作流构建的,支持稳定工具调用、256K 上下文、多种推理模式。

它在 SWE-Bench Verified 上得分 78.0,在 Terminal-Bench 2.1 得分 71.7。

目前大多数运行智能体的免费模型都是 20B 级别。这个模型能以 0 美元的成本和 GLM-5.1 竞争。

在 X 看原帖 ↗
8.5K1114
行业动态 · @ElevenLabs▲ 4.1K

语音AI公司说,语音AI能帮保卫民主选举

接下来有多场大型选举,这家做语音AI的公司发文讲,他们准备用自家技术守护选举进程

Voice AI 可以成为推动民主的强大工具。

随着多场重要选举临近,我们的最新博客阐述了我们将如何利用自身技术,强化并保护民主进程。

在 X 看原帖 ↗
4.1K293
新品发布 · @berryxia▲ 1.2万

能控制电脑干活的免费开源AI,现在就能本地跑

之前能可靠操作电脑的自动化工具要么大,要么贵,要么闭源。现在中等规模的开源模型就能处理真实网页任务,可以省掉付费RPA的钱。

兄弟们,可以退掉自己的RPA了!这个本地模型电脑操作Agent 岂不是搞起来美滋滋啊!不花一分钱😂 Microsoft扔出了一个27B的电脑操作Agent。

Fara1.5-27B基于Qwen3.5架构,能看图像、读文字,并像人一样控制电脑。它专门面向computer-use场景:浏览网页、填表单、从截图提取数据、点击按钮,把视觉和文本理解结合成真正能干活的数字助手。27B这个体量已经能做实用的网页自动化,对本地部署和自托管来说门槛不算高。

以前能可靠操作电脑的模型往往很大、很贵或者闭源,现在一个中等规模的��源模型就能上手处理真实网页任务。地址见评论区 👇

在 X 看原帖 ↗
1.2万14102153
前沿研究 · @omarsar0▲ 3.1K

AI代理跑崩,问题根本不是推理而是上下文

帮你理清token成本到底花在了哪里,现在大规模生产AI代理,开始把上下文管理当成头等问题了

阅读全文 →
3.1K62544
AI工具 · @shengzheyao

Antigravity CLI 1.1.6更新 支持用Markdown定义自定义智能体

开发者shengzheyao发布工具更新,新增多项功能,还分享了代码审查智能体示例

自定义智能体现在仅需Markdown即可创建。在Antigravity CLI 1.1.6版本中,用户可以通过路径~/.gemini/config/agents/<智能体名称>/agent.md文件定义智能体,文件包含YAML前置元数据和Markdown格式的提示词。

这种方式便于对智能体进行版本管理、审阅和分享。

本次更新还新增了三项功能:调取前序第n条回复的/copy <n>命令、流式代码搜索,以及改进了文本用户界面(TUI)和工具稳定性。

可以通过agy命令更新工具,也可访问链接获取更多信息。

开发者分享了一个简单的代码审查智能体示例,输入/agents命令即可激活,更多示例将在后续推出。该示例文件的YAML元数据设置智能体名称为code-reviewer,功能为分析git差异并给出简洁代码改进建议。

文件的正文部分为系统指令,设定智能体为专项代码审查者,核心目标是分析git差异并给出代码改进建议,明确了三项职责:分析git diff、从可读性、性能与安全维度审代码、提供附带修改前后代码示例的可操作反馈。

在 X 看原帖 ↗
AI开发工具 · @orca_build

Orca推出跨编码AI会话断点续传功能

用户在Codex或Claude Code中碰到使用限额中断时,可一键切换到另一代理恢复完整会话

如果在使用Codex或Claude Code时,任务进行到一半就碰到了使用限额,工作会被迫中断。Orca推出新功能可以解决这个问题。

用户只需点击一次,就能在不同的AI代理框架中恢复完全一致的会话。

该功能支持Codex与Claude Code之间互相切换,并且可以完整保留全部会话上下文。

在 X 看原帖 ↗
AI开发 · @viktoroddy

博主分享Claude Code+Fable 5打造电影感网站教程

开发者viktoroddy发布教程,介绍怎么用Fable 5 AI搭建出不像AI生成的电影风网站,还公开了所有提示词

开发者viktoroddy在𝕏发文称,结合Claude Code与Fable 5,能够设计出质感类似电影的网站。

他刚刚录制了一份教程,讲解如何使用Fable 5 AI搭建出不像AI生成的电影感网站,教程链接已经公开。

这份教程用到的所有提示词也已对外放出,提供了两个下载链接供用户获取。

在 X 看原帖 ↗
开源大模型 · @itsaflecha

企业将按需本地推理转为常启本地推理,迁移至GLM 5.2

租用GPU后企业全面使用GLM 5.2,称其达到Claude Opus质量且成本远低于闭源大模型

企业已经把按需调用的本地推理,改为持续运行的本地推理模式。企业租用GPU后,全体人员已将GLM 5.2作为首要使用的大模型迁移完成。

GLM 5.2可达到Claude Opus的输出质量,同时成本可确定。其成本仅为OpenAI和Anthropic闭源模型的很小一部分。

想要阻止全球企业转向开源大模型,唯一可能是美国政府出台禁令禁止开源模型。但即便禁令出台,也只会推高美国本土企业的成本,世界其他地区仍会继续迁移到开源大模型。

在 X 看原帖 ↗
教育科技 · @mattshumer_

开发者用Opus 5开发新型实时AI家教原型

为AlphaSchool开发的原型结合大模型能力与定制小模型实现实时交互渲染

开发者mattshumer_正使用Opus 5,为AlphaSchool开发一款全新的实时AI家教原型。Opus 5在后台支撑对话与方向引导功能。

该原型搭配一个定制训练的类小型世界模型,担任实时渲染器和交互层。它和典型的基于像素的世界模型概念相近但并不完全相同,画面清晰度比常规方案更高。

目前原型仍较为粗糙,但已经呈现出超出预期的效果。构思和训练这个模型的过程很有乐趣,后续会择机分享更多进展。

在 X 看原帖 ↗
提示工程 · @AYi_AInotes▲ 207

Anthropic缩减Claude Code系统提示80% 模型性能反而更好

传统提示词工程的堆规则、塞示例方法已过时,新范式转向轻量精准的上下文工程

AI开发 · @tualatrix▲ 1.1万

开发者用GPT结对学习开发SwiftUI优化性能

开发者将技术方案交给GPT做基准测试验证,再决策是否采纳方案

开发者最近和GPT结对,深入学习开发SwiftUI。

开发者把自己的技术方案交给GPT,让它完成基准测试(Benchmark)和验证工作,拿到结果后再决策是否正式采纳方案。

借助这种方式,优化性能的过程变得轻松愉快,开发者对SwiftUI的抵触感也有所降低。

在 X 看原帖 ↗
1.1万3121
AI编程 · @Xudong07452910▲ 4.9K

Anthropic推出Claude Code Skills 将人工检查转为自动验证

该方法可将代码验收环节自动化,支持自定义团队代码规范作为固定流程

阅读全文 →
4.9K55775
学习 · @crypto_oldk▲ 2.6万

ChatGPT隐藏模式“无限私教”的8个实用提示词分享

分享ChatGPT“无限私教”隐藏模式的8个实用提示词

阅读全文 →
2.6万79794
AI智能体 · @luoling8192▲ 1.4万

开发者求问是否存在派生多模型子智能体的工具

开发者希望能派生多模型子智能体完成代码审查,求问现有工具

我想要有一个大的 agent,能够帮我派生出「不同模型」的 sub agent,让他们各自去调研或者是 review 我的代码,最后能够整合在一起。有没有这样的软件呢?

当我想要知道不同模型对同一个问题的看法时,我通常会把提示词复制一份贴给另外一个模型。如果有 hand off 的话可能会更好

在 X 看原帖 ↗
1.4万3727
AI开发 · @huangyun_122▲ 2.3万

开发者亲测Codex+Claude Code可自主完成开发任务

普通开发者实测双AI协作可独立完成项目开发,称AI可替代普通开发

x,我已无语。首次意识到,Codex + Claude Code 已经可以完全替代我这样资质平庸的程序员了 我让 Codex 出了一版 BitBrowser 多代理池 + yt-dlp 替我自动挖掘 Youtube AI KOL 的监控系统 Claude 去 Review Codex 的执行计划,提出了若干重大缺陷。而 Codex 尝试修复,又反向纠错 Claude. 几个回合下来,虽然有 md 做记录,但没完没了 于是我直接给 Codex 下任务:你去主导吧,做好来回沟通存档,启用母子 Agent, 直到任务完成 20分钟回来,他俩 sign off agreement 了 之前我一直以我的视角去约束,去左右AI Agent 的思考空间,没想到让他们放飞自我,可以跑更远。

我恰恰是那个阻碍他们的瓶颈

在 X 看原帖 ↗
2.3万1299170
🔬 前沿研究
前沿研究 · @omarsar0▲ 3.1K

AI代理跑崩,问题根本不是推理而是上下文

帮你理清token成本到底花在了哪里,现在大规模生产AI代理,开始把上下文管理当成头等问题了

阅读全文 →
3.1K62544
前沿研究 · @LightOnIO▲ 110

多向量晚交互检索,解决长文档处理痛点

专为长上下文、长文档和未微调领域的检索需求设计,提升泛化表现,现有完整公开讲座可学习

你只需要多向量!更好的泛化能力。对长上下文支持更好。对长文档支持更好。

这就是延迟交互:每个 token 对应一个表征,而不是把整篇文档压缩成一个单点。

智能体扔给检索系统的所有问题:更长的查询、更长的输入、没有人微调过的领域,都正好是它设计用来解决的场景。

@AmelieTabatta 在 @softwaredoug 和 @treygrainger 的 AI-Powered Search 课程里用一整节课讲清了整个领域。这是目前这个领域最接近领域指南的内容。🔗 完整课程:

在 X 看原帖 ↗
110362
前沿研究 · @jiqizhixin▲ 290

AI智能体下一个方向,能处理长期复杂任务了

这篇综述梳理了AI智能体领域,提出长周期智能体是下一个前沿,给出了统一研究框架和领域路线图。

很棒的综述!《走向长视界智能体:一份综述》全面概述了长视界智能体领域。

该综述提出,AI智能体的下一个前沿是超越简单的单轮任务,转向能够在长视界下规划、与真实环境交互、从故障中恢复,并在执行过程中调整策略的系统。

它引入了一个围绕以下二者共同演化构建的统一框架:🧩 外置 harness 🧠 内化优化

本文从六个视角梳理了整个领域:基础、演化、Harness、优化、应用与前沿。

对于理解如何构建有能力、可靠且真正自主的长视界智能体,这是一份很有价值的路线图。

在 X 看原帖 ↗
290222
🚀 新品发布
新品发布 · @berryxia▲ 1.2万

能控制电脑干活的免费开源AI,现在就能本地跑

之前能可靠操作电脑的自动化工具要么大,要么贵,要么闭源。现在中等规模的开源模型就能处理真实网页任务,可以省掉付费RPA的钱。

兄弟们,可以退掉自己的RPA了!这个本地模型电脑操作Agent 岂不是搞起来美滋滋啊!不花一分钱😂 Microsoft扔出了一个27B的电脑操作Agent。

Fara1.5-27B基于Qwen3.5架构,能看图像、读文字,并像人一样控制电脑。它专门面向computer-use场景:浏览网页、填表单、从截图提取数据、点击按钮,把视觉和文本理解结合成真正能干活的数字助手。27B这个体量已经能做实用的网页自动化,对本地部署和自托管来说门槛不算高。

以前能可靠操作电脑的模型往往很大、很贵或者闭源,现在一个中等规模的��源模型就能上手处理真实网页任务。地址见评论区 👇

在 X 看原帖 ↗
1.2万14102153
新品发布 · @RoundtableSpace▲ 8.5K

腾讯HY 3.0免费可用,性能对标GLM-5.1

想搭建AI智能体工作流,不用再付费买大模型,这个免费开源模型就能达到付费级性能。

Tencent HY 3.0 现已在 OpenRouter 免费开放,它是专门为智能体工作流构建的,支持稳定工具调用、256K 上下文、多种推理模式。

它在 SWE-Bench Verified 上得分 78.0,在 Terminal-Bench 2.1 得分 71.7。

目前大多数运行智能体的免费模型都是 20B 级别。这个模型能以 0 美元的成本和 GLM-5.1 竞争。

在 X 看原帖 ↗
8.5K1114
新品发布 · @vipulved▲ 227

针对企业核心业务的全新AI推理平台上线了

团队根据企业和原生AI团队使用开源、自定义模型的实际需求,从零重写了这套推理平台,现在已经可以使用。

很高兴向大家介绍我们全新的推理平台。我们从头开始重写了整个平台,构建基础来自原生 AI 公司和企业如何在关键生产任务中使用开源和自定义模型的经验总结。

目前平台已经上线,可供使用!

在 X 看原帖 ↗
227171
新品发布 · @MaxForAI▲ 1.4万

高端大模型降价一半,性能只降了0.5%

做高强度日常AI工作,现在能花一半钱拿到接近顶级模型的效果,还能自己造工具补全环境缺口,完成需要的任务

阅读全文 →
1.4万46016
📰 行业动态
行业动态 · @ElevenLabs▲ 4.1K

语音AI公司说,语音AI能帮保卫民主选举

接下来有多场大型选举,这家做语音AI的公司发文讲,他们准备用自家技术守护选举进程

Voice AI 可以成为推动民主的强大工具。

随着多场重要选举临近,我们的最新博客阐述了我们将如何利用自身技术,强化并保护民主进程。

在 X 看原帖 ↗
4.1K293
国内行业动态 · @Jiaxi_Cui▲ 2.1万

国内大厂集体重启AI,创业公司要遭殃了?

字节早早搭好了三角架构,腾讯也靠WorkBuddy入场,用高返佣加地推抢高流水应用市场,预计明年阿里和美团也会跟进

阅读全文 →
2.1万108942
代码生成 · @blackanger▲ 1.3万

你敢信?这俩AI写代码已经超过5年程序员了

有人说自己不看跑分,只谈使用体感,GPT 5.6 Sol 和 Claude Fable 5 闭着眼用就能超过五年经验开发者,用得好能追得上十年经验

我从来不关注什么大模型跑分, 说白了,我也不关注任何跑分, 单从我的使用体感来说, GPT 5.6 Sol 和 Claude Fable 5 这俩模型, 你闭着眼用, 现在至少已经超过 5 年开发经验的程序员。 但你如果用得好, 比肩 10 年开发经验的程序员也不是没有可能。

在 X 看原帖 ↗
1.3万8212
产品发布 · @dotey▲ 5.1万

Anthropic降价卖更能打AI,价格直接砍半

刚发布的Claude Opus 5定价和上一代一样,性能接近自家最强的Fable 5,价格只要它的一半

阅读全文 →
5.1万65123
行业观点 · @SupFin▲ 7.9K

美国怕中国开源大模型,居然不是因为技术

美国AI公司画了1.5万亿美元的AI基建蓝图,骗得产业链提前投了钱,一旦中国开源模型抢走市场,这些投资的泡沫就会破

为什么美国越来越担心中国开源大模型?因为现在AI行业最大的风险,已经不是技术,而是金融。OpenAI、Anthropic等公司,向市场描绘了一个价值超过1.5万亿美元的AI基建蓝图,大量芯片厂商、数据中心和投资机构也因此提前投入资金。

但些融资能否成立,取决于市场是否相信这些AI公司有能力兑现承诺。一旦中国开源模型抢走大量市场,美国AI公司的增长、估值和融资能力受到怀疑,那1.5万亿美元的采购承诺也会变得不再可信,整条产业链上的资产都会被重新定价。资本预期一旦落空,将会演变成一场覆盖整个科技行业的资产暴跌?

在 X 看原帖 ↗
7.9K53118
开源 · @crypto_oldk▲ 4.3K

花100美元用笔记本,就能复刻对冲基金交易工具

整理了10个免费GitHub开源工具,300多家对冲基金已经在用,包含免费替代彭博终端的OpenBB,能回测25年数据的算法引擎

阅读全文 →
4.3K155157
垂直领域 · @omarsar0▲ 4.8K

专门做住宅建筑的垂直AI,通用大模型还搞不定

有人发现handoffai的H1,只解决住宅建筑领域的特定工作流程,这是通用大模型至今还做不好的事

我遇到了 @handoffai 推出的 H1,它是垂直领域人工智能解决通用模型仍然难以处理的工作流的一个很好案例。

H1 专门为住宅建筑蓝图设计。它可以分析完整的图纸集,从原始 PDF 中自动生成工程量材料清单。

除模型之外,Handoff 还发布了一份行业基准测试结果,显示 H1 准确率达到 81.6%,表现领先于经验丰富的估算师,也远高于他们评估的前沿模型。

如果你对专业人工智能系统感兴趣,值得去看看。更多详情:#广告

在 X 看原帖 ↗
4.8K22014
工具 · @minchoi▲ 1.2万

Codex现在支持实时语音聊代码了,像跟同事说话一样

可以对着编程AI语音对话,中途能打断它,说完让它自己去写代码

Codex 刚刚推出了实时语音模式。你可以像和同事交流一样和你的编码代理对话。

直接和它们说话。打断它们说话。派它们去干活。

在 X 看原帖 ↗
1.2万6419
行业动态 · Hacker News▲ 1.2K

Claude Opus 5 悄悄放出来系统卡了

最新版本的 Claude 已经流出官方文档,想提前尝鲜的人可以先蹲进展

https://www.anthropic.com/claude-opus-5-system-card

社区讨论:多数开发者疑惑Anthropic推出能力不超过现有Fable 5的Opus 5的意义,有人不满长文档介绍几个月就会被替代的模型属于无效噪声,也有人点出核心价值:Opus 5没有Fable 5的30天数据留存要求,还对所有访问层级开放了源码漏洞发现功能,支持防御性网络安全工作。有开发者测试发现Opus 5图像转HTML的准确率比Fable更高,也有企业用户反映Anthropic现有基础设施近期故障频发,正考虑放弃订阅。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 391

OpenAI说AI变黑客,为什么大家都不信?

有超过三百位Hacker News读者支持这个观点,对OpenAI声称的 rogue hacker agent 说法保持怀疑。

社区讨论:多数人认为这是OpenAI的公关营销,有用户指出AI没解决预设的漏洞问题,OpenAI和Huggingface本身安全防护极差,事发后掩盖事实用来造势。有人反驳称,一口咬定是营销骗局本质是拒绝承认AI风险的自我麻痹,也有人提到,AI突破不安全的权限控制本来就是行业常见情况,不需要过度阴谋论。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 144

云服务商Hetzner也要做大模型推理了

老牌欧洲云厂商入局大模型推理服务,想用大模型的人又多了一个选择

社区讨论:多数欧洲从业者看好这项业务,认为本土合规大模型推理服务商缺口很大,符合欧盟监管要求,能填补市场空白。有人认可这是明智布局,依托Hetzner高效的托管能力,有望拉小小型模型的推理成本,方便企业部署自有小模型。还有人猜测会形成新分工:美国出闭源模型、中国出开源权重模型、欧洲做高效推理服务。

也有用户质疑Hetzner此前反对加密挖矿,高负载大模型推理会不会定位冲突,还有人担心会带动全产品线涨价。

在 HN 看讨论 ↗   原文 / 论文 ↗
💡 深度观点
深度观点 · @miramurati▲ 21.2万

让AI好用的知识不在一处,所以AI也得分散开

有用的AI知识分散在不同从业者和不同企业手中,要整合这些知识,AI本身也得采用分布式架构,这是值得探索的未来方向

让AI具备实用性的知识是分散的。它存在于科学家、工程师、临床医生和企业之中。

要让AI从这种分布式知识中获益,AI本身就必须是分布式的。

我同意Jensen的观点,这是一个值得去建设的未来。

在 X 看原帖 ↗
21.2万1951.6K125
深度观点 · @gdb▲ 7.0万

ChatGPT还没被挖透,AI能力核心在这

目前大家才刚开始摸索ChatGPT的用法,要让AI帮人过上更好生活,智能体能力会是其中的核心部分。

人们至今也才刚摸到 ChatGPT 工作方式应用边界的皮毛。

我们希望 AI 能赋能人们过上更好的生活,并且相信智能体能力将成为实现这一目标的核心部分。

在 X 看原帖 ↗
7.0万43717110
深度观点 · @AravSrinivas▲ 5.5K

Perplexity和英伟达联名支持开放权重AI

开放权重能促进行业竞争,让AI的收益更分散,不会集中在少数主体手中

“开放权重会强化竞争,而竞争才能让 AI 的收益被广泛共享,而非集中在少数人手中”。

我们在 @perplexity_ai 坚信这一点,我们正和 @nvidia 共同签署这封公开信。

感谢 @a16z 牵头组织了这件事!

在 X 看原帖 ↗
5.5K9824
深度观点 · @WallStreet0Name▲ 2.9万

黄仁勋首次发X,呼吁放开AI开放权重

黄仁勋首条X推文提出六点主张,支持开放权重AI生态,影响未来AI监管规则走向,关系每个用AI的人

阅读全文 →
2.9万77820
深度观点 · @itsolelehmann▲ 1.3K

中美顶尖AI实验室路线完全相反,差这么多?

列出DeepSeek与OpenAI/Anthropic完全相反的发展策略,两种路线走下来,最终谁能拿到领先位置还不确定。

这篇阅读材料非常引人入胜,中美前沿实验室的理念截然不同:

> DeepSeek:将最强模型以开放权重发布
>
> OpenAI / Anthropic:将最强模型锁在受控访问权限之后

DeepSeek:主动帮助竞争对手部署自己的最强模型

OpenAI / Anthropic:主动阻止竞争对手复制自己的最强模型

DeepSeek:打造核心模型,然后让合作伙伴开发大部分应用

OpenAI / Anthropic:打造核心模型,然后自己开发应用

DeepSeek:让模型足够高效,以克服算力稀缺问题

OpenAI / Anthropic:让算力足够充裕,以扩展更大的模型

DeepSeek:打破Nvidia的CUDA壁垒,让中国芯片能够迎头赶上

OpenAI / Anthropic:收紧出口管制,让中国实验室保持落后

DeepSeek:只有解决了持续学习问题,递归自我改进才能启动

OpenAI / Anthropic:递归自我改进已经在当下的模型中启动

DeepSeek:认为前沿领导权会不断易手

OpenAI / Anthropic:竞相将当下的领先转化为长期优势

在 X 看原帖 ↗
1.3K271
🛠 工具产品
工具产品 · @laobaishare▲ 2.1万

给中文内容创作者整理了10个免费实用写作工具

从改稿、找选题到整配图、拆内容分发,全流程都覆盖,不用再挨个找工具凑工作流。

阅读全文 →
2.1万143456502
工具产品 · @AISuperDomain▲ 5.6K

AI写代码乱堆?这个工具给它加上了工程纪律

折腾AI编程的人,能靠它约束AI Coding Agent按流程思考执行,不用一开始就乱写代码,支持多款主流Agent工具。

🚀发现一个很适合 AI 编程工作流的项目:OpenSpec Plus。

它不是替代 OpenSpec,而是在 Spec-Driven Development 里加了一层“工程纪律”: 从需求发现、可测试规格、设计决策、任务拆分,到执行验证和 TDD,全流程约束 AI Coding Agent 不要一上来就乱写代码。

支持 Claude Code、OpenCode、Cursor、GitHub Copilot 等主流 Agent。

简单说: OpenSpec 负责定义流程,OpenSpec Plus 负责让 Agent 真正按流程思考和执行。

对正在折腾 AI 编程、Spec 驱动开发、Agent 工作流的人,很值得看看。

在 X 看原帖 ↗
5.6K116176
工具产品 · @yibie▲ 3.3K

给编码AI做的长程循环模板,不用全靠Prompt堆了

做复杂多步编码任务时,可以直接复用这套标准化工作流,状态存在本地磁盘,验收不通过会自动重启,不用手动反复跟进

阅读全文 →
3.3K74257
⚡ 实战经验
实战经验 · @alexalbert__▲ 2.7万

Opus 5模型发布,开发者说比Fable 5好用

参与开发的人员分享了自己的使用偏好,在不少编码任务中,他更愿意用这款新发布的模型。

这是我最喜欢的几张来自Opus 5发布的图表。

我们投入了大量工作,让这个模型在各个领域都能实现token效率,同时还提升了智能水平。

它用起来手感非常顺滑,在很多编码任务上我都更喜欢用它,而非Fable 5。

在 X 看原帖 ↗
2.7万1742140
实战经验 · @LangChain▲ 5.0K

顶级资管给数百投资人配了AI分析师

原本需要耗时数小时的深度调研,现在几分钟就能完成,帮投资人省出大量时间处理更核心的工作。

在 Interrupt 大会上,@Bridgewater 团队分享了他们是如何打造 AIA Pocket Analyst Tool(PAT)的。

PAT 是部署给数百名投资者使用的内部 AI 分析师,它依托 Bridgewater 的专有数据、研究方法和专业投资者反馈,能在数分钟内完成长达数小时的深度探索性研究。

PAT 是 AIA 的组成部分,而 AIA 正是 Bridgewater 的人工智能投资者。你可以观看主题演讲,了解他们的打造过程:

在 X 看原帖 ↗
5.0K3198
📌 其他
软件开发 · @dotey▲ 21.0万

《Clean Code》作者鲍勃大叔公开其AI代码使用实践

鲍勃大叔称自己不看AI生成代码,靠测试和指标管控代码质量

阅读全文 →
21.0万2461.7K2.0K
AI开发 · @huangyun_122▲ 2.3万

开发者亲测Codex+Claude Code可自主完成开发任务

普通开发者实测双AI协作可独立完成项目开发,称AI可替代普通开发

x,我已无语。首次意识到,Codex + Claude Code 已经可以完全替代我这样资质平庸的程序员了 我让 Codex 出了一版 BitBrowser 多代理池 + yt-dlp 替我自动挖掘 Youtube AI KOL 的监控系统 Claude 去 Review Codex 的执行计划,提出了若干重大缺陷。而 Codex 尝试修复,又反向纠错 Claude. 几个回合下来,虽然有 md 做记录,但没完没了 于是我直接给 Codex 下任务:你去主导吧,做好来回沟通存档,启用母子 Agent, 直到任务完成 20分钟回来,他俩 sign off agreement 了 之前我一直以我的视角去约束,去左右AI Agent 的思考空间,没想到让他们放飞自我,可以跑更远。

我恰恰是那个阻碍他们的瓶颈

在 X 看原帖 ↗
2.3万1299170
AI智能体 · @luoling8192▲ 1.4万

开发者求问是否存在派生多模型子智能体的工具

开发者希望能派生多模型子智能体完成代码审查,求问现有工具

我想要有一个大的 agent,能够帮我派生出「不同模型」的 sub agent,让他们各自去调研或者是 review 我的代码,最后能够整合在一起。有没有这样的软件呢?

当我想要知道不同模型对同一个问题的看法时,我通常会把提示词复制一份贴给另外一个模型。如果有 hand off 的话可能会更好

在 X 看原帖 ↗
1.4万3727
学习 · @crypto_oldk▲ 2.6万

ChatGPT隐藏模式“无限私教”的8个实用提示词分享

分享ChatGPT“无限私教”隐藏模式的8个实用提示词

阅读全文 →
2.6万79794
AI编程 · @Xudong07452910▲ 4.9K

Anthropic推出Claude Code Skills 将人工检查转为自动验证

该方法可将代码验收环节自动化,支持自定义团队代码规范作为固定流程

阅读全文 →
4.9K55775
AI开发 · @tualatrix▲ 1.1万

开发者用GPT结对学习开发SwiftUI优化性能

开发者将技术方案交给GPT做基准测试验证,再决策是否采纳方案

开发者最近和GPT结对,深入学习开发SwiftUI。

开发者把自己的技术方案交给GPT,让它完成基准测试(Benchmark)和验证工作,拿到结果后再决策是否正式采纳方案。

借助这种方式,优化性能的过程变得轻松愉快,开发者对SwiftUI的抵触感也有所降低。

在 X 看原帖 ↗
1.1万3121
提示工程 · @AYi_AInotes▲ 207

Anthropic缩减Claude Code系统提示80% 模型性能反而更好

传统提示词工程的堆规则、塞示例方法已过时,新范式转向轻量精准的上下文工程

教育科技 · @mattshumer_

开发者用Opus 5开发新型实时AI家教原型

为AlphaSchool开发的原型结合大模型能力与定制小模型实现实时交互渲染

开发者mattshumer_正使用Opus 5,为AlphaSchool开发一款全新的实时AI家教原型。Opus 5在后台支撑对话与方向引导功能。

该原型搭配一个定制训练的类小型世界模型,担任实时渲染器和交互层。它和典型的基于像素的世界模型概念相近但并不完全相同,画面清晰度比常规方案更高。

目前原型仍较为粗糙,但已经呈现出超出预期的效果。构思和训练这个模型的过程很有乐趣,后续会择机分享更多进展。

在 X 看原帖 ↗
开源大模型 · @itsaflecha

企业将按需本地推理转为常启本地推理,迁移至GLM 5.2

租用GPU后企业全面使用GLM 5.2,称其达到Claude Opus质量且成本远低于闭源大模型

企业已经把按需调用的本地推理,改为持续运行的本地推理模式。企业租用GPU后,全体人员已将GLM 5.2作为首要使用的大模型迁移完成。

GLM 5.2可达到Claude Opus的输出质量,同时成本可确定。其成本仅为OpenAI和Anthropic闭源模型的很小一部分。

想要阻止全球企业转向开源大模型,唯一可能是美国政府出台禁令禁止开源模型。但即便禁令出台,也只会推高美国本土企业的成本,世界其他地区仍会继续迁移到开源大模型。

在 X 看原帖 ↗
AI开发 · @viktoroddy

博主分享Claude Code+Fable 5打造电影感网站教程

开发者viktoroddy发布教程,介绍怎么用Fable 5 AI搭建出不像AI生成的电影风网站,还公开了所有提示词

开发者viktoroddy在𝕏发文称,结合Claude Code与Fable 5,能够设计出质感类似电影的网站。

他刚刚录制了一份教程,讲解如何使用Fable 5 AI搭建出不像AI生成的电影感网站,教程链接已经公开。

这份教程用到的所有提示词也已对外放出,提供了两个下载链接供用户获取。

在 X 看原帖 ↗
AI开发工具 · @orca_build

Orca推出跨编码AI会话断点续传功能

用户在Codex或Claude Code中碰到使用限额中断时,可一键切换到另一代理恢复完整会话

如果在使用Codex或Claude Code时,任务进行到一半就碰到了使用限额,工作会被迫中断。Orca推出新功能可以解决这个问题。

用户只需点击一次,就能在不同的AI代理框架中恢复完全一致的会话。

该功能支持Codex与Claude Code之间互相切换,并且可以完整保留全部会话上下文。

在 X 看原帖 ↗
AI工具 · @shengzheyao

Antigravity CLI 1.1.6更新 支持用Markdown定义自定义智能体

开发者shengzheyao发布工具更新,新增多项功能,还分享了代码审查智能体示例

自定义智能体现在仅需Markdown即可创建。在Antigravity CLI 1.1.6版本中,用户可以通过路径~/.gemini/config/agents/<智能体名称>/agent.md文件定义智能体,文件包含YAML前置元数据和Markdown格式的提示词。

这种方式便于对智能体进行版本管理、审阅和分享。

本次更新还新增了三项功能:调取前序第n条回复的/copy <n>命令、流式代码搜索,以及改进了文本用户界面(TUI)和工具稳定性。

可以通过agy命令更新工具,也可访问链接获取更多信息。

开发者分享了一个简单的代码审查智能体示例,输入/agents命令即可激活,更多示例将在后续推出。该示例文件的YAML元数据设置智能体名称为code-reviewer,功能为分析git差异并给出简洁代码改进建议。

文件的正文部分为系统指令,设定智能体为专项代码审查者,核心目标是分析git差异并给出代码改进建议,明确了三项职责:分析git diff、从可读性、性能与安全维度审代码、提供附带修改前后代码示例的可操作反馈。

在 X 看原帖 ↗

📖 深度解读

精选文章的中文编辑重写 · 按更新时间排列

▲ Top
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部