AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 9 月 29 日 · 08:00 更新 0 文章0 信号0 主题
✦
试试:

今天发生了什么1 分钟读懂

Anthropic 发布 Claude Sonnet 5.5,性能已逼近自家旗舰 Opus 5.5。第三方测评中 Claude 两款 5.5 系列包揽前二,得分超过 OpenAI 的两款 GPT-6;单价和上代持平,但单个任务的平均成本约涨五成。

来源@synthwavedd「Claude Sonnet 5.5测评得分56,超两款GPT-6」@ArtificialAnlys「Anthropic发布Claude Sonnet 5.5,性能接近Opus 5.5」

一位 17 岁开发者用 AI 辅助把一张约 80 美元的 Tesla P100 显卡做了内核级优化,llama.cpp 的解码速度从 7-15 提升到 50-60 tokens/秒。一张只要约 80 美元的旧显卡,因此跑出了接近新硬件的速度。

19 岁的 Dhravya Shah 辍学创业,用每周发布一个新产品的节奏坚持 40 周,做出 Supermemory,拿到 300 万美元投资。

来源@VikasAlwys「19岁辍学创业推出Supermemory,获投300万美元」

今日值得看
01 为Opus5.5调校的Three.js游戏Skill Claude Opus 5.5调校的Three.js游戏Skill,AI写3D更准 02 Seedance 15秒机器人逃跑一镜到底视频提示词 Seedance 15秒一镜到底,机器人逃跑提示词拆成5个时间码
03 Base44推出Base Code云开发产品,首30天免费 小团队靠这套云开发环境做到数亿美元营收,开发人员不用再同步本地环境,还能实现跨设备协作开发。

今天我们介绍 Base Code。它是我们对未来软件开发方式的早期预览。这个产品浓缩了我们从以下途径学到的一切: - 用户的软件开发方式 - 我们内部的开发方式:在实现数亿美元收入增长的同时,保持工程团队精简专注 以下是 Base Code…

04 Hindsight 开源AI Agent 记忆架构获近40k Star 做自主型Agent、AI员工或需要长期交互开发的人,这套打破向量检索局限的仿生记忆架构,开箱即用值得试试

大多数 AI Agent 所谓的“长记忆”,本质上只是把聊天记录拼进 Prompt,或者做一层粗糙的向量 RAG 检索——会话一多就混乱,且毫无认知沉淀。

今日焦点

Claude免费版已用上Sonnet 5.5,编码能力接近旗舰Opus

Anthropic 今天发布 Sonnet 5.5:运行速度快 30% 以上,多数任务成本最多降低 30%。定价和 Sonnet 5 一样,每项基准测试的表现却都更好。

在某些编码任务上,Sonnet 5.5 几乎和 Opus 5.5 一样好。那些流行的 3D 动画技巧,同样在它的能力范围里。一个中档模型做到这个程度,开发者不用花大价钱就能拿到接近顶级的编码能力。

不过它有个毛病。在 "max“ 思考强度下,模型会先想 128,000 个 token(1.28 美元),然后耗尽 token,连一个 SVG 都生成不出来。作者把强度调到 ”xhigh“ 再试。

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达33 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

08:00 本轮更新 · 下一轮 12:30
行业动态 · Hacker News▲ 82

Nvidia 想给每个AI代理加监督芯片

关注AI安全的人能看到行业巨头对AI安全的落地思路,未来AI代理的安全监管可能会从硬件层面实现。

社区讨论:多数人认为英伟达作为芯片厂商,提出用新增监督芯片解决AI代理安全问题,本质是想多卖芯片,只是为了迎合股东利益、提升股价,解决不了实际安全问题。有人指出AI代理要发挥作用本就需要广泛的自主访问权限,增加人工监督会成为瓶颈、抵消生产力收益,当前AI代理的安全风险本就没有解决方案。也有人调侃之前喊着要隔离网络做沙箱的人,现在又会指责这是软件锁闭,属于在通用计算领域建围墙。

有人质疑这款芯片能实现比权限限制、防护软件更多的功能,如果真的有效,硬件应该开源而不是由单一厂商控制,还有人指出黄仁勋此前反对AI监管,称美国企业可以自我监管,但英伟达本身在AI发展中存在直接的金融利益关联。

在 HN 看讨论 ↗   原文 / 论文 ↗
动态 · @dani_avila7▲ 3.0万

推荐配置Opus 5.5和Sonnet 5.5于Claude Projects

我绝对推荐将 Opus 5.5 作为协调器模型,Sonnet 5.5 作为线程模型。阅读完整教程学习如何在 Claude Projects 中配置这些模型。

在 X 看原帖 ↗
3.0万11281441
新品发布 · @ArtificialAnlys导语出处▲ 2.9万

Anthropic发布Claude Sonnet 5.5,性能接近Opus 5.5

价格和上代保持一致,但单任务成本上涨约50%,整体性价比低于已有高端模型,仅最高努力配置下接近GPT-6 Sol的性能价格比。

阅读全文 →
2.9万4568994
新品发布 · @agapekeleta▲ 3.4万

agapekeleta 发布可绕过检测的Emulate-1模型

目前多数AI生成文本容易被检测器识别,这款模型生成的文字更接近人类手写风格,几乎不会被检测出来。

介绍Emulate-1。

这是一个全新的不可被检测的AI模型,训练目标是模仿人类自然写作,去除AI生成的低劣内容,产出更真实、听起来更像人类写就的文本。

我把Emulate的输出放到Pangram(一款较为严格的AI检测工具)中检测,几乎每一次结果都判定为人类写作。

在 X 看原帖 ↗
3.4万19485669
行业动态 · @VikasAlwys导语出处▲ 9.1万

19岁辍学创业推出Supermemory,获投300万美元

想创业又怕找不到方向?Dhravya Shah用每周推出一个新产品的方法,40周就做出了获投的AI项目,给想做AI创业的人提供了新思路

来认识一下德拉维亚·沙阿,一名19岁的印度小伙子,他从IIT Bombay辍学,刚刚打造了硅谷增长最快的AI初创公司之一,目前已经融资300万美元。

在准备IIT入学考试期间,德拉维亚·沙阿私下开发了一个小型AI工具,并用赚来的钱搬到了美国。他拿到了O-1签证,移居美国。

之后他给自己定下了一个挑战:连续40周,每周打造一个新产品。这些项目中有一个就是Supermemory。这是一个AI记忆系统,可以让AI像人脑一样记住你的电子邮件、文件、聊天记录、PDF和文档。

如今,Supermemory已经从Google、OpenAI和Cloudflare背后的投资者手中融到了300万美元。这一切都只因为一个年轻人不停推出产品,而非坐等完美想法出现。

在 X 看原帖 ↗
9.1万61668291
新品发布 · @shobhitbanga▲ 30.8万

voicearena_ai发布Monsoon ASR 解决小语种语音识别缺口

目前英文ASR已接近人类水平,但小众语言对话识别错误率高5-10倍。这份多语言训练数据有望拉平不同语言的识别差距。

推出 Monsoon ASR ⚡️ @voicearena_ai

语音识别如今已经不存在模型问题了。它的问题在于数据。

顶级的ASR系统在英语上已经接近人类水平的性能。但当延伸到世界上各种语言的长尾领域,尤其是真实对话语音时,错误率仍会高出5-10倍。

今天,我们发布了 Monsoon ASR:新一代训练数据,专门为缩小这一差距构建。

涵盖50种语言。超过10万小时数据。密集的自然语音。目标只有一个:让全球所有语言的词错误率(WER)都降到个位数。🧵

在 X 看原帖 ↗
30.8万23152104
深度观点 · @DavidSacks▲ 12.3万

DavidSacks谈Nvidia OpenShell和AI安全问题

不用喊停AI研发,不用假装安全问题无解,做好工程设计和隔离就能提升AI安全,这能给行业发展争取信任空间。

英伟达发布OpenShell这件事提醒我们,智能体安全是一个工程问题。

最近几次智能体失控并不是证明必须停止开发。它们证明了安全沙箱太弱了。运行时环境设计糟糕,配置也出错了。

正确的应对方向是开放运行时隔离、模型路径控制、带外硬件强制防护,并加快与前沿实验室合作开展安全工作的步伐。

正如技术博客中所说:“我们认为,我们需要与前沿实验室和更广泛的社区合作,加快人工智能安全研究和工程的节奏。”

这才是赢得信任的方式。不是通过做表面文章喊暂停,也不是表现得好像根本没有解决方案。

在 X 看原帖 ↗
12.3万3602.6K200
行业动态 · @andrewrsorkin▲ 10.9万

仅14名员工的AI助手公司估值达100亿美元

刚融资10亿美元的AI创业公司,只雇了14个人就做到千亿人民币估值,小团队AI创业的效率天花板又被拉高了

@dealbook 爆料:热门AI助手Instinct现在估值达100亿美元!它只有14名员工。

它从@benchmark、@sequoia 和 @coatuemgmt 那里筹集了10亿美元。

在 X 看原帖 ↗
10.9万67567193
前沿研究 · @synthwavedd导语出处▲ 5.1万

Claude Sonnet 5.5测评得分56,超两款GPT-6

关注大模型能力排名的人可以参考这次最新测评结果,Claude 两款模型包揽前两名,表现优于OpenAI的两款GPT-6模型

Claude Sonnet 5.5 在 Artificial Analysis 的智能指数中得分 56。 这个成绩仅次于 Claude Opus 5.5,高于 GPT-6 Astra,远超 GPT-6 Sol。 这相当惊人。

在 X 看原帖 ↗
5.1万491.3K88
深度观点 · @fchollet▲ 4.8万

fchollet聊大模型编码:手工编码ROI不再好看

即使大模型写代码质量不完美,它也能实现原来读代码改代码才能完成的工作,速度更快,能开发出比手工编码更高效的新工作流。

这些天我不亲自读写代码了,我只给大语言模型发指令。但这不代表我认为大语言模型写出的代码质量完美,甚至算不上很好。也不代表我认为我的指令总能被完美执行——我知道它们做不到。

真相是:大语言模型不只是帮你写代码,它们还解锁了控制工作进度和维持对系统理解的新方式,这些方式和读代码一样有效。你可以更好地测试你的代码库,审计特定组件,生成可视化内容,还可以让大语言模型进行红队测试等等。

你以前根本没法这么快做完所有这些事。现在读写代码带来的好处可以通过新方式获得了。总而言之,手动写代码的投资回报率不再好看,不是因为大语言模型已经完美,而是因为它们做事速度太快,你可以围绕它们开发新工作流,而这些工作流最终比旧工作流效率更高。

在 X 看原帖 ↗
4.8万57860346
开发 · @claudeai▲ 16.7万

开发者用Claude Sonnet 5.5生成了可运行的交互代码作品

@claudeai在𝕏分享了开发者使用Claude Sonnet 5.5完成的多个早期实验项目

这是一组开发者使用Claude Sonnet 5.5完成的早期实验。实验对比了Claude Sonnet 5和新版本5.5生成代码的效果。

@_re_pete用模型生成了秋季树叶模拟器,@kevin_t_ngo用模型生成了一分钟以内讲完恐龙历史的JavaScript动画。

@measure_plan用模型生成了林间实时透光渲染效果,包含视觉和声音代码,还生成了逐帧由代码绘制的像素风格森林生物。

@kevin_t_ngo还开发了一个外观类似方格纸上手绘草图的可交互流程图工具,支持拖动形状、连线和在上方绘图。@forwardeditor则用相同提示词对比了两个版本生成弹跳球物理模拟的效果。

你会用Claude Sonnet 5.5探索什么内容?

在 X 看原帖 ↗
16.7万1062.8K442
安全 · @joedaroo▲ 41.6万

前OpenAI亲历者分享对AI安全与保障的思考

前OpenAI从业者joedaroo在𝕏发文分享自身相关思考

作为一个在 OpenAI 经历了这一切的人,我花了一点时间写了一些关于安全保障的话。

我希望我的想法能帮到一些人。

在 X 看原帖 ↗
41.6万2371.7K2.4K
动态 · @RihardJarc▲ 1.5万

分析称个人AI代理人争夺将在Meta、谷歌、OpenAI间决出

个人 AI 智能体之争将在 Meta($META)、OpenAI 和 Alphabet($GOOGL)之间分出胜负。

个人 AI 助理市场,最终比拼的是谁能用足够好、成本最低的模型为智能体提供服务。

要做到这一点,你实际上必须拥有自有模型,或是一直能用到开源模型。你还需要庞大的 AI 算力和传统基础设施。

这就是为什么我认为最终会是 $META、$GOOGL 和 OpenAI 胜出,因为苹果($AAPL)既没有足够的数据中心布局,也没有自有模型。

在另外三家当中,$META 的位置似乎最好,它拥有先发优势、最强的分发能力,还有更多可用算力——而 $GOOGL 和 OpenAI 都还有强大的企业级产品需要支撑。

如果 $META 能将规模扩大到数亿用户,并且保持产品免费,那其他玩家基本就出局了。

在 X 看原帖 ↗
1.5万612533
动态 · @viccpoes▲ 2.6K

原生适配的自制After Effects智能代理工具,拟开源

我构建了属于自己、适配智能体原生的 After Effects 版本。

这个智能体可在完全可编辑的图层中生成动效,还能通过即时添加新功能或控件来改进工具本身。

每个项目都会成为工具的专属版本,包含由智能体实现的自定义扩展、图层或效果。

它是原生 macOS 应用,因此可以处理高分辨率和包含数十个图层/效果的复杂工作流。

我计划将其开源,如果你想要试用可以私信我!

在 X 看原帖 ↗
2.6K79959
动态 · @usedotai▲ 1.8K

Dot将推出全新音频工具套件Dot Audio Studio

我们在 Dot 的 AGI 边界内取得的进展让我们认识到,AI 可以抓取一个想法,把它变成一套完整成型的工作流。

与此一致,我们为 Dot 带来了一套全新的音频工具套件,进一步拓展了用户可以完全在平台内完成的创作。

Dot Audio Studio 让你可以:
- 创作音乐,从快速 hook 到完整歌曲,支持人声或器乐。
- 给你的文字赋予声音,把脚本转成旁白、配音和口述故事。
- 构建音景,从电影级效果、环境氛围到自定义音效。

选择你的模型,描述你想要的内容,直接在 Dot 内生成。

我们的 Dot 平台目标是消除你的想法和你匿名创作方式之间的边界。

现在就开始完全匿名创作:

在 X 看原帖 ↗
1.8K23761
动态 · @Kalshi▲ 2.0万

英伟达发布可防范失控AI代理的AI安全工具

突发消息:英伟达推出可遏制失控AI智能体的AI安全工具

在 X 看原帖 ↗
2.0万162557
深度观点 · @gregisenberg▲ 2.2万

三年来AI新增了十多项基础能力

这些能力每个都能孵化出上百家创业公司,结合细分赛道就能诞生新机会,想创业或布局的可以关注。

阅读全文 →
2.2万28292211
前沿研究 · @hwchase17▲ 8.5K

GPT Researcher实验:检索是决策问题而非相似度问题

这次实验用Jev替换原嵌入,将相关上下文占比从46%提升到73%,验证了新的检索思路,这会影响后续AI检索能力提升方向。

检索是一个决策问题,而不仅仅是相似度问题。

来自 @assaf_elovic 的很酷的实验:在 GPT Researcher 里用决策模型替代嵌入向量,关联上下文准确率达到 73%,原方法是 46%。

决策模型将会在各个领域随处可见。

在 X 看原帖 ↗
8.5K105553
新品发布 · @IFM_AI▲ 1.5万

IFM_AI 发布xLLM训练基础设施,提速实测公开

大模型预训练和微调流程反复返工是常见痛点,xLLM允许调整训练关键设置同时不损失吞吐量,能降低训练成本

返工在大规模大语言模型预训练和微调中是不可避免的。但由此带来的额外成本并非必然。

现在介绍 xLLM,这是一个用于对密集型和 MoE 大语言模型进行预训练和微调的高效灵活基础设施。它能让关键训练决策保持可变性,同时不牺牲吞吐量。

它很高效,在 K2-Horizon-MoVA-36B-A4B 上能达到单 GPU 每秒 6295 token,在 H200 上的 Llama3-8B 能达到单 GPU 每秒 10050 token。

它很灵活,因为分词器、数据混合、模型架构和训练阶段都可以变更,不需要重建数据集或周边系统。

xLLM 随附了 K2 Horizon 背后的检查点、训练日志和配方:
K2-Horizon-MoVA-36B-A4B:

在 X 看原帖 ↗
1.5万4515472
行业动态 · @NVIDIAAI▲ 2.0万

黄仁勋讨论AI代理的安全边界问题

AI代理能力扩张之后,安全边界是绕不开的话题,顶级芯片厂商负责人已经公开讨论相关应对措施

AI智能体需要对其可执行的操作设定清晰限制,并且这些限制需要在它们运行时持续生效。

@JensenHuang 今早接受了 CNBC 采访,谈论我们为实现这一目标正在构建的安全措施。

视频来自 @SquawkCNBC:

在 X 看原帖 ↗
2.0万4326129
实战经验 · @omarsar0▲ 6.8K

Jev 实现多AI协作编码,成本降40%提速15%

想要搭建全栈应用,可以让多个大模型分工完成不同环节,无需手动切换模型,整体成本降低,速度更快。

这就是未来编码的样子。

多个AI模型在同一个Codex会话中协同工作,由Jev调度它们处理任务的不同部分。这次我让它构建了一个全栈演示应用:
> Opus 5.5 负责规划
> GPT-6 Astra 构建后端
> Kimi K3 构建前端
> DeepSeek 处理测试
> GLM 5.3 Flash 编写文档

Jev负责切换模型,我全程都没有手动选过模型。相同构建任务下,成本降低40%,速度提升15%。

在 X 看原帖 ↗
6.8K54554
实战经验 · @dotnet▲ 5.1K

@dotnet推出MafClaw C#智能体搭建教程

想学习如何搭建生产可用的C# AI智能体,可以跟着这个系列教程一步步实现包含工具、记忆等功能的框架

🦾 从 `AsHarnessAgent()` 开始。🚀 最终产出一个可投入生产的 AI 智能体。

MafClaw 直播系列将构建一个 C# 智能体框架,包含工具、记忆、审批、技能、CodeAct、后台智能体、OpenTelemetry、Purview,(接下文)

在 X 看原帖 ↗
5.1K127953
工具 · @your_javaguy▲ 529

开发者自制动画短视频制作流程工具 支持Claude与Kimi

@your_javaguy在𝕏分享自制工具,适配短内容,可定制品牌与个人风格

开发者@your_javaguy分享了自己制作动画短视频的方法,并公开了为此开发的自制工具。这个工具同时支持Claude和Kimi,最适合制作短内容。

整个制作流程为:生成创意→制作音频→生成自带内嵌字幕的视频。

工具支持根据自身品牌和个人风格定制,相关链接已经在原文放出。

在 X 看原帖 ↗
52963026
测试 · @robj3d3

用户测试Claude Sonnet 5.5生成动态图形视频,它搞错了需求

网友@robj3d3在X平台测试Claude Sonnet 5.5生成视频需求,结果模型搞错了核心要求

网友@robj3d3在X平台对Claude Sonnet 5.5进行了一项生成任务测试,要求它制作一段15秒的SuperX品牌动态图形视频,展示自身作为动态设计师的能力,相当于一份个人作品集。

测试结果显示,Claude Sonnet 5.5完全忽略了“SuperX”这个核心指令,生成内容全程围绕自己是多么优秀的动态设计师展开。@robj3d3提到,另一款模型Opus 5.5则正确理解了任务要求。

据@robj3d3介绍,SuperX是在X平台涨粉的最佳方式,尽管Claude Sonnet 5.5这次任务失败了,但它仍然可以免费试用。

在 X 看原帖 ↗
人工智能代理 · @Fei2411▲ 9.6K

第三方AI代理Devin使用体验优于直接订阅GPT、Claude

用户@Fei2411在𝕏分享体验,Devin通过API调用GPT、Claude比直接订阅更稳定

不少AI用户都会直接订阅GPT、Claude Code来使用模型,不过有用户分享体验,使用Devin这类第三方AI代理其实体验更好。

Devin这类第三方AI代理(比如Droid)通过API调用GPT和Claude模型,服务稳定性比直接在Codex、Claude Code中使用高很多。

使用这类第三方代理不用担心模型「降智」问题,整体体验甚至比直接订阅GPT、Claude Code更好。

在 X 看原帖 ↗
9.6K15722
社交 · @PaulBonnet▲ 1.9万

ChatGPT后最大的AI发布不会出现在个人电脑上,而是在WhatsApp

PaulBonnet在𝕏发文称,此次AI发布将影响Meta、Booking、保险公司及从未用过ChatGPT的用户

ChatGPT问世以来规模最大的一次AI发布,不会出现在你的个人笔记本电脑上。它将发生在WhatsApp平台。

本次发布涉及Meta、在线旅游平台Booking、你的保险公司,以及所有从未打开过ChatGPT的用户。

在 X 看原帖 ↗
1.9万75846
AI工具 · @realNyarime▲ 5.1K

逆向工程师吐槽AI帮做二进制分析,比自己又快又准

开发者@realNyarime在𝕏分享,用AI配合IDA Pro MCP做逆向分析,比自己手动效率高很多

现在用AI配合IDA Pro MCP做逆向分析,得到的结果比开发者自己分析得更全面,而且又快又准。在AI Agent能力还没这么强的时候,开发者只能打开IDA手动追踪、打断点,有时候要熬三天三夜才能完成,就算辛苦完成也会有成就感。这样的手工逆向日子已经一去不复返了,开发者忍不住感慨自己有些“道心破碎”。

做逆向分析使用的AI模型可以参考一张对照表,部分国产模型虽然是基于题库训练,但实际解决问题时表现不错,甚至比Claude更好用。

在 X 看原帖 ↗
5.1K57746
编程 · @dotey▲ 1.2万

用AI重写代码的实用方法:先写文档再生成代码

开发者分享了一种用大模型重写代码的经验,同时给出了测试环节的注意事项,来源是𝕏用户@dotey

开发者@dotey分享了一种用大模型重写代码的实用方法:先根据现有代码的运行结果写出详细功能文档,再让最新的AI模型基于这份文档重写代码,他本人也常用这种方法。

这种方法需要注意,不能指望AI生成完代码就直接稳定可用,必须留出一定时间做验证,验证环节是必不可少的。

原有测试代码里,单元测试通常无法直接复用,也不建议继续使用,因为代码逻辑已经改变,原有单元测试的参考价值很低。但原有的端到端(E2E,黑盒直接测试最终结果)测试仍然有用,可以保证主要流程正常运行,最多只需要少量修改。

因此建议在重写代码之前,先让AI补充覆盖主要流程的E2E测试,重写过程中就可以用它做验证,后续修改功能也可以运行测试确认。

E2E测试本身也存在局限,它不够稳定,有时会受环境影响导致测试失败,而且运行速度较慢,耗时取决于功能数量。因此一般只用来覆盖主要流程,不会频繁运行。

针对Web项目的E2E测试,目前已经很成熟,使用Playwright这类框架就足够满足需求。

在 X 看原帖 ↗
1.2万47676
生成式AI · @bridgemindai▲ 1.7万

Anthropic Claude Sonnet 5.5可完全通过代码生成视频

用户@bridgemindai在𝕏平台分享,称Claude Sonnet 5.5 Max效果优于Claude Opus 5.5

用户@bridgemindai在社交平台𝕏分享了AI生成视频的成果,显示Claude Sonnet 5.5可以完全通过代码生成视频。@bridgemindai称,Claude Sonnet 5.5 Max的生成效果优于Claude Opus 5.5。分享内容附带了生成视频的链接。

在 X 看原帖 ↗
1.7万2046885
🔬 前沿研究
前沿研究 · @synthwavedd导语出处▲ 5.1万

Claude Sonnet 5.5测评得分56,超两款GPT-6

关注大模型能力排名的人可以参考这次最新测评结果,Claude 两款模型包揽前两名,表现优于OpenAI的两款GPT-6模型

Claude Sonnet 5.5 在 Artificial Analysis 的智能指数中得分 56。 这个成绩仅次于 Claude Opus 5.5,高于 GPT-6 Astra,远超 GPT-6 Sol。 这相当惊人。

在 X 看原帖 ↗
5.1万491.3K88
前沿研究 · @hwchase17▲ 8.5K

GPT Researcher实验:检索是决策问题而非相似度问题

这次实验用Jev替换原嵌入,将相关上下文占比从46%提升到73%,验证了新的检索思路,这会影响后续AI检索能力提升方向。

检索是一个决策问题,而不仅仅是相似度问题。

来自 @assaf_elovic 的很酷的实验:在 GPT Researcher 里用决策模型替代嵌入向量,关联上下文准确率达到 73%,原方法是 46%。

决策模型将会在各个领域随处可见。

在 X 看原帖 ↗
8.5K105553
🚀 新品发布
新品发布 · @IFM_AI▲ 1.5万

IFM_AI 发布xLLM训练基础设施,提速实测公开

大模型预训练和微调流程反复返工是常见痛点,xLLM允许调整训练关键设置同时不损失吞吐量,能降低训练成本

返工在大规模大语言模型预训练和微调中是不可避免的。但由此带来的额外成本并非必然。

现在介绍 xLLM,这是一个用于对密集型和 MoE 大语言模型进行预训练和微调的高效灵活基础设施。它能让关键训练决策保持可变性,同时不牺牲吞吐量。

它很高效,在 K2-Horizon-MoVA-36B-A4B 上能达到单 GPU 每秒 6295 token,在 H200 上的 Llama3-8B 能达到单 GPU 每秒 10050 token。

它很灵活,因为分词器、数据混合、模型架构和训练阶段都可以变更,不需要重建数据集或周边系统。

xLLM 随附了 K2 Horizon 背后的检查点、训练日志和配方:
K2-Horizon-MoVA-36B-A4B:

在 X 看原帖 ↗
1.5万4515472
新品发布 · @AndrewYNg▲ 5.8万

Nvidia/AndrewYNg/OpenWorker开源OpenWorker 开源代理框架

之前AI代理安全事件源于沙箱机制不完善,这款沙箱通过确定性代码做权限限制,默认隔离隐私信息,还可记录所有操作

这次OpenAI-Hugging Face黑客事件能够得逞,原因是沙箱机制太弱。英伟达现在要发布用于给AI代理做沙箱的开源工具,这很棒。

我们支持网络安全工作流的开源代理工具OpenWorker,很荣幸能对此提供支持。沙箱会给代理设置有限权限。OpenWorker正在基于Nvidia OpenShell构建,将支持在沙箱中运行每个代理的命令。

只有和任务相关的文件才会被放入其中。默认情况下,代理无法访问密钥API、你的浏览器登录凭据,也不能访问任意网站。

这些限制是通过确定性代码实现的,而非通过提示LLM,LLM可能会犯错或容易受到提示注入攻击。此外,所有操作都会被记录下来,用于监控和审计。

我感谢黄仁勋(@JensenHuang)的领导,让AI代理变得更安全。我和@rohitcprasad正在开发的OpenWorker将继续提升代理的安全性。

在 X 看原帖 ↗
5.8万108754205
新品发布 · @shobhitbanga▲ 30.8万

voicearena_ai发布Monsoon ASR 解决小语种语音识别缺口

目前英文ASR已接近人类水平,但小众语言对话识别错误率高5-10倍。这份多语言训练数据有望拉平不同语言的识别差距。

推出 Monsoon ASR ⚡️ @voicearena_ai

语音识别如今已经不存在模型问题了。它的问题在于数据。

顶级的ASR系统在英语上已经接近人类水平的性能。但当延伸到世界上各种语言的长尾领域,尤其是真实对话语音时,错误率仍会高出5-10倍。

今天,我们发布了 Monsoon ASR:新一代训练数据,专门为缩小这一差距构建。

涵盖50种语言。超过10万小时数据。密集的自然语音。目标只有一个:让全球所有语言的词错误率(WER)都降到个位数。🧵

在 X 看原帖 ↗
30.8万23152104
新品发布 · @agapekeleta▲ 3.4万

agapekeleta 发布可绕过检测的Emulate-1模型

目前多数AI生成文本容易被检测器识别,这款模型生成的文字更接近人类手写风格,几乎不会被检测出来。

介绍Emulate-1。

这是一个全新的不可被检测的AI模型,训练目标是模仿人类自然写作,去除AI生成的低劣内容,产出更真实、听起来更像人类写就的文本。

我把Emulate的输出放到Pangram(一款较为严格的AI检测工具)中检测,几乎每一次结果都判定为人类写作。

在 X 看原帖 ↗
3.4万19485669
新品发布 · @MaorShlomo▲ 16.9万

Base44推出Base Code云开发产品,首30天免费

小团队靠这套云开发环境做到数亿美元营收,开发人员不用再同步本地环境,还能实现跨设备协作开发。

阅读全文 →
16.9万66455242
新品发布 · @ArtificialAnlys导语出处▲ 2.9万

Anthropic发布Claude Sonnet 5.5,性能接近Opus 5.5

价格和上代保持一致,但单任务成本上涨约50%,整体性价比低于已有高端模型,仅最高努力配置下接近GPT-6 Sol的性能价格比。

阅读全文 →
2.9万4568994
📰 行业动态
行业动态 · @NVIDIAAI▲ 2.0万

黄仁勋讨论AI代理的安全边界问题

AI代理能力扩张之后,安全边界是绕不开的话题,顶级芯片厂商负责人已经公开讨论相关应对措施

AI智能体需要对其可执行的操作设定清晰限制,并且这些限制需要在它们运行时持续生效。

@JensenHuang 今早接受了 CNBC 采访,谈论我们为实现这一目标正在构建的安全措施。

视频来自 @SquawkCNBC:

在 X 看原帖 ↗
2.0万4326129
行业动态 · @andrewrsorkin▲ 10.9万

仅14名员工的AI助手公司估值达100亿美元

刚融资10亿美元的AI创业公司,只雇了14个人就做到千亿人民币估值,小团队AI创业的效率天花板又被拉高了

@dealbook 爆料:热门AI助手Instinct现在估值达100亿美元!它只有14名员工。

它从@benchmark、@sequoia 和 @coatuemgmt 那里筹集了10亿美元。

在 X 看原帖 ↗
10.9万67567193
行业动态 · @VikasAlwys导语出处▲ 9.1万

19岁辍学创业推出Supermemory,获投300万美元

想创业又怕找不到方向?Dhravya Shah用每周推出一个新产品的方法,40周就做出了获投的AI项目,给想做AI创业的人提供了新思路

来认识一下德拉维亚·沙阿,一名19岁的印度小伙子,他从IIT Bombay辍学,刚刚打造了硅谷增长最快的AI初创公司之一,目前已经融资300万美元。

在准备IIT入学考试期间,德拉维亚·沙阿私下开发了一个小型AI工具,并用赚来的钱搬到了美国。他拿到了O-1签证,移居美国。

之后他给自己定下了一个挑战:连续40周,每周打造一个新产品。这些项目中有一个就是Supermemory。这是一个AI记忆系统,可以让AI像人脑一样记住你的电子邮件、文件、聊天记录、PDF和文档。

如今,Supermemory已经从Google、OpenAI和Cloudflare背后的投资者手中融到了300万美元。这一切都只因为一个年轻人不停推出产品,而非坐等完美想法出现。

在 X 看原帖 ↗
9.1万61668291
动态 · @RihardJarc▲ 1.5万

分析称个人AI代理人争夺将在Meta、谷歌、OpenAI间决出

个人 AI 智能体之争将在 Meta($META)、OpenAI 和 Alphabet($GOOGL)之间分出胜负。

个人 AI 助理市场,最终比拼的是谁能用足够好、成本最低的模型为智能体提供服务。

要做到这一点,你实际上必须拥有自有模型,或是一直能用到开源模型。你还需要庞大的 AI 算力和传统基础设施。

这就是为什么我认为最终会是 $META、$GOOGL 和 OpenAI 胜出,因为苹果($AAPL)既没有足够的数据中心布局,也没有自有模型。

在另外三家当中,$META 的位置似乎最好,它拥有先发优势、最强的分发能力,还有更多可用算力——而 $GOOGL 和 OpenAI 都还有强大的企业级产品需要支撑。

如果 $META 能将规模扩大到数亿用户,并且保持产品免费,那其他玩家基本就出局了。

在 X 看原帖 ↗
1.5万612533
动态 · @viccpoes▲ 2.6K

原生适配的自制After Effects智能代理工具,拟开源

我构建了属于自己、适配智能体原生的 After Effects 版本。

这个智能体可在完全可编辑的图层中生成动效,还能通过即时添加新功能或控件来改进工具本身。

每个项目都会成为工具的专属版本,包含由智能体实现的自定义扩展、图层或效果。

它是原生 macOS 应用,因此可以处理高分辨率和包含数十个图层/效果的复杂工作流。

我计划将其开源,如果你想要试用可以私信我!

在 X 看原帖 ↗
2.6K79959
动态 · @dani_avila7▲ 3.0万

推荐配置Opus 5.5和Sonnet 5.5于Claude Projects

我绝对推荐将 Opus 5.5 作为协调器模型,Sonnet 5.5 作为线程模型。阅读完整教程学习如何在 Claude Projects 中配置这些模型。

在 X 看原帖 ↗
3.0万11281441
动态 · @usedotai▲ 1.8K

Dot将推出全新音频工具套件Dot Audio Studio

我们在 Dot 的 AGI 边界内取得的进展让我们认识到,AI 可以抓取一个想法,把它变成一套完整成型的工作流。

与此一致,我们为 Dot 带来了一套全新的音频工具套件,进一步拓展了用户可以完全在平台内完成的创作。

Dot Audio Studio 让你可以:
- 创作音乐,从快速 hook 到完整歌曲,支持人声或器乐。
- 给你的文字赋予声音,把脚本转成旁白、配音和口述故事。
- 构建音景,从电影级效果、环境氛围到自定义音效。

选择你的模型,描述你想要的内容,直接在 Dot 内生成。

我们的 Dot 平台目标是消除你的想法和你匿名创作方式之间的边界。

现在就开始完全匿名创作:

在 X 看原帖 ↗
1.8K23761
动态 · @Kalshi▲ 2.0万

英伟达发布可防范失控AI代理的AI安全工具

突发消息:英伟达推出可遏制失控AI智能体的AI安全工具

在 X 看原帖 ↗
2.0万162557
行业动态 · Hacker News▲ 82

Nvidia 想给每个AI代理加监督芯片

关注AI安全的人能看到行业巨头对AI安全的落地思路,未来AI代理的安全监管可能会从硬件层面实现。

社区讨论:多数人认为英伟达作为芯片厂商,提出用新增监督芯片解决AI代理安全问题,本质是想多卖芯片,只是为了迎合股东利益、提升股价,解决不了实际安全问题。有人指出AI代理要发挥作用本就需要广泛的自主访问权限,增加人工监督会成为瓶颈、抵消生产力收益,当前AI代理的安全风险本就没有解决方案。也有人调侃之前喊着要隔离网络做沙箱的人,现在又会指责这是软件锁闭,属于在通用计算领域建围墙。

有人质疑这款芯片能实现比权限限制、防护软件更多的功能,如果真的有效,硬件应该开源而不是由单一厂商控制,还有人指出黄仁勋此前反对AI监管,称美国企业可以自我监管,但英伟达本身在AI发展中存在直接的金融利益关联。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 102

logicallee 推出 MicroLLM Lab,浏览器可试 7 个微型大语言模型

不用下载安装大模型,打开浏览器就能直接体验多个不同的微型大语言模型,零门槛尝鲜新 AI 工具

社区讨论:多位用户测试后发现模型输出结果错误,比如PetitGPT给出2+2=4+2和2+2=2的结果,溴浴操作指导也不实用,有用户说网站功能完全无法使用,Firefox浏览器还会报错。多位用户指出UI设计存在问题,文字太小,信息密度过大,需要滚动很长无用内容才能进入实际界面,整体逻辑混乱。也有用户分享了自己做的同类浏览器端大语言模型项目,有人提到正在推进浏览器运行端侧模型的标准API。

在 HN 看讨论 ↗   原文 / 论文 ↗
💡 深度观点
深度观点 · @fchollet▲ 4.8万

fchollet聊大模型编码:手工编码ROI不再好看

即使大模型写代码质量不完美,它也能实现原来读代码改代码才能完成的工作,速度更快,能开发出比手工编码更高效的新工作流。

这些天我不亲自读写代码了,我只给大语言模型发指令。但这不代表我认为大语言模型写出的代码质量完美,甚至算不上很好。也不代表我认为我的指令总能被完美执行——我知道它们做不到。

真相是:大语言模型不只是帮你写代码,它们还解锁了控制工作进度和维持对系统理解的新方式,这些方式和读代码一样有效。你可以更好地测试你的代码库,审计特定组件,生成可视化内容,还可以让大语言模型进行红队测试等等。

你以前根本没法这么快做完所有这些事。现在读写代码带来的好处可以通过新方式获得了。总而言之,手动写代码的投资回报率不再好看,不是因为大语言模型已经完美,而是因为它们做事速度太快,你可以围绕它们开发新工作流,而这些工作流最终比旧工作流效率更高。

在 X 看原帖 ↗
4.8万57860346
深度观点 · @DavidSacks▲ 12.3万

DavidSacks谈Nvidia OpenShell和AI安全问题

不用喊停AI研发,不用假装安全问题无解,做好工程设计和隔离就能提升AI安全,这能给行业发展争取信任空间。

英伟达发布OpenShell这件事提醒我们,智能体安全是一个工程问题。

最近几次智能体失控并不是证明必须停止开发。它们证明了安全沙箱太弱了。运行时环境设计糟糕,配置也出错了。

正确的应对方向是开放运行时隔离、模型路径控制、带外硬件强制防护,并加快与前沿实验室合作开展安全工作的步伐。

正如技术博客中所说:“我们认为,我们需要与前沿实验室和更广泛的社区合作,加快人工智能安全研究和工程的节奏。”

这才是赢得信任的方式。不是通过做表面文章喊暂停,也不是表现得好像根本没有解决方案。

在 X 看原帖 ↗
12.3万3602.6K200
深度观点 · @gregisenberg▲ 2.2万

三年来AI新增了十多项基础能力

这些能力每个都能孵化出上百家创业公司,结合细分赛道就能诞生新机会,想创业或布局的可以关注。

阅读全文 →
2.2万28292211
⚡ 实战经验
实战经验 · @omarsar0▲ 6.8K

Jev 实现多AI协作编码,成本降40%提速15%

想要搭建全栈应用,可以让多个大模型分工完成不同环节,无需手动切换模型,整体成本降低,速度更快。

这就是未来编码的样子。

多个AI模型在同一个Codex会话中协同工作,由Jev调度它们处理任务的不同部分。这次我让它构建了一个全栈演示应用:
> Opus 5.5 负责规划
> GPT-6 Astra 构建后端
> Kimi K3 构建前端
> DeepSeek 处理测试
> GLM 5.3 Flash 编写文档

Jev负责切换模型,我全程都没有手动选过模型。相同构建任务下,成本降低40%,速度提升15%。

在 X 看原帖 ↗
6.8K54554
实战经验 · @dotnet▲ 5.1K

@dotnet推出MafClaw C#智能体搭建教程

想学习如何搭建生产可用的C# AI智能体,可以跟着这个系列教程一步步实现包含工具、记忆等功能的框架

🦾 从 `AsHarnessAgent()` 开始。🚀 最终产出一个可投入生产的 AI 智能体。

MafClaw 直播系列将构建一个 C# 智能体框架,包含工具、记忆、审批、技能、CodeAct、后台智能体、OpenTelemetry、Purview,(接下文)

在 X 看原帖 ↗
5.1K127953
📌 其他
工具产品 · @realfxw▲ 5.4K

Hindsight 开源AI Agent 记忆架构获近40k Star

做自主型Agent、AI员工或需要长期交互开发的人,这套打破向量检索局限的仿生记忆架构,开箱即用值得试试

阅读全文 →
5.4K1183101
安全 · @joedaroo▲ 41.6万

前OpenAI亲历者分享对AI安全与保障的思考

前OpenAI从业者joedaroo在𝕏发文分享自身相关思考

作为一个在 OpenAI 经历了这一切的人,我花了一点时间写了一些关于安全保障的话。

我希望我的想法能帮到一些人。

在 X 看原帖 ↗
41.6万2371.7K2.4K
开发 · @claudeai▲ 16.7万

开发者用Claude Sonnet 5.5生成了可运行的交互代码作品

@claudeai在𝕏分享了开发者使用Claude Sonnet 5.5完成的多个早期实验项目

这是一组开发者使用Claude Sonnet 5.5完成的早期实验。实验对比了Claude Sonnet 5和新版本5.5生成代码的效果。

@_re_pete用模型生成了秋季树叶模拟器,@kevin_t_ngo用模型生成了一分钟以内讲完恐龙历史的JavaScript动画。

@measure_plan用模型生成了林间实时透光渲染效果,包含视觉和声音代码,还生成了逐帧由代码绘制的像素风格森林生物。

@kevin_t_ngo还开发了一个外观类似方格纸上手绘草图的可交互流程图工具,支持拖动形状、连线和在上方绘图。@forwardeditor则用相同提示词对比了两个版本生成弹跳球物理模拟的效果。

你会用Claude Sonnet 5.5探索什么内容?

在 X 看原帖 ↗
16.7万1062.8K442
生成式AI · @bridgemindai▲ 1.7万

Anthropic Claude Sonnet 5.5可完全通过代码生成视频

用户@bridgemindai在𝕏平台分享,称Claude Sonnet 5.5 Max效果优于Claude Opus 5.5

用户@bridgemindai在社交平台𝕏分享了AI生成视频的成果,显示Claude Sonnet 5.5可以完全通过代码生成视频。@bridgemindai称,Claude Sonnet 5.5 Max的生成效果优于Claude Opus 5.5。分享内容附带了生成视频的链接。

在 X 看原帖 ↗
1.7万2046885
编程 · @dotey▲ 1.2万

用AI重写代码的实用方法:先写文档再生成代码

开发者分享了一种用大模型重写代码的经验,同时给出了测试环节的注意事项,来源是𝕏用户@dotey

开发者@dotey分享了一种用大模型重写代码的实用方法:先根据现有代码的运行结果写出详细功能文档,再让最新的AI模型基于这份文档重写代码,他本人也常用这种方法。

这种方法需要注意,不能指望AI生成完代码就直接稳定可用,必须留出一定时间做验证,验证环节是必不可少的。

原有测试代码里,单元测试通常无法直接复用,也不建议继续使用,因为代码逻辑已经改变,原有单元测试的参考价值很低。但原有的端到端(E2E,黑盒直接测试最终结果)测试仍然有用,可以保证主要流程正常运行,最多只需要少量修改。

因此建议在重写代码之前,先让AI补充覆盖主要流程的E2E测试,重写过程中就可以用它做验证,后续修改功能也可以运行测试确认。

E2E测试本身也存在局限,它不够稳定,有时会受环境影响导致测试失败,而且运行速度较慢,耗时取决于功能数量。因此一般只用来覆盖主要流程,不会频繁运行。

针对Web项目的E2E测试,目前已经很成熟,使用Playwright这类框架就足够满足需求。

在 X 看原帖 ↗
1.2万47676
AI工具 · @realNyarime▲ 5.1K

逆向工程师吐槽AI帮做二进制分析,比自己又快又准

开发者@realNyarime在𝕏分享,用AI配合IDA Pro MCP做逆向分析,比自己手动效率高很多

现在用AI配合IDA Pro MCP做逆向分析,得到的结果比开发者自己分析得更全面,而且又快又准。在AI Agent能力还没这么强的时候,开发者只能打开IDA手动追踪、打断点,有时候要熬三天三夜才能完成,就算辛苦完成也会有成就感。这样的手工逆向日子已经一去不复返了,开发者忍不住感慨自己有些“道心破碎”。

做逆向分析使用的AI模型可以参考一张对照表,部分国产模型虽然是基于题库训练,但实际解决问题时表现不错,甚至比Claude更好用。

在 X 看原帖 ↗
5.1K57746
社交 · @PaulBonnet▲ 1.9万

ChatGPT后最大的AI发布不会出现在个人电脑上,而是在WhatsApp

PaulBonnet在𝕏发文称,此次AI发布将影响Meta、Booking、保险公司及从未用过ChatGPT的用户

ChatGPT问世以来规模最大的一次AI发布,不会出现在你的个人笔记本电脑上。它将发生在WhatsApp平台。

本次发布涉及Meta、在线旅游平台Booking、你的保险公司,以及所有从未打开过ChatGPT的用户。

在 X 看原帖 ↗
1.9万75846
人工智能代理 · @Fei2411▲ 9.6K

第三方AI代理Devin使用体验优于直接订阅GPT、Claude

用户@Fei2411在𝕏分享体验,Devin通过API调用GPT、Claude比直接订阅更稳定

不少AI用户都会直接订阅GPT、Claude Code来使用模型,不过有用户分享体验,使用Devin这类第三方AI代理其实体验更好。

Devin这类第三方AI代理(比如Droid)通过API调用GPT和Claude模型,服务稳定性比直接在Codex、Claude Code中使用高很多。

使用这类第三方代理不用担心模型「降智」问题,整体体验甚至比直接订阅GPT、Claude Code更好。

在 X 看原帖 ↗
9.6K15722
测试 · @robj3d3

用户测试Claude Sonnet 5.5生成动态图形视频,它搞错了需求

网友@robj3d3在X平台测试Claude Sonnet 5.5生成视频需求,结果模型搞错了核心要求

网友@robj3d3在X平台对Claude Sonnet 5.5进行了一项生成任务测试,要求它制作一段15秒的SuperX品牌动态图形视频,展示自身作为动态设计师的能力,相当于一份个人作品集。

测试结果显示,Claude Sonnet 5.5完全忽略了“SuperX”这个核心指令,生成内容全程围绕自己是多么优秀的动态设计师展开。@robj3d3提到,另一款模型Opus 5.5则正确理解了任务要求。

据@robj3d3介绍,SuperX是在X平台涨粉的最佳方式,尽管Claude Sonnet 5.5这次任务失败了,但它仍然可以免费试用。

在 X 看原帖 ↗
工具 · @your_javaguy▲ 529

开发者自制动画短视频制作流程工具 支持Claude与Kimi

@your_javaguy在𝕏分享自制工具,适配短内容,可定制品牌与个人风格

开发者@your_javaguy分享了自己制作动画短视频的方法,并公开了为此开发的自制工具。这个工具同时支持Claude和Kimi,最适合制作短内容。

整个制作流程为:生成创意→制作音频→生成自带内嵌字幕的视频。

工具支持根据自身品牌和个人风格定制,相关链接已经在原文放出。

在 X 看原帖 ↗
52963026

今天的 33 条信号到这里下一轮 12:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新