AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 8 月 28 日 · 08:00 更新 0 文章0 信号0 主题
试试:

今天发生了什么1 分钟读懂

Anthropic 发布 Model Hardware Standard(MHS)研究预览:一个让 AI 智能体安全操作科研与先进制造物理设备的新标准。AI 正从数字内容走向真实设备,操作规范先被定下来了。

Google 的 Gemini Omni 1.1 Flash 上线 AI Studio,开发者通过 API 就能生成视频,从 360p 草稿超分到 4K 成品。视频生成的调用门槛再降一档。

Thomson Reuters 花 4000 万美元用开源基础模型训出自有模型,不再依赖 Anthropic 的 API。这与昨天英伟达拟收购 Hugging Face 是同一逻辑:顶级客户正把供应链关键环节收回自己手里。

另外,预印本网站开始出现冒用学者姓名的 AI 水论文,多名学者发现自己没写过的论文挂着自己的名字。

今日值得看
01 wan 3.0 一张参考图锁死同一人的视频提示词 wan 3.0 上传一张参考图,14 套造型同脸不变,提示词逐秒拆解
02 OpenInstinct开源可自托管,支持所有大模型 代码、数据、密码都由自己控制,可以部署在Vercel,使用时不需要连公共互联网。

我们很高兴发布 OpenInstinct:Instinct 但支持自托管、开源,并且兼容所有模型。 你可以完全掌控代码、数据和密码。 部署到 Vercel,再也不用手动联网操作了。

03 @kwindla推出PhoneLLM,解决语音智能体延迟痛点 做语音智能体不用再在延迟和能力之间妥协,低成本低延迟的开源方案已经可用,能大幅降低语音AI服务的部署成本。

隆重推出 PhoneLLM,一款面向语音代理的开源模型。它在典型语音代理任务上能达到 GPT 5.6 Terra 的性能,延迟仅为其三分之一,成本仅为其十八分之一。

04 OpenResearch推出autoresearch自动研究arXiv论文 多个AI代理可帮你复现、实验arXiv论文,还能并行运行强化学习实验,帮做学术研究的人节省重复实验的时间

介绍针对 arXiv 论文的自动研究功能:使用一大批 Claude/Codex 智能体复现和实验任意 arXiv 论文。 训练后,你的智能体可以通过 @tinkerapi 启动并行强化学习运行,同时你可以观察实验树的生长。

今日焦点

AI代理统一调度实验室设备,集成时间从数周缩至几小时

一个实验室要跑通自动化流程,得先把硬件连起来。显微镜、液体处理器、机械臂来自不同供应商,各有各的软件和接口。光是这一步,通常要花数周甚至数月。Anthropic发布了一个模型硬件标准,简称MHS,想把集成时间压到几小时甚至几分钟。它是给AI代理用的共享规范,让代理安全操作物理设备。首批开放给科研实验室和先进制造商。

MHS的起点是Anthropic和HHMI Janelia研究园区的合作。Anthropic的Alek Kemeny来自有益部署团队,Janelia的Arco Bast是博士后。两人一起做了个共享内存字典,仪器之间能以内存速度通信。

MHS的办法是标准化驱动。

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达32 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

08:00 本轮更新 · 下一轮 12:30
行业动态 · Hacker News▲ 111

开发者k9294发布Gemini-3.5-Transcribe工具

需要音频转文字的用户可以多一个基于Gemini模型的新工具选择,可关注后续实际使用体验

行业动态 · Hacker News▲ 172

Hacker News 讨论Gemini Omni 1.1 Flash新版

Gemini新版本曝光,关注谷歌大模型迭代的人,可以留意后续动向

社区讨论:多数用户聚焦技术之外的行业影响,有人提到大家常讨论生成式AI对开发者的影响,却很少关注AI对配音演员和影视演员的冲击。有人对比行业动向,提出OpenAI已经完全放弃Sora项目,但谷歌仍在重度投资视频生成,可能是把视频生成当做开发世界模型的核心环节。不少用户提出质疑,有人称含人类的AI生成视频仍有严重的恐怖谷效应,有人指出该版本依然无法实现将生成视频和已有音频同步。

在 HN 看讨论 ↗   原文 / 论文 ↗
模型发布 · @GoogleAI▲ 5.9万

Google推出Gemini Omni 1.1 Flash,支持视频生成编辑

它集成了Voe已有的创作控制功能,还新增了包括4K在内的新能力。给做视频剪辑的人多了AI工具选项。

认识一下 Gemini Omni 1.1 Flash ⚡️,这是我们最新推出的视频生成与编辑多模态模型。

它现在整合了你最爱的 Veo 创意控制功能,还新增了全新能力。你可以使用 4K 超分辨率、首帧/末帧控制,以及快速 360p 草稿生成等功能。

但最大的升级是什么?是更上一层楼的场景扩展能力。

使用 Omni 1.1,你可以基于原视频中 10 秒的上下文来扩展场景,相比 Veo 原先只支持 1 秒是巨大的飞跃!

这意味着更强的连贯性、更深度的控制,以及更长、更统一的叙事。点击下方看实际演示↓

在 X 看原帖 ↗
5.9万70879261
模型发布 · @tavus▲ 1.6万

tavus推出Sparrow-2,主打实时对话理解

做AI对话产品的开发者可以直接调用,它目前给Tavus自家产品提供能力。目前AI对话仍被认为是难度很高的问题。

人机对话是 AI 领域最难解决的问题之一。

今天,我们正式推出 Sparrow-2,这是我们最先进的实时对话理解模型。

它为 Tavus PALs 带来了大多数语音 AI 至今仍不具备的能力:理解对话当前的进展,并决定下一步该做什么——该何时倾听、等待、开口,或是继续说下去。

在 X 看原帖 ↗
1.6万48261183
行业动态 · @HedgieMarkets▲ 9.2K

Thomson Reuters花4000万自建模型 脱离Anthropic

大公司靠开源基础模型训自有模型,成本远低于持续支付API费用,这套方案已经跑通,未来顶级API厂商的溢价空间会持续被压缩。

阅读全文 →
9.2K7125487
新品发布 · @induction_labs▲ 2.0万

induction_labs发布intrinsic discovery 新学习方法

训练出的世界模型在模拟终端环境时表现超过GPT-5.6 Sol,未来AI自主学习少了一道人工门槛

我们推出了内在发现(intrinsic discovery),一种全新的学习方法,能让模型在无人工监督的情况下,在开放环境中自主探索和学习。

借助内在发现,我们训练出了一个世界模型,它在模拟终端环境方面的表现超过了 GPT-5.6 Sol。

在 X 看原帖 ↗
2.0万33480347
新品发布 · @shinshin86▲ 3.7万

赖泽聊天AI带火PC端私有AI角色聊天开发

开发可自定义声音性格界面,全程在本地PC完成,不用依赖外部服务,想做专属AI角色聊天空间可以参考这条路子

据称,随着近期成为话题的「Raiza Chat AI」出现,越来越多人开始挑战在PC上开发属于自己的AI角色聊天👀

如果你对聊天开发感兴趣,可以去看看引用内容。你可以用Claude Code和Codex轻松做出视频里那样的AI角色聊天,不光声音和性格,聊天界面也能按照自己的喜好自定义。

它不需要依托外部服务,可以直接在你的PC里搭建,因此能做出完全只属于你的AI角色聊天空间。

还支持自选头像格式,你可以选自己想用的头像格式。另外,如果你有希望新增支持的头像格式,也欢迎提需求😊

在 X 看原帖 ↗
3.7万44422458
新品发布 · @GoogleAIStudio▲ 6.4万

Google AI Studio发布Gemini Omni 1.1 Flash,支持生视频

普通开发者也能通过API调用带视频生成能力的大模型,可直接从360p草稿 upscale 到4K成品,生成视频门槛再降一档

介绍 Gemini Omni 1.1 Flash。该模型为开发者带来了一套全新的创意控制工具与生成式视频能力。

- 扩展场景以实现更长的叙事
- 可指定首帧与末帧
- 以 360p 分辨率更高效地起草视频
- 最高可升频至 4K 分辨率
- 可在多模态输入中添加视频参考

目前该模型已可通过 Gemini API 和 AI Studio 使用。

在 X 看原帖 ↗
6.4万98946175
新品发布 · @AnthropicAI▲ 10.4万

AnthropicAI发布Model Hardware Standard (MHS) 研究预览第一阶段

AI 不只会处理数字内容,现在开始接入物理设备,未来科研和制造环节里,AI 可能直接帮你完成实体操作

今日,我们启动 Model Hardware Standard (MHS) 研究预览的第一阶段。这是一套全新标准,用于让 AI 智能体安全操作科研与先进制造领域的物理设备。

了解更多:https://www.anthropic.com/news/model-hardware-standard-research-preview

在 X 看原帖 ↗
10.4万1431.7K450
深度观点 · @GoogleDeepMind▲ 2.4万

DeepMind高管讨论:AI要学会自我怀疑?

这套思路如果落地,能让AI在天气预报、机器人这类场景里做出更安全可靠的决策,可以关注后续研究进展

从天气预报到机器人学,智能决策都依赖于对未知的理解。

我们的研究副总裁 @ZoubinGhahrama1 与 @fryrsquared 一同探讨,为什么教会系统自我怀疑和概率思维能带来更安全、更可靠的真实世界决策。🧠 观看本期节目 ↓

时间码:
00:00 引言
01:06 不确定性的作用
07:45 正确性与置信度
09:40 历史视角
16:10 AI 中的贝叶斯思维
26:30 真实世界中的不确定性
36:42 未来研究与 AGI

在 X 看原帖 ↗
2.4万2017945
AI开发 · @lydiahallie▲ 4.1万

开发者征集Claude Code物理场景应用开发案例

开发者Lydia Hallie征集Claude Code在实体场景的使用案例

如果你正在用 Claude Code 做实体相关的项目(固件、机器人、传感器、家庭自动化等等),我非常想听听你的设备配置和你正在搭建的东西!

在 X 看原帖 ↗
4.1万19383135
🔥 热点追踪 · @AnthropicAI▲ 51.1万

Anthropic发布Model Hardware Standard (MHS)研究预览(第一阶段)

Anthropic推出Model Hardware Standard (MHS),这是让AI智能体安全操作科研与先进制造物理设备的新标准,目前已启动第一阶段研究预览,业内人士对此展开讨论。后续看看它在湿实验室的落地表现。

📖 阅读深度解读 →
51.1万4234.2K1.3K
学术 · @emollick▲ 1.6万

预印本网站出现冒用学者姓名的AI水论文

已有多名学者遇到这种情况,自己没写过没见过的论文,挂着自己的名字放在网站上。

我发现在预印本网站上有不少挂着我名字的AI垃圾论文,这些论文我既没写过,也从来没见过。

我聊过的其他学者也遇到了同样的情况。

我不认为现在所有这类论文都是真的……不过质量尚可的AI论文工厂很快就要出现了。

在 X 看原帖 ↗
1.6万4577
AI开发 · @omarsar0▲ 1.8万

做AI代理不一定需要专门的编排框架

现成常用的代理框架本身就支持单独并行处理任务,动态生成代理框架的思路没得到足够关注。

阅读全文 →
1.8万14284173
前沿研究 · @emollick▲ 1.0万

@emollick发布智能体购物偏好研究

如果你用AI帮忙选商品,小差异就会改变它的选择,提前预判AI选品结果这件事做不到。

🚨我们的新研究考察了智能体购物:你能否始终预测(或是通过营销手段影响)智能体的选择?答案是不能。我们发现,哪怕是微小差异(页面浏览顺序、记忆)都会以不可预测的方式改变AI的偏好。

在 X 看原帖 ↗
1.0万118531
深度观点 · @noor36758▲ 1.9K

博主给不同AI开发技能排了难度等级

想入行AI开发,可以对照这个难度表安排学习顺序,看看哪些技能适合入门,哪些需要更久积累。

按难度排序的 AI 开发技能 🤖

🔴 模型训练 —— 极难
🔴 微调 LLM —— 极难
🔴 多智能体系统 —— 难
🔴 AI 基础设施 —— 难

🔵 RAG —— 中偏难
🔵 向量数据库 —— 中等
🔵 AI 智能体 —— 中偏难
🔵 LangGraph —— 中等

🟢 提示词工程 —— 简单
🟢 OpenAI API —— 简单
🟢 Claude API —— 简单
🟢 Gemini API —— 简单

哪项 AI 技能实际上被低估了?👀

在 X 看原帖 ↗
1.9K75721
工具产品 · @AISecurityInst▲ 6.0K

AISecurityInst 开源 optstop 评估工具

前沿AI评估需要上亿token,每一次无效试错都要花钱。这个工具可以帮做AI评估的人省下不必要的token成本。

部分前沿AI评估需要数亿token,每一次失败的试验都会产生实实在在的成本。

我们推出了optstop:这是我们的开源工具,可以在估值已经足够精确的时候终止评估,在估值不够精确的时候让评估继续运行。🧵

在 X 看原帖 ↗
6.0K119341
实战经验 · @ungetsuli▲ 1.1万

@ungetsuli分享清理屎山代码的AI Prompt方案

长期用AI写代码迭代会累积冗余代码,增加维护负担。这套方法用多代理分工清扫,能帮你降低代码库的维护成本。

分享一段最近实测非常有效的 Prompt,专门清理 AI Coding 长程迭代以后留下的屎山代码。

这套方案基于 DeepSeek Harness 仓库,随后经过优化和抽象,整理成了适用于一般代码库的 simplify-codebase 规范。

AI 很擅长继续添加抽象、状态、接口和兼容层,却很少主动证明哪些东西已经可以安全删除。单次修改都看似合理,长期累积后,整个仓库会背上越来越多维护义务。

这套方法会先按真实模块和所有权边界拆分任务,由多个子代理并行清扫,主代理处理跨模块契约并完成最终验证。

另一个很好用的工作流:先让网页端 Pro 模型审查整个仓库并生成方案,再交给 Codex 按检查结果实际修改和验证。

仓库地址:
完整提示词见下图。

在 X 看原帖 ↗
1.1万11118286
AI医疗 · @petergyang▲ 1.2K

用户上传160页病历给AI 建议ChatGPT Health优化设计

用户@petergyang分享使用AI处理病历体验,呼吁ChatGPT Health面向患者和家属设计开放共享功能

用户@petergyang在𝕏上分享了自己的使用体验。他将共160页的个人医疗记录上传给AI工具,认为效果非常出色。

他公开提问@ChatGPT Health项目的团队成员都有哪些,同时提出设计建议。他指出这款产品不仅需要为患者设计,也应该照顾护理人员和患者家属。

目前这类医疗AI工具基本都只支持单人使用。医疗记录属于敏感隐私内容,但@petergyang认为,应当允许患者向直系亲属开放病历共享权限。

在 X 看原帖 ↗
1.2K143
动态 · @DamiDefi▲ 1.2万

SpaceXAI首席工程师发布C语言运行Grok 4.6一小时工作坊

该工作坊从零搭建项目,涵盖降token消耗、代理搭建等多个主题,可学习向AI代理分配工作

SpaceXAI的一名首席工程师发布了时长一小时的工作坊,内容是在C语言环境下运行Grok 4.6,将后续工作交付给GrokBot团队,整个项目从零开始搭建。

工作坊按时间划分了不同内容模块:1分14秒讲解降低token消耗的方法,4分27秒介绍工具工程相关内容,9分38秒聊到模型失忆问题,30分12秒讲解搭建AI代理的正确方式,44分08秒展示全栈项目的现场运行。

这类工作坊会改变人们向AI代理分配工作的思考方式。原文建议今晚跳过看剧,抽出一小时观看这个工作坊,之后可以阅读下方文章,学习如何用AI代理自动化整套日常流程。

在 X 看原帖 ↗
1.2万141313
智能体开发 · @kunchenguid▲ 1.5K

AI开发者谈AI智能体开发的苦涩教训与核心方向

开发者从GPT-4到Sonnet 3.5 v2的开发经验出发,提出应当专注三个长期不变的核心基础

阅读全文 →
1.5K45027
强化学习 · @mattshumer_▲ 7.4K

AI研究者看好HuggingFace合作方的强化学习训练项目

X用户mattshumer_称产品发布时模型将可自主完成强化学习训练配置,希望提前测试

mattshumer_在X平台发文表示,这个项目相当出色。等到该产品正式推出时,模型会非常擅长自主配置强化学习(RL)运行流程,完成相关训练。

mattshumer_@了Hugging Face和Pollen Robotics,表示希望能够提前参与测试,之后会向公众分享自己的看法与实验结果。

在 X 看原帖 ↗
7.4K295
AI工具 · @eCom_Amin▲ 2.5K

开发者用Claude自动化整流程打造软文生产系统

基于Opus 5 Claude代码模式搭建,包含全套提示词与文件,可免费分享给关注者

阅读全文 →
2.5K46236
AI编码 · @AYi_AInotes▲ 4.7K

Cursor工程师用AI Agent实现每月千PR高效研发

顶级工程师搭建自动化验证流程,指挥AI军团并行开发

阅读全文 →
4.7K124242
开发 · @0xCodila▲ 7.4K

前Cursor现SpaceX AI工程师用10个GrokBot自动完成开发任务

工程师打造GrokBot代理团队,睡眠时可自动推进工作提交PR

前Cursor工程师,现SpaceXAI工程师说:「我再也不用一步步提示/微观管理我那大约10个GrokBot智能体了。我睡觉的时候,我的「参谋长」会管理整个机器人团队的任务,它们还能推送PR」。

在一场30分钟的研讨会上,poteto展示了她如何搭建一支全天候运行的GrokBot团队来自动化自己的生活,以及自动化如何改变了她的代码(视频的第一部分)。

这段内容的价值超过十多本讲GrokBot和软件工程的指南。观看视频,向SpaceXAI团队学习从代码到生活的全自动化,然后阅读文章,正确搭建好整支团队↓

在 X 看原帖 ↗
7.4K888140
3D建模 · @louszbd▲ 828

开发者使用GLM-5.3-Flash在Blender构建3D梦幻厨房

开发者用GLM-5.3-Flash在Blender中搭建出3D梦幻厨房场景

我们使用 GLM-5.3-Flash 搭建了一个理想厨房。这是一个在 Blender 中构建的 3D 世界。这不是一段生成视频。

在 X 看原帖 ↗
8282609
自动化运维 · @gkpacker▲ 5.4K

开发者基于Grok Bot构建自动运维SRE机器人

该机器人可自动监控排查问题并提交代码修复实现系统自愈

我在Grok Bot做了一个SRE机器人,用来检查日志、链路追踪、Sentry里的错误,还会定期检查我存在datadog里的仪表盘,自动持续优化系统。

它会定期运行,而且每次部署的时候,它都会观测日志、链路追踪,识别代码里的问题,然后提交修正用的PR。

我认为这个@bot和使用claude/codex的区别,就在于它拥有特定领域的例行工作和职责,因为它是7×24小时不间断运行的。

现在每次部署都能以一种出乎意料的方式自我修复,所有错误和慢查询都会被自动修复,我根本不用停下来手动分析所有这些内容,而且这还只是众多机器人中的一个。我们生活在一个不可思议的时代。

接下来它要做的是观测部署,出现问题的时候执行回滚,同时提交修复方案。

在 X 看原帖 ↗
5.4K513897
大模型 · @MiaAI_lab▲ 1.6万

博主评价GLM-5.3 Flash性能优于同规模其他大模型

海外AI博主称GLM-5.3 Flash性能品质优于其他可部署模型

我改主意了。如果你追求最高质量,GLM-5.3 Flash 值得你优先于其他任何模型运行。它是能放进 2 块 DGX Spark 里的最好模型。

这个模型能做到其他模型根本做不到的事。它比 GLM-5.2 更好,体积还只有一半。

希望我们能早日见到 DFlash2,到时候它就能真正大放异彩了!

在 X 看原帖 ↗
1.6万1335569
🚀 新品发布
新品发布 · @AnthropicAI▲ 10.4万

AnthropicAI发布Model Hardware Standard (MHS) 研究预览第一阶段

AI 不只会处理数字内容,现在开始接入物理设备,未来科研和制造环节里,AI 可能直接帮你完成实体操作

今日,我们启动 Model Hardware Standard (MHS) 研究预览的第一阶段。这是一套全新标准,用于让 AI 智能体安全操作科研与先进制造领域的物理设备。

了解更多:https://www.anthropic.com/news/model-hardware-standard-research-preview

在 X 看原帖 ↗
10.4万1431.7K450
新品发布 · @GoogleAIStudio▲ 6.4万

Google AI Studio发布Gemini Omni 1.1 Flash,支持生视频

普通开发者也能通过API调用带视频生成能力的大模型,可直接从360p草稿 upscale 到4K成品,生成视频门槛再降一档

介绍 Gemini Omni 1.1 Flash。该模型为开发者带来了一套全新的创意控制工具与生成式视频能力。

- 扩展场景以实现更长的叙事
- 可指定首帧与末帧
- 以 360p 分辨率更高效地起草视频
- 最高可升频至 4K 分辨率
- 可在多模态输入中添加视频参考

目前该模型已可通过 Gemini API 和 AI Studio 使用。

在 X 看原帖 ↗
6.4万98946175
新品发布 · @shinshin86▲ 3.7万

赖泽聊天AI带火PC端私有AI角色聊天开发

开发可自定义声音性格界面,全程在本地PC完成,不用依赖外部服务,想做专属AI角色聊天空间可以参考这条路子

据称,随着近期成为话题的「Raiza Chat AI」出现,越来越多人开始挑战在PC上开发属于自己的AI角色聊天👀

如果你对聊天开发感兴趣,可以去看看引用内容。你可以用Claude Code和Codex轻松做出视频里那样的AI角色聊天,不光声音和性格,聊天界面也能按照自己的喜好自定义。

它不需要依托外部服务,可以直接在你的PC里搭建,因此能做出完全只属于你的AI角色聊天空间。

还支持自选头像格式,你可以选自己想用的头像格式。另外,如果你有希望新增支持的头像格式,也欢迎提需求😊

在 X 看原帖 ↗
3.7万44422458
新品发布 · @induction_labs▲ 2.0万

induction_labs发布intrinsic discovery 新学习方法

训练出的世界模型在模拟终端环境时表现超过GPT-5.6 Sol,未来AI自主学习少了一道人工门槛

我们推出了内在发现(intrinsic discovery),一种全新的学习方法,能让模型在无人工监督的情况下,在开放环境中自主探索和学习。

借助内在发现,我们训练出了一个世界模型,它在模拟终端环境方面的表现超过了 GPT-5.6 Sol。

在 X 看原帖 ↗
2.0万33480347
新品发布 · @askalphaxiv▲ 1.4万

OpenResearch推出autoresearch自动研究arXiv论文

多个AI代理可帮你复现、实验arXiv论文,还能并行运行强化学习实验,帮做学术研究的人节省重复实验的时间

介绍针对 arXiv 论文的自动研究功能:使用一大批 Claude/Codex 智能体复现和实验任意 arXiv 论文。

训练后,你的智能体可以通过 @tinkerapi 启动并行强化学习运行,同时你可以观察实验树的生长。

现在就去 OpenResearch 试用:

在 X 看原帖 ↗
1.4万25193154
新品发布 · @kwindla▲ 2.8万

@kwindla推出PhoneLLM,解决语音智能体延迟痛点

做语音智能体不用再在延迟和能力之间妥协,低成本低延迟的开源方案已经可用,能大幅降低语音AI服务的部署成本。

阅读全文 →
2.8万50508571
📰 行业动态
🔥 热点追踪 · @AnthropicAI▲ 51.1万

Anthropic发布Model Hardware Standard (MHS)研究预览(第一阶段)

Anthropic推出Model Hardware Standard (MHS),这是让AI智能体安全操作科研与先进制造物理设备的新标准,目前已启动第一阶段研究预览,业内人士对此展开讨论。后续看看它在湿实验室的落地表现。

📖 阅读深度解读 →
51.1万4234.2K1.3K
行业动态 · @HedgieMarkets▲ 9.2K

Thomson Reuters花4000万自建模型 脱离Anthropic

大公司靠开源基础模型训自有模型,成本远低于持续支付API费用,这套方案已经跑通,未来顶级API厂商的溢价空间会持续被压缩。

阅读全文 →
9.2K7125487
模型发布 · @tavus▲ 1.6万

tavus推出Sparrow-2,主打实时对话理解

做AI对话产品的开发者可以直接调用,它目前给Tavus自家产品提供能力。目前AI对话仍被认为是难度很高的问题。

人机对话是 AI 领域最难解决的问题之一。

今天,我们正式推出 Sparrow-2,这是我们最先进的实时对话理解模型。

它为 Tavus PALs 带来了大多数语音 AI 至今仍不具备的能力:理解对话当前的进展,并决定下一步该做什么——该何时倾听、等待、开口,或是继续说下去。

在 X 看原帖 ↗
1.6万48261183
模型发布 · @GoogleAI▲ 5.9万

Google推出Gemini Omni 1.1 Flash,支持视频生成编辑

它集成了Voe已有的创作控制功能,还新增了包括4K在内的新能力。给做视频剪辑的人多了AI工具选项。

认识一下 Gemini Omni 1.1 Flash ⚡️,这是我们最新推出的视频生成与编辑多模态模型。

它现在整合了你最爱的 Veo 创意控制功能,还新增了全新能力。你可以使用 4K 超分辨率、首帧/末帧控制,以及快速 360p 草稿生成等功能。

但最大的升级是什么?是更上一层楼的场景扩展能力。

使用 Omni 1.1,你可以基于原视频中 10 秒的上下文来扩展场景,相比 Veo 原先只支持 1 秒是巨大的飞跃!

这意味着更强的连贯性、更深度的控制,以及更长、更统一的叙事。点击下方看实际演示↓

在 X 看原帖 ↗
5.9万70879261
开源 · @samrags_▲ 2.0万

OpenInstinct开源可自托管,支持所有大模型

代码、数据、密码都由自己控制,可以部署在Vercel,使用时不需要连公共互联网。

我们很高兴发布 OpenInstinct:Instinct 但支持自托管、开源,并且兼容所有模型。

你可以完全掌控代码、数据和密码。

部署到 Vercel,再也不用手动联网操作了。

在 X 看原帖 ↗
2.0万15262193
学术 · @emollick▲ 1.6万

预印本网站出现冒用学者姓名的AI水论文

已有多名学者遇到这种情况,自己没写过没见过的论文,挂着自己的名字放在网站上。

我发现在预印本网站上有不少挂着我名字的AI垃圾论文,这些论文我既没写过,也从来没见过。

我聊过的其他学者也遇到了同样的情况。

我不认为现在所有这类论文都是真的……不过质量尚可的AI论文工厂很快就要出现了。

在 X 看原帖 ↗
1.6万4577
AI开发 · @omarsar0▲ 1.8万

做AI代理不一定需要专门的编排框架

现成常用的代理框架本身就支持单独并行处理任务,动态生成代理框架的思路没得到足够关注。

阅读全文 →
1.8万14284173
行业动态 · Hacker News▲ 172

Hacker News 讨论Gemini Omni 1.1 Flash新版

Gemini新版本曝光,关注谷歌大模型迭代的人,可以留意后续动向

社区讨论:多数用户聚焦技术之外的行业影响,有人提到大家常讨论生成式AI对开发者的影响,却很少关注AI对配音演员和影视演员的冲击。有人对比行业动向,提出OpenAI已经完全放弃Sora项目,但谷歌仍在重度投资视频生成,可能是把视频生成当做开发世界模型的核心环节。不少用户提出质疑,有人称含人类的AI生成视频仍有严重的恐怖谷效应,有人指出该版本依然无法实现将生成视频和已有音频同步。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 111

开发者k9294发布Gemini-3.5-Transcribe工具

需要音频转文字的用户可以多一个基于Gemini模型的新工具选择,可关注后续实际使用体验

💡 深度观点
深度观点 · @GoogleDeepMind▲ 2.4万

DeepMind高管讨论:AI要学会自我怀疑?

这套思路如果落地,能让AI在天气预报、机器人这类场景里做出更安全可靠的决策,可以关注后续研究进展

从天气预报到机器人学,智能决策都依赖于对未知的理解。

我们的研究副总裁 @ZoubinGhahrama1 与 @fryrsquared 一同探讨,为什么教会系统自我怀疑和概率思维能带来更安全、更可靠的真实世界决策。🧠 观看本期节目 ↓

时间码:
00:00 引言
01:06 不确定性的作用
07:45 正确性与置信度
09:40 历史视角
16:10 AI 中的贝叶斯思维
26:30 真实世界中的不确定性
36:42 未来研究与 AGI

在 X 看原帖 ↗
2.4万2017945
深度观点 · @noor36758▲ 1.9K

博主给不同AI开发技能排了难度等级

想入行AI开发,可以对照这个难度表安排学习顺序,看看哪些技能适合入门,哪些需要更久积累。

按难度排序的 AI 开发技能 🤖

🔴 模型训练 —— 极难
🔴 微调 LLM —— 极难
🔴 多智能体系统 —— 难
🔴 AI 基础设施 —— 难

🔵 RAG —— 中偏难
🔵 向量数据库 —— 中等
🔵 AI 智能体 —— 中偏难
🔵 LangGraph —— 中等

🟢 提示词工程 —— 简单
🟢 OpenAI API —— 简单
🟢 Claude API —— 简单
🟢 Gemini API —— 简单

哪项 AI 技能实际上被低估了?👀

在 X 看原帖 ↗
1.9K75721
📌 其他
前沿研究 · @emollick▲ 1.0万

@emollick发布智能体购物偏好研究

如果你用AI帮忙选商品,小差异就会改变它的选择,提前预判AI选品结果这件事做不到。

🚨我们的新研究考察了智能体购物:你能否始终预测(或是通过营销手段影响)智能体的选择?答案是不能。我们发现,哪怕是微小差异(页面浏览顺序、记忆)都会以不可预测的方式改变AI的偏好。

在 X 看原帖 ↗
1.0万118531
工具产品 · @AISecurityInst▲ 6.0K

AISecurityInst 开源 optstop 评估工具

前沿AI评估需要上亿token,每一次无效试错都要花钱。这个工具可以帮做AI评估的人省下不必要的token成本。

部分前沿AI评估需要数亿token,每一次失败的试验都会产生实实在在的成本。

我们推出了optstop:这是我们的开源工具,可以在估值已经足够精确的时候终止评估,在估值不够精确的时候让评估继续运行。🧵

在 X 看原帖 ↗
6.0K119341
实战经验 · @ungetsuli▲ 1.1万

@ungetsuli分享清理屎山代码的AI Prompt方案

长期用AI写代码迭代会累积冗余代码,增加维护负担。这套方法用多代理分工清扫,能帮你降低代码库的维护成本。

分享一段最近实测非常有效的 Prompt,专门清理 AI Coding 长程迭代以后留下的屎山代码。

这套方案基于 DeepSeek Harness 仓库,随后经过优化和抽象,整理成了适用于一般代码库的 simplify-codebase 规范。

AI 很擅长继续添加抽象、状态、接口和兼容层,却很少主动证明哪些东西已经可以安全删除。单次修改都看似合理,长期累积后,整个仓库会背上越来越多维护义务。

这套方法会先按真实模块和所有权边界拆分任务,由多个子代理并行清扫,主代理处理跨模块契约并完成最终验证。

另一个很好用的工作流:先让网页端 Pro 模型审查整个仓库并生成方案,再交给 Codex 按检查结果实际修改和验证。

仓库地址:
完整提示词见下图。

在 X 看原帖 ↗
1.1万11118286
大模型 · @choopyplug1▲ 3.0万

谷歌团队发布线束工程9页文档 取代提示工程

谷歌团队发布9页线束工程文档,提出Agent新公式

阅读全文 →
3.0万49271522
大模型 · @MiaAI_lab▲ 1.6万

博主评价GLM-5.3 Flash性能优于同规模其他大模型

海外AI博主称GLM-5.3 Flash性能品质优于其他可部署模型

我改主意了。如果你追求最高质量,GLM-5.3 Flash 值得你优先于其他任何模型运行。它是能放进 2 块 DGX Spark 里的最好模型。

这个模型能做到其他模型根本做不到的事。它比 GLM-5.2 更好,体积还只有一半。

希望我们能早日见到 DFlash2,到时候它就能真正大放异彩了!

在 X 看原帖 ↗
1.6万1335569
自动化运维 · @gkpacker▲ 5.4K

开发者基于Grok Bot构建自动运维SRE机器人

该机器人可自动监控排查问题并提交代码修复实现系统自愈

我在Grok Bot做了一个SRE机器人,用来检查日志、链路追踪、Sentry里的错误,还会定期检查我存在datadog里的仪表盘,自动持续优化系统。

它会定期运行,而且每次部署的时候,它都会观测日志、链路追踪,识别代码里的问题,然后提交修正用的PR。

我认为这个@bot和使用claude/codex的区别,就在于它拥有特定领域的例行工作和职责,因为它是7×24小时不间断运行的。

现在每次部署都能以一种出乎意料的方式自我修复,所有错误和慢查询都会被自动修复,我根本不用停下来手动分析所有这些内容,而且这还只是众多机器人中的一个。我们生活在一个不可思议的时代。

接下来它要做的是观测部署,出现问题的时候执行回滚,同时提交修复方案。

在 X 看原帖 ↗
5.4K513897
AI开发 · @lydiahallie▲ 4.1万

开发者征集Claude Code物理场景应用开发案例

开发者Lydia Hallie征集Claude Code在实体场景的使用案例

如果你正在用 Claude Code 做实体相关的项目(固件、机器人、传感器、家庭自动化等等),我非常想听听你的设备配置和你正在搭建的东西!

在 X 看原帖 ↗
4.1万19383135
3D建模 · @louszbd▲ 828

开发者使用GLM-5.3-Flash在Blender构建3D梦幻厨房

开发者用GLM-5.3-Flash在Blender中搭建出3D梦幻厨房场景

我们使用 GLM-5.3-Flash 搭建了一个理想厨房。这是一个在 Blender 中构建的 3D 世界。这不是一段生成视频。

在 X 看原帖 ↗
8282609
开发 · @0xCodila▲ 7.4K

前Cursor现SpaceX AI工程师用10个GrokBot自动完成开发任务

工程师打造GrokBot代理团队,睡眠时可自动推进工作提交PR

前Cursor工程师,现SpaceXAI工程师说:「我再也不用一步步提示/微观管理我那大约10个GrokBot智能体了。我睡觉的时候,我的「参谋长」会管理整个机器人团队的任务,它们还能推送PR」。

在一场30分钟的研讨会上,poteto展示了她如何搭建一支全天候运行的GrokBot团队来自动化自己的生活,以及自动化如何改变了她的代码(视频的第一部分)。

这段内容的价值超过十多本讲GrokBot和软件工程的指南。观看视频,向SpaceXAI团队学习从代码到生活的全自动化,然后阅读文章,正确搭建好整支团队↓

在 X 看原帖 ↗
7.4K888140
AI编码 · @AYi_AInotes▲ 4.7K

Cursor工程师用AI Agent实现每月千PR高效研发

顶级工程师搭建自动化验证流程,指挥AI军团并行开发

阅读全文 →
4.7K124242
AI工具 · @eCom_Amin▲ 2.5K

开发者用Claude自动化整流程打造软文生产系统

基于Opus 5 Claude代码模式搭建,包含全套提示词与文件,可免费分享给关注者

阅读全文 →
2.5K46236
强化学习 · @mattshumer_▲ 7.4K

AI研究者看好HuggingFace合作方的强化学习训练项目

X用户mattshumer_称产品发布时模型将可自主完成强化学习训练配置,希望提前测试

mattshumer_在X平台发文表示,这个项目相当出色。等到该产品正式推出时,模型会非常擅长自主配置强化学习(RL)运行流程,完成相关训练。

mattshumer_@了Hugging Face和Pollen Robotics,表示希望能够提前参与测试,之后会向公众分享自己的看法与实验结果。

在 X 看原帖 ↗
7.4K295
智能体开发 · @kunchenguid▲ 1.5K

AI开发者谈AI智能体开发的苦涩教训与核心方向

开发者从GPT-4到Sonnet 3.5 v2的开发经验出发,提出应当专注三个长期不变的核心基础

阅读全文 →
1.5K45027
动态 · @DamiDefi▲ 1.2万

SpaceXAI首席工程师发布C语言运行Grok 4.6一小时工作坊

该工作坊从零搭建项目,涵盖降token消耗、代理搭建等多个主题,可学习向AI代理分配工作

SpaceXAI的一名首席工程师发布了时长一小时的工作坊,内容是在C语言环境下运行Grok 4.6,将后续工作交付给GrokBot团队,整个项目从零开始搭建。

工作坊按时间划分了不同内容模块:1分14秒讲解降低token消耗的方法,4分27秒介绍工具工程相关内容,9分38秒聊到模型失忆问题,30分12秒讲解搭建AI代理的正确方式,44分08秒展示全栈项目的现场运行。

这类工作坊会改变人们向AI代理分配工作的思考方式。原文建议今晚跳过看剧,抽出一小时观看这个工作坊,之后可以阅读下方文章,学习如何用AI代理自动化整套日常流程。

在 X 看原帖 ↗
1.2万141313
AI医疗 · @petergyang▲ 1.2K

用户上传160页病历给AI 建议ChatGPT Health优化设计

用户@petergyang分享使用AI处理病历体验,呼吁ChatGPT Health面向患者和家属设计开放共享功能

用户@petergyang在𝕏上分享了自己的使用体验。他将共160页的个人医疗记录上传给AI工具,认为效果非常出色。

他公开提问@ChatGPT Health项目的团队成员都有哪些,同时提出设计建议。他指出这款产品不仅需要为患者设计,也应该照顾护理人员和患者家属。

目前这类医疗AI工具基本都只支持单人使用。医疗记录属于敏感隐私内容,但@petergyang认为,应当允许患者向直系亲属开放病历共享权限。

在 X 看原帖 ↗
1.2K143

今天的 32 条信号到这里下一轮 12:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新