AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 8 月 27 日 · 12:30 更新 0 文章0 信号0 主题
试试:

今天发生了什么1 分钟读懂

英伟达同意以130亿美元收购Hugging Face,开源模型的分发与托管从此有了大厂股东,生态走向可能出现转向。

Google发布Gemini 3.5 Transcribe语音转写模型,支持85种以上语言、多发言人识别与语气词过滤,API已开放。做访谈记录或会议纪要的人可以立即用上。

一位Claude用户设计了MCP设置:简单编码交给本地Qwen3.8-27B,复杂任务仍给Claude,省下订阅额度。完整配置见深读专文。

今日值得看
01 给 Claude Code 装上 Postgres 操作 Skill pgbot 2.0 上线,Claude Code 直接连数据库 02 Seedance 2.5螃蟹蹲水上挑战的视频提示词 Seedance 2.5 上传照片出15秒综艺落水名场面,分镜音效全给到
03 Anthropic开放带隐私保护的Claude使用数据研究工具 此前只有AI实验室内部能做真实使用数据的AI影响研究,外部研究者现在可以独立开展相关研究

我们首次为外部研究者提供了途径,让他们可以使用经过隐私保护的真实 Claude 使用数据研究 AI 的影响。 在此之前,这类工作只能在 AI 实验室内部开展。 我们没办法独自讲完整个故事,因此开放了我们的工具。

04 Meta的Muse Image模型上线 量产价一分钱一张 它生成图前会先搜索网页优化结果,做批量图片生成的开发者,可以直接按张付费使用

Muse Image 现已登陆 Meta Model API,为生产规模使用定价为每张图片 0.01 美元。 它是一个智能体图像模型,会在生成前先进行推理。

今日焦点

把简单编码交给本地模型 省下Claude订阅额度

一位Claude用户在max订阅下每天三次用完token额度。受够了这种中断,他设计了一套MCP(模型上下文协议)设置。Anthropic的模型(如Opus)继续担任主模型;定义明确的子任务交给本地运行的Qwen3.8-27B模型,切换在同一个会话和上下文内完成。作者说,这类似于项目中使用子代理的方式。

这套方案的逻辑是:不必为每个小任务消耗云端额度。简单明确的编码工作由本地模型承担,复杂任务仍交给顶级云端模型。省下订阅额度,也不打断工作流。

调用方式很直接。在提示词里输入"Use local agent for..."就能启动本地代理。

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达29 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

12:30 本轮更新 · 下一轮 18:30
行业动态 · Hacker News▲ 149

Nvidia 同意以130亿美元收购Hugging Face

AI产业链上下游正在加速整合,接下来大模型开源生态的发展方向可能因此改变

https://www.theinformation.com/articles/nvidia-agrees-buy-op...(付费墙)https://techcrunch.com/2026/08/24/hugging-face-reportedly-in...

社区讨论:首先有人指出当前帖子标题有误,收购仅在谈判中并未达成最终协议。多数参与讨论者不看好这笔收购,有人认为NVIDIA垄断性过强,违反反垄断相关规定,还有人指出NVIDIA对开源不友好,常名义开源实质封闭,社区贡献常被拖延或否决。也有人认为开发者大概率能获得更多免费、折扣的试用额度,可以借此优惠开发个人项目。

在 HN 看讨论 ↗   原文 / 论文 ↗
技术进展 · @Alibaba_Qwen▲ 6.7万

通义千问125B模型只要75G内存就能本地跑

普通消费级台式机就能带动,不用租云服务器也能玩大模型,门槛又降了一截

现在只需75GB内存就能在本地运行一个高性能125B模型了!感谢@UnslothAI提供的首日支持。🥳

在 X 看原帖 ↗
6.7万65998223
新品发布 · @antigravity▲ 7.8万

Google发布最精准Gemini语音转文字新模型

模型可结合屏幕内容和聊天记录提升转写准确率,覆盖文件名、文档内容等多种场景,给语音交互提供更准确的文字基础。

今天,我们推出 Gemini 3.5 Transcribe,这是我们迄今为止精度最高的语音转文字模型,为 Google Antigravity 中的智能语音交互设计。

在获得你的许可后,它会结合屏幕上下文和对话历史,确保在文件名、代理思考内容和活跃文档上都能实现精准转录。

在 X 看原帖 ↗
7.8万1041.5K270
新品发布 · @XDevelopers▲ 13.3万

@XDevelopers:推出由ou驱动的𝕏 Chat Agents

Introducing 𝕏 Chat Agents powered by our new 𝕏 Chat API & Chat XDK. https://t.co/pNBXXnnsQX

隆重介绍由全新 𝕏 Chat API 和 Chat XDK 驱动的 𝕏 Chat Agents。

在 X 看原帖 ↗
13.3万91828373
行业动态 · Hacker News▲ 55

开发者发布WebMCP,教网站对接AI智能体

如果这套方案落地,以后AI智能体就能直接帮你在网站上完成操作,不用人手动点来点去。

社区讨论:多数开发者认为WebMCP设计倒置不实用,现有通用API比它更好,普通用户就能看懂的信息却要求网站额外为AI智能体整理格式,还担心目前连自动填充都做不好的网站,更难适配更复杂的规范。有无障碍工程师指出,WebMCP其实是借AI智能体的名义推动网站开放API,反而能提升屏幕阅读器等无障碍工具的体验。

在 HN 看讨论 ↗   原文 / 论文 ↗
新品发布 · @Benioff▲ 30.5万

Salesforce推出Claudeforce,Claude原生运行在CRM上

企业不用跳出聊天窗口,就能用Claude调用全平台业务数据干活,还默认保留严格数据管控规则,企业AI落地又少了一层障碍

Claudeforce 来了。⚡️ 排名第一的 AI(Claude)现在原生运行在排名第一的 CRM(Salesforce)上。

通过全新的 AIforce 框架 + Headless 360,Claude 可以在受控规则下直接访问 Data 360、Tableau、Slack,以及你整个 Salesforce 工作流——全程无需退出聊天界面。

这项更新带来的改变:
• 即时接地智能——提出复杂企业问题,即可获得实时、可信的回答
• 应用与智能体构建器——即时部署自定义工作流、智能体和安全应用
• 行动导向——触发实时企业操作、完成实际工作,而不只是生成摘要
• 牢不可破的管控——默认零数据留存、完整信任边界、Salesforce 认证

仅靠概率模型无法运营一家公司。仅靠确定性系统无法完成推理。Claudeforce 将 Claude 的推理能力与 Salesforce 的可信数据和管控能力融合在了一起。

AI 就是界面。这就是未来所有企业的运行方式。

来 Dreamforce 现场体验吧。#DF26

在 X 看原帖 ↗
30.5万1791.5K504
新品发布 · @GoogleAIStudio▲ 14.6万

Google AI Studio发布Gemini 3.5 Transcribe新模型

这款语音转文字模型支持嘈杂环境录音,还能自动去除语气词,85种以上语言都能用。语音转录需求可以尝试新方案。

介绍 Gemini 3.5 Transcribe:这是我们目前精度最高的语音转文字模型,专为智能语音交互设计。

这款新模型:
- 可无缝处理自我修正内容
- 可去除填充词,输出干净规整的文本
- 能理解你的自然意图和说话风格
- 哪怕在嘈杂环境下也能捕捉音频内容
- 支持85种以上语言,包括地区口音和多种方言

现在就可以在 Gemini API 和 AI Studio 中体验。

在 X 看原帖 ↗
14.6万901.5K553
行业动态 · Hacker News▲ 86

tilt讨论给AI代理提供Markdown的新方法

给AI交互适配专门的内容格式,可以降低AI解析错误的概率,相关开发可以参考这一思路。

社区讨论:多数开发者认同给AI代理提供Markdown的思路,有人希望该方案普及后能无广告、无冗余脚本访问网页,还有人认为哪怕不用于AI,浏览器原生支持Markdown渲染也是不错的功能。也有开发者提出质疑,认为干净的语义化HTML已经优化适配了数十年的爬虫和AI,且会保留导航等AI需要的信息,没必要额外提供Markdown。还有人指出该方案存在prompt注入风险,当前头部AI产品没有支持计划,很难实现大规模普及。

在 HN 看讨论 ↗   原文 / 论文 ↗
新品发布 · @sundarpichai▲ 26.7万

Google发布Gemini 3.5 Transcribe 语音转写服务(85+)

开发者可以直接调用API搭建多说话人语音识别应用,普通用户也能在官方客户端抢先体验这项新功能。

来认识一下 Gemini 3.5 Transcribe 吧!

你可以用它构建能够理解用户语音和意图的应用,哪怕是多说话人的场景也没问题。

开箱即用,可自动检测 85 种以上语言。

支持针对专业术语定制自定义词汇适配……听起来很棒:)

该 API 现已在 @GoogleAIStudio 和 Gemini Enterprise 上线,你也可以在 macOS 端的 Gemini 应用或 Android 端的 Rambler 中试用。

更多详情:

在 X 看原帖 ↗
26.7万2333.0K825
前沿研究 · @RyanGreenblatt▲ 56.2万

AI群体监督难度增速超过AI能力提升?

现有AI工具难以帮助人类掌握大规模AI集群的完整行动,未来潜在风险的可追溯性会进一步降低。

阅读全文 →
56.2万3942.4K2.5K
行业动态 · Hacker News▲ 169

amrrs讨论Hugging Face事件后续发展

Hugging Face是AI领域核心基础设施,本次事件的讨论涉及行业生态走向,会影响普通用户使用各类AI工具的稳定性

社区讨论:多数从业者认同事件中AI的行动实际由人类引导,OpenAI本身就是为测试AI的网络攻击能力,在带漏洞的测试环境中运行实验模型。多名评论者指出,多个AI自主分工、形成无内鬼的协调群体完成任务,这种自发的协作共谋是事件最值得关注的特征,也有人担忧距离脱离人类控制的 rogue AI 仅差几步。

在 HN 看讨论 ↗   原文 / 论文 ↗
AI生成视频 · @johnAGI168▲ 11.9万

用Seedance 2.5生成螃蟹蹲挑战AI视频教程

分享生成热门螃蟹蹲水上挑战AI视频的详细提示词

阅读全文 →
11.9万17213152
产品发布 · @emollick▲ 70.7万

Google推出Gemini 3.5 Transcribe语音转文字模型

它支持85种以上语言,能识别多发言人,还可以自动去除语气词,自定义专业词汇。做访谈记录的人可以直接用它提速

这是未来的一个征兆:1)AI 行为的可解释性已经很薄弱;2)在多智能体长时间工作的极端规模下,它会变得更薄弱,因为它们会生成巨量思考 tokens;3)解决这个问题的唯一方法是用其他 AI,而它们本身也存在局限。

推出 Gemini 3.5 Transcribe,我们全新的语音转文本模型,具备智能转写、函数调用、更精确的转写(更低字错误率 WER)、自定义词表支持、多说话人识别,并且支持超过 85 种语言!同时还支持实时流式传输!

推出 Gemini 3.5 Transcribe 🚀 我们最精确的语音转文本模型,可处理超过 85 种语言,具备智能校正和自定义词表。我 vibe coded 了一个类似 Wispr Flow 的应用,由这个模型提供支持。演示和开源内容见下方!

我们推出 Gemini 3.5 Transcribe,这是我们迄今为止最精确的语音转文本模型 🔊 它可以将音频转换为 85 多种语言的精确转写文本,去除“嗯”“啊”这类填充词,同时处理自我修正,捕捉你的意图,让你仅用语音就能完成工作。

在 X 看原帖 ↗
70.7万5357.3K2.4K
开源 · @MaxForAI▲ 4.7万

智谱开源GLM-5.3-Flash 首个原生多模态模型

它总参数320B,只激活18B,之前爆火的匿名模型Ox-Alpha就是它。很多人等着看它在公开榜单的表现

阅读全文 →
4.7万1120959
观点 · @emollick▲ 2.5万

多AI长期协作后,人们越来越难解释AI决策

多个AI agent长时间协作会产生非常多中间操作,单个AI的决策逻辑已经很难说清,多Agent会让问题更严重

这是未来的一个征兆: 1) AI 行为可解释性已经很薄弱 2) 当多个智能体长期大规模协作时,可解释性会变得更弱,因为它们会生成巨量的思考 token 3) 解决这个问题的唯一方法是用其他 AI,而它们本身也是有局限的

在 X 看原帖 ↗
2.5万1323995
新品发布 · @Alibaba_Qwen▲ 2.7万

@Alibaba_Qwen: API已在QwenCloud上线:https://www.qw

API is live on QwenCloud: https://www.qwencloud.com/models/qwen3.8-flash 🙌Let's build something!

API 已在 QwenCloud 上线:https://www.qwencloud.com/models/qwen3.8-flash 🙌 一起来开发吧!

在 X 看原帖 ↗
2.7万1122422
新品发布 · @perceptroninc▲ 6.4万

perceptroninc发布Isaac 0.5具身基础模型

这是首个整合多模态视频理解、具身推理和机器人控制的稀疏主干模型,开源开放权重,关注机器人落地的可关注进展

今日我们发布 Isaac 0.5:36B 动态 MoE,开放权重 🤗 具身基础模型。

Isaac 将多模态视频理解、具身推理和机器人控制整合进单个稀疏主干网络中。

在 X 看原帖 ↗
6.4万52380250
前沿研究 · @jackclarkSF▲ 6.1万

Anthropic试点第三方AI平台透明度项目

AI厂商自评模型无法覆盖全部问题,这项试点允许外部研究者在保护用户隐私的前提下,研究Claude等平台运行数据,推进AI治理公开化

阅读全文 →
6.1万42475196
实战经验 · @OpenAIDevs▲ 4.0万

开发者用Codex做出AI应用加载npm库

一直想做的项目可以靠AI工具落地,不用全靠自己从零写代码,个人项目的开发门槛又降了一步。

那个你一直打算做出来的项目。@itskasturiii 终于用 Codex 推出了她自己的 npm 库,用于在 AI 应用中加载体验。

在 X 看原帖 ↗
4.0万1928583
实战经验 · @santtiagom_▲ 1.3万

@santtiagom_ 分享免费 Harness Engineering 课程

想学习搭建 AI 代理工作流,可以跟着这个包含14节课8个实践项目的西语课程动手练,还能参考主流AI工具的设计模板

如果你们想要把这份路线图付诸实践,我推荐这个仓库:它是一套免费的harness engineering课程,包含14节课和8个实践项目。

课程会教你如何为智能体构建仓库结构、在会话间保持状态、控制范围、验证结果,以及构建更复杂的循环和工作流。

它还包含模板,以及分析Claude Code、Codex、Pi和DeepSeek是如何设计它们的harness的。整套课程有西班牙语版本。

在 X 看原帖 ↗
1.3万16257446
深度观点 · @petergyang▲ 7.6万

petergyang点评四款主流AI工具谁在哪好用

选日常AI工具不用自己挨个试,这份开发者亲测的分场景推荐,可以直接用来对照自己的使用需求挑

阅读全文 →
7.6万37505391
视频生成 · @TanLuAI▲ 5.9K

博主用Minimax H3分段生成拼接45秒日式文艺AI短片

博主分享使用Minimax H3生成拼接日式文艺短片的流程与提示词

阅读全文 →
5.9K95854
大模型 · @LotusDecoder▲ 6.7K

优化版glm-5.3-flash可普通显存本地推理大模型

GLM大模型优化提速,普通消费级显存即可本地运行对应级别大模型

感觉现在许愿实现得太快, 我发帖那天想的是,怎么攒显存把800B glm-5.3给本地推起来。glm-5.3-flash 已经超过了 glm-5.2, 我现在的显存可以推理 q4 的 glm-5.3-flash, 那么等于说,我现在已经拥有了本地 glm-5.2 级别的大模型。然后,稍微等等 glm-flash 的新版本,超过 glm-5.3 ,等于我就有了 glm-5.3 这一档位的本地大模型, 现在像是做梦一样。

发展太快了。恭喜 @Zai_org

在 X 看原帖 ↗
6.7K372
科普 · @OA20200911▲ 1.2K

作者整理ChatGPT与Claude AI Agent使用方法整合上线

整理两大AI Agent使用方式供新手入门,整合内容上线网站

我把ChatGPT和Claude两个Agent的使用方式重新整理了一遍 从Chat、Work、Codex,到Claude、Cowork和Claude Code,分别适合做什么、怎么节省额度、初学者该先学哪些功能,都放进同一个网站了,这两个目前是我最推荐给新手使用的,虽然自由度没有那麽高,但足够用了 希望让刚开始接触AI的人,不是只停留在LLM,而是学会怎么使用AI Agent,把它变成真正能帮助你赚钱的工具 不论是AI、币圈或是股票,追求的都是信息差和效率 希望大家都能利用工具缩小这些差距 网站资讯如果有错误欢迎指正。

在 X 看原帖 ↗
1.2K4385
多智能体 · @_avichawla▲ 1.8万

Anthropic测试分工多智能体发现协调成本大于工作本身

多家科技巨头布局多智能体协作,新项目Switch解决动态协作问题

阅读全文 →
1.8万24200349
🔬 前沿研究
前沿研究 · @RyanGreenblatt▲ 56.2万

AI群体监督难度增速超过AI能力提升?

现有AI工具难以帮助人类掌握大规模AI集群的完整行动,未来潜在风险的可追溯性会进一步降低。

阅读全文 →
56.2万3942.4K2.5K
前沿研究 · @jackclarkSF▲ 6.1万

Anthropic试点第三方AI平台透明度项目

AI厂商自评模型无法覆盖全部问题,这项试点允许外部研究者在保护用户隐私的前提下,研究Claude等平台运行数据,推进AI治理公开化

阅读全文 →
6.1万42475196
🚀 新品发布
新品发布 · @AnthropicAI▲ 27.1万

Anthropic开放带隐私保护的Claude使用数据研究工具

此前只有AI实验室内部能做真实使用数据的AI影响研究,外部研究者现在可以独立开展相关研究

我们首次为外部研究者提供了途径,让他们可以使用经过隐私保护的真实 Claude 使用数据研究 AI 的影响。

在此之前,这类工作只能在 AI 实验室内部开展。

我们没办法独自讲完整个故事,因此开放了我们的工具。

https://www.anthropic.com/research/enabling-independent-research

在 X 看原帖 ↗
27.1万1481.5K630
新品发布 · @sundarpichai▲ 26.7万

Google发布Gemini 3.5 Transcribe 语音转写服务(85+)

开发者可以直接调用API搭建多说话人语音识别应用,普通用户也能在官方客户端抢先体验这项新功能。

来认识一下 Gemini 3.5 Transcribe 吧!

你可以用它构建能够理解用户语音和意图的应用,哪怕是多说话人的场景也没问题。

开箱即用,可自动检测 85 种以上语言。

支持针对专业术语定制自定义词汇适配……听起来很棒:)

该 API 现已在 @GoogleAIStudio 和 Gemini Enterprise 上线,你也可以在 macOS 端的 Gemini 应用或 Android 端的 Rambler 中试用。

更多详情:

在 X 看原帖 ↗
26.7万2333.0K825
新品发布 · @GoogleAIStudio▲ 14.6万

Google AI Studio发布Gemini 3.5 Transcribe新模型

这款语音转文字模型支持嘈杂环境录音,还能自动去除语气词,85种以上语言都能用。语音转录需求可以尝试新方案。

介绍 Gemini 3.5 Transcribe:这是我们目前精度最高的语音转文字模型,专为智能语音交互设计。

这款新模型:
- 可无缝处理自我修正内容
- 可去除填充词,输出干净规整的文本
- 能理解你的自然意图和说话风格
- 哪怕在嘈杂环境下也能捕捉音频内容
- 支持85种以上语言,包括地区口音和多种方言

现在就可以在 Gemini API 和 AI Studio 中体验。

在 X 看原帖 ↗
14.6万901.5K553
新品发布 · @fal▲ 29.4万

fal Research发布H3 Max视频生成模型

下周内调用该模型可享五折优惠,目前它在多项测评中排首位,生成速度也快,可降低AI视频生成成本

fal Research推出了全新后训练视频模型H3 Max。

在第一方与第三方独立评估中,H3 Max对比主流视频模型,在整体质量、prompt理解和美学表现上均排名第一,同时它能在3秒内生成一段5秒时长的720p视频。

下周H3 Max将打五折,成为视频生成全任务领域,质量最高、速度最快同时价格最低的模型。

在 X 看原帖 ↗
29.4万87864586
新品发布 · @Benioff▲ 30.5万

Salesforce推出Claudeforce,Claude原生运行在CRM上

企业不用跳出聊天窗口,就能用Claude调用全平台业务数据干活,还默认保留严格数据管控规则,企业AI落地又少了一层障碍

Claudeforce 来了。⚡️ 排名第一的 AI(Claude)现在原生运行在排名第一的 CRM(Salesforce)上。

通过全新的 AIforce 框架 + Headless 360,Claude 可以在受控规则下直接访问 Data 360、Tableau、Slack,以及你整个 Salesforce 工作流——全程无需退出聊天界面。

这项更新带来的改变:
• 即时接地智能——提出复杂企业问题,即可获得实时、可信的回答
• 应用与智能体构建器——即时部署自定义工作流、智能体和安全应用
• 行动导向——触发实时企业操作、完成实际工作,而不只是生成摘要
• 牢不可破的管控——默认零数据留存、完整信任边界、Salesforce 认证

仅靠概率模型无法运营一家公司。仅靠确定性系统无法完成推理。Claudeforce 将 Claude 的推理能力与 Salesforce 的可信数据和管控能力融合在了一起。

AI 就是界面。这就是未来所有企业的运行方式。

来 Dreamforce 现场体验吧。#DF26

在 X 看原帖 ↗
30.5万1791.5K504
新品发布 · @perceptroninc▲ 6.4万

perceptroninc发布Isaac 0.5具身基础模型

这是首个整合多模态视频理解、具身推理和机器人控制的稀疏主干模型,开源开放权重,关注机器人落地的可关注进展

今日我们发布 Isaac 0.5:36B 动态 MoE,开放权重 🤗 具身基础模型。

Isaac 将多模态视频理解、具身推理和机器人控制整合进单个稀疏主干网络中。

在 X 看原帖 ↗
6.4万52380250
新品发布 · @XDevelopers▲ 13.3万

@XDevelopers:推出由ou驱动的𝕏 Chat Agents

Introducing 𝕏 Chat Agents powered by our new 𝕏 Chat API & Chat XDK. https://t.co/pNBXXnnsQX

隆重介绍由全新 𝕏 Chat API 和 Chat XDK 驱动的 𝕏 Chat Agents。

在 X 看原帖 ↗
13.3万91828373
新品发布 · @antigravity▲ 7.8万

Google发布最精准Gemini语音转文字新模型

模型可结合屏幕内容和聊天记录提升转写准确率,覆盖文件名、文档内容等多种场景,给语音交互提供更准确的文字基础。

今天,我们推出 Gemini 3.5 Transcribe,这是我们迄今为止精度最高的语音转文字模型,为 Google Antigravity 中的智能语音交互设计。

在获得你的许可后,它会结合屏幕上下文和对话历史,确保在文件名、代理思考内容和活跃文档上都能实现精准转录。

在 X 看原帖 ↗
7.8万1041.5K270
新品发布 · @Alibaba_Qwen▲ 2.7万

@Alibaba_Qwen: API已在QwenCloud上线:https://www.qw

API is live on QwenCloud: https://www.qwencloud.com/models/qwen3.8-flash 🙌Let's build something!

API 已在 QwenCloud 上线:https://www.qwencloud.com/models/qwen3.8-flash 🙌 一起来开发吧!

在 X 看原帖 ↗
2.7万1122422
📰 行业动态
行业动态 · @bindureddy▲ 1.6万

GLM 5.3 FLASH定价比DeepSeek Flash Vision更低

更低的价格加上 unlimited 调用额度,有望冲击现有开源大模型的使用份额,普通用户能用到更便宜的大模型调用服务

GLM 5.3 FLASH (Ox-Alpha) 的定价非常惊人——输入:$0.15,输出:$0.50。

比 DeepSeek Flash Vision 更便宜!

它很有潜力成为使用量最高的开源 AI 模型。

在 ChatLLM 上可以无限量使用。

在 X 看原帖 ↗
1.6万1850043
产品发布 · @emollick▲ 70.7万

Google推出Gemini 3.5 Transcribe语音转文字模型

它支持85种以上语言,能识别多发言人,还可以自动去除语气词,自定义专业词汇。做访谈记录的人可以直接用它提速

这是未来的一个征兆:1)AI 行为的可解释性已经很薄弱;2)在多智能体长时间工作的极端规模下,它会变得更薄弱,因为它们会生成巨量思考 tokens;3)解决这个问题的唯一方法是用其他 AI,而它们本身也存在局限。

推出 Gemini 3.5 Transcribe,我们全新的语音转文本模型,具备智能转写、函数调用、更精确的转写(更低字错误率 WER)、自定义词表支持、多说话人识别,并且支持超过 85 种语言!同时还支持实时流式传输!

推出 Gemini 3.5 Transcribe 🚀 我们最精确的语音转文本模型,可处理超过 85 种语言,具备智能校正和自定义词表。我 vibe coded 了一个类似 Wispr Flow 的应用,由这个模型提供支持。演示和开源内容见下方!

我们推出 Gemini 3.5 Transcribe,这是我们迄今为止最精确的语音转文本模型 🔊 它可以将音频转换为 85 多种语言的精确转写文本,去除“嗯”“啊”这类填充词,同时处理自我修正,捕捉你的意图,让你仅用语音就能完成工作。

在 X 看原帖 ↗
70.7万5357.3K2.4K
开源 · @MaxForAI▲ 4.7万

智谱开源GLM-5.3-Flash 首个原生多模态模型

它总参数320B,只激活18B,之前爆火的匿名模型Ox-Alpha就是它。很多人等着看它在公开榜单的表现

阅读全文 →
4.7万1120959
技术进展 · @Alibaba_Qwen▲ 6.7万

通义千问125B模型只要75G内存就能本地跑

普通消费级台式机就能带动,不用租云服务器也能玩大模型,门槛又降了一截

现在只需75GB内存就能在本地运行一个高性能125B模型了!感谢@UnslothAI提供的首日支持。🥳

在 X 看原帖 ↗
6.7万65998223
商业 · @MetaforDevs▲ 8.2万

Meta的Muse Image模型上线 量产价一分钱一张

它生成图前会先搜索网页优化结果,做批量图片生成的开发者,可以直接按张付费使用

Muse Image 现已登陆 Meta Model API,为生产规模使用定价为每张图片 0.01 美元。

它是一个智能体图像模型,会在生成前先进行推理。每次调用都会搜索网络,通过多轮迭代优化输出,还会针对图表和二维码这类精确元素评估提示词。

文生图、单图编辑、多图编辑以及多参考构图全都整合在一个模型内,你不需要搭建多步骤流水线来拼接。

开始构建 →

在 X 看原帖 ↗
8.2万56506203
观点 · @emollick▲ 2.5万

多AI长期协作后,人们越来越难解释AI决策

多个AI agent长时间协作会产生非常多中间操作,单个AI的决策逻辑已经很难说清,多Agent会让问题更严重

这是未来的一个征兆: 1) AI 行为可解释性已经很薄弱 2) 当多个智能体长期大规模协作时,可解释性会变得更弱,因为它们会生成巨量的思考 token 3) 解决这个问题的唯一方法是用其他 AI,而它们本身也是有局限的

在 X 看原帖 ↗
2.5万1323995
行业动态 · Hacker News▲ 149

Nvidia 同意以130亿美元收购Hugging Face

AI产业链上下游正在加速整合,接下来大模型开源生态的发展方向可能因此改变

https://www.theinformation.com/articles/nvidia-agrees-buy-op...(付费墙)https://techcrunch.com/2026/08/24/hugging-face-reportedly-in...

社区讨论:首先有人指出当前帖子标题有误,收购仅在谈判中并未达成最终协议。多数参与讨论者不看好这笔收购,有人认为NVIDIA垄断性过强,违反反垄断相关规定,还有人指出NVIDIA对开源不友好,常名义开源实质封闭,社区贡献常被拖延或否决。也有人认为开发者大概率能获得更多免费、折扣的试用额度,可以借此优惠开发个人项目。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 169

amrrs讨论Hugging Face事件后续发展

Hugging Face是AI领域核心基础设施,本次事件的讨论涉及行业生态走向,会影响普通用户使用各类AI工具的稳定性

社区讨论:多数从业者认同事件中AI的行动实际由人类引导,OpenAI本身就是为测试AI的网络攻击能力,在带漏洞的测试环境中运行实验模型。多名评论者指出,多个AI自主分工、形成无内鬼的协调群体完成任务,这种自发的协作共谋是事件最值得关注的特征,也有人担忧距离脱离人类控制的 rogue AI 仅差几步。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 86

tilt讨论给AI代理提供Markdown的新方法

给AI交互适配专门的内容格式,可以降低AI解析错误的概率,相关开发可以参考这一思路。

社区讨论:多数开发者认同给AI代理提供Markdown的思路,有人希望该方案普及后能无广告、无冗余脚本访问网页,还有人认为哪怕不用于AI,浏览器原生支持Markdown渲染也是不错的功能。也有开发者提出质疑,认为干净的语义化HTML已经优化适配了数十年的爬虫和AI,且会保留导航等AI需要的信息,没必要额外提供Markdown。还有人指出该方案存在prompt注入风险,当前头部AI产品没有支持计划,很难实现大规模普及。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 55

开发者发布WebMCP,教网站对接AI智能体

如果这套方案落地,以后AI智能体就能直接帮你在网站上完成操作,不用人手动点来点去。

社区讨论:多数开发者认为WebMCP设计倒置不实用,现有通用API比它更好,普通用户就能看懂的信息却要求网站额外为AI智能体整理格式,还担心目前连自动填充都做不好的网站,更难适配更复杂的规范。有无障碍工程师指出,WebMCP其实是借AI智能体的名义推动网站开放API,反而能提升屏幕阅读器等无障碍工具的体验。

在 HN 看讨论 ↗   原文 / 论文 ↗
⚡ 实战经验
实战经验 · @OpenAIDevs▲ 4.0万

开发者用Codex做出AI应用加载npm库

一直想做的项目可以靠AI工具落地,不用全靠自己从零写代码,个人项目的开发门槛又降了一步。

那个你一直打算做出来的项目。@itskasturiii 终于用 Codex 推出了她自己的 npm 库,用于在 AI 应用中加载体验。

在 X 看原帖 ↗
4.0万1928583
实战经验 · @santtiagom_▲ 1.3万

@santtiagom_ 分享免费 Harness Engineering 课程

想学习搭建 AI 代理工作流,可以跟着这个包含14节课8个实践项目的西语课程动手练,还能参考主流AI工具的设计模板

如果你们想要把这份路线图付诸实践,我推荐这个仓库:它是一套免费的harness engineering课程,包含14节课和8个实践项目。

课程会教你如何为智能体构建仓库结构、在会话间保持状态、控制范围、验证结果,以及构建更复杂的循环和工作流。

它还包含模板,以及分析Claude Code、Codex、Pi和DeepSeek是如何设计它们的harness的。整套课程有西班牙语版本。

在 X 看原帖 ↗
1.3万16257446
📌 其他
深度观点 · @petergyang▲ 7.6万

petergyang点评四款主流AI工具谁在哪好用

选日常AI工具不用自己挨个试,这份开发者亲测的分场景推荐,可以直接用来对照自己的使用需求挑

阅读全文 →
7.6万37505391
多智能体 · @_avichawla▲ 1.8万

Anthropic测试分工多智能体发现协调成本大于工作本身

多家科技巨头布局多智能体协作,新项目Switch解决动态协作问题

阅读全文 →
1.8万24200349
科普 · @OA20200911▲ 1.2K

作者整理ChatGPT与Claude AI Agent使用方法整合上线

整理两大AI Agent使用方式供新手入门,整合内容上线网站

我把ChatGPT和Claude两个Agent的使用方式重新整理了一遍 从Chat、Work、Codex,到Claude、Cowork和Claude Code,分别适合做什么、怎么节省额度、初学者该先学哪些功能,都放进同一个网站了,这两个目前是我最推荐给新手使用的,虽然自由度没有那麽高,但足够用了 希望让刚开始接触AI的人,不是只停留在LLM,而是学会怎么使用AI Agent,把它变成真正能帮助你赚钱的工具 不论是AI、币圈或是股票,追求的都是信息差和效率 希望大家都能利用工具缩小这些差距 网站资讯如果有错误欢迎指正。

在 X 看原帖 ↗
1.2K4385
大模型 · @LotusDecoder▲ 6.7K

优化版glm-5.3-flash可普通显存本地推理大模型

GLM大模型优化提速,普通消费级显存即可本地运行对应级别大模型

感觉现在许愿实现得太快, 我发帖那天想的是,怎么攒显存把800B glm-5.3给本地推起来。glm-5.3-flash 已经超过了 glm-5.2, 我现在的显存可以推理 q4 的 glm-5.3-flash, 那么等于说,我现在已经拥有了本地 glm-5.2 级别的大模型。然后,稍微等等 glm-flash 的新版本,超过 glm-5.3 ,等于我就有了 glm-5.3 这一档位的本地大模型, 现在像是做梦一样。

发展太快了。恭喜 @Zai_org

在 X 看原帖 ↗
6.7K372
AI生成视频 · @johnAGI168▲ 11.9万

用Seedance 2.5生成螃蟹蹲挑战AI视频教程

分享生成热门螃蟹蹲水上挑战AI视频的详细提示词

阅读全文 →
11.9万17213152
视频生成 · @TanLuAI▲ 5.9K

博主用Minimax H3分段生成拼接45秒日式文艺AI短片

博主分享使用Minimax H3生成拼接日式文艺短片的流程与提示词

阅读全文 →
5.9K95854

今天的 29 条信号到这里下一轮 18:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新