AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 8 月 14 日 · 08:00 更新 0 文章0 信号0 主题
试试:

今天发生了什么1 分钟读懂

OpenAI 推出 GPT-5.6 Sol,推理速度提升至 14 倍,首批仅向 API 选定客户开放,产能爬坡后扩围。这是近期少有的明确性能跃迁而非单纯参数竞赛的发布。

DeepSeek 首款 Agent 产品 DeepSeek Harness 正式开源,几小时内获 3.5 万星。其全插件化架构允许热插拔替换核心组件,无需改源码或分叉仓库,被资深开发者评价为"重新思考项目重构方向"的设计。

研究者披露可从 Claude、GPT、Gemini 等闭源模型中提取内部思考过程及敏感数据,漏洞绕过加密机制。所有主流厂商需重新评估安全架构,"隐藏推理链"作为商业护城河的前提被动摇。

今日值得看
01 /interface-review:2300人存的UI审查Skill 一条 prompt 让 AI 像设计总监一样逐层挑刺,从无障碍到品牌一致性全扫一遍。 02 Grok 生成效果不输 Seedance 的视频提示词 Grok 拿 Fable 5 提示词跑出手持 DV 质感,94 人验证过效果。
03 GoogleDeepMind 发布 Gemini 3.7 Flash 新版模型 日常写代码、处理知识工作和做网页开发,都能用到这个更强的新版模型,可关注实际使用体验的变化。

Gemini 3.7 Flash 已发布。它在编码、知识工作和网页开发方面能力更强。🧵

04 OpenAI 把 Codex 放进 Linux 版 ChatGPT 客户端了 之前用 Linux 没法在官方客户端体验 Codex 代码能力,现在开放预览测试,写代码的Linux用户终于能用上官方功能了。

社区讨论:多数用户质疑该应用采用Electron框架开发,未查询就已占用2.2GB内存,资源消耗过大,也有人提问,它相比网页版、Codex CLI有什么优势。有用户提醒,需将它放在虚拟机中隔离运行,避免直接访问系统,防止安全风险。

今日焦点

OpenAI推超快AI服务,实时响应不再牺牲智能

OpenAI发布名为Ultrafast的服务层级。里面跑的是其最智能的模型GPT-5.6 Sol,速度比标准处理快14倍,每秒最多生成750个输出token。该能力先在OpenAI API中推出。底层支持来自Cerebras,是双方在超低延迟推理合作上的下一步。

过去想要实时响应,通常只能选更小、更专门的模型。速度和智能不可兼得,Ultrafast把这一步省了。

对工程师来说,最直接的变化体现在处理故障上。OpenAI内部团队已经把它用在事件响应里。它能快速读日志、分析追踪、综合对话内容、确定下一步检查项。修复方案也能交给它准备或验证。研究端的节奏也一样。

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达51 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

08:00 本轮更新 · 下一轮 12:30
行业动态 · Hacker News▲ 67

MCP-stama 做了个无依赖超高速 Rust MCP 服务器

做后端服务的开发者可以试试这个新项目,它完全不需要外部依赖就能运行,对追求部署速度和稳定性的工作流有用

行业动态 · Hacker News▲ 53

MCP Memory 用开源组件做快 agent 记忆存储

开发 AI agent 不用纠结慢存储方案,有人用现有开源工具搭出了更快的替代实现,可以直接参考

社区讨论:多数用户质疑该项目和现有方案差异不大,有人认为和给markdown文件做grep搜索效果差不多,也有人提问它和Claude内置的代码记忆、mem0等已有项目相比在性能上有何优势。有人认可用SQLite FTS5做快速存储是务实的架构选择,还有人提出可以用git仓库存储记忆,用FTS5专门做速度优化方便人工检查。已有开发者分享了同领域的其他开源项目和托管服务。

在 HN 看讨论 ↗   原文 / 论文 ↗
新品发布 · @Teknium▲ 6.3万

Hermes Agent 推出Bot模式,让不同AI bots互动

不同AI可以分配不同工作,还能互相沟通协作。现在开启一天公开测试,后续更新会根据反馈调整功能。

我们推出了 Hermes Agent 的 Bot Mode。

Bot Mode 是会话模式(sessions mode)的替代方案,在这个模式下,每个代理配置文件也就是「bot」对应一个聊天窗口。

你可以给这些 bots 分配工作、添加描述、设置头像,而且它们还可以和你的其他 bots 交流!

我们将在接下来一天,通过这个插件对 Hermes Desktop 的 Bot Mode 开启公开 beta 测试:

请在这里把你的所有反馈发给我,告诉我它的使用体验如何、是否符合预期、以及你发现的任何 bug。之后我们会处理反馈,将功能整合进面向所有人的主桌面应用!

在 X 看原帖 ↗
6.3万49874401
行业动态 · Hacker News▲ 225

Mistral 更新推出了新版本 OCR 4.1

关注文字识别工具升级的人,可以留意新版本的功能变化,等待社区实际体验反馈。

社区讨论:不少网友认为Mistral OCR 4.1定价过高,1000页收费3.5欧元不值,有人自建OCR pipeline处理千页仅需0.05到0.1美元。用户实测认为它处理复杂排版效果不如OpenAI的专业模型,OpenAI目前仍占据优势;有人提到百度OCR效果出色且本地运行成本近乎免费。部分欧洲网友对欧洲在AI竞赛中没能拿出有竞争力的产品感到失望,还有人吐槽产品不合理的快捷键设置。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 366

pr337h4m 加速了 GPT-5.6 Sol 的运行速度

这项提速工作在 Hacker News 引发大量讨论,关注大模型运行效率的人可以跟进看看具体方案

社区讨论:不少开发者认为推理速度被当前行业低估,速度提升能支持更多迭代,提升输出质量,也有人畅想未来可以实现本地离线的超高速小型大模型。有人指出目前尚未公布性能不变的明确结论,也没有公开定价,推测价格会很高,预测明年外部开发者单推理开销就会超过五万美元。还有人提出,人类审核代码的场景下,十倍速度并没有实际用处。

在 HN 看讨论 ↗   原文 / 论文 ↗
新品发布 · @OpenAI▲ 50.7万

OpenAI 推出 GPT-5.6 Sol 速度提至 14倍

最先仅对 OpenAI API 的选定客户开放,后续产能提升后会向更多企业开放,高需求用户能更快获得 AI 结果。

预览超高速模式:GPT-5.6 Sol 最高可达 14 倍速度。

该模式首先会在 OpenAI API 向选定客户群体推出,随着算力提升,会逐步扩大开放给更多企业使用。

在 X 看原帖 ↗
50.7万4327.3K1.1K
行业动态 · Hacker News▲ 537

谷歌Gemini推出了新版本Gemini 3.7 Flash

新版本提前泄露出来被社区挖出,普通用户很快就能用上新版 Gemini 模型了

https://ai.google.dev/gemini-api/docs/models/gemini-3.7-flas...

社区讨论:多数用户吐槽Gemini 3.7 Flash的入门定价设定不合理,入门价2026年底才到期涨价,到2027年至少会更新三代新模型,没人会继续用这个版本。有人认可它多模态尤其是视觉生成HTML的能力很强,性价比优于Claude Sonnet 5,也有人提出纯文本场景下,DeepSeek V3的同水平模型价格低十多倍,GPT-5.6 Luna性能更好价格也更低,只有多模态场景才需要选它。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 621

网友曝出Grok 4.6版本基准测试结果

Hacker News网友曝出新版Grok,相关讨论热度很高,可以关注后续性能数据公开后的变化

https://artificialanalysis.ai/articles/grok-4-6-benchmarks-a...

社区讨论:不少用户认可Grok的体验,称它回答直截了当、速度快,做安全审查表现出色,API定价更便宜,靠着SpaceX的投入已经能成为头部模型的有力竞争者,也给行业带来了良性竞争。也有用户质疑Fable发布仅两个月,各大实验室就都推出了同级模型,不清楚背后到底是什么原因,还有用户因马斯克的个人声誉不愿使用他旗下的产品。

在 HN 看讨论 ↗   原文 / 论文 ↗
前沿研究 · @danielmckinn0n▲ 99.7万

xAI Grok 4.6 罕见病诊断跑分超过Claude Opus 5

它的成本仅为对手的三分之一,这个结果出乎测试者预料,你可以用更低成本尝试儿童罕见病诊断

从机械希特勒到儿童罕见病诊断SOTA?@SpaceXAI的@grok 4.6拿下了RareBench的王冠,以仅约@AnthropicAI Claude Opus 5三分之一的成本反超了它。

这根本不在我的2026年宾果预测卡上!

@deepseek_ai的新v4-pro-0813模型表现低于我的预期,也低于v4-flash的水平,看起来整个互联网对它的预期都落了空。

我们是在发布当天通过DeepSeek的1P API访问的,我几乎怀疑他们是不是没有正确切换模型端点。我们会重新进行基准测试并给出后续报告。

@Zai_org凭借GLM5.2吸引了一批追随者,但他们的表现同样低于预期。这并不让我意外,因为我在对比GLM和@Kimi_Moonshot K3的编码场景表现时,发现Kimi要强大得多,但互联网似乎就是喜欢这款GLM模型。

在 X 看原帖 ↗
99.7万2617126
行业动态 · Hacker News▲ 1.0K

DeepSeek V4 Pro 新版本0813已上线可查询

新版大模型现身公开文档和第三方榜单,相关链接已经放出,感兴趣可以自行查看更新内容

https://api-docs.deepseek.com/https://artificialanalysis.ai/models/deepseek-v4-prohttps://twitter.com/ChrisGPT/status/2087572834650407024, https://xcancel.com/ChrisGPT/status/2087572834650407024

社区讨论:多位开发者实测后指出,新版本DeepSeek V4 Pro 0813完成开发任务存在小错误,性能弱于Grok 4.6、Fable 5等头部模型,价格比竞品Luna更高但表现更差,官方今日起已上调定价。开发者认可它比Opus 4.8便宜约20倍,成本优势明显,也有用户提到部分中国大模型能力出色,但开发者更习惯默认选用成熟的行业标准模型。

在 HN 看讨论 ↗   原文 / 论文 ↗
工具产品 · @eliebakouch▲ 8.6万

deepseek harness 打造了首个优先AI开发的开源项目

这个AI agent开发工具保留了完整KV缓存,不会修改对话历史,还附带开箱可用的多种开发模式,能帮你省掉重复调试的时间

出色的发布。它是一个内置了多个 harness 的网页 UI,你可以通过它的 SDK 生成 claude code 和 codex agent。

deepseek harness 默认支持多种不同的「模式」(也就是不同的 harness):带程序化工具调用的代码模式(用 TypeScript 实现)、bash+编辑模式(通常用于评测),或是带读写工具等功能的标准模式。

它具备一流的 KV 缓存感知设计,核心是保证 KV 缓存永远不会被修改。对于每一处修改,他们不会改动之前的历史(前缀),只会在末尾追加一条说明修改内容的记录。

我期待其他 harness 也这么做,但世事难料?这个 harness 的开发过程也非常有意思。它完全是以代理优先的方式编码开发的,项目里有一整个叫 .agents/notes 的文件夹,记录了代理留下的每一个决策和提案。

其中还包含一些很棒的信息,比如他们也会用这个框架做后训练。UI 非常美观,轨迹视图尤其出色。他们还发布了一篇完整的论文,详细介绍了「插件」的可组合性和系统设计,这会非常有用。

在 X 看原帖 ↗
8.6万50628395
🔥 热点追踪 · @Teknium▲ 6.3万

Teknium 为 Hermes Agent 推出 Bot Mode 功能

Teknium 推出 Bot Mode,可将每个代理设置为独立 bots,分配工作、设置头像并让 bots 互相通信。目前开启一日公开测试,后续将根据反馈调整功能。下一步将看功能优化后的落地效果。

📖 阅读深度解读 →
6.3万49874401
行业动态 · Hacker News▲ 48

这份论文统计了企业实际用ChatGPT的情况

市面上大多是企业喊口号的AI转型宣传,这份论文带来实际调研数据,可以帮你看清真实的AI落地进度

动态 · @beffjezos▲ 2.2K

感谢Elon与开源,谢天谢地

谢天谢地有 Elon 和开源让 AI 竞赛保持多极格局,否则会出现疯狂、史无前例、风险极高的权力过度集中。

在 X 看原帖 ↗
2.2K4332
动态 · @TheAhmadOsman▲ 3.2K

适用于Codex Cli、OMP、Pi Claud等智能代理

对于 Codex Cli、OMP、Pi Claude Code、Droid、OpenCode 这类智能代理来说,有一套至关重要的准则:
1. 模块化
2. 领域驱动设计
3. 极致清晰明确的规格说明
4. 充足完备的文档

这就是系统工程。

我不是说智能代理不够强大,但规范纪律比模型能力更重要。

如果你的文档没能回答清楚这些问题:
- 在哪里
- 做什么
- 怎么做
- 为什么做

代理就会自行猜测,把事情搞砸。

在 X 看原帖 ↗
3.2K76740
动态 · @omarsar0▲ 2.5K

如果你在AGENTS.md中编写规则,本文

如果你在 AGENTS.md 里写规则,这条结论值得你花时间了解。

当编码代理遵守了你写的规则时,它本来也有可能自己就会这么做。

Harness-IF 区分了这两种情况:它会根据执行证据逐个给256条规则打分,然后在九个探针构建中,在不应用规则的情况下重新运行所有任务,以此找出哪些规则是真的和模型默认行为冲突的。

在12个前沿模型上,原始准确率区间为72.1%到85.9%,去先验准确率区间为66.1%到78.6%。剔除巧合因素后,所有模型的表现都变差了,分数下降3.6到7.4个百分点。

有一个发现值得注意:优先级并不遵循提示词深度。系统提示、项目文件和用户指令的优先级全都高于工具和技能描述。

论文:在我们的学院跟踪更多趋势AI论文:

在 X 看原帖 ↗
2.5K52541
动态 · @rauchg▲ 9.2K

一统全局的一条命令(tokens)。

一条命令统御所有(token)。我预测这会成为大规模使用编码AI的默认方式。

正常运行时间、模型选择、更低成本、可观测性、ZDR……

厉害的地方在于,这条命令可以配置所有**现有**的编码工具链,比如 Claude Code 和 Codex!

在 X 看原帖 ↗
9.2K75918
动态 · @yousefhll▲ 1.3万

我们学会了开飞机 去向SF诉说

我们学会了开飞机,只为给旧金山传递一件事。

推出 Vendo (YC S26) 全栈智能体界面。

这是一款面向你用户的生产就绪智能体,内置了用户所需的一切功能。

它可以代表你的用户执行真实操作。它甚至能直接在你的产品之上,构建出完整的新功能、微应用和自动化流程。

内置权限管理、工具防护、用户上下文等功能。包含了面向用户的智能体所需的一切。

仅需一条命令即可完成安装。开源。

@runvendo @nourzahzah

在 X 看原帖 ↗
1.3万1811015
前沿研究 · @jerryjliu0▲ 1.5万

研究者推出ExtractBench 覆盖14+提取系统评测

想选靠谱的企业文档信息提取工具?这份36页的基准评测,给出了不同方案准确度和成本的真实对比

我们在 ArXiv 发布了一篇 36 页的关于 ExtractBench 🧑‍🔬 的白皮书,我们致力于打造最全面、模式引导、面向真实世界文档提取的基准测试。

这份报告内容极其详尽,涵盖了从文档提取领域相关工作的对比,到数据集构建、真值生成方法,再到我们对 14 多个提取系统的实验。

以下是论文中最核心的要点:
✅ 该基准针对真实企业文档上的模式引导提取打分。给定输入文档+模式,以及提取器的预测输出,基准会测量值准确率、 grounding、各“挑战项”标签,以及成本。

✅ 与其他基准相比,我们拥有更多模式、更多评估维度,以及更高的数据领域多样性。

✅ 真值构建按三种文档子类型区分:真实文档采用模型集成+人工审核,合成长列表按构造生成真值,扫描表单也包含人工审核,含框标注。

✅ 我们的三种模式(LlamaParse 性价比版、智能代理版、智能代理增强版)都处于准确率和成本的帕累托前沿。

完整 ArXiv 论文在这里:我们的网站:

在 X 看原帖 ↗
1.5万13134112
深度观点 · @mitsuhiko▲ 1.4万

资深开发者 Mitsuhiko 认可 DeepSeek Harness 设计

这位开发者说这个设计让他重新思考 Pi 项目的重构方案,行业顶尖开发者的判断可以帮你判断工具选型方向。

说真的,我对 DeepSeek Harness 目前呈现出的东西很喜欢。它确实让我对我们在 Pi 里处理 harness 重构的方式产生了一些思考。

在 X 看原帖 ↗
1.4万1532251
新品发布 · @akshay_pachaar▲ 2.2万

DeepSeek 开源的DeepSeek Harness,几小时涨了3.5万星

想修改AI Agent框架的上下文组装逻辑,不用改源码也不用分叉仓库了,所有核心组件都做成可替换的插件,调试也能看到完整的模型可见输入日志。

阅读全文 →
2.2万29226253
前沿研究 · @Sa4d_k1▲ 4.6K

研究者偷出闭源大模型的内部思考过程,还挖到敏感数据

这个漏洞能绕过加密,从 Claude、GPT、Gemini 等闭源模型中提取出原本隐藏的内部思考步骤,还能挖到公开数据里未披露的敏感信息,现在所有AI厂商都得重新检查安全漏洞

阅读全文 →
4.6K56656
深度观点 · @harleyfoote_▲ 722

十年交易员说,大语言模型根本没法直接做交易

这位有十年经验的交易员用实盘验证了现有结论,真正有潜力的AI交易方向是集群化算法迭代,这是只有AI能做到的新前沿

阅读全文 →
722201002
前沿研究 · @DKokotajlo▲ 5.3K

研究者呼吁OpenAI公开AI失控事件全部原始数据

只有开放数据,第三方研究者才能复现事件,摸清AI真实目标和行为边界,避免企业自证清白留下漏洞

阅读全文 →
5.3K1816066
前沿研究 · @aaronburnett▲ 1.8万

这份研究预测2040年AI算力市场将达3.2万亿美元

79%的模拟结果都显示,未来AI算力需求会长期超过供给,普通人能通过即将上线的仪表盘自由探索不同场景

阅读全文 →
1.8万1214925
深度观点 · @alighodsi▲ 946

Genie Ontology 让企业AI代理跑通了业务增长

原来企业AI缺内部私有上下文,手动补全成本高昂,现在这套流程已经可以自动化。高管开会不用等各部门汇报,直接就能拿到答案。

我今天被问了无数次这个问题:“当公司已经达到70亿美元规模,你还怎么实现80%增长?”

真正的答案是,我们终于看到AI智能体开始在企业中发挥作用,取得了突破。

AI已经有一段时间都具备了超高智能,但一直缺少存在于人们头脑中、或是存在于某些SaaS记录系统里的基础上下文信息。

很多组织会部署FDE来捕捉这些上下文,也就是本体(Ontology),再将其输入AI。这个过程劳动密集,成本高昂。

我们刚刚用Genie Ontology实现了这个流程的自动化。一旦你有了企业上下文图谱,像Genie这样的AI智能体就会变得出奇好用。

我现在已经不再等我的CRO、CFO、CMO、CHRO等人给我答案了,我开会的时候直接在手机上连续提问就行。说实话,这真的会上瘾。

我们的客户也开始这么做了,目前平台上超过70%的查询都是由Genie智能体生成的。

这给平台带来了更多查询,推动了消耗量增长,进而拉动了收入增长。这就是简单直白的答案。

在 X 看原帖 ↗
946321158
行业动态 · @MaxForAI▲ 4.0万

DeepSeek 发布首款Agent产品 DeepSeek Harness

这意味着AI Agent的能力不再只由底层模型决定,工具、提示词等环节也会影响最终表现,竞争已经延伸到模型之外。

阅读全文 →
4.0万1620762
实战经验 · @yanhua1010▲ 3.5K

开发者做了DeepSeek Harness从零搭建AI Agent手把手教程

想自己动手做AI Agent却找不到入门路径的人,可以跟着这个教程从零完成完整实现,还有在线学习入口可以直接跟着练

新鲜出炉 Deepseek harness教程,使用DeepSeek v4 pro max 做了个手把手教程。 👉 DeepSeek Harness原理与实现:从零到一实现一个 AI Agent 🌍在线学习: 🔗仓库地址:

在 X 看原帖 ↗
3.5K64554
AI生成视频 · @huangyun_122▲ 2.2万

有用户测试Grok生成视频 效果不输Seedance 2.5

用户基于Fable 5提示词改写后测试Grok,分享完整提示词与测试入口链接

阅读全文 →
2.2万115494
大语言模型 · @MaxForAI

DeepSeek Harness系统提示词泄漏 指向Agent运行时新方向

泄漏的系统提示词显示,该产品不止聚焦代码生成,更定义了Agent完整运行框架

工具 · @jmrphy

这款免费AI工具可完成电脑操作,成本仅需5美元

用户jmrphy分享了一款几乎免费的AI智能体搭建方案,十分钟就能在电脑上配置完成

如果你过去一年一直观望AI智能体炒作,觉得它只是潮流炒作、浪费时间,成本太高不值得尝试——说实话,你之前的想法可能没错。但jmrphy认为,搭配Hermes桌面端的DeepSeek V4 Flash刚刚跨过了值得尝试的门槛,之前一直观望的人现在都应该动手配置。

这个组合几乎免费,其AI能力大致相当于美国企业每月收费200美元的产品。不需要复杂设置,全程只需大约十分钟,就能让AI帮你完成电脑上的几乎所有操作。

超高智能水平已经和极低成本结合到一起,花十分钟把它装到电脑上完全值得。配置步骤十分简单:先免费下载Hermes Desktop,再在OpenRouter注册账号,购买5美元额度,不会自动续费,复制你的API密钥,也就是应用程序编程接口密钥,将密钥填入Hermes的设置中,选择DeepSeek v4 Flash作为默认模型,剩下的操作都可以让Hermes帮你解释和完成。

5美元额度可以使用很长时间,如果试用后不满意,损失的时间和金钱都非常少。

使用需要注意安全风险,如果没有集中注意力,AI智能体有可能误删电脑上的文件。刚开始使用时操作节奏放慢。

在 X 看原帖 ↗
AI开发工具 · @stevibe

DeepSeek Harness发布 改用网页界面替代命令行工具

开发者实测其完成3D魔方构建任务,新增轨迹页可追踪助手与工具调用

DeepSeek Harness已推出,核心改动是使用网页界面替代命令行界面(CLI)。

开发者测试了该工具生成3D魔方的任务,总共耗时27分钟,完成52个步骤,生成速度为每秒120个令牌(tok/s),最终结果完美成型。

工具新增「轨迹」标签页,用户可以在该页面追踪每一次助手调用与工具调用。

顺带一提,该工具默认选用3080端口运行。

在 X 看原帖 ↗
开发工具 · @contextconor▲ 250

开发者评价AI可观测性工具Emma AI体验出色

开发人员contextconor分享使用体验,称赞Emma AI可观测性产品与开发团队

用户contextconor在X平台分享了自己使用Emma AI可观测性工具的体验。他表示,这款工具实际使用体验非常好。

和传统工具要求使用者预先定义所有可能的故障模式不同,Emma AI可以自主理解AI代理预期要完成的任务。

他同时称赞Emma AI的开发团队非常出色,向zjearbear及整个团队表示祝贺。

在 X 看原帖 ↗
2505
互联网 · @majamediaco▲ 180

用户自2012年运营表情包账号 累计近15年经验

网友调侃自己按平台阶段获得了表情包领域不同等级学位

很难相信,我从2012年就开始在互联网运营表情包账号了。

我把这个过程戏称成:在Instagram读本科,在Tumblr读硕士,在Twitter读博士。

目前我在应用模因学(meme)领域的专业从业经验已经接近15年。

在 X 看原帖 ↗
180141
开源 · @MinLiBuilds▲ 7.8K

DeepSeek Harness与V4 Pro同日开源 提供AI Agent搭建框架

该项目将AI Agent全组件模块化,底层支持全插件化架构,配套发布相关编程范式论文

阅读全文 →
7.8K13028
语音技术 · @aiwithsally▲ 2.3万

测试者谈文本转语音工具:演示效果易做生产可靠难

Soniox发布新版TTS,支持超60种语言,每小时定价0.7美元,兼顾多项实用功能

我测试过足够多文本转语音(TTS)工具,很清楚在演示中获得好听的语音效果是很容易的部分。真正的挑战是让语音人工智能在生产环境中稳定运行。生产环境要求包括低延迟、顺畅打断、准确发音、多语言支持,还要在不同语言间保持同一音色。

Soniox刚刚推出了TTS v2,这也是本次发布的亮点所在。单个模型就集成了超过60种语言支持、数秒音频即可完成语音克隆、自然语言切换、字符级时间戳以及超低延迟流媒体功能。

本次发布的定价为每小时0.7美元,对实际想要扩展语音智能代理的开发团队来说实用性进一步提升。文本转语音技术正快速发展为实用基础设施。

在 X 看原帖 ↗
2.3万131781
产品体验 · @dotey▲ 9.2K

普通用户分享DeepSeek Harness使用体验与改进建议

用户从普通用户视角提出产品体验问题与优化方向,建议引入专业AI产品经理

阅读全文 →
9.2K47221
大模型 · @aitech_komoriya▲ 1.4万

Claude Code「三席位分级」配置方案可降低近八成成本提速两倍

由用户aitech_komoriya分享,通过三款Claude模型分工实现成本与效率优化,适合深度使用Claude Code的用户

如果你在使用Claude Code,建议牢记「三席位」分工配置方案。该方案可将成本从约2万日元降至约3000日元,处理速度可提升至原来的三倍。

方案的核心原则,是不要把所有工作都交给最高级的大模型。

具体分工分为三层:最轻量的Haiku负责分类任务,中等规格的Sonnet负责具体工作,可支持8个任务并行处理,最顶级的Opus只负责最终的质量检查和结果判定,如果结果不符合要求就发回Sonnet重新处理。

这本质就是「分类器→8个工作线程→裁判员」的三级分工。要把生成内容的AI和评估内容的AI分开,不要让同一个AI既生成内容又自我审核。

最不推荐的用法就是把所有工作都交给Opus,这种做法相当于花高薪聘请顶级人员做基础工作,成本很高。

AI时代的核心问题,从来都不是哪个模型能力最强,而是该把哪类工作交给对应的模型。

要真正用好Claude Code,这种根据模型能力分配任务的方式非常重要。未来人与人之间的差距,不在于会不会用AI,而在于能不能把AI放到最合适的位置上。

这套分级分工方案同样适用于Codex。

在 X 看原帖 ↗
1.4万77382
产品体验 · @brian_lovin▲ 3.5万

开发者分享Grok BotAI助手初步使用体验

梳理了该产品在交互设计、功能设置等方面的优缺点与行业观察

阅读全文 →
3.5万13452334
影视 · @gkxspace▲ 8.3K

Higgsfield用AI生成全长20分钟剧情片《ONEIRIC》

影片由Cinema Studio 4制作,全部提示词与制作素材已经完全公开

全长20分钟的剧情片《ONEIRIC》完全由AI生成,由Higgsfield使用Cinema Studio 4制作完成。

以往看到AI生成的影片内容,爱好者最常询问的就是生成提示词。这次不需要额外索要提示词,《ONEIRIC》的全部提示词和制作素材都已公开。

公开项目中可以查看五项核心制作信息,分别是:故事拆分场景与分镜的方式;角色、地点、道具制作成资产的方法;每个镜头使用的参考素材;细节提示词的撰写详细程度;前后镜头保持一致性的方法。

完整公开项目可通过指定链接查看,这些制作资料很难在平时获得。

在 X 看原帖 ↗
8.3K23232
开源 · @anion_ex▲ 6.1K

深度求索开源DeepSeek Harness 已现Agent操作系统雏形

参与者分享内测体验,称框架支持组件动态重组,内测阶段已有近300个第三方插件

阅读全文 →
6.1K87136
AI编码 · @goan999999▲ 2.0万

Codex 5.6隐藏技巧:可省90%token提升编码效率

用户分享了让AI编码效率提升的正确提示词用法,替代直接要求AI写功能的操作

阅读全文 →
2.0万1473111
Agent框架 · @mylifcc▲ 3.6万

对比DSH与Pi:Agent框架设计理念与架构差异

本文对比两款Agent框架DSH与Pi的设计定位与架构

阅读全文 →
3.6万1511299
编码Agent · @0xcherry▲ 4.6万

体验解读DeepSeek Harness的设计理念与实现思路

分享使用DeepSeek Harness的体验,解读其创作思路

阅读全文 →
4.6万24402183
大模型 · @wquguru▲ 4.7万

博主评价DeepSeek V4 Pro未达预期 Harness体验惊艳

科技博主分享对DeepSeek两款AI工具的使用体验评价

DS V4 Pro效果没有完全达到预期,不过DeepSeek Harness(dsh)却十分惊艳,草草的列几个印象深刻的点: 1. 快,非常之快 2. dsh没有选择GUI、也没有选择TUI,或者CLI,而是走了一条其他Harness几乎没走过的路——Web UI,采用BS架构,这个设计非常的巧妙,把客户端繁重的工作省下来做优先级更高的事情,后期如果要做客户端,直接Electron包一下就是客户端了 3. 插件系统非常nice,万物皆可插拔,有趋势的,默认开启的插件中竟然有个佳作llm-pi-ai的插件,可见也用到了pi生态的组件 4. 可观测性的设计惊为天人,分Duration、Turns、Calls三大块,你可以理解为Harness的F12,System、User、Assistant具体都在输入什么、输出什么,每个Tool做了什么,轮次、模型耗时、工具调用耗时、首 token 平均时长、缓存命中率。..非常的详尽 5. github star破10万轻轻松松🫱

更多截图

插件能做什么应用层的东西,可以看这个例子🫱

在 X 看原帖 ↗
4.7万10191105
AI开发 · @thdxr▲ 1.7万

开发者对比DeepSeek Harness与OpenCode2设计思路

开发者称DeepSeek Harness与自研OpenCode2设计思路多有重合,核心实现选择不同

我抽时间看了新的 deepseek harness,它很有意思,因为其中有大量和我们在 opencode2 里为支持全热重载开发的方案重叠的思路。

他们最终做了一个关键的不同选择,让最终解决方案不一样,但整体思路非常眼熟。

简单来说,用插件系统的话,如果插件A、B、C都修改了状态,30秒后A又改了一次,状态很容易陷入混乱,你要怎么处理?

我们用的是一个非常简单的重放系统来重新推导状态,而 deepseek 维护了一套撤销修改的方案。

在 X 看原帖 ↗
1.7万541985
大模型 · @chunxiangai▲ 3.6万

DeepSeek Harness架构解析:全插件化可热插拔Agent框架

对比同类产品,拆解DeepSeek Harness的原子化全插件设计思路

阅读全文 →
3.6万1516395
🔬 前沿研究
前沿研究 · @danielmckinn0n▲ 99.7万

xAI Grok 4.6 罕见病诊断跑分超过Claude Opus 5

它的成本仅为对手的三分之一,这个结果出乎测试者预料,你可以用更低成本尝试儿童罕见病诊断

从机械希特勒到儿童罕见病诊断SOTA?@SpaceXAI的@grok 4.6拿下了RareBench的王冠,以仅约@AnthropicAI Claude Opus 5三分之一的成本反超了它。

这根本不在我的2026年宾果预测卡上!

@deepseek_ai的新v4-pro-0813模型表现低于我的预期,也低于v4-flash的水平,看起来整个互联网对它的预期都落了空。

我们是在发布当天通过DeepSeek的1P API访问的,我几乎怀疑他们是不是没有正确切换模型端点。我们会重新进行基准测试并给出后续报告。

@Zai_org凭借GLM5.2吸引了一批追随者,但他们的表现同样低于预期。这并不让我意外,因为我在对比GLM和@Kimi_Moonshot K3的编码场景表现时,发现Kimi要强大得多,但互联网似乎就是喜欢这款GLM模型。

在 X 看原帖 ↗
99.7万2617126
前沿研究 · @aaronburnett▲ 1.8万

这份研究预测2040年AI算力市场将达3.2万亿美元

79%的模拟结果都显示,未来AI算力需求会长期超过供给,普通人能通过即将上线的仪表盘自由探索不同场景

阅读全文 →
1.8万1214925
前沿研究 · @DKokotajlo▲ 5.3K

研究者呼吁OpenAI公开AI失控事件全部原始数据

只有开放数据,第三方研究者才能复现事件,摸清AI真实目标和行为边界,避免企业自证清白留下漏洞

阅读全文 →
5.3K1816066
前沿研究 · @Sa4d_k1▲ 4.6K

研究者偷出闭源大模型的内部思考过程,还挖到敏感数据

这个漏洞能绕过加密,从 Claude、GPT、Gemini 等闭源模型中提取出原本隐藏的内部思考步骤,还能挖到公开数据里未披露的敏感信息,现在所有AI厂商都得重新检查安全漏洞

阅读全文 →
4.6K56656
前沿研究 · @jerryjliu0▲ 1.5万

研究者推出ExtractBench 覆盖14+提取系统评测

想选靠谱的企业文档信息提取工具?这份36页的基准评测,给出了不同方案准确度和成本的真实对比

我们在 ArXiv 发布了一篇 36 页的关于 ExtractBench 🧑‍🔬 的白皮书,我们致力于打造最全面、模式引导、面向真实世界文档提取的基准测试。

这份报告内容极其详尽,涵盖了从文档提取领域相关工作的对比,到数据集构建、真值生成方法,再到我们对 14 多个提取系统的实验。

以下是论文中最核心的要点:
✅ 该基准针对真实企业文档上的模式引导提取打分。给定输入文档+模式,以及提取器的预测输出,基准会测量值准确率、 grounding、各“挑战项”标签,以及成本。

✅ 与其他基准相比,我们拥有更多模式、更多评估维度,以及更高的数据领域多样性。

✅ 真值构建按三种文档子类型区分:真实文档采用模型集成+人工审核,合成长列表按构造生成真值,扫描表单也包含人工审核,含框标注。

✅ 我们的三种模式(LlamaParse 性价比版、智能代理版、智能代理增强版)都处于准确率和成本的帕累托前沿。

完整 ArXiv 论文在这里:我们的网站:

在 X 看原帖 ↗
1.5万13134112
🚀 新品发布
新品发布 · @OpenAI▲ 50.7万

OpenAI 推出 GPT-5.6 Sol 速度提至 14倍

最先仅对 OpenAI API 的选定客户开放,后续产能提升后会向更多企业开放,高需求用户能更快获得 AI 结果。

预览超高速模式:GPT-5.6 Sol 最高可达 14 倍速度。

该模式首先会在 OpenAI API 向选定客户群体推出,随着算力提升,会逐步扩大开放给更多企业使用。

在 X 看原帖 ↗
50.7万4327.3K1.1K
新品发布 · @Teknium▲ 6.3万

Hermes Agent 推出Bot模式,让不同AI bots互动

不同AI可以分配不同工作,还能互相沟通协作。现在开启一天公开测试,后续更新会根据反馈调整功能。

我们推出了 Hermes Agent 的 Bot Mode。

Bot Mode 是会话模式(sessions mode)的替代方案,在这个模式下,每个代理配置文件也就是「bot」对应一个聊天窗口。

你可以给这些 bots 分配工作、添加描述、设置头像,而且它们还可以和你的其他 bots 交流!

我们将在接下来一天,通过这个插件对 Hermes Desktop 的 Bot Mode 开启公开 beta 测试:

请在这里把你的所有反馈发给我,告诉我它的使用体验如何、是否符合预期、以及你发现的任何 bug。之后我们会处理反馈,将功能整合进面向所有人的主桌面应用!

在 X 看原帖 ↗
6.3万49874401
新品发布 · @GoogleDeepMind▲ 36.4万

GoogleDeepMind 发布 Gemini 3.7 Flash 新版模型

日常写代码、处理知识工作和做网页开发,都能用到这个更强的新版模型,可关注实际使用体验的变化。

Gemini 3.7 Flash 已发布。它在编码、知识工作和网页开发方面能力更强。🧵

在 X 看原帖 ↗
36.4万2372.0K164
新品发布 · @akshay_pachaar▲ 2.2万

DeepSeek 开源的DeepSeek Harness,几小时涨了3.5万星

想修改AI Agent框架的上下文组装逻辑,不用改源码也不用分叉仓库了,所有核心组件都做成可替换的插件,调试也能看到完整的模型可见输入日志。

阅读全文 →
2.2万29226253
📰 行业动态
🔥 热点追踪 · @Teknium▲ 6.3万

Teknium 为 Hermes Agent 推出 Bot Mode 功能

Teknium 推出 Bot Mode,可将每个代理设置为独立 bots,分配工作、设置头像并让 bots 互相通信。目前开启一日公开测试,后续将根据反馈调整功能。下一步将看功能优化后的落地效果。

📖 阅读深度解读 →
6.3万49874401
行业动态 · @MaxForAI▲ 4.0万

DeepSeek 发布首款Agent产品 DeepSeek Harness

这意味着AI Agent的能力不再只由底层模型决定,工具、提示词等环节也会影响最终表现,竞争已经延伸到模型之外。

阅读全文 →
4.0万1620762
动态 · @beffjezos▲ 2.2K

感谢Elon与开源,谢天谢地

谢天谢地有 Elon 和开源让 AI 竞赛保持多极格局,否则会出现疯狂、史无前例、风险极高的权力过度集中。

在 X 看原帖 ↗
2.2K4332
动态 · @TheAhmadOsman▲ 3.2K

适用于Codex Cli、OMP、Pi Claud等智能代理

对于 Codex Cli、OMP、Pi Claude Code、Droid、OpenCode 这类智能代理来说,有一套至关重要的准则:
1. 模块化
2. 领域驱动设计
3. 极致清晰明确的规格说明
4. 充足完备的文档

这就是系统工程。

我不是说智能代理不够强大,但规范纪律比模型能力更重要。

如果你的文档没能回答清楚这些问题:
- 在哪里
- 做什么
- 怎么做
- 为什么做

代理就会自行猜测,把事情搞砸。

在 X 看原帖 ↗
3.2K76740
动态 · @omarsar0▲ 2.5K

如果你在AGENTS.md中编写规则,本文

如果你在 AGENTS.md 里写规则,这条结论值得你花时间了解。

当编码代理遵守了你写的规则时,它本来也有可能自己就会这么做。

Harness-IF 区分了这两种情况:它会根据执行证据逐个给256条规则打分,然后在九个探针构建中,在不应用规则的情况下重新运行所有任务,以此找出哪些规则是真的和模型默认行为冲突的。

在12个前沿模型上,原始准确率区间为72.1%到85.9%,去先验准确率区间为66.1%到78.6%。剔除巧合因素后,所有模型的表现都变差了,分数下降3.6到7.4个百分点。

有一个发现值得注意:优先级并不遵循提示词深度。系统提示、项目文件和用户指令的优先级全都高于工具和技能描述。

论文:在我们的学院跟踪更多趋势AI论文:

在 X 看原帖 ↗
2.5K52541
动态 · @rauchg▲ 9.2K

一统全局的一条命令(tokens)。

一条命令统御所有(token)。我预测这会成为大规模使用编码AI的默认方式。

正常运行时间、模型选择、更低成本、可观测性、ZDR……

厉害的地方在于,这条命令可以配置所有**现有**的编码工具链,比如 Claude Code 和 Codex!

在 X 看原帖 ↗
9.2K75918
动态 · @yousefhll▲ 1.3万

我们学会了开飞机 去向SF诉说

我们学会了开飞机,只为给旧金山传递一件事。

推出 Vendo (YC S26) 全栈智能体界面。

这是一款面向你用户的生产就绪智能体,内置了用户所需的一切功能。

它可以代表你的用户执行真实操作。它甚至能直接在你的产品之上,构建出完整的新功能、微应用和自动化流程。

内置权限管理、工具防护、用户上下文等功能。包含了面向用户的智能体所需的一切。

仅需一条命令即可完成安装。开源。

@runvendo @nourzahzah

在 X 看原帖 ↗
1.3万1811015
行业动态 · Hacker News▲ 1.0K

DeepSeek V4 Pro 新版本0813已上线可查询

新版大模型现身公开文档和第三方榜单,相关链接已经放出,感兴趣可以自行查看更新内容

https://api-docs.deepseek.com/https://artificialanalysis.ai/models/deepseek-v4-prohttps://twitter.com/ChrisGPT/status/2087572834650407024, https://xcancel.com/ChrisGPT/status/2087572834650407024

社区讨论:多位开发者实测后指出,新版本DeepSeek V4 Pro 0813完成开发任务存在小错误,性能弱于Grok 4.6、Fable 5等头部模型,价格比竞品Luna更高但表现更差,官方今日起已上调定价。开发者认可它比Opus 4.8便宜约20倍,成本优势明显,也有用户提到部分中国大模型能力出色,但开发者更习惯默认选用成熟的行业标准模型。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 621

网友曝出Grok 4.6版本基准测试结果

Hacker News网友曝出新版Grok,相关讨论热度很高,可以关注后续性能数据公开后的变化

https://artificialanalysis.ai/articles/grok-4-6-benchmarks-a...

社区讨论:不少用户认可Grok的体验,称它回答直截了当、速度快,做安全审查表现出色,API定价更便宜,靠着SpaceX的投入已经能成为头部模型的有力竞争者,也给行业带来了良性竞争。也有用户质疑Fable发布仅两个月,各大实验室就都推出了同级模型,不清楚背后到底是什么原因,还有用户因马斯克的个人声誉不愿使用他旗下的产品。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 537

谷歌Gemini推出了新版本Gemini 3.7 Flash

新版本提前泄露出来被社区挖出,普通用户很快就能用上新版 Gemini 模型了

https://ai.google.dev/gemini-api/docs/models/gemini-3.7-flas...

社区讨论:多数用户吐槽Gemini 3.7 Flash的入门定价设定不合理,入门价2026年底才到期涨价,到2027年至少会更新三代新模型,没人会继续用这个版本。有人认可它多模态尤其是视觉生成HTML的能力很强,性价比优于Claude Sonnet 5,也有人提出纯文本场景下,DeepSeek V3的同水平模型价格低十多倍,GPT-5.6 Luna性能更好价格也更低,只有多模态场景才需要选它。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 366

pr337h4m 加速了 GPT-5.6 Sol 的运行速度

这项提速工作在 Hacker News 引发大量讨论,关注大模型运行效率的人可以跟进看看具体方案

社区讨论:不少开发者认为推理速度被当前行业低估,速度提升能支持更多迭代,提升输出质量,也有人畅想未来可以实现本地离线的超高速小型大模型。有人指出目前尚未公布性能不变的明确结论,也没有公开定价,推测价格会很高,预测明年外部开发者单推理开销就会超过五万美元。还有人提出,人类审核代码的场景下,十倍速度并没有实际用处。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 225

Mistral 更新推出了新版本 OCR 4.1

关注文字识别工具升级的人,可以留意新版本的功能变化,等待社区实际体验反馈。

社区讨论:不少网友认为Mistral OCR 4.1定价过高,1000页收费3.5欧元不值,有人自建OCR pipeline处理千页仅需0.05到0.1美元。用户实测认为它处理复杂排版效果不如OpenAI的专业模型,OpenAI目前仍占据优势;有人提到百度OCR效果出色且本地运行成本近乎免费。部分欧洲网友对欧洲在AI竞赛中没能拿出有竞争力的产品感到失望,还有人吐槽产品不合理的快捷键设置。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 441

OpenAI 把 Codex 放进 Linux 版 ChatGPT 客户端了

之前用 Linux 没法在官方客户端体验 Codex 代码能力,现在开放预览测试,写代码的Linux用户终于能用上官方功能了。

社区讨论:多数用户质疑该应用采用Electron框架开发,未查询就已占用2.2GB内存,资源消耗过大,也有人提问,它相比网页版、Codex CLI有什么优势。有用户提醒,需将它放在虚拟机中隔离运行,避免直接访问系统,防止安全风险。也有人认为,OpenAI已经花精力推出Linux版,用户不该对框架、内存这些问题要求过多。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 48

这份论文统计了企业实际用ChatGPT的情况

市面上大多是企业喊口号的AI转型宣传,这份论文带来实际调研数据,可以帮你看清真实的AI落地进度

行业动态 · Hacker News▲ 53

MCP Memory 用开源组件做快 agent 记忆存储

开发 AI agent 不用纠结慢存储方案,有人用现有开源工具搭出了更快的替代实现,可以直接参考

社区讨论:多数用户质疑该项目和现有方案差异不大,有人认为和给markdown文件做grep搜索效果差不多,也有人提问它和Claude内置的代码记忆、mem0等已有项目相比在性能上有何优势。有人认可用SQLite FTS5做快速存储是务实的架构选择,还有人提出可以用git仓库存储记忆,用FTS5专门做速度优化方便人工检查。已有开发者分享了同领域的其他开源项目和托管服务。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 67

MCP-stama 做了个无依赖超高速 Rust MCP 服务器

做后端服务的开发者可以试试这个新项目,它完全不需要外部依赖就能运行,对追求部署速度和稳定性的工作流有用

💡 深度观点
深度观点 · @alighodsi▲ 946

Genie Ontology 让企业AI代理跑通了业务增长

原来企业AI缺内部私有上下文,手动补全成本高昂,现在这套流程已经可以自动化。高管开会不用等各部门汇报,直接就能拿到答案。

我今天被问了无数次这个问题:“当公司已经达到70亿美元规模,你还怎么实现80%增长?”

真正的答案是,我们终于看到AI智能体开始在企业中发挥作用,取得了突破。

AI已经有一段时间都具备了超高智能,但一直缺少存在于人们头脑中、或是存在于某些SaaS记录系统里的基础上下文信息。

很多组织会部署FDE来捕捉这些上下文,也就是本体(Ontology),再将其输入AI。这个过程劳动密集,成本高昂。

我们刚刚用Genie Ontology实现了这个流程的自动化。一旦你有了企业上下文图谱,像Genie这样的AI智能体就会变得出奇好用。

我现在已经不再等我的CRO、CFO、CMO、CHRO等人给我答案了,我开会的时候直接在手机上连续提问就行。说实话,这真的会上瘾。

我们的客户也开始这么做了,目前平台上超过70%的查询都是由Genie智能体生成的。

这给平台带来了更多查询,推动了消耗量增长,进而拉动了收入增长。这就是简单直白的答案。

在 X 看原帖 ↗
946321158
深度观点 · @harleyfoote_▲ 722

十年交易员说,大语言模型根本没法直接做交易

这位有十年经验的交易员用实盘验证了现有结论,真正有潜力的AI交易方向是集群化算法迭代,这是只有AI能做到的新前沿

阅读全文 →
722201002
深度观点 · @mitsuhiko▲ 1.4万

资深开发者 Mitsuhiko 认可 DeepSeek Harness 设计

这位开发者说这个设计让他重新思考 Pi 项目的重构方案,行业顶尖开发者的判断可以帮你判断工具选型方向。

说真的,我对 DeepSeek Harness 目前呈现出的东西很喜欢。它确实让我对我们在 Pi 里处理 harness 重构的方式产生了一些思考。

在 X 看原帖 ↗
1.4万1532251
📌 其他
工具产品 · @eliebakouch▲ 8.6万

deepseek harness 打造了首个优先AI开发的开源项目

这个AI agent开发工具保留了完整KV缓存,不会修改对话历史,还附带开箱可用的多种开发模式,能帮你省掉重复调试的时间

出色的发布。它是一个内置了多个 harness 的网页 UI,你可以通过它的 SDK 生成 claude code 和 codex agent。

deepseek harness 默认支持多种不同的「模式」(也就是不同的 harness):带程序化工具调用的代码模式(用 TypeScript 实现)、bash+编辑模式(通常用于评测),或是带读写工具等功能的标准模式。

它具备一流的 KV 缓存感知设计,核心是保证 KV 缓存永远不会被修改。对于每一处修改,他们不会改动之前的历史(前缀),只会在末尾追加一条说明修改内容的记录。

我期待其他 harness 也这么做,但世事难料?这个 harness 的开发过程也非常有意思。它完全是以代理优先的方式编码开发的,项目里有一整个叫 .agents/notes 的文件夹,记录了代理留下的每一个决策和提案。

其中还包含一些很棒的信息,比如他们也会用这个框架做后训练。UI 非常美观,轨迹视图尤其出色。他们还发布了一篇完整的论文,详细介绍了「插件」的可组合性和系统设计,这会非常有用。

在 X 看原帖 ↗
8.6万50628395
实战经验 · @yanhua1010▲ 3.5K

开发者做了DeepSeek Harness从零搭建AI Agent手把手教程

想自己动手做AI Agent却找不到入门路径的人,可以跟着这个教程从零完成完整实现,还有在线学习入口可以直接跟着练

新鲜出炉 Deepseek harness教程,使用DeepSeek v4 pro max 做了个手把手教程。 👉 DeepSeek Harness原理与实现:从零到一实现一个 AI Agent 🌍在线学习: 🔗仓库地址:

在 X 看原帖 ↗
3.5K64554
大模型 · @chunxiangai▲ 3.6万

DeepSeek Harness架构解析:全插件化可热插拔Agent框架

对比同类产品,拆解DeepSeek Harness的原子化全插件设计思路

阅读全文 →
3.6万1516395
AI开发 · @thdxr▲ 1.7万

开发者对比DeepSeek Harness与OpenCode2设计思路

开发者称DeepSeek Harness与自研OpenCode2设计思路多有重合,核心实现选择不同

我抽时间看了新的 deepseek harness,它很有意思,因为其中有大量和我们在 opencode2 里为支持全热重载开发的方案重叠的思路。

他们最终做了一个关键的不同选择,让最终解决方案不一样,但整体思路非常眼熟。

简单来说,用插件系统的话,如果插件A、B、C都修改了状态,30秒后A又改了一次,状态很容易陷入混乱,你要怎么处理?

我们用的是一个非常简单的重放系统来重新推导状态,而 deepseek 维护了一套撤销修改的方案。

在 X 看原帖 ↗
1.7万541985
大模型 · @wquguru▲ 4.7万

博主评价DeepSeek V4 Pro未达预期 Harness体验惊艳

科技博主分享对DeepSeek两款AI工具的使用体验评价

DS V4 Pro效果没有完全达到预期,不过DeepSeek Harness(dsh)却十分惊艳,草草的列几个印象深刻的点: 1. 快,非常之快 2. dsh没有选择GUI、也没有选择TUI,或者CLI,而是走了一条其他Harness几乎没走过的路——Web UI,采用BS架构,这个设计非常的巧妙,把客户端繁重的工作省下来做优先级更高的事情,后期如果要做客户端,直接Electron包一下就是客户端了 3. 插件系统非常nice,万物皆可插拔,有趋势的,默认开启的插件中竟然有个佳作llm-pi-ai的插件,可见也用到了pi生态的组件 4. 可观测性的设计惊为天人,分Duration、Turns、Calls三大块,你可以理解为Harness的F12,System、User、Assistant具体都在输入什么、输出什么,每个Tool做了什么,轮次、模型耗时、工具调用耗时、首 token 平均时长、缓存命中率。..非常的详尽 5. github star破10万轻轻松松🫱

更多截图

插件能做什么应用层的东西,可以看这个例子🫱

在 X 看原帖 ↗
4.7万10191105
编码Agent · @0xcherry▲ 4.6万

体验解读DeepSeek Harness的设计理念与实现思路

分享使用DeepSeek Harness的体验,解读其创作思路

阅读全文 →
4.6万24402183
Agent框架 · @mylifcc▲ 3.6万

对比DSH与Pi:Agent框架设计理念与架构差异

本文对比两款Agent框架DSH与Pi的设计定位与架构

阅读全文 →
3.6万1511299
AI编码 · @goan999999▲ 2.0万

Codex 5.6隐藏技巧:可省90%token提升编码效率

用户分享了让AI编码效率提升的正确提示词用法,替代直接要求AI写功能的操作

阅读全文 →
2.0万1473111
AI编码 · @josesilesdata▲ 8.3K

GitHub推出spec-kit开发工具 重构AI编码流程

该工具要求先写开发规范再由AI执行,支持三十多款AI编码代理,现已在GitHub开源

开发者josesilesdata在社交平台发文,宣告随性AI编码(vibe coding)时代终结。GitHub推出全新工具spec-kit,改变了开发者向AI编码代理提需求的方式。

它要求开发者先写清楚项目规范,再由AI代理执行开发工作。工具共有五条命令,分别对应定义项目原则、明确开发目标、确定技术栈与架构、梳理实际任务清单、完成代码实现。

spec-kit支持超过三十款不同的AI编码代理,包括Copilot、Claude、Codex、Cursor等。

目前该项目在GitHub上已经获得超过12.5万星标,项目仓库链接附在原发文的评论区。

在 X 看原帖 ↗
8.3K8112161
开源 · @anion_ex▲ 6.1K

深度求索开源DeepSeek Harness 已现Agent操作系统雏形

参与者分享内测体验,称框架支持组件动态重组,内测阶段已有近300个第三方插件

阅读全文 →
6.1K87136
影视 · @gkxspace▲ 8.3K

Higgsfield用AI生成全长20分钟剧情片《ONEIRIC》

影片由Cinema Studio 4制作,全部提示词与制作素材已经完全公开

全长20分钟的剧情片《ONEIRIC》完全由AI生成,由Higgsfield使用Cinema Studio 4制作完成。

以往看到AI生成的影片内容,爱好者最常询问的就是生成提示词。这次不需要额外索要提示词,《ONEIRIC》的全部提示词和制作素材都已公开。

公开项目中可以查看五项核心制作信息,分别是:故事拆分场景与分镜的方式;角色、地点、道具制作成资产的方法;每个镜头使用的参考素材;细节提示词的撰写详细程度;前后镜头保持一致性的方法。

完整公开项目可通过指定链接查看,这些制作资料很难在平时获得。

在 X 看原帖 ↗
8.3K23232
产品体验 · @brian_lovin▲ 3.5万

开发者分享Grok BotAI助手初步使用体验

梳理了该产品在交互设计、功能设置等方面的优缺点与行业观察

阅读全文 →
3.5万13452334
大模型 · @aitech_komoriya▲ 1.4万

Claude Code「三席位分级」配置方案可降低近八成成本提速两倍

由用户aitech_komoriya分享,通过三款Claude模型分工实现成本与效率优化,适合深度使用Claude Code的用户

如果你在使用Claude Code,建议牢记「三席位」分工配置方案。该方案可将成本从约2万日元降至约3000日元,处理速度可提升至原来的三倍。

方案的核心原则,是不要把所有工作都交给最高级的大模型。

具体分工分为三层:最轻量的Haiku负责分类任务,中等规格的Sonnet负责具体工作,可支持8个任务并行处理,最顶级的Opus只负责最终的质量检查和结果判定,如果结果不符合要求就发回Sonnet重新处理。

这本质就是「分类器→8个工作线程→裁判员」的三级分工。要把生成内容的AI和评估内容的AI分开,不要让同一个AI既生成内容又自我审核。

最不推荐的用法就是把所有工作都交给Opus,这种做法相当于花高薪聘请顶级人员做基础工作,成本很高。

AI时代的核心问题,从来都不是哪个模型能力最强,而是该把哪类工作交给对应的模型。

要真正用好Claude Code,这种根据模型能力分配任务的方式非常重要。未来人与人之间的差距,不在于会不会用AI,而在于能不能把AI放到最合适的位置上。

这套分级分工方案同样适用于Codex。

在 X 看原帖 ↗
1.4万77382
产品体验 · @dotey▲ 9.2K

普通用户分享DeepSeek Harness使用体验与改进建议

用户从普通用户视角提出产品体验问题与优化方向,建议引入专业AI产品经理

阅读全文 →
9.2K47221
语音技术 · @aiwithsally▲ 2.3万

测试者谈文本转语音工具:演示效果易做生产可靠难

Soniox发布新版TTS,支持超60种语言,每小时定价0.7美元,兼顾多项实用功能

我测试过足够多文本转语音(TTS)工具,很清楚在演示中获得好听的语音效果是很容易的部分。真正的挑战是让语音人工智能在生产环境中稳定运行。生产环境要求包括低延迟、顺畅打断、准确发音、多语言支持,还要在不同语言间保持同一音色。

Soniox刚刚推出了TTS v2,这也是本次发布的亮点所在。单个模型就集成了超过60种语言支持、数秒音频即可完成语音克隆、自然语言切换、字符级时间戳以及超低延迟流媒体功能。

本次发布的定价为每小时0.7美元,对实际想要扩展语音智能代理的开发团队来说实用性进一步提升。文本转语音技术正快速发展为实用基础设施。

在 X 看原帖 ↗
2.3万131781
开源 · @MinLiBuilds▲ 7.8K

DeepSeek Harness与V4 Pro同日开源 提供AI Agent搭建框架

该项目将AI Agent全组件模块化,底层支持全插件化架构,配套发布相关编程范式论文

阅读全文 →
7.8K13028
本地部署 · @ollama▲ 5.0K

可本地运行Meta AI的Muse Glimmer处理个人信用卡账单

Ollama平台支持该本地部署模式,可保障数据完全留存在用户本地

可在本地完全运行Meta AI的Muse Glimmer,用来处理个人月度信用卡账单。处理过程中所有数据都保留在用户本地,数据所有权完全归用户所有。

用户可以结合Ollama,用自己常用的应用或工具框架尝试不同智能代理任务。

相关任务链接和Muse Glimmer模型页面已公开。

在 X 看原帖 ↗
5.0K2599
互联网 · @majamediaco▲ 180

用户自2012年运营表情包账号 累计近15年经验

网友调侃自己按平台阶段获得了表情包领域不同等级学位

很难相信,我从2012年就开始在互联网运营表情包账号了。

我把这个过程戏称成:在Instagram读本科,在Tumblr读硕士,在Twitter读博士。

目前我在应用模因学(meme)领域的专业从业经验已经接近15年。

在 X 看原帖 ↗
180141
开发工具 · @contextconor▲ 250

开发者评价AI可观测性工具Emma AI体验出色

开发人员contextconor分享使用体验,称赞Emma AI可观测性产品与开发团队

用户contextconor在X平台分享了自己使用Emma AI可观测性工具的体验。他表示,这款工具实际使用体验非常好。

和传统工具要求使用者预先定义所有可能的故障模式不同,Emma AI可以自主理解AI代理预期要完成的任务。

他同时称赞Emma AI的开发团队非常出色,向zjearbear及整个团队表示祝贺。

在 X 看原帖 ↗
2505
AI开发工具 · @stevibe

DeepSeek Harness发布 改用网页界面替代命令行工具

开发者实测其完成3D魔方构建任务,新增轨迹页可追踪助手与工具调用

DeepSeek Harness已推出,核心改动是使用网页界面替代命令行界面(CLI)。

开发者测试了该工具生成3D魔方的任务,总共耗时27分钟,完成52个步骤,生成速度为每秒120个令牌(tok/s),最终结果完美成型。

工具新增「轨迹」标签页,用户可以在该页面追踪每一次助手调用与工具调用。

顺带一提,该工具默认选用3080端口运行。

在 X 看原帖 ↗
工具 · @jmrphy

这款免费AI工具可完成电脑操作,成本仅需5美元

用户jmrphy分享了一款几乎免费的AI智能体搭建方案,十分钟就能在电脑上配置完成

如果你过去一年一直观望AI智能体炒作,觉得它只是潮流炒作、浪费时间,成本太高不值得尝试——说实话,你之前的想法可能没错。但jmrphy认为,搭配Hermes桌面端的DeepSeek V4 Flash刚刚跨过了值得尝试的门槛,之前一直观望的人现在都应该动手配置。

这个组合几乎免费,其AI能力大致相当于美国企业每月收费200美元的产品。不需要复杂设置,全程只需大约十分钟,就能让AI帮你完成电脑上的几乎所有操作。

超高智能水平已经和极低成本结合到一起,花十分钟把它装到电脑上完全值得。配置步骤十分简单:先免费下载Hermes Desktop,再在OpenRouter注册账号,购买5美元额度,不会自动续费,复制你的API密钥,也就是应用程序编程接口密钥,将密钥填入Hermes的设置中,选择DeepSeek v4 Flash作为默认模型,剩下的操作都可以让Hermes帮你解释和完成。

5美元额度可以使用很长时间,如果试用后不满意,损失的时间和金钱都非常少。

使用需要注意安全风险,如果没有集中注意力,AI智能体有可能误删电脑上的文件。刚开始使用时操作节奏放慢。

在 X 看原帖 ↗
大语言模型 · @MaxForAI

DeepSeek Harness系统提示词泄漏 指向Agent运行时新方向

泄漏的系统提示词显示,该产品不止聚焦代码生成,更定义了Agent完整运行框架

AI生成视频 · @huangyun_122▲ 2.2万

有用户测试Grok生成视频 效果不输Seedance 2.5

用户基于Fable 5提示词改写后测试Grok,分享完整提示词与测试入口链接

阅读全文 →
2.2万115494

今天的 51 条信号到这里下一轮 12:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新