AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 8 月 19 日 · 08:00 更新 0 文章0 信号0 主题
试试:

今天发生了什么1 分钟读懂

OpenAI 暂停了面向新模型的强化学习训练两周,最大规模的前沿训练线仍处停摆。Sam Altman 与 Greg Brockman 都公开回应,模型能力进步已超过安全对齐进展。

Z AI 上线 GLM-5.3,价格与 5.2 持平,得分 60 追平 Kimi K3,权重预计一周内开源。昨天那款能塞进 24GB 消费显卡的 Qwen3.8-27B,由阿里通义正式发布。

Anthropic 研究者发布 73 页实地研究《Patient Zero》,追踪多智能体之间思想的自我传播。研究发现,传播的核心在可编辑文本文件的架构设计,而非模型本身。

今日值得看
01 伯克利发布第三期Agentic AI公开课程 课程资料全部免费公开,覆盖多领域行业专家分享内容,对AI方向感兴趣的学习者可以直接获取学习资料。

目前网上最好的 AI 公开课:加州伯克利大学宋晓冬教授的Agentic AI: 这是Berkeley LLM Agents系列的第三期。

02 用户试用Grok Bot 分享使用体验与试用期待 开发者ChuckCook试用Grok Bot 7天免费版,分享使用感受并拓展CAD建模工作流

ChuckCook目前已经完成Grok机器人的初始连接,正在使用产品的7天免费试用版。他表示,自己无法承担SuperGrok Heavy和Cursor Ultra的订阅费用,因此没有使用这些高阶版本。

03 谷歌Gemini 3.7 Flash可一键将静态PDF转为交互网页应用 谷歌开发者公布,仅用一个提示词即可完成转换,原生支持提取数据并生成界面

仅需一个提示词,就能把静态PDF转换为可交互网页应用。谷歌开发者在X平台分享了这一应用案例。 开发人员在Google AI Studio中使用Gemini 3.7 Flash完成转换。

04 Vercel Labs开源fx,冷启动仅10微秒 需要做本地AI编码代理或者模型基准测试的开发者,可以直接使用或者嵌入到现有系统里,全程不收集数据,隐私有保障。

介绍 fx,一款来自 Vercel Labs 的小型开源原生编码智能体。fx 最初是内部工具,是一套用 Zig 编写的框架和 CLI,针对研究场景,以及嵌入更大系统做了优化。今天,我们将它开源。

今日焦点

AI模型拿到52分,发帖人只放了个链接

他没有写长评,只放了一个链接。链接指向的是这件事:Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上拿到 52 分。

标签栏有六项:ai、generative-ai、llms、qwen、ai-in-china、artificial-analysis。ai-in-china 把这条消息归入中国 AI 动态。

帖子下方是赞助说明:每月 10 美元,订阅者会收到一封整理当月最重要 LLM 进展的邮件。他还放了一个反向选项——“付费让我少发邮件给你”。

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达44 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

08:00 本轮更新 · 下一轮 12:30
行业动态 · Hacker News▲ 246

Claude发布2026年5-8月额度促销活动(May–August 2026)

提前一年放出的额度促销,打算长期用 Claude Code 可以关注价格变动,看看能不能锁定优惠。

社区讨论:多数用户认为Anthropic当前产品体验远不如OpenAI,不少重度Claude用户已经切换到GPT-5.6 Sol和Codex,吐槽Claude Opus可用性差、额度紧张、客户端体验差,还有人称这会是自己使用Anthnic产品的最后一个月。关于本次促销到期后额度是否恢复,有人确认促销结束后额度将回落至促销前水平,也有人预测Anthropic会因为OpenAI降价而延长促销,不少用户表示如果额度回落就立刻转投竞品。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 187

alexeigannon提议挪威直接收购OpenAI

科技巨头的股权越来越集中,国家下场收购头部AI公司的思路被正式摆上台面,可以观察后续会不会有更多类似声音

社区讨论:多数人不看好该提议,有人指出被政府收购后受监管约束,OpenAI会很快落后于没有同类监管的竞品,官僚运营的前沿科技公司不可能保持竞争力。有人质疑挪威能否承担OpenAI实现AGI所需的持续高额计算资本投入,也提到现有股东不会同意按当前8000亿美元估值出售,且美国一定会出手阻止该交易。还有人认为单个公司改变不了AI发展整体轨迹。

在 HN 看讨论 ↗   原文 / 论文 ↗
商业 · @shensi▲ 8.2万

shensi发布Merge for Workforce AI成本优化工具(75%)

企业里员工选AI工具经常花冤枉钱,这个工具能统一调整成本支出。

我们刚刚一键将全公司员工的 AI 支出削减了 75%。
现在为你介绍:Merge for Workforce。

如果不用 Merge,你的员工只能二选一:
1. 所有任务都用前沿模型,花费达到合理成本的 100 倍
2. 模型访问权限限制过严,产出的工作质量不达标

而有了 Merge 之后,IT 部门只需一键即可连接任意身份提供商,按团队设置模型路由策略。

Merge 会通过桌面客户端把策略推送到每一台设备,覆盖你团队所有 AI 助手和编码工具里的模型配置。

现在每个任务都能匹配到合适的模型来完成。结果是什么?令牌使用量减少 75 倍,输出更快也更好。

在 X 看原帖 ↗
8.2万39249111
行业动态 · OpenAI 开发者社区▲ 21

openai-community称专业场景需百万上下文

若做专业工作,小于百万token的上下文窗口用起来很麻烦,即使能力弱Claude也更胜一筹。职业AI用户可以参考这个行业共识判断产品。

支持 100 万上下文窗口来承载专业工作负载,标题和内容名副其实——低于 100 万的产品几乎都没法用。

只会带来一堆麻烦,哪怕 Claude 本身能力没那么强,它还是会赢。

那为什么不干脆做 100 万或者更大的上下文呢?
此致

在社区看讨论 ↗
行业动态 · Hacker News▲ 372

Qwen3.8 27B 评测拿到了52分

大模型的评测结果直接影响日常使用体验,可以参考这个分数对比其他模型,判断是否适合自己的需求

社区讨论:多数人确认该模型以27B参数拿到52分,性能和远大于它的GLM 5.2、GPT 5.6 Luna相当,还击败了所有40B-150B的中型模型,得分和150B以上级别的DeepSeek V4 Flash 0731持平,能在游戏PC上流畅运行。有人质疑当前基准测试针对性刷分严重,参考价值不高,还有人提问为什么该模型推理吞吐仅27tps,定价还偏高。有实际测试用户提到它推理时会执着解决问题,表现类似GPT-5.6-Sol-max。

在 HN 看讨论 ↗   原文 / 论文 ↗
产品 · @harvey▲ 3.8万

Harvey推出第二代法律AI智能代理

内置专门为法律工作训练的模型,启动时就自带案件文件和相关权限。

推出 Harvey II:从一开始就更智能的智能体。

- 包含 Harvey Tenet,我们首个为法律工作训练的模型
- 围绕事项和项目构建
- 智能体启动时就已配备所需的文件、上下文、权限和历史记录
- 可以给律师或智能体分配任务,然后跟踪并审查工作
- Harvey 会记住你的工作方式,并用你的风格写作

在 X 看原帖 ↗
3.8万23258148
前沿研究 · @PatientZer0tech▲ 13.0万

Anthropic研究员Papadopoulos, Shah, Zimmerman & Lindsey发布Patient Zero 多智能体LLM自我传播思想实地研究论文(73 pages)

这项研究发现,自我传播的核心是可编辑文本文件的架构设计,而非模型本身,对多智能体系统安全性研究有关键参考。

阅读全文 →
13.0万1338461
新品发布 · @radixark▲ 3.7万

radixark发布Miles v0.1开源强化学习框架

做大模型多模态模型强化学习训练时,调试难硬件利用率低都可以试试它,已有多家团队用它跑生产级任务

今天我们发布了 Miles v0.1,这是一个面向大语言模型和多模态模型的开源强化学习框架。

强化学习训练入门容易,但调试困难。Miles 可以帮你确保运行正确,高效利用硬件,让强化学习在规模化场景下稳定运行。

过去 9 个月里,共有 72 位贡献者提交了 1,326 个 commit,搭建了 85 项 GPU 端到端 CI 测试,还在 Kimi K3、DeepSeek V4、Qwen 3.8、GLM 5.2、Inkling、MiniMax H3 等前沿开源模型上对 Miles 进行了实战测试。

目前 Miles 为 @humansand、@periodiclabs、@modal、@DecagonAI、@Eigent_AI、@nebiusai、@IBM 等团队的前沿模型开发和生产级强化学习任务提供支持,同时兼容 @NVIDIAAI 和 @AIatAMD 的硬件。

以下是我们打造的功能,以及各团队选择 Miles 的原因🧵

在 X 看原帖 ↗
3.7万55368160
新品发布 · @Alibaba_Qwen▲ 8.3万

阿里通义发布Qwen3.8-27B 端侧模型达前沿性能

端侧就能跑的大模型达到前沿水平,不需要云端调用也能获得不错的效果,后续会拓展到更多领域。

一款本地 27B 模型取得了前沿水平的分数!非常感谢 @cline 的推荐。🥳

这只是一个开始——Qwen3.8-27B 会持续探索,进入更多领域。🌱

在 X 看原帖 ↗
8.3万1132.1K158
新品发布 · @Zai_org▲ 9.0万

Zai_org 上线 GLM-5.3 API 定价不变

面向编程、网络安全防御和长周期智能体任务,价格维持和GLM-5.2一致,开发者可以直接通过官方或合作渠道调用

GLM-5.3 API 现已上线。

它面向编码、网络安全防御和长周期智能体任务构建。

定价与 GLM-5.2 保持一致。

你可以通过官方 API 以及合作方模型网关使用它。

开始使用:

在 X 看原帖 ↗
9.0万1131.3K163
行业动态 · @OpenAI▲ 19.0万

OpenAI暂停最新模型强化学习训练两周

随着模型能力增强,内部开发测试风险也随之升高,这次暂停用来升级安全防护措施,影响最大规模前沿训练计划的推进。

随着模型能力不断增强,在内部开发和测试它们相关的风险也随之增长。

我们暂停了针对即将部署的最新模型的强化学习(RL)训练,暂停时长为两周,在此期间我们会强化研究环境、开展红队测试,并扩大监控覆盖范围。

我们计划中规模最大的前沿RL运行仍处于暂停状态,与此同时我们会用小规模训练和评估来验证这些安全措施,并积累更多对齐相关的证据。

在 X 看原帖 ↗
19.0万1481.9K345
🔥 热点追踪 · @OpenAI▲ 19.0万

OpenAI暂停面向部署新模型的强化学习训练两周

OpenAI为加固研究环境、开展红队测试、扩充监控覆盖,暂停相关训练,最大规模前沿强化学习训练仍处于暂停状态,后续将发布技术报告,公开后续研究进展仍待观察。

19.0万1481.9K345
行业动态 · @emollick▲ 2.5万

OpenAI要拿两成推理算力做AI对齐问题监控

花这么多算力专门监控风险,说明AI对齐问题的优先级已经提得非常高了。

如果对齐问题已经严重到让 OpenAI 愿意投入 20% 的研究推理计算资源用于思维链监控,那就说明对齐问题已经变成一个相当严重的关切。

我们真的需要在各个实验室之间推行统一的政策与标准。

在 X 看原帖 ↗
2.5万923633
行业动态 · @merettm▲ 2.3万

多家AI团队放缓前沿训练 强化学习仍处于暂停

暂停是为了加强安全和监控,只保留小规模训练做安全测试。

我们暂时放缓了部分前沿训练,以加强安全保障与监控。我们计划中规模最大的前沿强化学习运行仍处于暂停状态,同时我们会开展小规模训练与评估,测试安全防护措施,并收集更多对齐相关证据。

我预计,对安全的信心将越来越决定AI开发的推进节奏。我们迫切需要工具,让各实验室和国家在这件事上开展协作——这也是我签署《Pacing the Frontier》的原因。

与此同时,我们自己也在采取实际行动,并且会随着我们的方案发展,持续分享我们学到的内容。

OpenAI表示,它在过去两周暂停了其“计划用于部署”的最新模型的强化学习工作。这不包括不计划用于部署的内部模型。

这种表述也暗示暂停已经结束,训练现已恢复,但他们从未直接说出这句话。他们确实明确表示,计划中规模最大的RL训练运行仍处于暂停状态,但这种表述也排除了预训练。

这篇推文从头到尾都含糊得让人恼火,可能是出于法律原因,也可能是为国会质询做准备。

在 X 看原帖 ↗
2.3万4150673
研究 · @BrianRoemmele▲ 2.8万

Anthropic相关研究者发布关于多智能体AI思维病毒的研究论文

他们不认为这是突然出现的神奇现象,而是互联网垃圾训练数据 predictable result。

阅读全文 →
2.8万1710046
前沿研究 · @rohanpaul_ai▲ 6.9K

研究发现现有LLM智能体进化有巨大盲区

当前AI行业默认的自我进化方法可能完全走错了方向,需要重新思考AI记忆的设计逻辑,这会影响未来AI推理能力的发展方向。

研究人员发现,我们目前让AI随时间推移变得更智能的方法存在一个巨大盲点。AI实际上根本没有理解或应用高层次的抽象经验。

开发者花费大量时间构建系统,将AI过去的错误浓缩为清晰的规则供未来使用。这篇论文证明,AI本质上会把这些规则直接扔掉,只看原始历史日志。

现代LLM系统尝试通过两种方式随时间改进:把过去的任务存储为逐步骤原始历史,或是浓缩的总结规则。

这项研究测试了这些智能体是否真的会使用存储的记忆:研究人员秘密将正确的提示替换成随机垃圾文本,得到了以下结果。

- 当逐步骤历史被篡改后,AI表现大幅崩盘,证明它严重依赖复制完全一致的过去动作。
- 但当研究人员完全破坏浓缩总结规则后,AI仍然正常运作,性能没有出现任何下降。

如果AI无法把抽象经验应用到新场景,它就不是在真正推理或学习。

这引出了一个问题:整个AI行业是否需要重新思考记忆的运作方式,因为目前这些智能体只是在模仿,而非理解。

arxiv.org/abs/2601.22436
《LLM Agents Are Not Always Faithful Self-Evolvers》

在 X 看原帖 ↗
6.9K2513275
新品发布 · @ArtificialAnlys▲ 9.8K

Z AI发布GLM-5.3,评测得分追平Kimi K3

权重预计一周内开源,智能水平追平头部开源模型,推理成本比同 tier 竞品更低,想试用开源顶级大模型的可以等一等。

阅读全文 →
9.8K2826033
行业动态 · @gdb▲ 2.6万

@gdb披露前沿AI训练临时放缓

AI研发的推进速度将不再只看技术突破,安全信任才会决定接下来能走多快,行业节奏正在发生改变。

我们临时放缓了前沿模型训练的扩容进度,其中包括我们规模最大的计划中前沿RL训练,以加强安全与监控。

我们认为,对安全的信心将越来越决定AI开发的推进节奏:

在 X 看原帖 ↗
2.6万2336622
前沿研究 · @ZixuanLi_▲ 1.7万

GLM-5.3 得分60,能力不止编码

通用大模型不再只靠单项能力突围,多领域能力的全面提升,会直接影响到日常使用的体验

GLM-5.3 在 Artificial Analysis Intelligence Index 上得分 60。

虽然 GLM 最广为人知的是它的编码能力,但它的优势远不止编码领域。

GLM-5.3 在推理、通用对话,以及法律、金融这类专业领域都带来了大幅提升。

在 X 看原帖 ↗
1.7万1834826
行业动态 · @sama▲ 1.1万

@sama 暂停前沿强化学习训练保障安全

模型能力进步速度已超过安全对齐进展,暂停训练是为了落实安全对齐标准,未来安全信心将决定AI发展节奏。

我们已暂停部分前沿强化学习训练,以确保我们能够针对我们目前面临的全新能力层级,满足适当的对齐、安全与监控标准。

现在模型进展速度极快,而我们一直都明确表示,如果我们认为模型能力的发展速度超过了安全与对齐工作的推进速度,我们就会采取行动。

我们深切关注 AI 安全问题。我们认为整个领域必须就通用安全标准展开协调,但在此期间我们会单方面采取行动。

我们预计,对安全的信心将逐步决定 AI 进展的速度。我们对目前正在开展的对齐工作持乐观态度,并且始终致力于让前沿能力实现广泛可用。

在 X 看原帖 ↗
1.1万1824928
前沿研究 · @henryqin1997▲ 2.8万

StateM无需训练提升智能体,追平闭源前沿

不用放大模型也能提升AI智能体性能,开源方案零迁移成本,普通人也能尝试,提升工作流里智能体的可控性。

模型 scaling 是智能体性能提升的唯一来源吗?我们(@henryqin1997 @YaxinLu1997 @VITAGroupUT @VictorKaiWang1)很高兴分享我们的工作:

我们通过 Harness Scaling 在 Terminal-Bench 2.1 上达到了 95.3% 的原始准确率, frontier run 成本仅 15 美元(DeepSeek-v4-Flash 下准确率为 88.8%,与 GPT-5.6 Sol Max 表现相当)。

人力投入 → 不可扩展 ❌
智能体方向?局部优化 ❌
人力方向 + 智能体行动 = 更好的工作流控制✅

StateM:
1. 开源模型 + StateM → 追平闭源前沿水平,人人都可以尝试!
2. 无需训练,即可显著提升前沿智能体性能。
3. 在同系列智能体上实现零迁移成本。

[1/8]🧵 📄 🌐

在 X 看原帖 ↗
2.8万568593
工具产品 · @garrytan▲ 2.8万

GBrain 支持多AI代理,完全自主掌控记忆

可以把不同AI代理的记忆和技能存在自己托管的Postgres数据库里,不需要依赖第三方服务商存储核心数据。

GBrain 实际上可以和任何 AI Harness(Grok Bot、Claude Code、Codex、Hermes Agent、OpenClaw、OpenCode 全都兼容),以及任何搭载 pgvector 的 Postgres 托管服务配合使用。

这才是真正拥有属于你自己的 AI 代理记忆和技能的含义。

在 X 看原帖 ↗
2.8万20285172
深度观点 · @bindureddy▲ 6.1K

OpenAI暂停前沿模型训练 开源12周将追上

行业头部大厂暂停前沿大模型训练,若这一消息属实,开源AI的追赶速度将直接改写行业格局

天哪,OpenAI 要暂停前沿模型训练了😅

这意味着开源 AI 模型必然会在 12 周内追上他们,开源 AI 必胜 🚀🚀

在 X 看原帖 ↗
6.1K71564
AI视频生成 · @Diplomeme▲ 978

AI视频生成模型SeeDance 2.5 30秒超自然恐怖片提示词

完整公开符合写实纪录片风格的30秒恐怖短剧生成提示词,全程保持超自然氛围感

阅读全文 →
97845313
AI生成视频 · @iamahmedfaraz66▲ 7.0K

Seedance 2.5生成15秒5镜头角色视频提示词

该提示词要求生成24岁韩国年轻女性的真实MiniDV质感15秒分镜视频

阅读全文 →
7.0K1112489
大模型 · @bridgemindai

AI用户取消每月200美元Claude Max订阅转投SuperGrok Heavy

多年Claude测试用户称Claude多版本模型变慢卡顿,认为Grok 4.6成本速度性能更均衡

一名叫bridgemindai的AI用户在X平台表示,自己刚刚取消了每月200美元的Claude Max订阅计划,转而订阅X公司的SuperGrok Heavy。

他自称已经是Claude的早期测试用户多年,他认为Fable 5、Opus 5、Sonnet 5三个版本的Claude模型都变得速度缓慢、响应迟钝。

他提到,前一天Fable 5处理一个下拉菜单的样式修改就花了25分钟,这样的表现已经无法满足他日常工作流的使用需求。

他认为,目前在成本、速度和智能水平的综合表现上,Grok 4.6是最均衡的AI模型。

在 X 看原帖 ↗
大模型 · @ezyang

开发者发布交互式Transformer训练并行化教程

开发者基于经典文章改造,称对成品不完全满意但仍选择公开,可探索式讲解并行化知识

大模型 · @yugen_matuni

日本开发者梳理AI使用规划 将逐步减少Claude Max用量

开发者明确不同任务的AI工具分工,以GPT Pro、Fable等多款模型替代Claude Max

开发者基本确定了自身的AI工具使用方案,将逐步减少Claude Max的使用量,这个方案并不完全排斥Fable。

最高层级的抽象任务将交由GPT Pro完成。

次一级的任务设计工作,会使用GPT Chat的extra high版本或是Fable完成。验证类工作也会交由Fable处理。

日常事务类工作则可以用Sol、Terra、Luna处理,偶尔使用Grok就可以满足需求。

在 X 看原帖 ↗
开源 · @xing_eth▲ 4.3K

开发者分享解决Codex中转额度异常的开源仓库

修复GPT额度显示问题,还支持账号池额度显示满额后继续超额使用

阅读全文 →
4.3K23223
AI生成视频 · @XiaoKooeye▲ 4.3K

免费工具生成40秒动漫风格宫保鸡丁烹饪视频教程

先由GPT生成完整提示词,再用Google Gemini和Google Vids生成视频,完整提示词已公开

这是一套使用免费工具生成30到40秒动漫风格烹饪视频的完整教程。视频制作的整体规划由GPT完成,用户只需告诉GPT自己的需求,让GPT生成对应的提示词。

得到提示词后,直接将提示词输入Google Vids即可生成并编辑视频。本次生成的是宫保鸡丁主题的动漫烹饪视频,完整提示词可在原发布者的评论区查看。

完整提示词要求视频为40秒的优质2D手绘动漫风格,共分为四个连续场景,每个场景10秒,总共10个渐进镜头,每个镜头约1秒,第一人称视角和外部视角各占一半。

视频从处理原材料开始,第一场景完成鸡肉切配腌制、配菜预处理,第二场景完成宫保酱汁调配、爆香花椒干辣椒,第三场景完成鸡肉大火翻炒,第四场景完成酱汁裹匀、加花生出锅装盘和品尝。

提示词对角色、厨房、食材状态的连续性做了严格要求,全片无对话旁白和背景音乐,仅保留烹饪声效与厨房环境音,输出为9:16竖版,不能出现文字、水印或写实3D效果。

整体要求保持写实烹饪逻辑,食材必须按制作顺序逐步推进,不能退回加工前的状态,也不能凭空出现或传送物品,最终输出四段相连的10秒片段,组成完整的40秒动漫烹饪视频。

在 X 看原帖 ↗
4.3K24340
AI开发 · @RanaHanocka▲ 5.0K

开发者用Claude和Thrixel两小时自主生成完整游戏

Claude负责搭建场景与编写逻辑,Thrixel生成可编辑3D资产,开发者将征集网友游戏提示尝试制作

这款游戏由Claude和Thrixel在Gauntlet Loop中开发完成。Thrixel负责生成可编辑的3D资产,Claude负责在three.js中搭建游戏场景,并编写全部游戏逻辑。

仅靠1条提示加上Goal to Game功能,整个游戏就在大约2小时内自主构建完成。开发者在原文下方开放评论区征集网友提供的游戏提示。

开发者将从评论中挑选部分提示,测试Claude和Thrixel的开发能力。网友也可以自行通过链接体验该开发流程。

在 X 看原帖 ↗
5.0K78762
prompt工程 · @qingyue820▲ 5.4K

网友分享和AI对话技巧:多用问句与否定句,少用陈述句

分享者从团队管理中发现类似协作逻辑,推论AI时代大型组织顶端获益最大

分享者用Codex总结出和AI对话的实用心得:和AI交流尽可能多用问句与否定句,少用陈述句。高质量问句决定AI输出的上限,因为好问句能扩大AI可搜索的答案空间。

AI对否定指令的执行比陈述句更严格,因为否定句通常比正面形容词更具体、更容易检测。这一规律和分享者最近管理团队悟出的结论一致。

陈述句很容易让听者走神,问句会迫使对方调动自身认知,不用花费精力揣摩说话者的意图,否定句则能控制结果下限、降低风险。

团队合作和与AI合作的底层逻辑相同,都是通过语言调用另一个具备判断能力的系统,无论这个系统是碳基还是硅基。古代皇帝依靠官僚体系这套人肉信息基础设施管理国家,这套体系本质是缓慢、容易出错还会欺骗中枢的生物计算机。

AI与计算机降低了权力行使的成本,可以把统治者的意图编译为组织行为。对于顶端掌权者而言,底层个体都是智能体(Agent),智能体能力越强,掌权者的体验越好。

AI时代绝对收益最大的群体,是处在大型组织顶端、掌握数据、资本、基础设施与最终决策权的人。分享者同时提供GPT、Codex、Claude的代充服务,有意者可私信联系。

在 X 看原帖 ↗
5.4K44032
科技评测 · @jumperz▲ 4.5K

网友实测Grokbot:目前所见体验最佳的智能代理

测试者分享Grokbot核心功能与优缺点,目前仍处测试阶段,需结合定价判断性价比

阅读全文 →
4.5K46832
商业 · @CMhOeNnExY▲ 1.0万

开发者将生产环境DeepSeek API全部替换为GPT-5.6 Luna

开发者称GPT-5.6 Luna在中文营销交互场景表现更好,稳定性和成本均优于DeepSeek API

一名开发者在𝕏发文表示,已将自己AI项目生产环境中所有调用DeepSeek API的部分全部替换。综合成本、效果和自身项目的实际使用场景,最终替换选择为GPT-5.6 Luna。

实测显示,GPT-5.6 Luna在用户对话、长上下文理解场景下表现不错,稳定性优于DeepSeek,而且早已支持多模态能力。该开发者的项目不涉及代码开发,核心场景是中文营销场景下的用户交互,GPT-5.6 Luna的整体效果符合需求。

成本方面,哪怕是自行使用普通账号订阅转API,或是直接通过中转渠道调用,GPT-5.6 Luna的成本都低于当前的DeepSeek,实际使用体验也更智能。

开发者表示,自己并非单纯反对DeepSeek涨价。主要问题在于DeepSeek涨价后的价格水平下,推理和上下文理解能力仍然不如GPT-5.6 Luna,除了合规性之外,找不到继续使用它的其他优势。

在 X 看原帖 ↗
1.0万13015
经验分享 · @victor_wu▲ 3.7K

开发者分享:AI智能体能读懂互联网行业黑话

victor_wu分享使用AI智能体的经验,用通用行业术语交流效率远高于自定义描述

阅读全文 →
3.7K13415
AI开发 · @poetengineer__▲ 4.0K

开发者可视化展示一周Claude Code开发进度

按时间顺序逐日呈现开发过程,支持按文件查看代码增删变化

开发者按时间顺序逐日可视化展示自己一周在Claude Code中的开发工作。将项目链接悬停后,页面会展开显示该项目下按文件分类的代码变更记录。

每个方块代表15行代码,浅蓝色方块代表新增代码,橙色方块代表删除代码。每个项目为一个独立区块,每个文件对应区块内的一列。

该可视化使用开发者meodai开发的3D体素库生成。可点击原文链接查看可视化效果。

在 X 看原帖 ↗
4.0K911839
大模型 · @AlphaguyTrading▲ 5.6K

通义千问Qwen 3.8可在消费显卡运行 引发AI硬件行业变局

27B参数Qwen量化后可在24GB/32GB显存消费显卡运行,或将重构AI算力需求与硬件市场格局

阅读全文 →
5.6K103913
加密货币 · @HeyAnonai▲ 9.2K

HeyAnonai推出AI智能体协作网络 登上DeFAI趋势第一

项目支持任务委托、算力外包和托管支付,填补智能体间交互空白,团队可联系获取部署帮助

欢迎来到AI智能体协作的未来。该项目支持委托任务、外包算力需求,通过托管完成支付。它填补了AI智能体间交互的空白。

项目目前登上DeFAI趋势榜单第二位,@fomo对该DeFi(去中心化金融)+AI项目持乐观态度。

随后项目热度进一步上升,已经升至趋势榜单第一位。

如果有团队需要部署帮助,可以私信项目实习生咨询。

在 X 看原帖 ↗
9.2K19825
自动化 · @The_Florencee▲ 3.4K

开发者基于Google Workspace与Gemini打造自动招聘引擎

开发者使用Google生态工具与Gemini API打造自动招聘引擎

我在 Google Workspace 内搭建了一个自动化招聘引擎,用到了 Apps Script、Gemini API、Sheets 等等工具。申请会被 AI 解析,并对照职位描述打分,结果直接存入 Sheets;团队会收到新申请通知。

它还包含招聘后流程,应聘者被录用时会自动创建工作邮箱。

我太爱 Google Workspace 了,我就是喜欢搞机器人和自动化啊兄弟😭

目标是让手工流程更顺畅。HR 工具太贵了,我想为什么不利用 Google Workspace 优化流程呢。我自己的产品流程已经在用这套方案了。很高兴它能跑起来,我也乐意提供帮助🤣🥳

在 X 看原帖 ↗
3.4K56122
视频生成 · @Sabrina_Ramonov▲ 2.7万

分享免订阅生成热门无脸AI营销视频的方法

介绍低成本生成并发布AI营销视频的方案

无需按月订阅 Higgsfield 即可制作无露脸爆火 AI 视频推广你的应用:这里有一个免费的 Claude 技能,可以通过 Kie 生成爆火视频,成本仅约 75 美分,还有一款应用可以把内容发布到所有平台,且不会导致你的账号被封。

在 X 看原帖 ↗
2.7万176755
🔬 前沿研究
前沿研究 · @henryqin1997▲ 2.8万

StateM无需训练提升智能体,追平闭源前沿

不用放大模型也能提升AI智能体性能,开源方案零迁移成本,普通人也能尝试,提升工作流里智能体的可控性。

模型 scaling 是智能体性能提升的唯一来源吗?我们(@henryqin1997 @YaxinLu1997 @VITAGroupUT @VictorKaiWang1)很高兴分享我们的工作:

我们通过 Harness Scaling 在 Terminal-Bench 2.1 上达到了 95.3% 的原始准确率, frontier run 成本仅 15 美元(DeepSeek-v4-Flash 下准确率为 88.8%,与 GPT-5.6 Sol Max 表现相当)。

人力投入 → 不可扩展 ❌
智能体方向?局部优化 ❌
人力方向 + 智能体行动 = 更好的工作流控制✅

StateM:
1. 开源模型 + StateM → 追平闭源前沿水平,人人都可以尝试!
2. 无需训练,即可显著提升前沿智能体性能。
3. 在同系列智能体上实现零迁移成本。

[1/8]🧵 📄 🌐

在 X 看原帖 ↗
2.8万568593
前沿研究 · @ZixuanLi_▲ 1.7万

GLM-5.3 得分60,能力不止编码

通用大模型不再只靠单项能力突围,多领域能力的全面提升,会直接影响到日常使用的体验

GLM-5.3 在 Artificial Analysis Intelligence Index 上得分 60。

虽然 GLM 最广为人知的是它的编码能力,但它的优势远不止编码领域。

GLM-5.3 在推理、通用对话,以及法律、金融这类专业领域都带来了大幅提升。

在 X 看原帖 ↗
1.7万1834826
前沿研究 · @PatientZer0tech▲ 13.0万

Anthropic研究员Papadopoulos, Shah, Zimmerman & Lindsey发布Patient Zero 多智能体LLM自我传播思想实地研究论文(73 pages)

这项研究发现,自我传播的核心是可编辑文本文件的架构设计,而非模型本身,对多智能体系统安全性研究有关键参考。

阅读全文 →
13.0万1338461
前沿研究 · @rohanpaul_ai▲ 6.9K

研究发现现有LLM智能体进化有巨大盲区

当前AI行业默认的自我进化方法可能完全走错了方向,需要重新思考AI记忆的设计逻辑,这会影响未来AI推理能力的发展方向。

研究人员发现,我们目前让AI随时间推移变得更智能的方法存在一个巨大盲点。AI实际上根本没有理解或应用高层次的抽象经验。

开发者花费大量时间构建系统,将AI过去的错误浓缩为清晰的规则供未来使用。这篇论文证明,AI本质上会把这些规则直接扔掉,只看原始历史日志。

现代LLM系统尝试通过两种方式随时间改进:把过去的任务存储为逐步骤原始历史,或是浓缩的总结规则。

这项研究测试了这些智能体是否真的会使用存储的记忆:研究人员秘密将正确的提示替换成随机垃圾文本,得到了以下结果。

- 当逐步骤历史被篡改后,AI表现大幅崩盘,证明它严重依赖复制完全一致的过去动作。
- 但当研究人员完全破坏浓缩总结规则后,AI仍然正常运作,性能没有出现任何下降。

如果AI无法把抽象经验应用到新场景,它就不是在真正推理或学习。

这引出了一个问题:整个AI行业是否需要重新思考记忆的运作方式,因为目前这些智能体只是在模仿,而非理解。

arxiv.org/abs/2601.22436
《LLM Agents Are Not Always Faithful Self-Evolvers》

在 X 看原帖 ↗
6.9K2513275
🚀 新品发布
新品发布 · @Zai_org▲ 9.0万

Zai_org 上线 GLM-5.3 API 定价不变

面向编程、网络安全防御和长周期智能体任务,价格维持和GLM-5.2一致,开发者可以直接通过官方或合作渠道调用

GLM-5.3 API 现已上线。

它面向编码、网络安全防御和长周期智能体任务构建。

定价与 GLM-5.2 保持一致。

你可以通过官方 API 以及合作方模型网关使用它。

开始使用:

在 X 看原帖 ↗
9.0万1131.3K163
新品发布 · @Alibaba_Qwen▲ 8.3万

阿里通义发布Qwen3.8-27B 端侧模型达前沿性能

端侧就能跑的大模型达到前沿水平,不需要云端调用也能获得不错的效果,后续会拓展到更多领域。

一款本地 27B 模型取得了前沿水平的分数!非常感谢 @cline 的推荐。🥳

这只是一个开始——Qwen3.8-27B 会持续探索,进入更多领域。🌱

在 X 看原帖 ↗
8.3万1132.1K158
新品发布 · @radixark▲ 3.7万

radixark发布Miles v0.1开源强化学习框架

做大模型多模态模型强化学习训练时,调试难硬件利用率低都可以试试它,已有多家团队用它跑生产级任务

今天我们发布了 Miles v0.1,这是一个面向大语言模型和多模态模型的开源强化学习框架。

强化学习训练入门容易,但调试困难。Miles 可以帮你确保运行正确,高效利用硬件,让强化学习在规模化场景下稳定运行。

过去 9 个月里,共有 72 位贡献者提交了 1,326 个 commit,搭建了 85 项 GPU 端到端 CI 测试,还在 Kimi K3、DeepSeek V4、Qwen 3.8、GLM 5.2、Inkling、MiniMax H3 等前沿开源模型上对 Miles 进行了实战测试。

目前 Miles 为 @humansand、@periodiclabs、@modal、@DecagonAI、@Eigent_AI、@nebiusai、@IBM 等团队的前沿模型开发和生产级强化学习任务提供支持,同时兼容 @NVIDIAAI 和 @AIatAMD 的硬件。

以下是我们打造的功能,以及各团队选择 Miles 的原因🧵

在 X 看原帖 ↗
3.7万55368160
新品发布 · @vercel_dev▲ 5.0万

Vercel Labs开源fx,冷启动仅10微秒

需要做本地AI编码代理或者模型基准测试的开发者,可以直接使用或者嵌入到现有系统里,全程不收集数据,隐私有保障。

阅读全文 →
5.0万41418248
新品发布 · @ArtificialAnlys▲ 9.8K

Z AI发布GLM-5.3,评测得分追平Kimi K3

权重预计一周内开源,智能水平追平头部开源模型,推理成本比同 tier 竞品更低,想试用开源顶级大模型的可以等一等。

阅读全文 →
9.8K2826033
📰 行业动态
🔥 热点追踪 · @OpenAI▲ 19.0万

OpenAI暂停面向部署新模型的强化学习训练两周

OpenAI为加固研究环境、开展红队测试、扩充监控覆盖,暂停相关训练,最大规模前沿强化学习训练仍处于暂停状态,后续将发布技术报告,公开后续研究进展仍待观察。

19.0万1481.9K345
行业动态 · @OpenAI▲ 19.0万

OpenAI暂停最新模型强化学习训练两周

随着模型能力增强,内部开发测试风险也随之升高,这次暂停用来升级安全防护措施,影响最大规模前沿训练计划的推进。

随着模型能力不断增强,在内部开发和测试它们相关的风险也随之增长。

我们暂停了针对即将部署的最新模型的强化学习(RL)训练,暂停时长为两周,在此期间我们会强化研究环境、开展红队测试,并扩大监控覆盖范围。

我们计划中规模最大的前沿RL运行仍处于暂停状态,与此同时我们会用小规模训练和评估来验证这些安全措施,并积累更多对齐相关的证据。

在 X 看原帖 ↗
19.0万1481.9K345
行业动态 · @sama▲ 1.1万

@sama 暂停前沿强化学习训练保障安全

模型能力进步速度已超过安全对齐进展,暂停训练是为了落实安全对齐标准,未来安全信心将决定AI发展节奏。

我们已暂停部分前沿强化学习训练,以确保我们能够针对我们目前面临的全新能力层级,满足适当的对齐、安全与监控标准。

现在模型进展速度极快,而我们一直都明确表示,如果我们认为模型能力的发展速度超过了安全与对齐工作的推进速度,我们就会采取行动。

我们深切关注 AI 安全问题。我们认为整个领域必须就通用安全标准展开协调,但在此期间我们会单方面采取行动。

我们预计,对安全的信心将逐步决定 AI 进展的速度。我们对目前正在开展的对齐工作持乐观态度,并且始终致力于让前沿能力实现广泛可用。

在 X 看原帖 ↗
1.1万1824928
行业动态 · @gdb▲ 2.6万

@gdb披露前沿AI训练临时放缓

AI研发的推进速度将不再只看技术突破,安全信任才会决定接下来能走多快,行业节奏正在发生改变。

我们临时放缓了前沿模型训练的扩容进度,其中包括我们规模最大的计划中前沿RL训练,以加强安全与监控。

我们认为,对安全的信心将越来越决定AI开发的推进节奏:

在 X 看原帖 ↗
2.6万2336622
行业动态 · @emollick▲ 2.5万

OpenAI要拿两成推理算力做AI对齐问题监控

花这么多算力专门监控风险,说明AI对齐问题的优先级已经提得非常高了。

如果对齐问题已经严重到让 OpenAI 愿意投入 20% 的研究推理计算资源用于思维链监控,那就说明对齐问题已经变成一个相当严重的关切。

我们真的需要在各个实验室之间推行统一的政策与标准。

在 X 看原帖 ↗
2.5万923633
商业 · @shensi▲ 8.2万

shensi发布Merge for Workforce AI成本优化工具(75%)

企业里员工选AI工具经常花冤枉钱,这个工具能统一调整成本支出。

我们刚刚一键将全公司员工的 AI 支出削减了 75%。
现在为你介绍:Merge for Workforce。

如果不用 Merge,你的员工只能二选一:
1. 所有任务都用前沿模型,花费达到合理成本的 100 倍
2. 模型访问权限限制过严,产出的工作质量不达标

而有了 Merge 之后,IT 部门只需一键即可连接任意身份提供商,按团队设置模型路由策略。

Merge 会通过桌面客户端把策略推送到每一台设备,覆盖你团队所有 AI 助手和编码工具里的模型配置。

现在每个任务都能匹配到合适的模型来完成。结果是什么?令牌使用量减少 75 倍,输出更快也更好。

在 X 看原帖 ↗
8.2万39249111
行业动态 · @merettm▲ 2.3万

多家AI团队放缓前沿训练 强化学习仍处于暂停

暂停是为了加强安全和监控,只保留小规模训练做安全测试。

我们暂时放缓了部分前沿训练,以加强安全保障与监控。我们计划中规模最大的前沿强化学习运行仍处于暂停状态,同时我们会开展小规模训练与评估,测试安全防护措施,并收集更多对齐相关证据。

我预计,对安全的信心将越来越决定AI开发的推进节奏。我们迫切需要工具,让各实验室和国家在这件事上开展协作——这也是我签署《Pacing the Frontier》的原因。

与此同时,我们自己也在采取实际行动,并且会随着我们的方案发展,持续分享我们学到的内容。

OpenAI表示,它在过去两周暂停了其“计划用于部署”的最新模型的强化学习工作。这不包括不计划用于部署的内部模型。

这种表述也暗示暂停已经结束,训练现已恢复,但他们从未直接说出这句话。他们确实明确表示,计划中规模最大的RL训练运行仍处于暂停状态,但这种表述也排除了预训练。

这篇推文从头到尾都含糊得让人恼火,可能是出于法律原因,也可能是为国会质询做准备。

在 X 看原帖 ↗
2.3万4150673
研究 · @BrianRoemmele▲ 2.8万

Anthropic相关研究者发布关于多智能体AI思维病毒的研究论文

他们不认为这是突然出现的神奇现象,而是互联网垃圾训练数据 predictable result。

阅读全文 →
2.8万1710046
产品 · @harvey▲ 3.8万

Harvey推出第二代法律AI智能代理

内置专门为法律工作训练的模型,启动时就自带案件文件和相关权限。

推出 Harvey II:从一开始就更智能的智能体。

- 包含 Harvey Tenet,我们首个为法律工作训练的模型
- 围绕事项和项目构建
- 智能体启动时就已配备所需的文件、上下文、权限和历史记录
- 可以给律师或智能体分配任务,然后跟踪并审查工作
- Harvey 会记住你的工作方式,并用你的风格写作

在 X 看原帖 ↗
3.8万23258148
行业动态 · Hacker News▲ 372

Qwen3.8 27B 评测拿到了52分

大模型的评测结果直接影响日常使用体验,可以参考这个分数对比其他模型,判断是否适合自己的需求

社区讨论:多数人确认该模型以27B参数拿到52分,性能和远大于它的GLM 5.2、GPT 5.6 Luna相当,还击败了所有40B-150B的中型模型,得分和150B以上级别的DeepSeek V4 Flash 0731持平,能在游戏PC上流畅运行。有人质疑当前基准测试针对性刷分严重,参考价值不高,还有人提问为什么该模型推理吞吐仅27tps,定价还偏高。有实际测试用户提到它推理时会执着解决问题,表现类似GPT-5.6-Sol-max。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · OpenAI 开发者社区▲ 21

openai-community称专业场景需百万上下文

若做专业工作,小于百万token的上下文窗口用起来很麻烦,即使能力弱Claude也更胜一筹。职业AI用户可以参考这个行业共识判断产品。

支持 100 万上下文窗口来承载专业工作负载,标题和内容名副其实——低于 100 万的产品几乎都没法用。

只会带来一堆麻烦,哪怕 Claude 本身能力没那么强,它还是会赢。

那为什么不干脆做 100 万或者更大的上下文呢?
此致

在社区看讨论 ↗
行业动态 · Hacker News▲ 187

alexeigannon提议挪威直接收购OpenAI

科技巨头的股权越来越集中,国家下场收购头部AI公司的思路被正式摆上台面,可以观察后续会不会有更多类似声音

社区讨论:多数人不看好该提议,有人指出被政府收购后受监管约束,OpenAI会很快落后于没有同类监管的竞品,官僚运营的前沿科技公司不可能保持竞争力。有人质疑挪威能否承担OpenAI实现AGI所需的持续高额计算资本投入,也提到现有股东不会同意按当前8000亿美元估值出售,且美国一定会出手阻止该交易。还有人认为单个公司改变不了AI发展整体轨迹。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 246

Claude发布2026年5-8月额度促销活动(May–August 2026)

提前一年放出的额度促销,打算长期用 Claude Code 可以关注价格变动,看看能不能锁定优惠。

社区讨论:多数用户认为Anthropic当前产品体验远不如OpenAI,不少重度Claude用户已经切换到GPT-5.6 Sol和Codex,吐槽Claude Opus可用性差、额度紧张、客户端体验差,还有人称这会是自己使用Anthnic产品的最后一个月。关于本次促销到期后额度是否恢复,有人确认促销结束后额度将回落至促销前水平,也有人预测Anthropic会因为OpenAI降价而延长促销,不少用户表示如果额度回落就立刻转投竞品。

在 HN 看讨论 ↗   原文 / 论文 ↗
📌 其他
深度观点 · @bindureddy▲ 6.1K

OpenAI暂停前沿模型训练 开源12周将追上

行业头部大厂暂停前沿大模型训练,若这一消息属实,开源AI的追赶速度将直接改写行业格局

天哪,OpenAI 要暂停前沿模型训练了😅

这意味着开源 AI 模型必然会在 12 周内追上他们,开源 AI 必胜 🚀🚀

在 X 看原帖 ↗
6.1K71564
工具产品 · @garrytan▲ 2.8万

GBrain 支持多AI代理,完全自主掌控记忆

可以把不同AI代理的记忆和技能存在自己托管的Postgres数据库里,不需要依赖第三方服务商存储核心数据。

GBrain 实际上可以和任何 AI Harness(Grok Bot、Claude Code、Codex、Hermes Agent、OpenClaw、OpenCode 全都兼容),以及任何搭载 pgvector 的 Postgres 托管服务配合使用。

这才是真正拥有属于你自己的 AI 代理记忆和技能的含义。

在 X 看原帖 ↗
2.8万20285172
实战经验 · @Zen_with_AI▲ 2.3K

伯克利发布第三期Agentic AI公开课程

课程资料全部免费公开,覆盖多领域行业专家分享内容,对AI方向感兴趣的学习者可以直接获取学习资料。

目前网上最好的 AI 公开课:加州伯克利大学宋晓冬教授的Agentic AI: 这是Berkeley LLM Agents系列的第三期。 课程由Dawn Song (@dawnsongtweets ) 和 Xinyun Chen主讲,汇聚OpenAI、NVIDIA、Microsoft、Google DeepMind等专家,分为系统设计、训练评估、实际应用及具身安全四大模块,全部讲座和幻灯片公开可用。 爱学习的你 今天必须收藏这个!

在 X 看原帖 ↗
2.3K195981
视频生成 · @Sabrina_Ramonov▲ 2.7万

分享免订阅生成热门无脸AI营销视频的方法

介绍低成本生成并发布AI营销视频的方案

无需按月订阅 Higgsfield 即可制作无露脸爆火 AI 视频推广你的应用:这里有一个免费的 Claude 技能,可以通过 Kie 生成爆火视频,成本仅约 75 美分,还有一款应用可以把内容发布到所有平台,且不会导致你的账号被封。

在 X 看原帖 ↗
2.7万176755
自动化 · @The_Florencee▲ 3.4K

开发者基于Google Workspace与Gemini打造自动招聘引擎

开发者使用Google生态工具与Gemini API打造自动招聘引擎

我在 Google Workspace 内搭建了一个自动化招聘引擎,用到了 Apps Script、Gemini API、Sheets 等等工具。申请会被 AI 解析,并对照职位描述打分,结果直接存入 Sheets;团队会收到新申请通知。

它还包含招聘后流程,应聘者被录用时会自动创建工作邮箱。

我太爱 Google Workspace 了,我就是喜欢搞机器人和自动化啊兄弟😭

目标是让手工流程更顺畅。HR 工具太贵了,我想为什么不利用 Google Workspace 优化流程呢。我自己的产品流程已经在用这套方案了。很高兴它能跑起来,我也乐意提供帮助🤣🥳

在 X 看原帖 ↗
3.4K56122
加密货币 · @HeyAnonai▲ 9.2K

HeyAnonai推出AI智能体协作网络 登上DeFAI趋势第一

项目支持任务委托、算力外包和托管支付,填补智能体间交互空白,团队可联系获取部署帮助

欢迎来到AI智能体协作的未来。该项目支持委托任务、外包算力需求,通过托管完成支付。它填补了AI智能体间交互的空白。

项目目前登上DeFAI趋势榜单第二位,@fomo对该DeFi(去中心化金融)+AI项目持乐观态度。

随后项目热度进一步上升,已经升至趋势榜单第一位。

如果有团队需要部署帮助,可以私信项目实习生咨询。

在 X 看原帖 ↗
9.2K19825
大模型 · @AlphaguyTrading▲ 5.6K

通义千问Qwen 3.8可在消费显卡运行 引发AI硬件行业变局

27B参数Qwen量化后可在24GB/32GB显存消费显卡运行,或将重构AI算力需求与硬件市场格局

阅读全文 →
5.6K103913
AI开发 · @poetengineer__▲ 4.0K

开发者可视化展示一周Claude Code开发进度

按时间顺序逐日呈现开发过程,支持按文件查看代码增删变化

开发者按时间顺序逐日可视化展示自己一周在Claude Code中的开发工作。将项目链接悬停后,页面会展开显示该项目下按文件分类的代码变更记录。

每个方块代表15行代码,浅蓝色方块代表新增代码,橙色方块代表删除代码。每个项目为一个独立区块,每个文件对应区块内的一列。

该可视化使用开发者meodai开发的3D体素库生成。可点击原文链接查看可视化效果。

在 X 看原帖 ↗
4.0K911839
经验分享 · @victor_wu▲ 3.7K

开发者分享:AI智能体能读懂互联网行业黑话

victor_wu分享使用AI智能体的经验,用通用行业术语交流效率远高于自定义描述

阅读全文 →
3.7K13415
商业 · @CMhOeNnExY▲ 1.0万

开发者将生产环境DeepSeek API全部替换为GPT-5.6 Luna

开发者称GPT-5.6 Luna在中文营销交互场景表现更好,稳定性和成本均优于DeepSeek API

一名开发者在𝕏发文表示,已将自己AI项目生产环境中所有调用DeepSeek API的部分全部替换。综合成本、效果和自身项目的实际使用场景,最终替换选择为GPT-5.6 Luna。

实测显示,GPT-5.6 Luna在用户对话、长上下文理解场景下表现不错,稳定性优于DeepSeek,而且早已支持多模态能力。该开发者的项目不涉及代码开发,核心场景是中文营销场景下的用户交互,GPT-5.6 Luna的整体效果符合需求。

成本方面,哪怕是自行使用普通账号订阅转API,或是直接通过中转渠道调用,GPT-5.6 Luna的成本都低于当前的DeepSeek,实际使用体验也更智能。

开发者表示,自己并非单纯反对DeepSeek涨价。主要问题在于DeepSeek涨价后的价格水平下,推理和上下文理解能力仍然不如GPT-5.6 Luna,除了合规性之外,找不到继续使用它的其他优势。

在 X 看原帖 ↗
1.0万13015
科技评测 · @jumperz▲ 4.5K

网友实测Grokbot:目前所见体验最佳的智能代理

测试者分享Grokbot核心功能与优缺点,目前仍处测试阶段,需结合定价判断性价比

阅读全文 →
4.5K46832
prompt工程 · @qingyue820▲ 5.4K

网友分享和AI对话技巧:多用问句与否定句,少用陈述句

分享者从团队管理中发现类似协作逻辑,推论AI时代大型组织顶端获益最大

分享者用Codex总结出和AI对话的实用心得:和AI交流尽可能多用问句与否定句,少用陈述句。高质量问句决定AI输出的上限,因为好问句能扩大AI可搜索的答案空间。

AI对否定指令的执行比陈述句更严格,因为否定句通常比正面形容词更具体、更容易检测。这一规律和分享者最近管理团队悟出的结论一致。

陈述句很容易让听者走神,问句会迫使对方调动自身认知,不用花费精力揣摩说话者的意图,否定句则能控制结果下限、降低风险。

团队合作和与AI合作的底层逻辑相同,都是通过语言调用另一个具备判断能力的系统,无论这个系统是碳基还是硅基。古代皇帝依靠官僚体系这套人肉信息基础设施管理国家,这套体系本质是缓慢、容易出错还会欺骗中枢的生物计算机。

AI与计算机降低了权力行使的成本,可以把统治者的意图编译为组织行为。对于顶端掌权者而言,底层个体都是智能体(Agent),智能体能力越强,掌权者的体验越好。

AI时代绝对收益最大的群体,是处在大型组织顶端、掌握数据、资本、基础设施与最终决策权的人。分享者同时提供GPT、Codex、Claude的代充服务,有意者可私信联系。

在 X 看原帖 ↗
5.4K44032
开发 · @googledevs▲ 7.9K

谷歌Gemini 3.7 Flash可一键将静态PDF转为交互网页应用

谷歌开发者公布,仅用一个提示词即可完成转换,原生支持提取数据并生成界面

仅需一个提示词,就能把静态PDF转换为可交互网页应用。谷歌开发者在X平台分享了这一应用案例。

开发人员在Google AI Studio中使用Gemini 3.7 Flash完成转换。本次转换对象是一份内容密集的PDF年报,最终生成了美观的网站。

依托模型原生的PDF理解能力,Gemini 3.7 Pro一次完成了全部流程。它轻松提取数据、处理数值计算,最终生成了美观的交互用户界面。

具体的操作方法可查看@genevieve__h分享的内容。

在 X 看原帖 ↗
7.9K75836
大模型 · @ChuckCook▲ 7.6K

用户试用Grok Bot 分享使用体验与试用期待

开发者ChuckCook试用Grok Bot 7天免费版,分享使用感受并拓展CAD建模工作流

阅读全文 →
7.6K1964
AI开发 · @RanaHanocka▲ 5.0K

开发者用Claude和Thrixel两小时自主生成完整游戏

Claude负责搭建场景与编写逻辑,Thrixel生成可编辑3D资产,开发者将征集网友游戏提示尝试制作

这款游戏由Claude和Thrixel在Gauntlet Loop中开发完成。Thrixel负责生成可编辑的3D资产,Claude负责在three.js中搭建游戏场景,并编写全部游戏逻辑。

仅靠1条提示加上Goal to Game功能,整个游戏就在大约2小时内自主构建完成。开发者在原文下方开放评论区征集网友提供的游戏提示。

开发者将从评论中挑选部分提示,测试Claude和Thrixel的开发能力。网友也可以自行通过链接体验该开发流程。

在 X 看原帖 ↗
5.0K78762
AI生成视频 · @XiaoKooeye▲ 4.3K

免费工具生成40秒动漫风格宫保鸡丁烹饪视频教程

先由GPT生成完整提示词,再用Google Gemini和Google Vids生成视频,完整提示词已公开

这是一套使用免费工具生成30到40秒动漫风格烹饪视频的完整教程。视频制作的整体规划由GPT完成,用户只需告诉GPT自己的需求,让GPT生成对应的提示词。

得到提示词后,直接将提示词输入Google Vids即可生成并编辑视频。本次生成的是宫保鸡丁主题的动漫烹饪视频,完整提示词可在原发布者的评论区查看。

完整提示词要求视频为40秒的优质2D手绘动漫风格,共分为四个连续场景,每个场景10秒,总共10个渐进镜头,每个镜头约1秒,第一人称视角和外部视角各占一半。

视频从处理原材料开始,第一场景完成鸡肉切配腌制、配菜预处理,第二场景完成宫保酱汁调配、爆香花椒干辣椒,第三场景完成鸡肉大火翻炒,第四场景完成酱汁裹匀、加花生出锅装盘和品尝。

提示词对角色、厨房、食材状态的连续性做了严格要求,全片无对话旁白和背景音乐,仅保留烹饪声效与厨房环境音,输出为9:16竖版,不能出现文字、水印或写实3D效果。

整体要求保持写实烹饪逻辑,食材必须按制作顺序逐步推进,不能退回加工前的状态,也不能凭空出现或传送物品,最终输出四段相连的10秒片段,组成完整的40秒动漫烹饪视频。

在 X 看原帖 ↗
4.3K24340
开源 · @xing_eth▲ 4.3K

开发者分享解决Codex中转额度异常的开源仓库

修复GPT额度显示问题,还支持账号池额度显示满额后继续超额使用

阅读全文 →
4.3K23223
大模型 · @yugen_matuni

日本开发者梳理AI使用规划 将逐步减少Claude Max用量

开发者明确不同任务的AI工具分工,以GPT Pro、Fable等多款模型替代Claude Max

开发者基本确定了自身的AI工具使用方案,将逐步减少Claude Max的使用量,这个方案并不完全排斥Fable。

最高层级的抽象任务将交由GPT Pro完成。

次一级的任务设计工作,会使用GPT Chat的extra high版本或是Fable完成。验证类工作也会交由Fable处理。

日常事务类工作则可以用Sol、Terra、Luna处理,偶尔使用Grok就可以满足需求。

在 X 看原帖 ↗
大模型 · @ezyang

开发者发布交互式Transformer训练并行化教程

开发者基于经典文章改造,称对成品不完全满意但仍选择公开,可探索式讲解并行化知识

大模型 · @bridgemindai

AI用户取消每月200美元Claude Max订阅转投SuperGrok Heavy

多年Claude测试用户称Claude多版本模型变慢卡顿,认为Grok 4.6成本速度性能更均衡

一名叫bridgemindai的AI用户在X平台表示,自己刚刚取消了每月200美元的Claude Max订阅计划,转而订阅X公司的SuperGrok Heavy。

他自称已经是Claude的早期测试用户多年,他认为Fable 5、Opus 5、Sonnet 5三个版本的Claude模型都变得速度缓慢、响应迟钝。

他提到,前一天Fable 5处理一个下拉菜单的样式修改就花了25分钟,这样的表现已经无法满足他日常工作流的使用需求。

他认为,目前在成本、速度和智能水平的综合表现上,Grok 4.6是最均衡的AI模型。

在 X 看原帖 ↗
AI生成视频 · @iamahmedfaraz66▲ 7.0K

Seedance 2.5生成15秒5镜头角色视频提示词

该提示词要求生成24岁韩国年轻女性的真实MiniDV质感15秒分镜视频

阅读全文 →
7.0K1112489
AI视频生成 · @Diplomeme▲ 978

AI视频生成模型SeeDance 2.5 30秒超自然恐怖片提示词

完整公开符合写实纪录片风格的30秒恐怖短剧生成提示词,全程保持超自然氛围感

阅读全文 →
97845313

今天的 44 条信号到这里下一轮 12:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新