AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 8 月 29 日 · 08:00 更新 0 文章0 信号0 主题
试试:

今天发生了什么1 分钟读懂

智谱把 GLM-5.3 的权重公开了,可商用,普通用户也免费。Ollama 已上线模型服务;UnslothAI 推出 2-bit 版,把 1.51TB 压到 239GB,精度保留约 81%,256GB 内存的 Mac 就能本地跑。

Anthropic 公开了一项实验:让 Claude 用 48 小时和一块 GPU 当对齐研究员,独立完成方法设计、模型训练与测试,效果优于 28 位资深研究者的方案。若在更多模型上复制成功,对齐研究的人力成本结构会出现松动。

另外,OpenAI 发布了 Rosalind 工作台,把蛋白质结构分析、测序这类生命科学流程整合在一起,做研究的不必反复切换工具。

今日值得看
01 seedcens 2.5 30秒爆米花火箭视频提示词 30秒内玉米变火箭再爆成爆米花,seedcens 2.5 一条提示词逐帧分镜
02 firecrawl发布free keyless 网页爬取服务(100% free) 开发AI智能体时需要的网页搜索爬取工具,现在可以零注册直接用,不用申请API密钥,降低了AI工具的开发门槛。

现在推出免费无密钥版 firecrawl,你的 AI 智能体现在可以 100% 免费搜索和爬取网页。 - 顶尖搜索准确率(在 simpleqa 上达到 94.7%) - 爬取耗时低于 3 秒,任意页面都能转成干净的 markdown - 无…

03 用户 speckx 实测 Mac Studio 本地跑 Qwen3.8 27B 想在本地部署大模型又怕带不动的人,可以参考实测的真实运行数据判断设备门槛

社区讨论:多数用户认为Mac Studio跑通Qwen3.8 27B后仅14token/秒的生成速度毫无实用价值,花高价买这类硬件只获得这种速度没有意义。

今日焦点

Claude自主修复对齐失败,平均关闭85%,六位资深专家仅20%

Anthropic开发了一套自动化对齐研究工具,让Claude自主完成对齐研究。这套工具能量化常见的对齐失败,比如欺骗、奉承、越狱。Claude的做法是逐一处理每类失败,循环执行搜索文献、提出方法和数据、训练、测试这几个步骤。在全部10类对齐失败上,Claude都改善了目标基准,而且没有降低模型能力。最佳方法在没碰过的基准和Petri上也有效,换到比优化目标大4.7倍的模型上同样成立。

关键对比来自人类。28位人类安全研究人员,每人最多8小时提出缓解方案。在欺骗这一项上,Claude的最佳方法比最好的提案好20%。六位经验丰富的安全研究员在相同规则下工作,平均只关闭了20%的安全差距。

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达31 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 2 条)

08:00 本轮更新 · 下一轮 12:30
观点 · @petergyang▲ 1.7万

Grok才是非技术用户AI助手的最终形态?

有人认为Claude和OpenAI的办公AI助手只是半成品,马斯克旗下的Grok Bot才走对了方向

我的犀利观点是:Claude Cowork 和 ChatGPT Work 都是不完整的解决方案,而对于非技术用户来说,Grok Bot 才是合格 AI 智能体产品的正确终极形态。

我认为人们可以很轻松地“理解”(grok),它就是一个运行在云端的程序。

如果你让人们解释 ChatGPT Work 和 Codex 的区别(比如说,Work 能运行云端任务但 Codex 不行),或是解释 Claude Cowork 到底是怎么工作的,我打赌绝大多数人都完全不知道。

在 X 看原帖 ↗
1.7万523163
科研 · @OpenAIDevs▲ 1.1万

OpenAI推出Rosalind工作台,整合科研全流程

把蛋白质结构分析、测序流程这类工作,整合在同一个工作流里,做生命科学研究不用切换多个工具

Rosalind Workbench 将科学问题与专业模型、工具和可复核输出整合在同一个工作流中,涵盖从蛋白质结构、序列分析到测序流程的各类任务。

在 X 看原帖 ↗
1.1万1313227
开源 · @DeryaTR_▲ 8.8K

腾讯开源Hy4模型,性能接近Kimi K3体积小三倍

国产开源大模型参数体积缩小的同时,性能追平头部产品,给本地部署爱好者多了一个选择

中国大模型正在不停进步!腾讯的 Hy4 预览版又是一个接近前沿水平的开源模型。

它的水平似乎达到了 Kimi K3 级别,参数量仅 770B,体积还小了三倍!

我尤其对它在科学推理基准测试中的出色表现感兴趣!看起来很不错!

在 X 看原帖 ↗
8.8K78710
前沿研究 · @ArtificialAnlys▲ 2.7万

Perplexity Search 实测登顶搜索指数榜首

不同搜索API的成本和效果直接影响AI工具的使用成本,这次测试给出了目前 inference 成本最低的搜索选项,可供搭建AI工作流参考

阅读全文 →
2.7万1218263
新品发布 · @UnslothAI▲ 1.4万

UnslothAI发布可本地运行的2-bit GLM-5.3 模型(~81%)

原1.51TB模型压缩到239GB仍保留约81%精度,256GB内存的Mac就能运行,想本地跑大模型有了新选择

GLM-5.3 现在可以本地运行了!我们将 2 位量化模型的体积从 1.51TB 压缩到 239GB(体积缩减 83%)后,它仍保留了约 81% 的准确率。

可以在 256GB 内存的 Mac 或对应容量的 RAM/VRAM 设备上运行。GLM-5.3 是目前最强的开源模型。

在 X 看原帖 ↗
1.4万2822140
新品发布 · @ollama▲ 4.2万

Ollama发布GLM-5.3 模型服务

服务部署在美国和欧洲机房,支持本地私有调用,还开放API接口,可接入多款现有AI开发工具使用

我们正在Ollama上推出GLM-5.3。

私有部署。快速。服务器托管在美国和欧洲。不保留数据。

在我们把GLM-5.3正式上线的同时,快来体验Ollama的GLM-5.3-Flash。速度超快。

Claude Code:ollama launch claude --model glm-5.3-flash:cloud

OpenCode:ollama launch opencode --model glm-5.3-flash:cloud

Hermes Agent:ollama launch hermes --model glm-5.3-flash:cloud

你也可以将它接入其他任何框架或应用。同时也开放API端点。

在 X 看原帖 ↗
4.2万3549575
前沿研究 · @AnthropicAI▲ 12.7万

Anthropic发布Claude自动对齐其他AI的研究(48 hours)

只需要48小时和一块GPU,Claude就能独立完成方法设计、模型训练与测试,对齐效果超出预期,这会改变AI对齐的人力成本结构

新研究员课题:Claude 能否自动对齐其他人工智能?

我们给了 Claude 48 小时时间和 1 块 GPU,让它提升小模型的对齐水平。

它独立研究并提出了方法,随后自行训练并测试了模型。

结果效果好得出乎意料。

在 X 看原帖 ↗
12.7万1201.5K470
新品发布 · @gigazine▲ 2.7万

国产GLM-5.3 AI模型如约免费开放

高性能模型可对标顶级竞品,普通用户也能免费使用

中国产AI模型「GLM-5.3」如约作为开放模型免费公开,是性能可与Claude Fable 5、GPT-5.6 Sol媲美的高性能模型。

在 X 看原帖 ↗
2.7万56351167
实战经验 · @TheAhmadOsman▲ 7.3K

用户实测本地运行GLM 5.3 Flash 效果惊艳

想在本地跑小参数AI模型做计算,这款实测达到了少见的好用水准,想搭本地AI工具可以试试。

GLM 5.3 Flash 是我第一次体验到,在本地运行的较小模型能在计算用途上表现这么好。

在 X 看原帖 ↗
7.3K523116
生成式AI · @john87445528▲ 5.7万

𝕏用户发布含公众人物内容的Grok AI生图提示词

用户@john87445528在𝕏发布Grok生图提示词,文案涉及中国女演员景甜的私人感情相关描述

这条提示词用于通过Grok生成符合要求的9:16竖屏自拍风格短视频。设定主角为成年女性,需要穿着两张参考图中的对应服饰,自然披散长发,坐在柔软沙发上。

画面要求为中景到半身构图,镜头保持稳定。主角全程配合口播完成流畅连续的身姿变化,身体保持柔软曲线和呼吸起伏,不能僵硬。

背景要求为动态动画或可视化故事画面,整体为温暖亲密的电影级光影,带有淡淡欲望氛围,不需要杂乱字幕和水印,全程保持主角面部、光线、画风统一,嘴型与动作同步。

视频开场0:00-0:15的动作和画面有详细设计,同时给出了对应口播文案。口播内容称景甜在一段感情中十分谨慎,反复确认对方无法进入北京后才放心开展关系。

在 X 看原帖 ↗
5.7万1113676
大模型 · @guansi▲ 5.2万

想学大模型的人 最好自己本地部署一次祛魅

@guansi在𝕏发文称,本地部署是了解大模型本质最快的方法

阅读全文 →
5.2万51567367
🔥 热点追踪 · @AnthropicAI▲ 12.7万

Anthropic新研究测试Claude能否自主对齐其他AI

Anthropic给Claude 48小时和1块GPU,让它自主研究改进小模型对齐,自动完成训练测试。其AAR方法表现优于28位资深研究者的方案,这会改变AI对齐的思路吗

📖 阅读深度解读 →
12.7万1201.5K470
开源 · @perplexity_ai▲ 8.6万

GLM-5.3 开放可商用,普通人也能本地部署

有开发者算出不同精度下的本地运行硬件要求,512GB显存的Mac Studio就能跑得动,可以自己跑大模型不用联网

阅读全文 →
8.6万791.2K114
机器人 · @LerrelPinto▲ 3.6K

研究者发现给机器人做上下文学习没那么难

之前大家默认给机器人适配大语言模型的上下文学习门槛很高,现在发现实现起来比预想简单

事实证明,给机器人做上下文学习并没有那么难……

在 X 看原帖 ↗
3.6K36616
研究 · @jcyhc_ai▲ 4.6K

让AI当对齐研究员,两天能优化其他AI对齐

研究者把Claude包装成自动对齐研究员,给了两天时间让它优化其他AI的对齐效果,它真的完成了改进

AI能不能自动对齐其他AI?我们搭建了一个智能代理框架,把Claude Opus 4.8包装成了一名自动化对齐研究员,给了它两天时间来改进其他AI的对齐效果。

它独立完成了研究、提出方法,然后全程自主训练并测试了模型。效果非常好。

更多有意思的发现请看下文推文串🧵

在 X 看原帖 ↗
4.6K96132
新品发布 · @simplifyinAI▲ 5.6K

Digital Life Project 团队发布任意大语言模型转3D交互角色开源项目(100% Free)

不需要游戏引擎和本地渲染配置就能在浏览器里用,还支持全自定义,想做互动3DAI角色可以零成本上手

一个开源项目可以将任意 LLM 转化为能在浏览器中说话、动作并做出反应的 3D 角色,无需游戏引擎,也无需本地渲染配置。

角色自带记忆系统,可以追踪情绪状态和关系历史,因此回复会根据目前对话中发生过的所有内容变化,而非只参考上一条消息。

完全可自定义:你可以更换 3D 模型、人格提示词、LLM 或文本转语音服务商。

零配置即可免费试用,托管版附赠免费 API 额度供你上手。自托管需要你使用自己的 API 密钥,但能给你完整的修改控制权。

该项目来自 Digital Life Project(CVPR 2024)团队,将在 SIGGRAPH Asia 2025 展示。100% 免费。开源。

在 X 看原帖 ↗
5.6K16117144
深度观点 · @goyalshaliniuk▲ 1.3K

整理了支撑所有AI系统的20个核心ML模型

想理解AI到底怎么运行,不用先啃完厚厚的教科书,先摸清这20个底层模型,就能理清AI背后的核心逻辑。

阅读全文 →
1.3K226235
工具产品 · @Sumanth_077▲ 4.7K

JIT-Agent 让同模型智能体最多提分 20.2

提升智能体性能不一定要换更大更好的基础模型,优化模型外部的架构就能拿到明显提升,给需要搭AI智能体的人提供了成本更低的方向。

阅读全文 →
4.7K196075
AI视频 · @lansenai▲ 3.4K

用户分享AI生成19秒写实动作片的完整帧级提示词

@lansenai在𝕏分享AI生成19秒4K一镜到底近身动作片的详细提示词,包含分镜、灯光、动作要求

阅读全文 →
3.4K65125
视频生成 · @Chengzilhy▲ 7.0K

用户分享Seedance 2.5制作爆款短视频的完整提示词

用户@Chengzilhy 在𝕏公开了可生成恶作剧竖屏短视频的完整Seedance 2.5提示词

阅读全文 →
7.0K14036
大模型 · @Sentdex

开发者称GLM 5.3 Flash表现已超出预期,完整版很快发布

开发者Sentdex在𝕏分享,GLM 5.3 Flash原生精度下速度达每秒180token,并发扩展性出色

完整版GLM 5.3很快就会正式发布,但GLM 5.3 Flash的表现已经十分出色。

GLM 5.3 Flash目前在原生精度下可实现每秒处理180个token,并发性能的扩展性也非常好,同时还支持视觉能力。

如果完整版GLM 5.3不新增视觉支持,这位开发者可能会一直使用GLM 5.3 Flash。

在 X 看原帖 ↗
开发活动 · @haskell_brooks

开发者haskell_brooks发起9月线上从零搭建AI代理直播活动

活动发起者为@haskell_brooks,将于9月5日周六举办线上聚会,全程用代码实操搭建

用户@haskell_brooks在𝕏发起线上聚会邀请,计划于9月5日周六举办本次活动。

本次活动的主题是仅使用Gemini SDK或Anthropic SDK,从零开始搭建AI代理。

活动将深入拆解AI代理的各类核心模块,包括记忆、轨迹、自反馈循环等内容。

整场活动全程为代码实操,没有空洞讲解。

在 X 看原帖 ↗
大模型 · @LLMJunky▲ 270

Qwen 3.8 Flash Next早期测试 双RTX 6000跑出超200tok/s

测试者@LLMJunky在𝕏公布测试结果,该非优化版本性能优于Deepseek v4 Flash

测试人员@LLMJunky在2块RTX 6000显卡上完成了Qwen 3.8 Flash Next的早期测试。本次测试使用的是尚未优化的版本,该模型已经可以实现每秒超过200个词元(tok/s)的推理速度。

就目前测试结果来看,Qwen 3.8 Flash Next相比Deepseek v4 Flash有明确的性能提升。

开启视觉功能后,该模型的上下文开销为430万,可支持高并发量。测试人员同步放出了测试相关的链接。

在 X 看原帖 ↗
2701
编程 · @Mayhem4Markets▲ 1.5K

X用户@Mayhem4Markets称赞一款好用的编程智能体工具

X用户@Mayhem4Markets公开感谢开发者@_can1357打造了这款编程智能体,称其使用顺畅功能实用

X用户@Mayhem4Markets公开向开发者@_can1357致谢,称赞对方开发的编程智能体工具是他目前最喜欢的同类工具。他评价这款工具使用顺畅,能直接满足使用需求。按任务类型或任务难度进行路由分配的功能,对用户来说非常有帮助。

在 X 看原帖 ↗
1.5K1
编程 · @mylifcc▲ 8.6K

用户分享节省AI编程token成本的双窗口分工方法

@mylifcc在𝕏分享的技巧,用能力强的大模型做规划核对,弱模型做代码实现

用户@mylifcc分享了一种能节省token的AI编程方法。操作方式为打开两个窗口,左侧用GPT-5.6 Sol完成项目规划和文档编写。

完成规划后,把左侧的输出复制到右侧窗口,交给能力较弱的模型做代码实现,分享中用到的是grok,Luna也适用。

代码实现完成后,把右侧的输出再发回左侧,让GPT-5.6 Sol做结果校验,之后再把调整要求发回右侧修改。

这种分工模式的好处是,能力最强的模型只负责规划和结果核对,不会出现上下文内容过多溢出的问题。成本更低的token用来承担代码实现工作,能降低整体花费。

在 X 看原帖 ↗
8.6K13028
教程 · @AYi_AInotes▲ 1.3万

Grok Bot 不止是聊天框,背后藏着免费可使用的 Linux 云主机

来自 @AYi_AInotes 在𝕏分享的教程,可将X Grok Bot 背后的8核16G云主机打通为专属开发机

阅读全文 →
1.3万1286128
大模型 · @fankaishuoai▲ 1.5万

博主实测Pi Agent中不同大模型完成浏览器任务的表现

@fankaishuoai在𝕏分享实测结果,让5款大模型在Pi Agent中完成同一YouTube数据分析任务

博主让Pi Agent内置的不同大模型逐个完成实际任务:控制Chrome浏览器打开自己的YouTube后台,分析最近的视频数据并给出结论。各款模型的表现各有不同。

GLM 5.3 Flash全程耗时14分钟,最终给出的结论尚可接受,但分析内容比较干瘪。

DeepSeek V4 Flash仅用4分钟就完成分析,最终结论质量相当不错。

GPT-5.6 Terra用2分钟完成了全部任务,数据分析质量是本次测试里最高的。

Kimi K3运行2分多钟后就开始报错,提示任务负荷已超出承载能力。

千问3.8 Flash为后续补测项目,耗时6分半完成任务。它的分析结论和GLM 5.3 Flash比较接近,数据质量比GLM 5.3 Flash稍差一点。

本次测试尚未覆盖千问其他版本,博主认为,国内几款模型中,DeepSeek的综合性能和可用性是最好的。

在 X 看原帖 ↗
1.5万13121
大模型 · @jun_song▲ 7.2K

开发者称GLM-5.3-Flash性能远超同规模模型水平

X用户@jun_song评价GLM-5.3-Flash,称它性能超出预期,推理速度也更快

GLM-5.3的性能表现远超出它自身规模对应的预期水平。

类似DeepSeek-V4-Flash的体验比Pro版本更出色,这次GLM-5.3-Flash的表现好得出乎意料。

它的推理速度也快很多。仅用2台DGX服务器运行GLM-5.3-Flash,就已经完全够用了。

在 X 看原帖 ↗
7.2K515312
大模型 · @rishdotblog▲ 1.1万

当前多数开源大模型场景下微调并不值得

开发者rish在X平台表示,开源大模型更新太快让微调失去性价比

更新:对大多数场景而言,目前微调不值得做。开源前沿模型的更新速度太快了。等你优化完一个微调版本,新的基础模型已经比它更好了。而且,随着模型的指令跟随能力变强,技能移植效果更好,移植难度也低得多。

这还没有把推理的成本效益算进去。对达不到超大规模的初创公司来说,让微调后的模型实现高GPU利用率,真的非常非常难😅

微调在「廉价高效开源模型的前沿性能不会每两周就进步一次」的世界里很棒。当一个模型家族每次发布带显著性能提升的新版本间隔一到两个季度时,微调非常有用,直到最近情况都还是这样。

也许几个月后我们会回到那种状态,但就目前而言,一切变化太快,微调还派不上用场(在我看来)。

在 X 看原帖 ↗
1.1万611547
🔬 前沿研究
前沿研究 · @AnthropicAI▲ 12.7万

Anthropic发布Claude自动对齐其他AI的研究(48 hours)

只需要48小时和一块GPU,Claude就能独立完成方法设计、模型训练与测试,对齐效果超出预期,这会改变AI对齐的人力成本结构

新研究员课题:Claude 能否自动对齐其他人工智能?

我们给了 Claude 48 小时时间和 1 块 GPU,让它提升小模型的对齐水平。

它独立研究并提出了方法,随后自行训练并测试了模型。

结果效果好得出乎意料。

在 X 看原帖 ↗
12.7万1201.5K470
前沿研究 · @ArtificialAnlys▲ 2.7万

Perplexity Search 实测登顶搜索指数榜首

不同搜索API的成本和效果直接影响AI工具的使用成本,这次测试给出了目前 inference 成本最低的搜索选项,可供搭建AI工作流参考

阅读全文 →
2.7万1218263
🚀 新品发布
新品发布 · @gigazine▲ 2.7万

国产GLM-5.3 AI模型如约免费开放

高性能模型可对标顶级竞品,普通用户也能免费使用

中国产AI模型「GLM-5.3」如约作为开放模型免费公开,是性能可与Claude Fable 5、GPT-5.6 Sol媲美的高性能模型。

在 X 看原帖 ↗
2.7万56351167
新品发布 · @ollama▲ 4.2万

Ollama发布GLM-5.3 模型服务

服务部署在美国和欧洲机房,支持本地私有调用,还开放API接口,可接入多款现有AI开发工具使用

我们正在Ollama上推出GLM-5.3。

私有部署。快速。服务器托管在美国和欧洲。不保留数据。

在我们把GLM-5.3正式上线的同时,快来体验Ollama的GLM-5.3-Flash。速度超快。

Claude Code:ollama launch claude --model glm-5.3-flash:cloud

OpenCode:ollama launch opencode --model glm-5.3-flash:cloud

Hermes Agent:ollama launch hermes --model glm-5.3-flash:cloud

你也可以将它接入其他任何框架或应用。同时也开放API端点。

在 X 看原帖 ↗
4.2万3549575
新品发布 · @UnslothAI▲ 1.4万

UnslothAI发布可本地运行的2-bit GLM-5.3 模型(~81%)

原1.51TB模型压缩到239GB仍保留约81%精度,256GB内存的Mac就能运行,想本地跑大模型有了新选择

GLM-5.3 现在可以本地运行了!我们将 2 位量化模型的体积从 1.51TB 压缩到 239GB(体积缩减 83%)后,它仍保留了约 81% 的准确率。

可以在 256GB 内存的 Mac 或对应容量的 RAM/VRAM 设备上运行。GLM-5.3 是目前最强的开源模型。

在 X 看原帖 ↗
1.4万2822140
新品发布 · @simplifyinAI▲ 5.6K

Digital Life Project 团队发布任意大语言模型转3D交互角色开源项目(100% Free)

不需要游戏引擎和本地渲染配置就能在浏览器里用,还支持全自定义,想做互动3DAI角色可以零成本上手

一个开源项目可以将任意 LLM 转化为能在浏览器中说话、动作并做出反应的 3D 角色,无需游戏引擎,也无需本地渲染配置。

角色自带记忆系统,可以追踪情绪状态和关系历史,因此回复会根据目前对话中发生过的所有内容变化,而非只参考上一条消息。

完全可自定义:你可以更换 3D 模型、人格提示词、LLM 或文本转语音服务商。

零配置即可免费试用,托管版附赠免费 API 额度供你上手。自托管需要你使用自己的 API 密钥,但能给你完整的修改控制权。

该项目来自 Digital Life Project(CVPR 2024)团队,将在 SIGGRAPH Asia 2025 展示。100% 免费。开源。

在 X 看原帖 ↗
5.6K16117144
新品发布 · @ericciarla▲ 7.5万

firecrawl发布free keyless 网页爬取服务(100% free)

开发AI智能体时需要的网页搜索爬取工具,现在可以零注册直接用,不用申请API密钥,降低了AI工具的开发门槛。

现在推出免费无密钥版 firecrawl,你的 AI 智能体现在可以 100% 免费搜索和爬取网页。

- 顶尖搜索准确率(在 simpleqa 上达到 94.7%)
- 爬取耗时低于 3 秒,任意页面都能转成干净的 markdown
- 无需 API 密钥,无需注册

`npx -y firecrawl-cli@latest init --all --browser`

在 X 看原帖 ↗
7.5万611.4K1.9K
📰 行业动态
🔥 热点追踪 · @AnthropicAI▲ 12.7万

Anthropic新研究测试Claude能否自主对齐其他AI

Anthropic给Claude 48小时和1块GPU,让它自主研究改进小模型对齐,自动完成训练测试。其AAR方法表现优于28位资深研究者的方案,这会改变AI对齐的思路吗

📖 阅读深度解读 →
12.7万1201.5K470
开源 · @perplexity_ai▲ 8.6万

GLM-5.3 开放可商用,普通人也能本地部署

有开发者算出不同精度下的本地运行硬件要求,512GB显存的Mac Studio就能跑得动,可以自己跑大模型不用联网

阅读全文 →
8.6万791.2K114
观点 · @petergyang▲ 1.7万

Grok才是非技术用户AI助手的最终形态?

有人认为Claude和OpenAI的办公AI助手只是半成品,马斯克旗下的Grok Bot才走对了方向

我的犀利观点是:Claude Cowork 和 ChatGPT Work 都是不完整的解决方案,而对于非技术用户来说,Grok Bot 才是合格 AI 智能体产品的正确终极形态。

我认为人们可以很轻松地“理解”(grok),它就是一个运行在云端的程序。

如果你让人们解释 ChatGPT Work 和 Codex 的区别(比如说,Work 能运行云端任务但 Codex 不行),或是解释 Claude Cowork 到底是怎么工作的,我打赌绝大多数人都完全不知道。

在 X 看原帖 ↗
1.7万523163
开源 · @DeryaTR_▲ 8.8K

腾讯开源Hy4模型,性能接近Kimi K3体积小三倍

国产开源大模型参数体积缩小的同时,性能追平头部产品,给本地部署爱好者多了一个选择

中国大模型正在不停进步!腾讯的 Hy4 预览版又是一个接近前沿水平的开源模型。

它的水平似乎达到了 Kimi K3 级别,参数量仅 770B,体积还小了三倍!

我尤其对它在科学推理基准测试中的出色表现感兴趣!看起来很不错!

在 X 看原帖 ↗
8.8K78710
科研 · @OpenAIDevs▲ 1.1万

OpenAI推出Rosalind工作台,整合科研全流程

把蛋白质结构分析、测序流程这类工作,整合在同一个工作流里,做生命科学研究不用切换多个工具

Rosalind Workbench 将科学问题与专业模型、工具和可复核输出整合在同一个工作流中,涵盖从蛋白质结构、序列分析到测序流程的各类任务。

在 X 看原帖 ↗
1.1万1313227
机器人 · @LerrelPinto▲ 3.6K

研究者发现给机器人做上下文学习没那么难

之前大家默认给机器人适配大语言模型的上下文学习门槛很高,现在发现实现起来比预想简单

事实证明,给机器人做上下文学习并没有那么难……

在 X 看原帖 ↗
3.6K36616
研究 · @jcyhc_ai▲ 4.6K

让AI当对齐研究员,两天能优化其他AI对齐

研究者把Claude包装成自动对齐研究员,给了两天时间让它优化其他AI的对齐效果,它真的完成了改进

AI能不能自动对齐其他AI?我们搭建了一个智能代理框架,把Claude Opus 4.8包装成了一名自动化对齐研究员,给了它两天时间来改进其他AI的对齐效果。

它独立完成了研究、提出方法,然后全程自主训练并测试了模型。效果非常好。

更多有意思的发现请看下文推文串🧵

在 X 看原帖 ↗
4.6K96132
行业动态 · Hacker News▲ 76

用户 speckx 实测 Mac Studio 本地跑 Qwen3.8 27B

想在本地部署大模型又怕带不动的人,可以参考实测的真实运行数据判断设备门槛

社区讨论:多数用户认为Mac Studio跑通Qwen3.8 27B后仅14token/秒的生成速度毫无实用价值,花高价买这类硬件只获得这种速度没有意义。有人质疑实测者的配置操作不当,也有用户发现同参数同量化的Qwen3.8速度比Qwen3.6慢一半,有人指出当前Mac本地大模型工具优化不足。还有用户提到AMD旧数据中心显卡成本更低带宽更高,另有用户分享了自己在苹果芯片上常用的更流畅的替代模型。

在 HN 看讨论 ↗   原文 / 论文 ↗
📌 其他
深度观点 · @goyalshaliniuk▲ 1.3K

整理了支撑所有AI系统的20个核心ML模型

想理解AI到底怎么运行,不用先啃完厚厚的教科书,先摸清这20个底层模型,就能理清AI背后的核心逻辑。

阅读全文 →
1.3K226235
工具产品 · @Sumanth_077▲ 4.7K

JIT-Agent 让同模型智能体最多提分 20.2

提升智能体性能不一定要换更大更好的基础模型,优化模型外部的架构就能拿到明显提升,给需要搭AI智能体的人提供了成本更低的方向。

阅读全文 →
4.7K196075
实战经验 · @TheAhmadOsman▲ 7.3K

用户实测本地运行GLM 5.3 Flash 效果惊艳

想在本地跑小参数AI模型做计算,这款实测达到了少见的好用水准,想搭本地AI工具可以试试。

GLM 5.3 Flash 是我第一次体验到,在本地运行的较小模型能在计算用途上表现这么好。

在 X 看原帖 ↗
7.3K523116
大模型 · @guansi▲ 5.2万

想学大模型的人 最好自己本地部署一次祛魅

@guansi在𝕏发文称,本地部署是了解大模型本质最快的方法

阅读全文 →
5.2万51567367
大模型 · @rishdotblog▲ 1.1万

当前多数开源大模型场景下微调并不值得

开发者rish在X平台表示,开源大模型更新太快让微调失去性价比

更新:对大多数场景而言,目前微调不值得做。开源前沿模型的更新速度太快了。等你优化完一个微调版本,新的基础模型已经比它更好了。而且,随着模型的指令跟随能力变强,技能移植效果更好,移植难度也低得多。

这还没有把推理的成本效益算进去。对达不到超大规模的初创公司来说,让微调后的模型实现高GPU利用率,真的非常非常难😅

微调在「廉价高效开源模型的前沿性能不会每两周就进步一次」的世界里很棒。当一个模型家族每次发布带显著性能提升的新版本间隔一到两个季度时,微调非常有用,直到最近情况都还是这样。

也许几个月后我们会回到那种状态,但就目前而言,一切变化太快,微调还派不上用场(在我看来)。

在 X 看原帖 ↗
1.1万611547
大模型 · @jun_song▲ 7.2K

开发者称GLM-5.3-Flash性能远超同规模模型水平

X用户@jun_song评价GLM-5.3-Flash,称它性能超出预期,推理速度也更快

GLM-5.3的性能表现远超出它自身规模对应的预期水平。

类似DeepSeek-V4-Flash的体验比Pro版本更出色,这次GLM-5.3-Flash的表现好得出乎意料。

它的推理速度也快很多。仅用2台DGX服务器运行GLM-5.3-Flash,就已经完全够用了。

在 X 看原帖 ↗
7.2K515312
大模型 · @fankaishuoai▲ 1.5万

博主实测Pi Agent中不同大模型完成浏览器任务的表现

@fankaishuoai在𝕏分享实测结果,让5款大模型在Pi Agent中完成同一YouTube数据分析任务

博主让Pi Agent内置的不同大模型逐个完成实际任务:控制Chrome浏览器打开自己的YouTube后台,分析最近的视频数据并给出结论。各款模型的表现各有不同。

GLM 5.3 Flash全程耗时14分钟,最终给出的结论尚可接受,但分析内容比较干瘪。

DeepSeek V4 Flash仅用4分钟就完成分析,最终结论质量相当不错。

GPT-5.6 Terra用2分钟完成了全部任务,数据分析质量是本次测试里最高的。

Kimi K3运行2分多钟后就开始报错,提示任务负荷已超出承载能力。

千问3.8 Flash为后续补测项目,耗时6分半完成任务。它的分析结论和GLM 5.3 Flash比较接近,数据质量比GLM 5.3 Flash稍差一点。

本次测试尚未覆盖千问其他版本,博主认为,国内几款模型中,DeepSeek的综合性能和可用性是最好的。

在 X 看原帖 ↗
1.5万13121
教程 · @AYi_AInotes▲ 1.3万

Grok Bot 不止是聊天框,背后藏着免费可使用的 Linux 云主机

来自 @AYi_AInotes 在𝕏分享的教程,可将X Grok Bot 背后的8核16G云主机打通为专属开发机

阅读全文 →
1.3万1286128
编程 · @mylifcc▲ 8.6K

用户分享节省AI编程token成本的双窗口分工方法

@mylifcc在𝕏分享的技巧,用能力强的大模型做规划核对,弱模型做代码实现

用户@mylifcc分享了一种能节省token的AI编程方法。操作方式为打开两个窗口,左侧用GPT-5.6 Sol完成项目规划和文档编写。

完成规划后,把左侧的输出复制到右侧窗口,交给能力较弱的模型做代码实现,分享中用到的是grok,Luna也适用。

代码实现完成后,把右侧的输出再发回左侧,让GPT-5.6 Sol做结果校验,之后再把调整要求发回右侧修改。

这种分工模式的好处是,能力最强的模型只负责规划和结果核对,不会出现上下文内容过多溢出的问题。成本更低的token用来承担代码实现工作,能降低整体花费。

在 X 看原帖 ↗
8.6K13028
编程 · @Mayhem4Markets▲ 1.5K

X用户@Mayhem4Markets称赞一款好用的编程智能体工具

X用户@Mayhem4Markets公开感谢开发者@_can1357打造了这款编程智能体,称其使用顺畅功能实用

X用户@Mayhem4Markets公开向开发者@_can1357致谢,称赞对方开发的编程智能体工具是他目前最喜欢的同类工具。他评价这款工具使用顺畅,能直接满足使用需求。按任务类型或任务难度进行路由分配的功能,对用户来说非常有帮助。

在 X 看原帖 ↗
1.5K1
大模型 · @LLMJunky▲ 270

Qwen 3.8 Flash Next早期测试 双RTX 6000跑出超200tok/s

测试者@LLMJunky在𝕏公布测试结果,该非优化版本性能优于Deepseek v4 Flash

测试人员@LLMJunky在2块RTX 6000显卡上完成了Qwen 3.8 Flash Next的早期测试。本次测试使用的是尚未优化的版本,该模型已经可以实现每秒超过200个词元(tok/s)的推理速度。

就目前测试结果来看,Qwen 3.8 Flash Next相比Deepseek v4 Flash有明确的性能提升。

开启视觉功能后,该模型的上下文开销为430万,可支持高并发量。测试人员同步放出了测试相关的链接。

在 X 看原帖 ↗
2701
开发活动 · @haskell_brooks

开发者haskell_brooks发起9月线上从零搭建AI代理直播活动

活动发起者为@haskell_brooks,将于9月5日周六举办线上聚会,全程用代码实操搭建

用户@haskell_brooks在𝕏发起线上聚会邀请,计划于9月5日周六举办本次活动。

本次活动的主题是仅使用Gemini SDK或Anthropic SDK,从零开始搭建AI代理。

活动将深入拆解AI代理的各类核心模块,包括记忆、轨迹、自反馈循环等内容。

整场活动全程为代码实操,没有空洞讲解。

在 X 看原帖 ↗
大模型 · @Sentdex

开发者称GLM 5.3 Flash表现已超出预期,完整版很快发布

开发者Sentdex在𝕏分享,GLM 5.3 Flash原生精度下速度达每秒180token,并发扩展性出色

完整版GLM 5.3很快就会正式发布,但GLM 5.3 Flash的表现已经十分出色。

GLM 5.3 Flash目前在原生精度下可实现每秒处理180个token,并发性能的扩展性也非常好,同时还支持视觉能力。

如果完整版GLM 5.3不新增视觉支持,这位开发者可能会一直使用GLM 5.3 Flash。

在 X 看原帖 ↗
生成式AI · @john87445528▲ 5.7万

𝕏用户发布含公众人物内容的Grok AI生图提示词

用户@john87445528在𝕏发布Grok生图提示词,文案涉及中国女演员景甜的私人感情相关描述

这条提示词用于通过Grok生成符合要求的9:16竖屏自拍风格短视频。设定主角为成年女性,需要穿着两张参考图中的对应服饰,自然披散长发,坐在柔软沙发上。

画面要求为中景到半身构图,镜头保持稳定。主角全程配合口播完成流畅连续的身姿变化,身体保持柔软曲线和呼吸起伏,不能僵硬。

背景要求为动态动画或可视化故事画面,整体为温暖亲密的电影级光影,带有淡淡欲望氛围,不需要杂乱字幕和水印,全程保持主角面部、光线、画风统一,嘴型与动作同步。

视频开场0:00-0:15的动作和画面有详细设计,同时给出了对应口播文案。口播内容称景甜在一段感情中十分谨慎,反复确认对方无法进入北京后才放心开展关系。

在 X 看原帖 ↗
5.7万1113676
视频生成 · @Chengzilhy▲ 7.0K

用户分享Seedance 2.5制作爆款短视频的完整提示词

用户@Chengzilhy 在𝕏公开了可生成恶作剧竖屏短视频的完整Seedance 2.5提示词

阅读全文 →
7.0K14036
AI视频 · @lansenai▲ 3.4K

用户分享AI生成19秒写实动作片的完整帧级提示词

@lansenai在𝕏分享AI生成19秒4K一镜到底近身动作片的详细提示词,包含分镜、灯光、动作要求

阅读全文 →
3.4K65125

今天的 31 条信号到这里下一轮 12:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新