AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 10 月 5 日 · 08:00 更新 1778 文章14615 信号1898 主题
✦
试试:

今天发生了什么1 分钟读懂

OpenAI 创始成员 Andrej Karpathy 发布了一个叫 autoresearch 的自动研究代理:三个文件、一张 NVIDIA GPU,就能自动循环跑 AI 研究流程,适合让科研在夜间自动推进。

来源@undefinedKi「Andrej Karpathy 发布 autoresearch 自动研究代理」

美国开源模型阵营正在集结:Reflection AI 计划本月发布开源模型,Axiois 称有一家投入数十亿美元的隐形初创即将推出微调后性能有望超过前沿大模型的开源模型,社区里也流出了多款新模型的发布时间表。这些目前都还是计划。

来源@AndrewCurran_「Reflection AI将发高性能开源模型竞争中国顶流」@kimmonismus「@kimmonismus 整理了一波新开源大模型发布传闻」@bindureddy「Axiois称美国初创即将推出顶级开源模型」

上海人工智能实验室发布了书生·端砚平台:注册即领每月免费调用额度,自家三款模型限时免费,还兼容主流 API 协议。

来源@xiangxiang103「上海人工智能实验室发布书生·端砚平台(5亿)」

今日值得看
01 零成本跑AI应用,这套Cloudflare工具组合就够了 来自@xiaomovps在𝕏的分享,用Cloudflare全套组件低成本搭建AI应用

很多人开发AI工具担心成本过高,实际上Cloudflare已经配齐了AI应用开发所需的大部分基础设施。 第一,Workers可承担API、业务逻辑和智能体调度,能直接作为AI应用的后端。

02 开源网页克隆模板 建站从几天缩到几分钟 对需要迁移旧网站、找回丢失代码或学习优秀界面的人来说,这个免费开源工具能大幅节省建站时间,效率提升明显。

现在 Claude Code 只需几分钟就能克隆出几乎任何网站的界面 现在有一个开源模板可以分析任意网站,并将其转换为整洁的 Next.js 代码库。

03 mixie3D Blender AI工具比GPT-6更快 已经在用ChatGPT或Codex订阅的用户,可以免费使用这个工具,能直接在Blender里生成带绑定的 procedural 飞马模型

我已经放弃让AI在Blender里自己点来点去了。@mixie3D 为智能体提供了直接控制能力,以及多智能体工作流和真正的3D技能。不再需要模拟UI操作。 我已经在我的游戏里测试过了。

04 Wavestone分析11款编码智能体,核心结构共7部分 如果你关注AI编码工具,这次研究梳理了现有编码智能体的通用结构,还公开了可复用的90行核心代码框架,方便开发者参考。

终于有人通读了 11 个编码智能体的源代码,发现它们每一个的构造方式都完全相同。 Wavestone AI Lab 研究了 Claude Code、Codex、Gemini CLI、OpenHands、Aider、OpenCode、Open…

AI Agent 订阅 · 每天四次推送

🔥 信号雷达40 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

08:00 本轮更新 · 下一轮 12:30
前沿论文 · arXiv▲ 64

跨模型KV缓存直传,免去重复预填充

多智能体系统里,不同模型之间可以直接传递已处理过的上下文缓存,省掉接收方重新读一遍的步骤,在32K上下文下比传统方式快10.7倍。

多智能体 · KV缓存 · 跨模型 · 加速
arXiv 原文 ↗
前沿论文 · arXiv▲ 15

做数据视频,AI 终于不用靠猜了

做一条数据视频,过去要么你会写代码、懂剪辑,要么让 AI 直接生成但数字可能错。

做一条数据视频,过去要么你会写代码、懂剪辑,要么让 AI 直接生成但数字可能错。这篇把过程拆成两半:先让多个 AI 各自生成图表、旁白、动画的候选,再统一编排成一条叙事连贯的视频。关键在中间那层「声明式规范」,它把每个画面和背后的数据绑定,AI 改动画时不会把数字改错。

在 109 个真实样本上,最强模型直接生成的质量只有 2.13/5,这套方法提到 3.89,用户做一条视频的时间也少了近八成。它不是你明天就能装上的工具,但「让 AI 干活、同时锁死数据准确性」这个思路,会是以后所有数据工具的方向。

数据视频 · 多智能体 · 数据可视化 · AI编排 · 数据准确性
阅读全文 →
行业动态 · Hacker News▲ 33

开发者构建出语义代码搜索的RAG管线

查找代码不用依赖内置模糊搜索,用自定义的RAG管线就能实现语义层面的代码搜索,降低代码检索的时间成本

开源大模型 · @Amank1412▲ 2.5万

Amank1412,Kolibri发布Kolibri开源大模型

这款名为Kolibri的开源模型自称击败了Qwen2 635B、Nemotron 3 Super和Mistral Small 4,德国也加入顶级大模型竞争。

德国刚刚加入前沿大语言模型竞争。

新的主权开源模型 Kolibri。

> 击败 Qwen2 635B
>
> 击败 Nemotron 3 Super
>
> 击败 Mistral Small 4

基于定制化MoE Transformer架构构建。

在 X 看原帖 ↗
2.5万823357
新品发布 · @bindureddy导语出处▲ 8.1K

Axiois称美国初创即将推出顶级开源模型

数十亿美元投入美国隐形大模型初创公司,即将推出的开源模型微调后性能有望超过前沿大模型,不妨保持观望。

多款美国开源模型即将推出。

Axiois 称,美国隐身基础模型初创企业投入的数十亿美元即将获得回报。

据称,他们推出的开放权重模型只需做一些调整,性能就能超越前沿模型。

我对此持怀疑态度,但也抱有希望😅

在 X 看原帖 ↗
8.1K312612
行业动态 · @AndrewCurran_导语出处▲ 2.6万

Reflection AI将发高性能开源模型竞争中国顶流

美国计划推动本土开源大模型在全球市场竞争中国开源模型,多家机构将在本月发布开源模型。

Axios 报道称,Reflection AI 即将发布一款能力极强的开放权重模型,预期将与中国顶级的开放权重模型竞争。

自 7 月以来,Reflection 每月向埃隆·马斯克支付 1.5 亿美元,用于获得 Colossus 的算力,除此之外还与 Nebius 签订了 10 亿美元的算力协议,因此开发出一款强大模型确实是有可能的。

消息人士还向 Axios 透露,其他未具名的美国实验室也计划在本月发布多个开源模型。美国开源人工智能复兴即将开始?

Howard Lutnick 一直期待出现这样的局面,据报道,他一度甚至考虑争取政府直接注资来推动此事。美国政府希望美国开放模型能在全球范围内与中国模型竞争。

在 X 看原帖 ↗
2.6万5539782
实战经验 · @AM09_21▲ 2.6万

Claude GPT缓存过期超时会多扣费

如果长时间运行循环AI Agent,控制缓存超时可以避免不必要的额外订阅计费,这是实际使用中的省钱技巧

在AI订阅服务中,Claude的缓存保留时长是1小时,GPT的缓存保留时长是30分钟。如果会话输出结束后,不在1小时/30分钟内发送后续内容,就会被扣除大量使用量……这条小知识,说实话,如果一直让AI Agent自主循环运行的话,其实不用太担心这个问题。

这种24小时运行的循环型Agent构想,是Cursor一直在主推的,但实际上能让大家方便使用的应该是Dot了(我自己没法用,只是从X时间线推出来的)。

Dot这个Agent可以统括Codex的多个Agent,用户通过Dot交流,而实际工作一直在循环运行……大概是这种结构。

使用技巧是不要和实际工作的部队直接对话,而是一直和情商、日语表现都更好,用起来更舒服的模型对话。

你和这个模型聊天,同时后台有规划器制定计划,如果规划器说信息不足,就由对话专长模型来好好询问用户,我觉得这样运行是最理想的。

而且,现在这种需求只需要让Dot基于Dsh或Pi进行改造就可以实现,这是目前很不错的一点。

就算是有点专业、自己懒得动手实现的内容,直接全扔给AI也能推进到一定程度,这点很不错。

在 X 看原帖 ↗
2.6万17241264
前沿论文 · arXiv▲ 11

AI看视频时,耳朵会骗眼睛

多模态大模型看视频时,声音和画面会互相干扰:明明画面里没有的东西,因为音频里提到了,模型就一本正经地说“看到了”。

多模态大模型看视频时,声音和画面会互相干扰:明明画面里没有的东西,因为音频里提到了,模型就一本正经地说“看到了”。研究者发现这不是模型乱猜,而是内部有个“中继站”——问题指令在传递时把不该用的模态信息也带上了。他们用对比法把问题状态往正确模态方向“掰”一下,不用重新训练,就能让模型少犯这类错,在测试集上准确率最高提升18个百分点。

它不是你明天能用上的东西,但它解释了为什么AI会“睁眼说瞎话”,以及这类幻觉不是玄学,而是可定位、可修正的机制问题。

多模态幻觉 · 视听大模型 · 跨模态干扰 · AI可靠性
阅读全文 →
深度观点 · @superalesha▲ 1.1万

OpenAI Anthropic 对AI蒸馏竟持双标态度

有人批评OpenAI和Anthic一边用人类公开成果训练AI赚钱,一边禁止他人用他们的API输出训练竞争模型,双标做法令人反感。

OpenAI 和 Anthropic 居然还有脸抱怨知识蒸馏,真是离谱。

人类花了几十年时间编写代码、解释科学、回答问题、分享知识。AI 实验室用这些成果训练模型,做成产品卖给我们赚钱。他们早就蒸馏了我们所有人。

现在,有人付费购买他们的 API,并用输出训练了一个竞争模型,结果突然就遭到封禁,还被安上了「蒸馏攻击」的名头。

OpenAI 自己就提供蒸馏工作流,他们会在自己的平台上帮你用大模型的输出训练小模型。但如果你用这些输出做一个竞品,那你就是违反规则。

他们的服务条款甚至说我拥有输出内容。我花了钱,按理说产出归我,结果他们还能规定我能用它建什么模型。

这些人花了那么多年维护机器从他人作品学习的权利,现在轮到从他们自己的作品学习,也该好好维护才对。

这就是为什么我支持中国实验室发布可以下载、本地运行、二次开发的权重。你们都可以滚蛋了。

在 X 看原帖 ↗
1.1万6040735
前沿研究 · @NFT_Chen▲ 1.3万

Aleph Alpha 德国主权模型Kolibri用了中企模型数据

标榜欧洲自主的主权AI模型,合成训练数据主要来自中国智谱GLM和阿里通义千问Qwen。对宣称技术自主的AI项目来说,这算是打脸了。

💥炸了!中国模型被欧洲模型蒸馏!德国“主权模型”Kolibri技术报告自曝:后训练合成数据主力其实来源于智谱GLM和阿里巴巴Qwen!

Aleph Alpha把Kolibri宣传成德国从零训练、欧洲基础设施、无外国控制。

报告3.1.1节写的却是:

1️⃣生成微调数据、重写开源数据集答案的主力模型,就是GLM-5.2、GLM-5.3(

2️⃣Nemotron指令跟随数据集的completions,直接用GLM-5.2和GLM-5.3重新生成;reasoning-off子集专门出无推理链版本,单条对话最长扩到50轮。

3️⃣Nemotron科学选择题的completions,用Qwen3.8-27B重写。

4️⃣论文自己说:小模型跑长上下文更快,大模型更适合出强推理轨迹;还会有意识挑选或避开这些模型的价值观和偏见。

美国骂中国蒸馏,欧洲新“主权AI”的教师模型写在纸面上的是智谱GLM和阿里Qwen。

报告原文: #Kolibri #AlephAlpha #主权AI #模型蒸馏 #GLM #Qwen #智谱 #通义千问 #唐杰

在 X 看原帖 ↗
1.3万148028
前沿论文 · arXiv▲ 11

让AI记住“上次看到过什么”

现在的视频世界模型有个尴尬:它要么把看过的画面全存下来(内存爆炸),要么压缩成一个小状态(细节全丢)。

现在的视频世界模型有个尴尬:它要么把看过的画面全存下来(内存爆炸),要么压缩成一个小状态(细节全丢)。这篇论文给了一个两全方案:一半的注意力层保留原始画面缓存,另一半用“循环记忆”压缩,关键是——压缩时把摄像机的视角也写进去。于是当镜头转回老地方,模型能按视角精准调出“上次这里长什么样”。

在公开基准上,它比同配置的全注意力模型省约30%内存,还能在固定内存下无限流式看长视频。这不是你明天能用的工具,但它指向一个方向:AI对世界的记忆,正在从“存照片”变成“懂空间”。

世界模型 · 空间记忆 · 视频生成 · 内存优化
阅读全文 →
行业动态 · @lennysan▲ 2.2万

lennysan对谈ChatGPT和Codex负责人

访谈涉及OpenAI对AI安全的思路,以及未来互联网动作将由智能体主导等行业判断,可以帮你了解AI行业的走向。

我和ChatGPT与Codex负责人thsottiaux的对话。我们讨论了:
🔸 为什么模型选择器可能会消失
🔸 为什么循环和图谱只是一个过渡阶段
🔸 为什么互联网上的大多数操作很快会由智能体完成
🔸 OpenAI的AI安全方法

现在就来收听吧

在 X 看原帖 ↗
2.2万19296201
实战经验 · @undefinedKi导语出处▲ 1.5万

Andrej Karpathy 发布 autoresearch 自动研究代理

这款工具只需要3个文件,可在单块NVIDIA GPU上运行,能自动循环完成AI研究,适合需要 overnight 自动化科研的场景使用。

安德烈·卡帕西(Andrej Karpathy)构建了一个能自主开展AI研究的智能体。整个配置只有3个文件,它叫做autoresearch。

你只需给Claude或Codex提供一个小型LLM训练配置,就可以不用管了。循环流程是:尝试一个想法→提交代码→训练正好5分钟→如果得分提升,就保留变更;如果得分变差,就用git重置→记录结果,永远重复这个过程。

指令明确告诉智能体永远不要停止,永远不要问“我应该继续吗?”,因为人类可能正在睡觉。你完全不用碰Python代码,只需要编辑program.md,也就是智能体的指令。卡帕西将其称为你的研究机构的代码。

这里甚至还有一条简洁性规则:带来微小收益但增加了20行hack代码的变更会被丢弃,得分相同但代码更少的变更会被保留。

我认为这个模式的适用范围远不止LLM。任何只要有一个需要超越的分数、一个需要编辑的文件、每次运行固定时间的任务,都可以像这样通宵自动运行。

项目9.2万星,MIT许可证。可以在单块NVIDIA GPU上运行,支持本地或租用的GPU,社区已经衍生出支持Mac、Windows和AMD的分支。

在 X 看原帖 ↗
1.5万16202362
前沿论文 · arXiv▲ 11

让AI记住去过的地方:世界模型不再“失忆”

AI在虚拟世界里逛了一圈再回来,常常“失忆”——它不记得自己刚才见过什么,画面会变得陌生。

AI在虚拟世界里逛了一圈再回来,常常“失忆”——它不记得自己刚才见过什么,画面会变得陌生。这篇研究让AI像人一样,对去过的地方有长期记忆。做法是:训练时不再要求AI把每一帧都看一遍,而是让它在“重访”时只去检索和当前视角最相关的旧画面,拼成一张共享记忆卡。

这样,无论间隔多久,它都能保持场景一致,而且计算成本几乎不涨——从100秒拉长到400秒,耗时只多12%。这不是你明天能用的功能,但它意味着未来的AI游戏、自动驾驶模拟器,能构建出真正连贯、可信的虚拟世界。

世界模型 · 长期记忆 · 场景一致性 · AI训练 · 检索
阅读全文 →
设计 · @Khazix0918▲ 2.5万

用户花半个多小时用Claude调出可用的公司logo动效

用户Khazix0918在𝕏分享,仅用半小时就通过Claude得到可使用的公司logo动效

用户Khazix0918在𝕏分享了自己用AI生成动效的经历。

他用Claude调整了半个多小时,就得到了差不多可以投入使用的公司logo动画。

他提到,放在一年前,没人能想到动效和视频这类内容,也会被AI用代码直接生成。

技术发展速度太快,很多时候人们都还来不及反应。

在 X 看原帖 ↗
2.5万716148
前沿论文 · arXiv▲ 11

大模型泛化被误解了:稳定才是真本事

我们一直用「准确率」衡量大模型会不会举一反三,但这篇论文说:准确率高不等于泛化好,稳定才算。

我们一直用「准确率」衡量大模型会不会举一反三,但这篇论文说:准确率高不等于泛化好,稳定才算。同一个问题换个说法,模型答案可能就变了——这才是泛化的真相。研究者提出一套新框架,不只看答对多少,而是看同一输入在不同表达、不同任务下,模型的输出、内部激活、置信度有多大波动。

结果发现:没有哪个模型在所有变化下都稳定,不同维度暴露的毛病互不相干,换个数据集甚至能让模型排名反转。也就是说,你平时看到的榜单排名,可能只是某个特定问法下的偶然结果。它不是你明天能用上的东西,但提醒你:别把跑分当人品,真正靠谱的模型,是换个问法依然不慌的那种。

泛化 · 稳定性 · 评测 · 大模型 · 准确率
阅读全文 →
前沿论文 · arXiv▲ 11

视频生成里的字,还是写不对

视频生成模型能把画面拍得像电影,但画面里的文字还是硬伤:11 个最强模型里,最好的一个文字错误率也有 25%,广告、科普这类带字的场景基本没法直接用。

视频生成 · 文字渲染 · 评测基准
arXiv 原文 ↗
开源 · @Promixyz▲ 5.6K

分享10个开源项目,给AI agents上锁

AI agents调用真实工具时容易权限溢出,这组开源项目能让agents在隔离环境运行,不会拿到系统全部权限。

阅读全文 →
5.6K18123128
前沿论文 · arXiv▲ 11

AI 找论文灵感,还不如普通检索

让 AI 像科学家一样,从海量论文里找出能启发新研究的那篇——184 位作者亲手标注了 207 篇论文的灵感来源,结果最强智能体检索成功率只有 51%,和普通向量检索差不多。

论文检索 · 科学灵感 · AI 智能体 · 评测基准
arXiv 原文 ↗
开源 · @realchendahuang▲ 3.0K

Pi Durable解决开源AI框架改造后台服务痛点

很多开源AI Agent框架要么绑死命令行,要么过于臃肿,这个新发布的底座是专门给做产品开发的团队二次开发用的。

阅读全文 →
3.0K63538
测试 · @ivanfioravanti▲ 3.5K

通义千猜工具调用9种方案5个引擎实测对比

研究者花了很长时间,在92种Agent场景下测试不同配置,已经得出了得分最高的方案。

阅读全文 →
3.5K107535
技巧约 2 分钟
通义千问免费额度获取与使用指南
截至2026年7月,新用户可免费获得阿里云Model Studio额度,另有Qwen3.7-Max限量免费tokens。
市场预测 · @zordcrypt▲ 5.6K

预计2030年全球AI推理市场规模达到2550亿美元

有观点认为AI推理会成为加密和AI结合的最大市场,现在需求增长已经带动产业链开始布局。

阅读全文 →
5.6K131063
深度观点 · @kimmonismus导语出处▲ 4.4K

@kimmonismus 整理了一波新开源大模型发布传闻

想自己本地跑新开源大模型的话,可以看看这份传闻汇总,多个热门模型的预计发布时间都列出来了。

我已经等不及下一波可以在本地运行的开放权重模型了。以下是我整理的目前谣言观察列表:

- Qwen 4:讨论的发布时间是10月到11月初。阿里云确认该模型正在训练中,但没有给出发布日期。

- Kimi K3.1:一个可能的预告和一个被曝的后端模型标识引发了期待。发布时间可能在10月,但这只是猜测。

- Next GLM:根据发布节奏预估发布时间为10月到11月(我对GLM-5.4尤其期待,因为5.3在网络安全能力上非常强)

- DeepSeek V4.2:遗憾的是目前还没有可靠的发布时间窗口。

Qwen 4 27b很可能会成为最强者,但我对K3.1和GLM-5.4也同样非常期待。当然还有DeepSeek 4.2 Flash。

在 X 看原帖 ↗
4.4K4597
工具产品 · @realfxw▲ 3.3K

REA 开源:AI Agent 实现自动化逆向工程

原来需要资深工程师手动完成的逆向分析,现在可以交给AI Agent自动执行,降低了逆向工程的门槛,同时也带来了合规和技术挑战值得关注。

阅读全文 →
3.3K83960
新品发布 · @xiangxiang103导语出处▲ 8.7K

上海人工智能实验室发布书生·端砚平台(5亿)

注册就能领每月免费额度,自家三款模型限时免费调用,还支持多款第三方模型,兼容主流协议,想用大模型API能省一笔钱。

卧槽,上海人工智能实验室免费发 5亿Token ! 平台叫书生·端砚,注册就送“每月免费基础包”:10 墨点。

官方写明 1 墨点最多抵 5000 万 Token,10 墨点就是最多 5 亿。

书生-S2、Atria-Dawn-Preview、Agents-A1 三个自家模型更直接,限时 0 墨点,调用不扣。

还能调 DeepSeek-V4、GLM-5.3、Kimi-K2.6 等 7 款第三方模型。

兼容 OpenAI 和 Anthropic 协议,Claude Code、Codex 换个 Base URL 就能跑。

入口:
我用API接入workbuddy,实测可用,大家薅起来!

在 X 看原帖 ↗
8.7K372104
前沿研究 · @yupi996▲ 6.9K

11款公开编程Agent 竟都不是LangChain搭建

业内现在做编程Agent 都不用现成框架了,统一用7个基础部件搭建,这个业内设计标准值得想要自己做Agent的人参考。

好家伙,有篇论文拆了 Claude Code 等 11 个编程 Agent 的源码,居然没有一个靠 LangChain 这类框架搭的!连 Google 的 Gemini CLI 都没用自家的框架 🤣 找代码时也没有一个用向量检索,靠的是 ripgrep、tree-sitter 这些工具,外加 AGENTS.md 这类说明文件。意外的是,这 11 个 Agent 都是同样 7 个部件拼出来的,区别只在每个部件写得多复杂。

看来这真的是业内标准的 Agent 设计了,值得学习~

在 X 看原帖 ↗
6.9K1085106
前沿研究 · @HowToPrompt__▲ 6.9K

研究人员发布机器意识可证伪理论MEM论文

现在有了可验证的科学框架区分算法和有意识的AI,未来人与AI建立情感连接时,有了判断依据

阅读全文 →
6.9K43151132
工具产品 · @RodmanAi▲ 4.2K

10个AI加持的网络安全GitHub仓库

不管是普通网络安全从业者,还是想要探索AI+网络安全方向,都可以直接保存这些仓库,不用自己再逐个筛选查找。

10 个将 AI 引入网络安全的 GitHub 仓库

人工智能不只是在改变我们构建软件的方式。它还在改变安全团队发现、测试和修复漏洞的方式。

1. PentestGPT:一款人工智能助手,用于推理渗透测试工作流程和发现结果。
2. Caido:现代化工具套件,用于在安全研究期间拦截和分析网络流量。
3. HexStrike AI:通过基于 MCP 的框架将人工智能代理与网络安全工具连接起来。
4. Strix:由人工智能驱动的安全测试,用于调查应用程序并发现漏洞。
5. Nuclei:快速、基于模板的漏洞扫描器,适用于应用程序和基础设施。
6. Semgrep:具有代码感知能力的安全扫描,帮助在部署前捕捉漏洞。
7. Gitleaks:发现 Git 仓库中暴露的 API 密钥、密码、令牌和其他机密信息。
8. OWASP Amass:发现域名、子域名和基础设施,帮助了解外部攻击面。
9. Wazuh:开源平台,用于安全监控、检测、漏洞管理和日志分析。
10. Prowler:根据安全最佳实践和合规框架评估云环境。

如果你正在探索人工智能驱动的网络安全,收藏这些仓库吧。

在 X 看原帖 ↗
4.2K249988
实战经验 · @0xGky▲ 3.0K

@0xGky发布Seedance 2.5 三步生成AI视频

你做AI视频不用反复调整提示词,一遍就能生成自然的AI视频,降低AI视频生成的门槛和重复操作。

一位AI圈的大佬 ,他搞了个叫 Seedance 2.5 导演 Skill 的东西。 操作流程特别简单,总共就三步: 1️⃣ 先让它帮你把提示词生成出来 2️⃣ 把参考角色扔进去,直接开跑 3️⃣ 通常一遍就能成,不用来回重试搞得人崩溃 这个工具不只是替你写提示词,还会顺带帮你把内容调优,生成出来的视频看起来挺自然,那种明显的AI感能削掉不少。

在 X 看原帖 ↗
3.0K65469
工作流 · @xikhar▲ 89

当不清楚最终输出时,AI代理可通过新工作流持续自我优化

@xikhar 在𝕏分享的改进型AI工作流,支持AI持续优化输入和输出

Gauntlet循环在已知最终输出形态时效果出色。但很多时候人们并不清楚最终输出的样子,需要AI代理持续同时优化输入与输出。

因此@xikhar正在测试一种新的循环工作流,让AI代理在循环中完成调研和构建两步工作。

这个思路其实由来已久,Matt Shumer最早提出了生成子代理的概念,让子代理构建输出、自我验证并优化结果。

想要了解更多细节,可以查看@xikhar置顶的视频帖子。本次测试在原有思路上做了延伸,目标是让AI代理遇到阻碍时,能通过反复调研自行优化输入。

在 X 看原帖 ↗
8921
动态 · @YxzRainy▲ 1.0万

ChatGPT严打风控,用Computer Use功能要注意屏幕内容

用户@YxzRainy在𝕏提醒,ChatGPT当前风控不光查提问内容,还要查AI看到的电脑屏幕内容

<p>ChatGPT近期开始严格执行账号封禁风控。经常使用ChatGPT的Computer Use功能的用户需要特别注意。</p> <p>现在的风控触发规则不止和用户提问内容有关,AI在用户电脑屏幕上看到的内容也可能触发风控。

</p> <p>目前已知的高风险内容包括:未成年色情、犯罪相关内容、越狱提示词、核/生物/黑客等敏感技术,以及账号/地区异常。</p> <p>用户使用Computer Use功能前,需要先关闭电脑中不合规的敏感内容。</p>

在 X 看原帖 ↗
1.0万383
大模型体验 · @EXM7777▲ 4.0K

Hermes内置的Opus 5.5比Grok Bot和Dots体验更好

用户@EXM7777在𝕏分享体验,称该模型能完成其他AI代理无法处理的任务

对@EXM7777来说,Hermes内置的Opus 5.5比Grok Bot或Dots高出一个等级。原因是默认状态下,它就能处理其他AI代理无法完成的场景。

开箱即用的写作效果比其他AI好得多。
它能够实际完成应用设计工作。
和它对话的体验非常流畅顺滑。

它确实会比Claude Code内置的Opus更快消耗额度限制。不过这个模型现在的效率足够高,因此用户可以接受这一点。

目前已经有1.5万名创始人加入用户分享的这套系统,用户每周会发送一封免费邮件,感兴趣的用户可以前往链接查看。

在 X 看原帖 ↗
4.0K25233
开发工具 · @velfo▲ 3.1K

用户分享:将Codex CLI接入Grok Bot可改变开发工作流

X平台用户@velfo分享@heliotsz提出的技巧,可在移动设备上完成开发操作

@velfo表示,这个思路看起来很奇怪,但在@heliotsx提到之前,他确实从来没有想到过。

将Codex CLI或Claude Code CLI连接到Grok Bot,能彻底改变开发工作流程。

这样一来,就不会只剩下向光标发送云代理指令的单一工作流,还能获得更完善的测试框架来评估部分功能。

整个操作都可以在手机上完成,@velfo分享时正处于前往投票的路上。

在 X 看原帖 ↗
3.1K45234
生活工具 · @griswold▲ 8.5K

个人定制AI机器人每周帮你省2-3小时 Meal Planning 购物时间

网友@griswold分享的家庭定制Sylvia-bot,完成每周餐食规划和 grocery 采买

阅读全文 →
8.5K1125107
教程 · @angeldot_▲ 1.1万

Anthropic官方插件帮你一步步配置Claude Code自动化

来自X用户@angeldot_分享的Anthropic官方claude-code-setup插件

Claude Code 是一团乱麻。直到你安装了这个东西。

这里有一个Anthropic官方插件叫做claude-code-setup。

它会告诉你可以搭建哪些自动化工具(钩子、技能、MCP服务器、智能体……),以及如何一步步配置它们。

基本上它会分析你的项目,并推荐你开启哪些功能。

安装指令:/plugin install claude-code-setup@claude-plugins-official

收藏这篇帖子,别找不到了🔖

在 X 看原帖 ↗
1.1万19201223
开发 · @RileyRalmuto▲ 2.6K

新AI认知架构Mnemos记忆效果2倍于Claude原生系统

开发者公开独立测试结果,后续将放出演示视频供用户体验

阅读全文 →
2.6K126942
📑 前沿论文
前沿论文 · arXiv▲ 64

跨模型KV缓存直传,免去重复预填充

多智能体系统里,不同模型之间可以直接传递已处理过的上下文缓存,省掉接收方重新读一遍的步骤,在32K上下文下比传统方式快10.7倍。

多智能体 · KV缓存 · 跨模型 · 加速
arXiv 原文 ↗
前沿论文 · arXiv▲ 15

做数据视频,AI 终于不用靠猜了

做一条数据视频,过去要么你会写代码、懂剪辑,要么让 AI 直接生成但数字可能错。

做一条数据视频,过去要么你会写代码、懂剪辑,要么让 AI 直接生成但数字可能错。这篇把过程拆成两半:先让多个 AI 各自生成图表、旁白、动画的候选,再统一编排成一条叙事连贯的视频。关键在中间那层「声明式规范」,它把每个画面和背后的数据绑定,AI 改动画时不会把数字改错。

在 109 个真实样本上,最强模型直接生成的质量只有 2.13/5,这套方法提到 3.89,用户做一条视频的时间也少了近八成。它不是你明天就能装上的工具,但「让 AI 干活、同时锁死数据准确性」这个思路,会是以后所有数据工具的方向。

数据视频 · 多智能体 · 数据可视化 · AI编排 · 数据准确性
阅读全文 →
前沿论文 · arXiv▲ 11

AI看视频时,耳朵会骗眼睛

多模态大模型看视频时,声音和画面会互相干扰:明明画面里没有的东西,因为音频里提到了,模型就一本正经地说“看到了”。

多模态大模型看视频时,声音和画面会互相干扰:明明画面里没有的东西,因为音频里提到了,模型就一本正经地说“看到了”。研究者发现这不是模型乱猜,而是内部有个“中继站”——问题指令在传递时把不该用的模态信息也带上了。他们用对比法把问题状态往正确模态方向“掰”一下,不用重新训练,就能让模型少犯这类错,在测试集上准确率最高提升18个百分点。

它不是你明天能用上的东西,但它解释了为什么AI会“睁眼说瞎话”,以及这类幻觉不是玄学,而是可定位、可修正的机制问题。

多模态幻觉 · 视听大模型 · 跨模态干扰 · AI可靠性
阅读全文 →
前沿论文 · arXiv▲ 11

让AI记住“上次看到过什么”

现在的视频世界模型有个尴尬:它要么把看过的画面全存下来(内存爆炸),要么压缩成一个小状态(细节全丢)。

现在的视频世界模型有个尴尬:它要么把看过的画面全存下来(内存爆炸),要么压缩成一个小状态(细节全丢)。这篇论文给了一个两全方案:一半的注意力层保留原始画面缓存,另一半用“循环记忆”压缩,关键是——压缩时把摄像机的视角也写进去。于是当镜头转回老地方,模型能按视角精准调出“上次这里长什么样”。

在公开基准上,它比同配置的全注意力模型省约30%内存,还能在固定内存下无限流式看长视频。这不是你明天能用的工具,但它指向一个方向:AI对世界的记忆,正在从“存照片”变成“懂空间”。

世界模型 · 空间记忆 · 视频生成 · 内存优化
阅读全文 →
前沿论文 · arXiv▲ 11

让AI记住去过的地方:世界模型不再“失忆”

AI在虚拟世界里逛了一圈再回来,常常“失忆”——它不记得自己刚才见过什么,画面会变得陌生。

AI在虚拟世界里逛了一圈再回来,常常“失忆”——它不记得自己刚才见过什么,画面会变得陌生。这篇研究让AI像人一样,对去过的地方有长期记忆。做法是:训练时不再要求AI把每一帧都看一遍,而是让它在“重访”时只去检索和当前视角最相关的旧画面,拼成一张共享记忆卡。

这样,无论间隔多久,它都能保持场景一致,而且计算成本几乎不涨——从100秒拉长到400秒,耗时只多12%。这不是你明天能用的功能,但它意味着未来的AI游戏、自动驾驶模拟器,能构建出真正连贯、可信的虚拟世界。

世界模型 · 长期记忆 · 场景一致性 · AI训练 · 检索
阅读全文 →
前沿论文 · arXiv▲ 11

大模型泛化被误解了:稳定才是真本事

我们一直用「准确率」衡量大模型会不会举一反三,但这篇论文说:准确率高不等于泛化好,稳定才算。

我们一直用「准确率」衡量大模型会不会举一反三,但这篇论文说:准确率高不等于泛化好,稳定才算。同一个问题换个说法,模型答案可能就变了——这才是泛化的真相。研究者提出一套新框架,不只看答对多少,而是看同一输入在不同表达、不同任务下,模型的输出、内部激活、置信度有多大波动。

结果发现:没有哪个模型在所有变化下都稳定,不同维度暴露的毛病互不相干,换个数据集甚至能让模型排名反转。也就是说,你平时看到的榜单排名,可能只是某个特定问法下的偶然结果。它不是你明天能用上的东西,但提醒你:别把跑分当人品,真正靠谱的模型,是换个问法依然不慌的那种。

泛化 · 稳定性 · 评测 · 大模型 · 准确率
阅读全文 →
前沿论文 · arXiv▲ 11

视频生成里的字,还是写不对

视频生成模型能把画面拍得像电影,但画面里的文字还是硬伤:11 个最强模型里,最好的一个文字错误率也有 25%,广告、科普这类带字的场景基本没法直接用。

视频生成 · 文字渲染 · 评测基准
arXiv 原文 ↗
前沿论文 · arXiv▲ 11

AI 找论文灵感,还不如普通检索

让 AI 像科学家一样,从海量论文里找出能启发新研究的那篇——184 位作者亲手标注了 207 篇论文的灵感来源,结果最强智能体检索成功率只有 51%,和普通向量检索差不多。

论文检索 · 科学灵感 · AI 智能体 · 评测基准
arXiv 原文 ↗
🔬 前沿研究
前沿研究 · @NFT_Chen▲ 1.3万

Aleph Alpha 德国主权模型Kolibri用了中企模型数据

标榜欧洲自主的主权AI模型,合成训练数据主要来自中国智谱GLM和阿里通义千问Qwen。对宣称技术自主的AI项目来说,这算是打脸了。

💥炸了!中国模型被欧洲模型蒸馏!德国“主权模型”Kolibri技术报告自曝:后训练合成数据主力其实来源于智谱GLM和阿里巴巴Qwen!

Aleph Alpha把Kolibri宣传成德国从零训练、欧洲基础设施、无外国控制。

报告3.1.1节写的却是:

1️⃣生成微调数据、重写开源数据集答案的主力模型,就是GLM-5.2、GLM-5.3(

2️⃣Nemotron指令跟随数据集的completions,直接用GLM-5.2和GLM-5.3重新生成;reasoning-off子集专门出无推理链版本,单条对话最长扩到50轮。

3️⃣Nemotron科学选择题的completions,用Qwen3.8-27B重写。

4️⃣论文自己说:小模型跑长上下文更快,大模型更适合出强推理轨迹;还会有意识挑选或避开这些模型的价值观和偏见。

美国骂中国蒸馏,欧洲新“主权AI”的教师模型写在纸面上的是智谱GLM和阿里Qwen。

报告原文: #Kolibri #AlephAlpha #主权AI #模型蒸馏 #GLM #Qwen #智谱 #通义千问 #唐杰

在 X 看原帖 ↗
1.3万148028
前沿研究 · @HowToPrompt__▲ 6.9K

研究人员发布机器意识可证伪理论MEM论文

现在有了可验证的科学框架区分算法和有意识的AI,未来人与AI建立情感连接时,有了判断依据

阅读全文 →
6.9K43151132
前沿研究 · @yupi996▲ 6.9K

11款公开编程Agent 竟都不是LangChain搭建

业内现在做编程Agent 都不用现成框架了,统一用7个基础部件搭建,这个业内设计标准值得想要自己做Agent的人参考。

好家伙,有篇论文拆了 Claude Code 等 11 个编程 Agent 的源码,居然没有一个靠 LangChain 这类框架搭的!连 Google 的 Gemini CLI 都没用自家的框架 🤣 找代码时也没有一个用向量检索,靠的是 ripgrep、tree-sitter 这些工具,外加 AGENTS.md 这类说明文件。意外的是,这 11 个 Agent 都是同样 7 个部件拼出来的,区别只在每个部件写得多复杂。

看来这真的是业内标准的 Agent 设计了,值得学习~

在 X 看原帖 ↗
6.9K1085106
前沿研究 · @slash1sol▲ 1.9K

Wavestone分析11款编码智能体,核心结构共7部分

如果你关注AI编码工具,这次研究梳理了现有编码智能体的通用结构,还公开了可复用的90行核心代码框架,方便开发者参考。

阅读全文 →
1.9K26336
🚀 新品发布
新品发布 · @S0N_IA▲ 5.5万

开源网页克隆模板 建站从几天缩到几分钟

对需要迁移旧网站、找回丢失代码或学习优秀界面的人来说,这个免费开源工具能大幅节省建站时间,效率提升明显。

现在 Claude Code 只需几分钟就能克隆出几乎任何网站的界面

现在有一个开源模板可以分析任意网站,并将其转换为整洁的 Next.js 代码库。你输入网址后,代理就会分析:

→ 界面和组件
→ 颜色和排版
→ 间距
→ 图片、图标这些资源

之后它会让多个代理并行工作,逐个重建每个区块。

它支持 Claude Code、Codex、Cursor、Gemini、Copilot 以及超过 10 种编程代理。

它在 GitHub 上已经获得超过 35k 星标,采用 MIT 许可证,完全免费。

效果就是:过去需要好几天来排版界面的工作,现在只需要几分钟。

对于想要迁移旧网站、找回丢失代码或是学习优秀界面制作方法的人来说,这完全改变了游戏规则。

仓库在评论区 👇

在 X 看原帖 ↗
5.5万17187373
新品发布 · @xiangxiang103导语出处▲ 8.7K

上海人工智能实验室发布书生·端砚平台(5亿)

注册就能领每月免费额度,自家三款模型限时免费调用,还支持多款第三方模型,兼容主流协议,想用大模型API能省一笔钱。

卧槽,上海人工智能实验室免费发 5亿Token ! 平台叫书生·端砚,注册就送“每月免费基础包”:10 墨点。

官方写明 1 墨点最多抵 5000 万 Token,10 墨点就是最多 5 亿。

书生-S2、Atria-Dawn-Preview、Agents-A1 三个自家模型更直接,限时 0 墨点,调用不扣。

还能调 DeepSeek-V4、GLM-5.3、Kimi-K2.6 等 7 款第三方模型。

兼容 OpenAI 和 Anthropic 协议,Claude Code、Codex 换个 Base URL 就能跑。

入口:
我用API接入workbuddy,实测可用,大家薅起来!

在 X 看原帖 ↗
8.7K372104
新品发布 · @bindureddy导语出处▲ 8.1K

Axiois称美国初创即将推出顶级开源模型

数十亿美元投入美国隐形大模型初创公司,即将推出的开源模型微调后性能有望超过前沿大模型,不妨保持观望。

多款美国开源模型即将推出。

Axiois 称,美国隐身基础模型初创企业投入的数十亿美元即将获得回报。

据称,他们推出的开放权重模型只需做一些调整,性能就能超越前沿模型。

我对此持怀疑态度,但也抱有希望😅

在 X 看原帖 ↗
8.1K312612
📰 行业动态
行业动态 · @lennysan▲ 2.2万

lennysan对谈ChatGPT和Codex负责人

访谈涉及OpenAI对AI安全的思路,以及未来互联网动作将由智能体主导等行业判断,可以帮你了解AI行业的走向。

我和ChatGPT与Codex负责人thsottiaux的对话。我们讨论了:
🔸 为什么模型选择器可能会消失
🔸 为什么循环和图谱只是一个过渡阶段
🔸 为什么互联网上的大多数操作很快会由智能体完成
🔸 OpenAI的AI安全方法

现在就来收听吧

在 X 看原帖 ↗
2.2万19296201
行业动态 · @AndrewCurran_导语出处▲ 2.6万

Reflection AI将发高性能开源模型竞争中国顶流

美国计划推动本土开源大模型在全球市场竞争中国开源模型,多家机构将在本月发布开源模型。

Axios 报道称,Reflection AI 即将发布一款能力极强的开放权重模型,预期将与中国顶级的开放权重模型竞争。

自 7 月以来,Reflection 每月向埃隆·马斯克支付 1.5 亿美元,用于获得 Colossus 的算力,除此之外还与 Nebius 签订了 10 亿美元的算力协议,因此开发出一款强大模型确实是有可能的。

消息人士还向 Axios 透露,其他未具名的美国实验室也计划在本月发布多个开源模型。美国开源人工智能复兴即将开始?

Howard Lutnick 一直期待出现这样的局面,据报道,他一度甚至考虑争取政府直接注资来推动此事。美国政府希望美国开放模型能在全球范围内与中国模型竞争。

在 X 看原帖 ↗
2.6万5539782
开源 · @Promixyz▲ 5.6K

分享10个开源项目,给AI agents上锁

AI agents调用真实工具时容易权限溢出,这组开源项目能让agents在隔离环境运行,不会拿到系统全部权限。

阅读全文 →
5.6K18123128
开源大模型 · @Amank1412▲ 2.5万

Amank1412,Kolibri发布Kolibri开源大模型

这款名为Kolibri的开源模型自称击败了Qwen2 635B、Nemotron 3 Super和Mistral Small 4,德国也加入顶级大模型竞争。

德国刚刚加入前沿大语言模型竞争。

新的主权开源模型 Kolibri。

> 击败 Qwen2 635B
>
> 击败 Nemotron 3 Super
>
> 击败 Mistral Small 4

基于定制化MoE Transformer架构构建。

在 X 看原帖 ↗
2.5万823357
开源 · @realchendahuang▲ 3.0K

Pi Durable解决开源AI框架改造后台服务痛点

很多开源AI Agent框架要么绑死命令行,要么过于臃肿,这个新发布的底座是专门给做产品开发的团队二次开发用的。

阅读全文 →
3.0K63538
测试 · @ivanfioravanti▲ 3.5K

通义千猜工具调用9种方案5个引擎实测对比

研究者花了很长时间,在92种Agent场景下测试不同配置,已经得出了得分最高的方案。

阅读全文 →
3.5K107535
市场预测 · @zordcrypt▲ 5.6K

预计2030年全球AI推理市场规模达到2550亿美元

有观点认为AI推理会成为加密和AI结合的最大市场,现在需求增长已经带动产业链开始布局。

阅读全文 →
5.6K131063
行业动态 · Hacker News▲ 33

开发者构建出语义代码搜索的RAG管线

查找代码不用依赖内置模糊搜索,用自定义的RAG管线就能实现语义层面的代码搜索,降低代码检索的时间成本

💡 深度观点
深度观点 · @superalesha▲ 1.1万

OpenAI Anthropic 对AI蒸馏竟持双标态度

有人批评OpenAI和Anthic一边用人类公开成果训练AI赚钱,一边禁止他人用他们的API输出训练竞争模型,双标做法令人反感。

OpenAI 和 Anthropic 居然还有脸抱怨知识蒸馏,真是离谱。

人类花了几十年时间编写代码、解释科学、回答问题、分享知识。AI 实验室用这些成果训练模型,做成产品卖给我们赚钱。他们早就蒸馏了我们所有人。

现在,有人付费购买他们的 API,并用输出训练了一个竞争模型,结果突然就遭到封禁,还被安上了「蒸馏攻击」的名头。

OpenAI 自己就提供蒸馏工作流,他们会在自己的平台上帮你用大模型的输出训练小模型。但如果你用这些输出做一个竞品,那你就是违反规则。

他们的服务条款甚至说我拥有输出内容。我花了钱,按理说产出归我,结果他们还能规定我能用它建什么模型。

这些人花了那么多年维护机器从他人作品学习的权利,现在轮到从他们自己的作品学习,也该好好维护才对。

这就是为什么我支持中国实验室发布可以下载、本地运行、二次开发的权重。你们都可以滚蛋了。

在 X 看原帖 ↗
1.1万6040735
深度观点 · @kimmonismus导语出处▲ 4.4K

@kimmonismus 整理了一波新开源大模型发布传闻

想自己本地跑新开源大模型的话,可以看看这份传闻汇总,多个热门模型的预计发布时间都列出来了。

我已经等不及下一波可以在本地运行的开放权重模型了。以下是我整理的目前谣言观察列表:

- Qwen 4:讨论的发布时间是10月到11月初。阿里云确认该模型正在训练中,但没有给出发布日期。

- Kimi K3.1:一个可能的预告和一个被曝的后端模型标识引发了期待。发布时间可能在10月,但这只是猜测。

- Next GLM:根据发布节奏预估发布时间为10月到11月(我对GLM-5.4尤其期待,因为5.3在网络安全能力上非常强)

- DeepSeek V4.2:遗憾的是目前还没有可靠的发布时间窗口。

Qwen 4 27b很可能会成为最强者,但我对K3.1和GLM-5.4也同样非常期待。当然还有DeepSeek 4.2 Flash。

在 X 看原帖 ↗
4.4K4597
🛠 工具产品
工具产品 · @RodmanAi▲ 4.2K

10个AI加持的网络安全GitHub仓库

不管是普通网络安全从业者,还是想要探索AI+网络安全方向,都可以直接保存这些仓库,不用自己再逐个筛选查找。

10 个将 AI 引入网络安全的 GitHub 仓库

人工智能不只是在改变我们构建软件的方式。它还在改变安全团队发现、测试和修复漏洞的方式。

1. PentestGPT:一款人工智能助手,用于推理渗透测试工作流程和发现结果。
2. Caido:现代化工具套件,用于在安全研究期间拦截和分析网络流量。
3. HexStrike AI:通过基于 MCP 的框架将人工智能代理与网络安全工具连接起来。
4. Strix:由人工智能驱动的安全测试,用于调查应用程序并发现漏洞。
5. Nuclei:快速、基于模板的漏洞扫描器,适用于应用程序和基础设施。
6. Semgrep:具有代码感知能力的安全扫描,帮助在部署前捕捉漏洞。
7. Gitleaks:发现 Git 仓库中暴露的 API 密钥、密码、令牌和其他机密信息。
8. OWASP Amass:发现域名、子域名和基础设施,帮助了解外部攻击面。
9. Wazuh:开源平台,用于安全监控、检测、漏洞管理和日志分析。
10. Prowler:根据安全最佳实践和合规框架评估云环境。

如果你正在探索人工智能驱动的网络安全,收藏这些仓库吧。

在 X 看原帖 ↗
4.2K249988
工具产品 · @realfxw▲ 3.3K

REA 开源:AI Agent 实现自动化逆向工程

原来需要资深工程师手动完成的逆向分析,现在可以交给AI Agent自动执行,降低了逆向工程的门槛,同时也带来了合规和技术挑战值得关注。

阅读全文 →
3.3K83960
⚡ 实战经验
实战经验 · @undefinedKi导语出处▲ 1.5万

Andrej Karpathy 发布 autoresearch 自动研究代理

这款工具只需要3个文件,可在单块NVIDIA GPU上运行,能自动循环完成AI研究,适合需要 overnight 自动化科研的场景使用。

安德烈·卡帕西(Andrej Karpathy)构建了一个能自主开展AI研究的智能体。整个配置只有3个文件,它叫做autoresearch。

你只需给Claude或Codex提供一个小型LLM训练配置,就可以不用管了。循环流程是:尝试一个想法→提交代码→训练正好5分钟→如果得分提升,就保留变更;如果得分变差,就用git重置→记录结果,永远重复这个过程。

指令明确告诉智能体永远不要停止,永远不要问“我应该继续吗?”,因为人类可能正在睡觉。你完全不用碰Python代码,只需要编辑program.md,也就是智能体的指令。卡帕西将其称为你的研究机构的代码。

这里甚至还有一条简洁性规则:带来微小收益但增加了20行hack代码的变更会被丢弃,得分相同但代码更少的变更会被保留。

我认为这个模式的适用范围远不止LLM。任何只要有一个需要超越的分数、一个需要编辑的文件、每次运行固定时间的任务,都可以像这样通宵自动运行。

项目9.2万星,MIT许可证。可以在单块NVIDIA GPU上运行,支持本地或租用的GPU,社区已经衍生出支持Mac、Windows和AMD的分支。

在 X 看原帖 ↗
1.5万16202362
实战经验 · @AM09_21▲ 2.6万

Claude GPT缓存过期超时会多扣费

如果长时间运行循环AI Agent,控制缓存超时可以避免不必要的额外订阅计费,这是实际使用中的省钱技巧

在AI订阅服务中,Claude的缓存保留时长是1小时,GPT的缓存保留时长是30分钟。如果会话输出结束后,不在1小时/30分钟内发送后续内容,就会被扣除大量使用量……这条小知识,说实话,如果一直让AI Agent自主循环运行的话,其实不用太担心这个问题。

这种24小时运行的循环型Agent构想,是Cursor一直在主推的,但实际上能让大家方便使用的应该是Dot了(我自己没法用,只是从X时间线推出来的)。

Dot这个Agent可以统括Codex的多个Agent,用户通过Dot交流,而实际工作一直在循环运行……大概是这种结构。

使用技巧是不要和实际工作的部队直接对话,而是一直和情商、日语表现都更好,用起来更舒服的模型对话。

你和这个模型聊天,同时后台有规划器制定计划,如果规划器说信息不足,就由对话专长模型来好好询问用户,我觉得这样运行是最理想的。

而且,现在这种需求只需要让Dot基于Dsh或Pi进行改造就可以实现,这是目前很不错的一点。

就算是有点专业、自己懒得动手实现的内容,直接全扔给AI也能推进到一定程度,这点很不错。

在 X 看原帖 ↗
2.6万17241264
实战经验 · @Stefan_3D_AI▲ 10.0K

mixie3D Blender AI工具比GPT-6更快

已经在用ChatGPT或Codex订阅的用户,可以免费使用这个工具,能直接在Blender里生成带绑定的 procedural 飞马模型

我已经放弃让AI在Blender里自己点来点去了。@mixie3D 为智能体提供了直接控制能力,以及多智能体工作流和真正的3D技能。不再需要模拟UI操作。

我已经在我的游戏里测试过了。只运行了一次,智能体就自动生成了完整程序化生成的珀伽索斯飞马,包括毛发、翅膀和绑定好的控制骨架。

使用同样的模型,路由更智能,比通过界面操作强行调用 GPT-4o / Opus 快得多。

你可以用自己的 ChatGPT/Codex 订阅免费使用。导入 .blend 文件后就能继续工作。这是第一个真正让模型仿佛置身Blender内部的设置。

#BlenderAI #Mixar #GameDev #3DAI

在 X 看原帖 ↗
10.0K12242277
实战经验 · @0xGky▲ 3.0K

@0xGky发布Seedance 2.5 三步生成AI视频

你做AI视频不用反复调整提示词,一遍就能生成自然的AI视频,降低AI视频生成的门槛和重复操作。

一位AI圈的大佬 ,他搞了个叫 Seedance 2.5 导演 Skill 的东西。 操作流程特别简单,总共就三步: 1️⃣ 先让它帮你把提示词生成出来 2️⃣ 把参考角色扔进去,直接开跑 3️⃣ 通常一遍就能成,不用来回重试搞得人崩溃 这个工具不只是替你写提示词,还会顺带帮你把内容调优,生成出来的视频看起来挺自然,那种明显的AI感能削掉不少。

在 X 看原帖 ↗
3.0K65469
📌 其他
开发 · @RileyRalmuto▲ 2.6K

新AI认知架构Mnemos记忆效果2倍于Claude原生系统

开发者公开独立测试结果,后续将放出演示视频供用户体验

阅读全文 →
2.6K126942
教程 · @angeldot_▲ 1.1万

Anthropic官方插件帮你一步步配置Claude Code自动化

来自X用户@angeldot_分享的Anthropic官方claude-code-setup插件

Claude Code 是一团乱麻。直到你安装了这个东西。

这里有一个Anthropic官方插件叫做claude-code-setup。

它会告诉你可以搭建哪些自动化工具(钩子、技能、MCP服务器、智能体……),以及如何一步步配置它们。

基本上它会分析你的项目,并推荐你开启哪些功能。

安装指令:/plugin install claude-code-setup@claude-plugins-official

收藏这篇帖子,别找不到了🔖

在 X 看原帖 ↗
1.1万19201223
教程 · @xiaomovps▲ 4.1K

零成本跑AI应用,这套Cloudflare工具组合就够了

来自@xiaomovps在𝕏的分享,用Cloudflare全套组件低成本搭建AI应用

很多人开发AI工具担心成本过高,实际上Cloudflare已经配齐了AI应用开发所需的大部分基础设施。

第一,Workers可承担API、业务逻辑和智能体调度,能直接作为AI应用的后端。

第二,Workers AI可以直接运行Llama、Qwen、Gemma等大模型,自带免费额度,开发演示项目和小工具非常方便。

第三,AI Gateway可以统一接入OpenAI、Claude、Gemini等模型接口,同时解决日志、缓存、限流、调用统计问题。

第四,Vectorize是Cloudflare自研的向量数据库,可直接用于搭建知识库、RAG(检索增强生成)和语义搜索。

第五,D1存储用户、任务和结构化数据,KV存储配置、缓存和高频状态数据。

第六,R2存储图片、文档和模型素材,Queues负责处理异步任务,避免耗时操作阻塞请求。

这套组合覆盖了从模型、API、RAG到数据库、文件存储、异步任务全流程,AI应用开发所需的大部分功能基本都能在Cloudflare实现。

很多服务都带有免费额度,前期开发演示项目、个人项目、小型SaaS都够用,等有用户访问之后再按需升级即可。

在 X 看原帖 ↗
4.1K34053
生活工具 · @griswold▲ 8.5K

个人定制AI机器人每周帮你省2-3小时 Meal Planning 购物时间

网友@griswold分享的家庭定制Sylvia-bot,完成每周餐食规划和 grocery 采买

阅读全文 →
8.5K1125107
设计 · @Khazix0918▲ 2.5万

用户花半个多小时用Claude调出可用的公司logo动效

用户Khazix0918在𝕏分享,仅用半小时就通过Claude得到可使用的公司logo动效

用户Khazix0918在𝕏分享了自己用AI生成动效的经历。

他用Claude调整了半个多小时,就得到了差不多可以投入使用的公司logo动画。

他提到,放在一年前,没人能想到动效和视频这类内容,也会被AI用代码直接生成。

技术发展速度太快,很多时候人们都还来不及反应。

在 X 看原帖 ↗
2.5万716148
开发工具 · @velfo▲ 3.1K

用户分享:将Codex CLI接入Grok Bot可改变开发工作流

X平台用户@velfo分享@heliotsz提出的技巧,可在移动设备上完成开发操作

@velfo表示,这个思路看起来很奇怪,但在@heliotsx提到之前,他确实从来没有想到过。

将Codex CLI或Claude Code CLI连接到Grok Bot,能彻底改变开发工作流程。

这样一来,就不会只剩下向光标发送云代理指令的单一工作流,还能获得更完善的测试框架来评估部分功能。

整个操作都可以在手机上完成,@velfo分享时正处于前往投票的路上。

在 X 看原帖 ↗
3.1K45234
大模型体验 · @EXM7777▲ 4.0K

Hermes内置的Opus 5.5比Grok Bot和Dots体验更好

用户@EXM7777在𝕏分享体验,称该模型能完成其他AI代理无法处理的任务

对@EXM7777来说,Hermes内置的Opus 5.5比Grok Bot或Dots高出一个等级。原因是默认状态下,它就能处理其他AI代理无法完成的场景。

开箱即用的写作效果比其他AI好得多。
它能够实际完成应用设计工作。
和它对话的体验非常流畅顺滑。

它确实会比Claude Code内置的Opus更快消耗额度限制。不过这个模型现在的效率足够高,因此用户可以接受这一点。

目前已经有1.5万名创始人加入用户分享的这套系统,用户每周会发送一封免费邮件,感兴趣的用户可以前往链接查看。

在 X 看原帖 ↗
4.0K25233
动态 · @YxzRainy▲ 1.0万

ChatGPT严打风控,用Computer Use功能要注意屏幕内容

用户@YxzRainy在𝕏提醒,ChatGPT当前风控不光查提问内容,还要查AI看到的电脑屏幕内容

<p>ChatGPT近期开始严格执行账号封禁风控。经常使用ChatGPT的Computer Use功能的用户需要特别注意。</p> <p>现在的风控触发规则不止和用户提问内容有关,AI在用户电脑屏幕上看到的内容也可能触发风控。

</p> <p>目前已知的高风险内容包括:未成年色情、犯罪相关内容、越狱提示词、核/生物/黑客等敏感技术,以及账号/地区异常。</p> <p>用户使用Computer Use功能前,需要先关闭电脑中不合规的敏感内容。</p>

在 X 看原帖 ↗
1.0万383
工作流 · @xikhar▲ 89

当不清楚最终输出时,AI代理可通过新工作流持续自我优化

@xikhar 在𝕏分享的改进型AI工作流,支持AI持续优化输入和输出

Gauntlet循环在已知最终输出形态时效果出色。但很多时候人们并不清楚最终输出的样子,需要AI代理持续同时优化输入与输出。

因此@xikhar正在测试一种新的循环工作流,让AI代理在循环中完成调研和构建两步工作。

这个思路其实由来已久,Matt Shumer最早提出了生成子代理的概念,让子代理构建输出、自我验证并优化结果。

想要了解更多细节,可以查看@xikhar置顶的视频帖子。本次测试在原有思路上做了延伸,目标是让AI代理遇到阻碍时,能通过反复调研自行优化输入。

在 X 看原帖 ↗
8921

今天的 40 条信号到这里下一轮 12:30 更新

回到今日焦点回到顶部 ↑

使用技巧

把 AI 用进工作生活的实操方法 · 实测接地 · 不卖课

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →

从这些问题开始精通 AI

查看全部知识库问题 →

随便看看

把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

按主题浏览共 30 个常见主题

查看全部主题 →

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新