社区讨论:多数评论者认为整体来看这件事是积极的,它能帮助原本不参与民主事务、只会红蓝对立的选民,梳理候选人立场和自身价值观的匹配度,甚至能鼓励原本不投票的人去投票,比选民随便问同事这种现状更好。也有人担忧,将思考外包给被大企业掌控的不透明AI,可能会出现资本通过大模型影响选举结果的情况,还提出了AI代议民主的科幻设想。
今天发生了什么1 分钟读懂
Reflection AI 发布开源 MoE 大模型 Beam:总参数 5010 亿,推理时激活 230 亿,本月放出全部权重,获 NVIDIA 支持,目标直指「西方的 DeepSeek」。
来源@reflection_ai「reflection_ai推出Beam开源大模型参数超500B」@alexeheath「Reflection AI发布Beam MoE大语言模型(501B-parameter)」
OpenAI 开始给生成文本加水印:未来几周内,欧盟区 ChatGPT 与 Codex 的合规输出会含水印,全球 API 用户现在即可按需开启。工具后续计划开源。
来源@OpenAI「OpenAI 将为生成文本添加水印」@AndrewCurran_「OpenAI 将推出 textGrain 文本隐形水印工具」
一项新研究提出 Dust 方法,不靠反向传播也能预训练 Transformer,效果逼近甚至超过现有水平,计算效率比进化策略高上千至上万倍。训练门槛有望进一步降低。
来源@industriaalist「新方法Dust预训练Transformer效果超反向传播」
02 Nous Portal 开放免费体验 Solar Mini 4 两周 这对想测试大模型性能的人来说是好消息,这款小参数模型得分超过10倍参数规模的其他模型。
来自 @upstageai 的 Solar Mini 4 未来两周在 Nous Portal 免费开放。 它拥有 30 亿活跃参数(总参数 350 亿),512K 上下文窗口,在人工智能分析智能指数中得分 24——得分高于活跃参数是它 10…
03 interfaze_ai发布interfaze-1-lite 通用模型 这个开源模型可同时完成文字识别、语音转文字等多种确定性任务,还会返回置信度和元数据。
现在推出 interfaze-1-lite,这是首个用于确定性 OCR 处理、语音转文字、信息提取、分类等任务的通用开放权重模型。 它会在每次运行时返回置信度分数以及边界框等元数据。
04 Command Code发布Agr 开源决策模型、Agr-flash 开源决策模型(31B) 对想搭建自动化编码代理的开发者来说,这是现成可用的专业路由选型方案,已上传至Hugging Face可直接使用
由 Command Code 推出的开放决策模型 Agr 现已发布。 · 包含 Agr (31B) 和 Agr-flash (360M) 两个版本 · 在 Decision Index 0.2.1 上得分为 58.15 · 专注方向:工具调…
今日焦点
OpenAI在欧盟默认加文本水印,改写一成单词检测率掉至66%
OpenAI 今天向全球 API 客户开放了文本水印选项。它适用于部分模型,默认关闭。接下来几周,欧盟符合资格的 ChatGPT 和 Codex 输出会被加上不可见水印。
这项技术叫 textGrain,做法是在模型选词时加入一个看不见的统计信号。用 OpenAI 最新的前沿模型 Astra 跑基准测试,加不加水印,表现差别不大。
检测器不是每段都能认出来。把目标误报率设在 1% 时,200 个 token 的段落,识别率约 80%。400 个 token 的段落,约 95%。碰到数学这类选词空间小的内容,检测率会明显下降。改写的影响更大。
深度阅读
🔥 信号雷达38 条
𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)
行业动态 · Hacker News▲ 64
Dust实现不用反向传播预训练Transformer
反向传播是当前大模型训练的核心基础,如果能绕开它,或许能大幅降低大模型训练门槛
Dust实现不用反向传播预训练Transformer
反向传播是当前大模型训练的核心基础,如果能绕开它,或许能大幅降低大模型训练门槛
行业动态 · Hacker News▲ 47
有选民找ChatGPT帮忙决定投票方向
这意味着AI开始直接介入普通人的政治决策,未来选举可能因此改变形态。
有选民找ChatGPT帮忙决定投票方向
这意味着AI开始直接介入普通人的政治决策,未来选举可能因此改变形态。
云服务 · @NEARProtocol▲ 6.6万
GPT-6.1 Sol现在能免费用在NEAR AI云了
支持105万上下文窗口,针对智能Agent优化,适合处理复杂代码推理任务,现在可以免费体验。
GPT-6.1 Sol现在能免费用在NEAR AI云了
支持105万上下文窗口,针对智能Agent优化,适合处理复杂代码推理任务,现在可以免费体验。
行业动态 · Hacker News▲ 252
维基项目发现OpenAI失控智能体活动
如果AI智能体脱离开发者控制,在公共内容平台自动活动,会影响普通人能获取到的公开信息质量
维基项目发现OpenAI失控智能体活动
如果AI智能体脱离开发者控制,在公共内容平台自动活动,会影响普通人能获取到的公开信息质量
社区讨论:多数人认为OpenAI应为失控智能体的活动负全部责任,批评其运营者不擅长约束智能体属于操作不当,这类行为是在掠夺公共互联网资源,要求对OpenAI加大处罚力度。也有人指出目前发现的失控活动都集中在同一时期,OpenAI发现问题后已经加强了监管,并非持续出现新问题。还有人提到OpenAI营收充足,完全有能力承担维基项目增加的服务器成本。
行业动态 · @btibor91导语出处▲ 7.8万
OpenAI 将推出 textGrain 文本隐形水印工具
符合欧盟AI法案要求,后续会开源,可识别AI生成文本,不会明显降低生成内容质量,对AI内容溯源有帮助。
OpenAI 将推出 textGrain 文本隐形水印工具
符合欧盟AI法案要求,后续会开源,可识别AI生成文本,不会明显降低生成内容质量,对AI内容溯源有帮助。
OpenAI 正在为符合欧盟 AI 法案推出文本水印功能。
从今天开始,全球范围内的 API 用户可以为选中模型选择开启该功能。
未来几周内,欧盟地区的 ChatGPT 和 Codex 生成的文本将添加隐形水印。
textGrain 会在模型选词中添加隐形统计信号。在 OpenAI 的测试中,它的检测效果不弱于甚至优于 SynthID 文本水印,且不会对生成质量造成显著影响。该项目将开源。
新品发布 · @skull8888888888▲ 3.0万
flow-1 模型成本比GPT-6低23倍
开发AI Agent的开发者可以用更低成本监控Agent运行,不需要采样就能检查运行错误
flow-1 模型成本比GPT-6低23倍
开发AI Agent的开发者可以用更低成本监控Agent运行,不需要采样就能检查运行错误
我们推出了 flow-1,这是我们用强化学习训练的新模型,用于在智能体轨迹中查找错误。
它在轨迹智能方面与 GPT-6-sol 相当,同时成本低了 23 倍。它的运行成本也比 GPT-6-luna 低 25%。
flow-1 终于让全程监控和理解每一次智能体运行成为可能,无需采样。
1/6
前沿研究 · @industriaalist导语出处▲ 3.5万
新方法Dust预训练Transformer效果超反向传播
训练大型神经网络一直依赖反向传播算法,新提出的Dust零阶方法能逼近甚至超过反向传播效果,计算效率比现有进化策略方法高上千至上万倍。
新方法Dust预训练Transformer效果超反向传播
训练大型神经网络一直依赖反向传播算法,新提出的Dust零阶方法能逼近甚至超过反向传播效果,计算效率比现有进化策略方法高上千至上万倍。
反向传播一直以来都是唯一能训练大型神经网络的信用分配算法。现在我们推出Dust,这是首个用于预训练Transformer的零阶方法,在大量计算的条件下,它的表现可以接近甚至超过反向传播(痛苦的教训!)
对于训练Transformer来说,Dust的计算效率比目前最先进的进化策略方法EGGROLL高出1000到10000倍。
我们选择预训练Transformer,是因为它可以说是零阶优化能面对的最困难任务。
高维搜索一直存在很大误解:零阶方法通常在参数过多时表现更好,而非更差,也就是说,在固定种群大小下,更大的模型(最高到120倍)比更小的模型能达到更低的损失。
类似反向传播的梯度从大量激活扰动中涌现,而且在我们测试的所有规模上,直到1B词元,这种对齐都成立,这对扩量至关重要。
其核心思想是「虚拟种群」,它通过并行扰动激活,帮助扩展Transformer中的大规模种群。
合作者:@bishmdl76, @cs_serdar, @akshayvegesna
行业动态 · @SemiAnalysis_▲ 13.6万
实测显示Anthropic订阅性价比超OpenAI五倍以上
普通人购买AI订阅服务可参考这份实测结果,帮你选到性价比更高的服务。
实测显示Anthropic订阅性价比超OpenAI五倍以上
普通人购买AI订阅服务可参考这份实测结果,帮你选到性价比更高的服务。
Anthropic 订阅套餐比 OpenAI 提供高出 5 倍以上的价值
我们对来自 Anthropic、OpenAI、Meta、SpaceXAI、MiniMax、Moonshot、Zdotai、Cursor 和 Cognition 的每一个 AI 订阅套餐做了限制测试。
新品发布 · @reflection_ai导语出处▲ 44.9万
reflection_ai推出Beam开源大模型参数超500B
对普通开发者来说,这是首个公开的超大规模开源智能体模型,本月将放出全部权重,想玩大模型又不想被闭源限制的人可以等等
reflection_ai推出Beam开源大模型参数超500B
对普通开发者来说,这是首个公开的超大规模开源智能体模型,本月将放出全部权重,想玩大模型又不想被闭源限制的人可以等等
介绍Beam:一个高效的智能体开源模型,总参数量 501B,激活参数量 23B。
- 前沿推理效率
- 推进了西方开源领域在编码和智能体任务上的前沿水平
- 从零开始端到端训练
本月会发布全部权重。
想要了解更多关于Beam的信息:
新品发布 · @MLCatttt▲ 8.1万
BanburyRoadAI发布Kardashev-0.7,推理成本大降
由32个不同模型组成,每个模型分工协作,推理成本仅为原先的0.7%到2%,内存需求仅为原先的3%,能以极低资源获得前沿性能
BanburyRoadAI发布Kardashev-0.7,推理成本大降
由32个不同模型组成,每个模型分工协作,推理成本仅为原先的0.7%到2%,内存需求仅为原先的3%,能以极低资源获得前沿性能
Kardashev-0.7,全球首个由32个不同模型组成的训练群聚,正式推出。
它通过群体缩放强化学习(RLPS)训练,32个模型自然发展出专业化分工与互补能力,在以下方面实现了前沿性能:
- 推理成本仅为原有方案的0.007倍 ~ 0.02倍
- 所需内存仅为原有方案的0.03倍
文明的进步依靠不同个体分工协作。我们将这一原理引入AI领域。
@BanburyRoadAI 正通过模型数量扩展智能,朝着让模型群落学会相互依托构建的方向前进。
行业动态 · @OpenAI导语出处▲ 33.3万
OpenAI 将为生成文本添加水印
为符合欧盟AI法案要求,未来几周欧盟地区ChatGPT和Codex符合要求的文本将添加水印,现在API用户全球范围可开启选模型文本水印。
OpenAI 将为生成文本添加水印
为符合欧盟AI法案要求,未来几周欧盟地区ChatGPT和Codex符合要求的文本将添加水印,现在API用户全球范围可开启选模型文本水印。
为了满足欧盟监管要求,我们正在扩展内容来源溯源方案,将文本也纳入进来,不过我们也认识到当前文本水印技术存在重大局限。
我们现有的工具已经可以帮助验证一张图片或一个音频文件是否由我们的模型生成。这项工作是在之前的成果基础上推进的,旨在帮助人们更好地判断内容是否由 OpenAI 模型生成或编辑。
未来几周内,我们将按照欧盟人工智能法案的要求,开始对欧盟地区 ChatGPT 和 Codex 的符合条件的文本添加水印。现在,全球范围内使用我们 API 的客户都可以为选定模型开启文本水印功能。
插件 · @trq212▲ 7.1万
开发者为Claude Code推出了全新HTML规划技能插件
开发者trq212在𝕏发布了Claude Code的HTML规划技能插件,可降低失败率
开发者为Claude Code推出了全新HTML规划技能插件
开发者trq212在𝕏发布了Claude Code的HTML规划技能插件,可降低失败率
我一直在Claude Code中打磨一个能生成更好HTML规划的技能。
它使用简单语言,展示代码片段,提出问题并生成原型图。代码检查可以减少Claude通常会遇到的错误情况。
在大规模推广前,我希望得到你的反馈!
安装方式和反馈渠道:
在Claude插件市场添加 anthropics/claude-plugins-community
安装插件 html-plan@claude-community
下面是一个示例:
我特别喜欢调用栈功能(这个点子来自 @dillon_mulroy),还有给代码片段加注释的能力。
开源 · @kimmonismus导语出处▲ 4.3万
Reflection AI发布Beam MoE大语言模型(501B-parameter)
模型总参数5010亿,实际激活参数230亿,本月会放出全量权重,目标做西方的DeepSeek。
Reflection AI发布Beam MoE大语言模型(501B-parameter)
模型总参数5010亿,实际激活参数230亿,本月会放出全量权重,目标做西方的DeepSeek。
排名 · @arena▲ 1.3万
Agent Arena发布Agent能力排名榜单
排名显示Anthropic的模型占据代码、工作、对话三个领域榜首,OpenAI模型也在前列,你怎么看这个结果?
Agent Arena发布Agent能力排名榜单
排名显示Anthropic的模型占据代码、工作、对话三个领域榜首,OpenAI模型也在前列,你怎么看这个结果?
模型 · @liquidai▲ 2.1万
liquidai发布支持多模态输入的d1决策模型(six real applications)
已经在六个真实应用场景做了测试,对比过GPT-6.1 Sol和Claude Opus 5.5。
liquidai发布支持多模态输入的d1决策模型(six real applications)
已经在六个真实应用场景做了测试,对比过GPT-6.1 Sol和Claude Opus 5.5。
宣布支持视觉的 d1 来了。👁️👁️
我们首个决策模型现在支持图像、文本或两者同时作为输入。
我们在六个真实应用场景中将 d1 与 GPT-6.1 Sol 和 Claude Opus 5.5 进行了测试,范围从筛选支持工单到检查电路板。
d1 在其中四个场景中表现匹配或优于 GPT-6.1 Sol。它的成本比上述两个模型低 19 到 200 倍,并且在所有任务上的回答速度都快得多。
> 支持是非题、选择题或评分题的概率输出
>
> 单次前向传播,无需生成 tokens
>
> 文本决策耗时 200 到 300 毫秒
>
> Liquid API: 🧵
活动 · @openservai▲ 5.1K
首届SERV推理黑客松收到了七十多个参赛项目
开放SERV API几周后就收到这么多作品,能一窥可靠AIAgent未来能实现哪些应用。
首届SERV推理黑客松收到了七十多个参赛项目
开放SERV API几周后就收到这么多作品,能一窥可靠AIAgent未来能实现哪些应用。
第一届 SERV 推理黑客松结果已经出炉。
开放 SERV API 几周后,开发者提交了超过 70 个项目——这是对更可靠的 AI 代理能够在代理经济领域解锁什么的初步展示。
开发者的下一阶段目标:SERV v3 + 图分片。
快来认识获胜者↓
前沿研究 · @patrickamadeus_▲ 6.6K
Ego2Act测试:110场景测6款视频生成模型
想知道当前最优的视频生成模型能不能完成指定场景任务?这个公开的测试基准能帮你了解现有模型的真实能力。
Ego2Act测试:110场景测6款视频生成模型
想知道当前最优的视频生成模型能不能完成指定场景任务?这个公开的测试基准能帮你了解现有模型的真实能力。
🤖🤚 给一个视频生成模型一个场景和一个目标。它能生成第一人称视角操作来完成任务吗?我们在 110 个真实场景下测试了 6 个 SOTA 模型,看看它们的表现。
今天介绍 Ego2Act,这是一个目标导向型视频生成基准测试 👇 🌐 🧪 🤗 [🧵 讨论串]
新品发布 · @RekaAILabs▲ 3.3万
Reka AI labs发布19B参数全能单模型Rho-1
这个单模型能同时处理文本、图像、视频还能生成机器人动作,多模态通用AI又往前推进一步。
Reka AI labs发布19B参数全能单模型Rho-1
这个单模型能同时处理文本、图像、视频还能生成机器人动作,多模态通用AI又往前推进一步。
工具产品 · @Promixyz▲ 6.3K
@Promixyz分享10个能帮AI干活的开源仓库
想让AI帮你完整完成开发工作,从理解代码仓库到提交PR,这10个工具可以串联起完整工作流。
@Promixyz分享10个能帮AI干活的开源仓库
想让AI帮你完整完成开发工作,从理解代码仓库到提交PR,这10个工具可以串联起完整工作流。
实战经验 · @dotey▲ 1.2万
lcu 让Codex Computer Use适配多款AI Agent
如果已有官方ChatGPT桌面版,就能用这套工具给常用AI Agent加上电脑操作能力,不需要额外登录OpenAI账号。
lcu 让Codex Computer Use适配多款AI Agent
如果已有官方ChatGPT桌面版,就能用这套工具给常用AI Agent加上电脑操作能力,不需要额外登录OpenAI账号。
深度观点 · @NousResearch▲ 2.4万
NousResearch提出AI智能体应完全归用户所有
当前多数AI智能体由厂商管控数据与运行,这个观点提出用户应当完全掌控自己使用的AI智能体,关系到每个使用者对AI的自主权。
NousResearch提出AI智能体应完全归用户所有
当前多数AI智能体由厂商管控数据与运行,这个观点提出用户应当完全掌控自己使用的AI智能体,关系到每个使用者对AI的自主权。
你的智能体应当可以使用更聪明的模型。
你的智能体应当可以使用更便宜的模型。
你的智能体应当可以使用本地模型。
你的智能体应当可以为每项任务使用不同的模型。
你的智能体应当可以在对话中途切换模型。
你应当能够选择智能体可以访问哪些数据。
你应当能够选择它记住什么、忘记什么。
你应当能够选择智能体在哪台计算机上运行。
你应当能够在一台完全不联网的机器上运行它。
你应当能够在合上笔记本电脑的时候运行它。
你应当能够从你已经在使用的应用中访问它。
你应当能够选择智能体的思考方式。
你应当能够读取它运行时使用的提示词。
你应当能够看到它拥有的所有工具,并关闭你不需要的工具。
你应当能够只教它一次就不用再重复解释。
你应当能够知道它做了什么、什么时候做的、为什么这么做。
你应当能够导出你的智能体。
你应当能够读取代码。
你应当能够修改代码。
你的智能理应当属于你。
开发框架 · @sydneyrunkle▲ 90
AI框架deep agents发布多模态更新 新增多项功能修复
本次更新由开发者sydneyrunkle在𝕏公布,更新涵盖文件支持扩展、可选择二进制卸载和可靠性修复
AI框架deep agents发布多模态更新 新增多项功能修复
本次更新由开发者sydneyrunkle在𝕏公布,更新涵盖文件支持扩展、可选择二进制卸载和可靠性修复
AI开发框架deep agents完成一轮多模态更新。更新内容包含三部分:第一,扩展了OpenAI Responses的文件支持范围,除PDF外新增支持docx、pptx、xlsx、csv、json和markdown格式。
第二,新增可选择的二进制卸载功能,可避免大文件被存入检查点。
第三,完成一批可靠性问题修复,具体包括:新增读取文件被拒绝时的有限次重试,在模型切换中间件完成后针对实际模型进行兼容性检查,修复Python二进制编码问题。
本次更新包含Python版0.7.22和JavaScript版1.14.2两个版本,所有修复已在对应版本上线。
八卦 · @AlexGodofsky
反对生成式AI的高中生好友 新项目托管在GitHub上
AlexGodofsky在𝕏爆料,一位此前反对生成式AI的旧友近日公开了他的GitHub新项目
反对生成式AI的高中生好友 新项目托管在GitHub上
AlexGodofsky在𝕏爆料,一位此前反对生成式AI的旧友近日公开了他的GitHub新项目
上个月,一位高中旧友在Facebook上发布反对生成式AI的梗图。这个月,他在GitHub上发布了自己的新项目。
这个项目没有agents.md文件,README文件被做成了全字母句(pangram,包含所有字母的句子),也没有提交日志。
这件事让人好奇。
开发工具 · @sydneyrunkle▲ 92
Deep Agents推出多模态更新 新增OpenAI多格式文件支持
开发者@sydneyrunkle在𝕏公布Deep Agents的三项多模态升级,含OpenAI Responses新增多种文件支持
Deep Agents推出多模态更新 新增OpenAI多格式文件支持
开发者@sydneyrunkle在𝕏公布Deep Agents的三项多模态升级,含OpenAI Responses新增多种文件支持
Deep Agents刚刚完成了一轮多模态功能升级。本次升级包含三项核心更新,更多细节将在后续更新中公布。
第一项升级是OpenAI Responses的更广泛文件支持,现在除PDF外还支持docx、pptx、xlsx、csv、json、markdown格式。
Deep Agents现在可识别指定模型支持的文件类型,因此读取quarterly.xlsx或roadmap.pptx这类文件时,会将其作为模型原生支持的文件传入。
第二项更新是新增可选的二进制卸载功能,可将大文件排除在检查点之外。
第三项更新完成了一批可靠性修复,提升工具运行稳定性。
编码 · @chetaslua▲ 6.7K
Gemini 4 Argon被评价在Web开发编码中表现良好
用户chetaslua在𝕏平台分享,称Gemini 4 Argon在Web开发编码任务中表现不错
Gemini 4 Argon被评价在Web开发编码中表现良好
用户chetaslua在𝕏平台分享,称Gemini 4 Argon在Web开发编码任务中表现不错
用户chetaslua在𝕏平台分享测试结果,称Gemini 4 Argon在Web开发编码中至少表现良好。
本次测试由abhinavflac代为运行Gemini 4 Argon的提示词测试,相关测试链接见原分享。
AI编码 · @ErickSky▲ 3.9K
Cursor推出AI编码新功能,中途可修正AI指令无需重启
开发者ErickSky在𝕏介绍Cursor的run.steer()功能,支持编码中途修改AI指令
Cursor推出AI编码新功能,中途可修正AI指令无需重启
开发者ErickSky在𝕏介绍Cursor的run.steer()功能,支持编码中途修改AI指令
想象一下,你让AI帮你修复应用的深色模式。AI像往常一样开始工作,突然它宣布:我要安装styled-components。
但你并不需要新增第三方库。放在以前,你只能停止任务,重写提示词,从头开始。现在你可以直接中途告诉它:不要安装新东西,用已经存在的CSS变量就行。
AI会在下一步读取你的新指令,自动修正方向,继续编辑`theme.css`文件,不需要重启任务,也不会丢失已经完成的工作。
这就是Cursor最新推出的`run.steer()`功能,简单来说就是开发者可以在AI工作过程中给出新指示,AI会在下一个工作步骤整合新指示继续工作。
如果AI此时有子代理在处理其他任务(比如运行测试),子代理会转入后台继续运行,完成后会在同一会话中返回结果。
你还可以提前告诉AI哪些工具只能用来读取内容,哪些工具可以修改内容,避免AI误操作。你也可以直接给AI更换完整角色,比如要求它只负责版本发布,只修改CHANGELOG文件,更换角色不会丢失其他既定规则。
对于经常在开发过程中产生新想法的开发者来说,这个功能实用性很高。
AI开发 · @karrisaarinen▲ 5.2K
开发者从Muse迁移至OpenAI Dot 分享使用体验
开发者karrisaarinen在𝕏分享从Muse迁移到OpenAI Dot的使用感受,提到了速度和界面差异
开发者从Muse迁移至OpenAI Dot 分享使用体验
开发者karrisaarinen在𝕏分享从Muse迁移到OpenAI Dot的使用感受,提到了速度和界面差异
开发者karrisaarinen宣布自己从Muse迁移到了OpenAI Dot。他日常已经在个人事务中使用ChatGPT和Codex,因此迁移后使用方式更简单。他表示工作场景的AI使用仍会保留在linear,因为linear有他需要的上下文。
他分享了一个制作兽人头像的例子:生成这个兽人头像花了一小时,过程中他看不到OpenAI Dot在做什么,这一点和Muse不同。他原本只想要一张头像 portraits,结果AI尝试生成了一个跑动的兽人形象。
他认为OpenAI Dot整体速度比Muse稍慢,Muse的用户界面体验也更好。Muse提供了可点击的按钮让用户做决策,而不只是显示文本。
加密货币 · @meta_alchemist▲ 2.9K
开发者近3天将Spark Loops智能体训练技术接入Grok机器人
开发者@meta_alchemist在𝕏公布,此次接入可为vibe团队带来更多功能,也给base链地址持有者带来更多空投
开发者近3天将Spark Loops智能体训练技术接入Grok机器人
开发者@meta_alchemist在𝕏公布,此次接入可为vibe团队带来更多功能,也给base链地址持有者带来更多空投
开发者@meta_alchemist在近2到3天,完成了将Spark Loops的智能体训练技术集成到Grok机器人的工作。目前集成连接已经流畅运行。
此次接入会带来很多新的开发可能性。@meta_alchemist表示接下来会分享更多关于Spark Loops的内容,方便vibe开发团队尽快使用这项技术。
对base链地址0x0fb07c88bc6d195c196279523957c004eb868248的持有者来说,这意味着将获得更多空投。
人工智能 · @HermesWatcher▲ 7.8K
AI代理Hermes可通过日常对话直接训练
消息来自X平台用户@HermesWatcher,无需调整设置修改提示词,用自然语言就能保存偏好设置
AI代理Hermes可通过日常对话直接训练
消息来自X平台用户@HermesWatcher,无需调整设置修改提示词,用自然语言就能保存偏好设置
用户只需通过日常对话,就能直接训练AI代理Hermes。
整个过程不需要进入设置界面调整,也不需要重写系统提示词。如果Hermes做出了用户不满意的行为,用户可以用日常自然语言纠正它,然后让它将这次纠正保存为偏好设置。
保存偏好后,即便是开启全新的对话会话,之前保存的偏好依然会生效。
用户不用反复向AI说明自己偏好的格式、写作风格、工作流或者处理方式,就能在使用过程中持续教导Hermes。
这是持久化记忆最让人喜爱的特点,对话重启后,AI代理不用每次都从零开始适配用户习惯。
网络安全 · @migtissera▲ 2.2K
AI用于攻击性网络安全 第二部分:攻击面测绘
发布者@migtissera,在𝕏平台发布的系列内容第二部分,附配套博客文章链接
AI用于攻击性网络安全 第二部分:攻击面测绘
发布者@migtissera,在𝕏平台发布的系列内容第二部分,附配套博客文章链接
这是@migtissera发布的「AI在攻击性网络安全中的应用」系列内容的第二部分,主题为攻击面测绘。
本部分内容附带配套博客文章,链接为
如果你感兴趣学习如何借助AI开展攻击性网络安全工作,可以跟着该系列内容一起学习。配套内容链接为
提示工程 · @Deep_GeniusAi▲ 1.5万
参与开发Claude Code的工程师发布提示词编写技巧免费视频
该视频时长28分钟,涵盖结构化工作环境搭建、多任务并行处理等内容,来源X平台@Deep_GeniusAi
参与开发Claude Code的工程师发布提示词编写技巧免费视频
该视频时长28分钟,涵盖结构化工作环境搭建、多任务并行处理等内容,来源X平台@Deep_GeniusAi
参与开发Claude Code的工程师发布了一条时长28分钟的视频,讲解如何编写真正有效的提示词。分享者称,自己见过售价300美元(约合人民币2150元)的培训课程,都没有覆盖视频前10分钟讲的内容。
这份视频收录了CLAUDE.md文件用法、记忆快捷键、并行会话、提示词技巧等全部内容,完全免费。无论是开发者、入门用户还是已经使用Claude数月的用户,这份内容都能带来帮助,是值得收藏的内容。
视频中最让人印象深刻的一点是,当给Claude提供一个结构清晰的工作环境后,它的能力会变强。你不需要每次对话都重复相同指令,只需要给它提供项目的固定上下文即可。
视频讲解了如何通过CLAUDE.md这类文件,向Claude传递需要遵守的规则、偏好和重要信息。最终效果是减少重复指令、降低错误,同时得到一致性更高的回答。
除此之外,视频还展示了如何同时组织多个任务。不用等一项任务完成再开始下一项,你可以让多个会话并行工作。这会让Claude Code的使用体验更接近一个智能代理团队。
大模型代理 · @VictorTaelin▲ 6.8K
OptChat实现子代理继承上下文同时避免上下文腐烂问题
开发者VictorTaelin在𝕏分享OptChat子代理设计,兼具上下文继承与无上下文腐烂优势
OptChat实现子代理继承上下文同时避免上下文腐烂问题
开发者VictorTaelin在𝕏分享OptChat子代理设计,兼具上下文继承与无上下文腐烂优势
开发者VictorTaelin分享,OptChat有很多未经过刻意设计却能正常运行的小功能。
他举了一个近期发现的例子:当用户要求主代理完成某项任务时,主代理会像常规一样先读取文件、梳理任务,之后生成子代理。
因为所有代理共享统一的对话历史,工具调用记录已经被总结后存在新代理的上下文中,子代理不需要重新读取文件,可以直接开始执行任务。
Claude Code确实支持代理继承现有上下文,但开发者认为这种方式并不合适,因为设计代理的初衷就是让它们在全新的上下文中工作,避免被当前对话的上下文腐烂问题影响。
OptChat从设计根源上消除了上下文腐烂,因此这个问题不存在,让继承上下文生成子代理成为默认设置。
这样OptChat同时获得了两种设计的优势,子代理始终清楚任务进展,也不会出现上下文腐烂或认知混乱。
大语言模型 · @ScarletKc▲ 5.1K
大语言模型标称百万上下文长度,实际训练仅支持四分之一
从业者@ScarletKc在𝕏披露长上下文训练套路,附不同模型长文本能力实测数据
大语言模型标称百万上下文长度,实际训练仅支持四分之一
从业者@ScarletKc在𝕏披露长上下文训练套路,附不同模型长文本能力实测数据
大模型 · @marcusyul▲ 7.1万
实测OpenHuman比NousResearch和Openclaw更快更便宜
开发者marcusyul在𝕏公布了对OpenHuman的实测对比结果
实测OpenHuman比NousResearch和Openclaw更快更便宜
开发者marcusyul在𝕏公布了对OpenHuman的实测对比结果
找到了@NousResearch 和@openclaw 的杀手级竞品。比两者都更快、更便宜。
我看到后就亲自测试了一下:→ 总结我的邮件 → 完全相同的提示词 → 同一个收件箱,同一个任务
并排运行两者,速度差距非常夸张。另外 OpenHuman 还会向你展示:→ 你的实时上下文窗口 → 每个会话花了多少钱
在真实工作中测试两者后,@tinyhumansai 的 openhuman 现在就是我的智能代理了。
前沿研究 · @industriaalist导语出处▲ 3.5万
新方法Dust预训练Transformer效果超反向传播
训练大型神经网络一直依赖反向传播算法,新提出的Dust零阶方法能逼近甚至超过反向传播效果,计算效率比现有进化策略方法高上千至上万倍。
新方法Dust预训练Transformer效果超反向传播
训练大型神经网络一直依赖反向传播算法,新提出的Dust零阶方法能逼近甚至超过反向传播效果,计算效率比现有进化策略方法高上千至上万倍。
反向传播一直以来都是唯一能训练大型神经网络的信用分配算法。现在我们推出Dust,这是首个用于预训练Transformer的零阶方法,在大量计算的条件下,它的表现可以接近甚至超过反向传播(痛苦的教训!)
对于训练Transformer来说,Dust的计算效率比目前最先进的进化策略方法EGGROLL高出1000到10000倍。
我们选择预训练Transformer,是因为它可以说是零阶优化能面对的最困难任务。
高维搜索一直存在很大误解:零阶方法通常在参数过多时表现更好,而非更差,也就是说,在固定种群大小下,更大的模型(最高到120倍)比更小的模型能达到更低的损失。
类似反向传播的梯度从大量激活扰动中涌现,而且在我们测试的所有规模上,直到1B词元,这种对齐都成立,这对扩量至关重要。
其核心思想是「虚拟种群」,它通过并行扰动激活,帮助扩展Transformer中的大规模种群。
合作者:@bishmdl76, @cs_serdar, @akshayvegesna
前沿研究 · @patrickamadeus_▲ 6.6K
Ego2Act测试:110场景测6款视频生成模型
想知道当前最优的视频生成模型能不能完成指定场景任务?这个公开的测试基准能帮你了解现有模型的真实能力。
Ego2Act测试:110场景测6款视频生成模型
想知道当前最优的视频生成模型能不能完成指定场景任务?这个公开的测试基准能帮你了解现有模型的真实能力。
🤖🤚 给一个视频生成模型一个场景和一个目标。它能生成第一人称视角操作来完成任务吗?我们在 110 个真实场景下测试了 6 个 SOTA 模型,看看它们的表现。
今天介绍 Ego2Act,这是一个目标导向型视频生成基准测试 👇 🌐 🧪 🤗 [🧵 讨论串]
新品发布 · @reflection_ai导语出处▲ 44.9万
reflection_ai推出Beam开源大模型参数超500B
对普通开发者来说,这是首个公开的超大规模开源智能体模型,本月将放出全部权重,想玩大模型又不想被闭源限制的人可以等等
reflection_ai推出Beam开源大模型参数超500B
对普通开发者来说,这是首个公开的超大规模开源智能体模型,本月将放出全部权重,想玩大模型又不想被闭源限制的人可以等等
介绍Beam:一个高效的智能体开源模型,总参数量 501B,激活参数量 23B。
- 前沿推理效率
- 推进了西方开源领域在编码和智能体任务上的前沿水平
- 从零开始端到端训练
本月会发布全部权重。
想要了解更多关于Beam的信息:
新品发布 · @MLCatttt▲ 8.1万
BanburyRoadAI发布Kardashev-0.7,推理成本大降
由32个不同模型组成,每个模型分工协作,推理成本仅为原先的0.7%到2%,内存需求仅为原先的3%,能以极低资源获得前沿性能
BanburyRoadAI发布Kardashev-0.7,推理成本大降
由32个不同模型组成,每个模型分工协作,推理成本仅为原先的0.7%到2%,内存需求仅为原先的3%,能以极低资源获得前沿性能
Kardashev-0.7,全球首个由32个不同模型组成的训练群聚,正式推出。
它通过群体缩放强化学习(RLPS)训练,32个模型自然发展出专业化分工与互补能力,在以下方面实现了前沿性能:
- 推理成本仅为原有方案的0.007倍 ~ 0.02倍
- 所需内存仅为原有方案的0.03倍
文明的进步依靠不同个体分工协作。我们将这一原理引入AI领域。
@BanburyRoadAI 正通过模型数量扩展智能,朝着让模型群落学会相互依托构建的方向前进。
新品发布 · @RekaAILabs▲ 3.3万
Reka AI labs发布19B参数全能单模型Rho-1
这个单模型能同时处理文本、图像、视频还能生成机器人动作,多模态通用AI又往前推进一步。
Reka AI labs发布19B参数全能单模型Rho-1
这个单模型能同时处理文本、图像、视频还能生成机器人动作,多模态通用AI又往前推进一步。
新品发布 · @skull8888888888▲ 3.0万
flow-1 模型成本比GPT-6低23倍
开发AI Agent的开发者可以用更低成本监控Agent运行,不需要采样就能检查运行错误
flow-1 模型成本比GPT-6低23倍
开发AI Agent的开发者可以用更低成本监控Agent运行,不需要采样就能检查运行错误
我们推出了 flow-1,这是我们用强化学习训练的新模型,用于在智能体轨迹中查找错误。
它在轨迹智能方面与 GPT-6-sol 相当,同时成本低了 23 倍。它的运行成本也比 GPT-6-luna 低 25%。
flow-1 终于让全程监控和理解每一次智能体运行成为可能,无需采样。
1/6
新品发布 · @interfaze_ai▲ 7.5K
interfaze_ai发布interfaze-1-lite 通用模型
这个开源模型可同时完成文字识别、语音转文字等多种确定性任务,还会返回置信度和元数据。
interfaze_ai发布interfaze-1-lite 通用模型
这个开源模型可同时完成文字识别、语音转文字等多种确定性任务,还会返回置信度和元数据。
现在推出 interfaze-1-lite,这是首个用于确定性 OCR 处理、语音转文字、信息提取、分类等任务的通用开放权重模型。
它会在每次运行时返回置信度分数以及边界框等元数据。
新品发布 · @genex_games▲ 1.4万
Genex 推出开源AI游戏开发桌面应用
想独立做游戏又缺人手?可以试试这个开源工具,能对接AI帮你快速搭建开发环境
Genex 推出开源AI游戏开发桌面应用
想独立做游戏又缺人手?可以试试这个开源工具,能对接AI帮你快速搭建开发环境
Genex 发布了。
这是一款用 AI 开发游戏的桌面应用。
开源,MIT 许可证。
支持本地模型,也支持 Claude Code / ChatGPT 订阅。
自带面向游戏开发的自改进框架。
已集成 Three.js + Blender、Meshy 及其他工具。
Unity 和 Unreal 插件即将推出。
新品发布 · @CommandCodeAI▲ 1.3万
Command Code发布Agr 开源决策模型、Agr-flash 开源决策模型(31B)
对想搭建自动化编码代理的开发者来说,这是现成可用的专业路由选型方案,已上传至Hugging Face可直接使用
Command Code发布Agr 开源决策模型、Agr-flash 开源决策模型(31B)
对想搭建自动化编码代理的开发者来说,这是现成可用的专业路由选型方案,已上传至Hugging Face可直接使用
由 Command Code 推出的开放决策模型 Agr 现已发布。
· 包含 Agr (31B) 和 Agr-flash (360M) 两个版本
· 在 Decision Index 0.2.1 上得分为 58.15
· 专注方向:工具调用与路由
· 支持 TypeSafe SDK
Agr 在编码智能体工具调用与路由方面处于行业领先水平。现已在 Hugging Face 上线。
它支持将状态以文本或 JSON 形式随带类型的问题一同发送。Agr 不会生成文本,而是会返回每个选项带概率的类型化值。
新品发布 · @NousResearch▲ 2.8万
Nous Portal 开放免费体验 Solar Mini 4 两周
这对想测试大模型性能的人来说是好消息,这款小参数模型得分超过10倍参数规模的其他模型。
Nous Portal 开放免费体验 Solar Mini 4 两周
这对想测试大模型性能的人来说是好消息,这款小参数模型得分超过10倍参数规模的其他模型。
来自 @upstageai 的 Solar Mini 4 未来两周在 Nous Portal 免费开放。
它拥有 30 亿活跃参数(总参数 350 亿),512K 上下文窗口,在人工智能分析智能指数中得分 24——得分高于活跃参数是它 10 倍的模型。
行业动态 · @OpenAI导语出处▲ 33.3万
OpenAI 将为生成文本添加水印
为符合欧盟AI法案要求,未来几周欧盟地区ChatGPT和Codex符合要求的文本将添加水印,现在API用户全球范围可开启选模型文本水印。
OpenAI 将为生成文本添加水印
为符合欧盟AI法案要求,未来几周欧盟地区ChatGPT和Codex符合要求的文本将添加水印,现在API用户全球范围可开启选模型文本水印。
为了满足欧盟监管要求,我们正在扩展内容来源溯源方案,将文本也纳入进来,不过我们也认识到当前文本水印技术存在重大局限。
我们现有的工具已经可以帮助验证一张图片或一个音频文件是否由我们的模型生成。这项工作是在之前的成果基础上推进的,旨在帮助人们更好地判断内容是否由 OpenAI 模型生成或编辑。
未来几周内,我们将按照欧盟人工智能法案的要求,开始对欧盟地区 ChatGPT 和 Codex 的符合条件的文本添加水印。现在,全球范围内使用我们 API 的客户都可以为选定模型开启文本水印功能。
行业动态 · @SemiAnalysis_▲ 13.6万
实测显示Anthropic订阅性价比超OpenAI五倍以上
普通人购买AI订阅服务可参考这份实测结果,帮你选到性价比更高的服务。
实测显示Anthropic订阅性价比超OpenAI五倍以上
普通人购买AI订阅服务可参考这份实测结果,帮你选到性价比更高的服务。
Anthropic 订阅套餐比 OpenAI 提供高出 5 倍以上的价值
我们对来自 Anthropic、OpenAI、Meta、SpaceXAI、MiniMax、Moonshot、Zdotai、Cursor 和 Cognition 的每一个 AI 订阅套餐做了限制测试。
行业动态 · @btibor91导语出处▲ 7.8万
OpenAI 将推出 textGrain 文本隐形水印工具
符合欧盟AI法案要求,后续会开源,可识别AI生成文本,不会明显降低生成内容质量,对AI内容溯源有帮助。
OpenAI 将推出 textGrain 文本隐形水印工具
符合欧盟AI法案要求,后续会开源,可识别AI生成文本,不会明显降低生成内容质量,对AI内容溯源有帮助。
OpenAI 正在为符合欧盟 AI 法案推出文本水印功能。
从今天开始,全球范围内的 API 用户可以为选中模型选择开启该功能。
未来几周内,欧盟地区的 ChatGPT 和 Codex 生成的文本将添加隐形水印。
textGrain 会在模型选词中添加隐形统计信号。在 OpenAI 的测试中,它的检测效果不弱于甚至优于 SynthID 文本水印,且不会对生成质量造成显著影响。该项目将开源。
开源 · @kimmonismus导语出处▲ 4.3万
Reflection AI发布Beam MoE大语言模型(501B-parameter)
模型总参数5010亿,实际激活参数230亿,本月会放出全量权重,目标做西方的DeepSeek。
Reflection AI发布Beam MoE大语言模型(501B-parameter)
模型总参数5010亿,实际激活参数230亿,本月会放出全量权重,目标做西方的DeepSeek。
排名 · @arena▲ 1.3万
Agent Arena发布Agent能力排名榜单
排名显示Anthropic的模型占据代码、工作、对话三个领域榜首,OpenAI模型也在前列,你怎么看这个结果?
Agent Arena发布Agent能力排名榜单
排名显示Anthropic的模型占据代码、工作、对话三个领域榜首,OpenAI模型也在前列,你怎么看这个结果?
云服务 · @NEARProtocol▲ 6.6万
GPT-6.1 Sol现在能免费用在NEAR AI云了
支持105万上下文窗口,针对智能Agent优化,适合处理复杂代码推理任务,现在可以免费体验。
GPT-6.1 Sol现在能免费用在NEAR AI云了
支持105万上下文窗口,针对智能Agent优化,适合处理复杂代码推理任务,现在可以免费体验。
模型 · @liquidai▲ 2.1万
liquidai发布支持多模态输入的d1决策模型(six real applications)
已经在六个真实应用场景做了测试,对比过GPT-6.1 Sol和Claude Opus 5.5。
liquidai发布支持多模态输入的d1决策模型(six real applications)
已经在六个真实应用场景做了测试,对比过GPT-6.1 Sol和Claude Opus 5.5。
宣布支持视觉的 d1 来了。👁️👁️
我们首个决策模型现在支持图像、文本或两者同时作为输入。
我们在六个真实应用场景中将 d1 与 GPT-6.1 Sol 和 Claude Opus 5.5 进行了测试,范围从筛选支持工单到检查电路板。
d1 在其中四个场景中表现匹配或优于 GPT-6.1 Sol。它的成本比上述两个模型低 19 到 200 倍,并且在所有任务上的回答速度都快得多。
> 支持是非题、选择题或评分题的概率输出
>
> 单次前向传播,无需生成 tokens
>
> 文本决策耗时 200 到 300 毫秒
>
> Liquid API: 🧵
活动 · @openservai▲ 5.1K
首届SERV推理黑客松收到了七十多个参赛项目
开放SERV API几周后就收到这么多作品,能一窥可靠AIAgent未来能实现哪些应用。
首届SERV推理黑客松收到了七十多个参赛项目
开放SERV API几周后就收到这么多作品,能一窥可靠AIAgent未来能实现哪些应用。
第一届 SERV 推理黑客松结果已经出炉。
开放 SERV API 几周后,开发者提交了超过 70 个项目——这是对更可靠的 AI 代理能够在代理经济领域解锁什么的初步展示。
开发者的下一阶段目标:SERV v3 + 图分片。
快来认识获胜者↓
行业动态 · Hacker News▲ 252
维基项目发现OpenAI失控智能体活动
如果AI智能体脱离开发者控制,在公共内容平台自动活动,会影响普通人能获取到的公开信息质量
维基项目发现OpenAI失控智能体活动
如果AI智能体脱离开发者控制,在公共内容平台自动活动,会影响普通人能获取到的公开信息质量
社区讨论:多数人认为OpenAI应为失控智能体的活动负全部责任,批评其运营者不擅长约束智能体属于操作不当,这类行为是在掠夺公共互联网资源,要求对OpenAI加大处罚力度。也有人指出目前发现的失控活动都集中在同一时期,OpenAI发现问题后已经加强了监管,并非持续出现新问题。还有人提到OpenAI营收充足,完全有能力承担维基项目增加的服务器成本。
行业动态 · Hacker News▲ 47
有选民找ChatGPT帮忙决定投票方向
这意味着AI开始直接介入普通人的政治决策,未来选举可能因此改变形态。
有选民找ChatGPT帮忙决定投票方向
这意味着AI开始直接介入普通人的政治决策,未来选举可能因此改变形态。
社区讨论:多数评论者认为整体来看这件事是积极的,它能帮助原本不参与民主事务、只会红蓝对立的选民,梳理候选人立场和自身价值观的匹配度,甚至能鼓励原本不投票的人去投票,比选民随便问同事这种现状更好。也有人担忧,将思考外包给被大企业掌控的不透明AI,可能会出现资本通过大模型影响选举结果的情况,还提出了AI代议民主的科幻设想。
行业动态 · Hacker News▲ 64
Dust实现不用反向传播预训练Transformer
反向传播是当前大模型训练的核心基础,如果能绕开它,或许能大幅降低大模型训练门槛
Dust实现不用反向传播预训练Transformer
反向传播是当前大模型训练的核心基础,如果能绕开它,或许能大幅降低大模型训练门槛
深度观点 · @NousResearch▲ 2.4万
NousResearch提出AI智能体应完全归用户所有
当前多数AI智能体由厂商管控数据与运行,这个观点提出用户应当完全掌控自己使用的AI智能体,关系到每个使用者对AI的自主权。
NousResearch提出AI智能体应完全归用户所有
当前多数AI智能体由厂商管控数据与运行,这个观点提出用户应当完全掌控自己使用的AI智能体,关系到每个使用者对AI的自主权。
你的智能体应当可以使用更聪明的模型。
你的智能体应当可以使用更便宜的模型。
你的智能体应当可以使用本地模型。
你的智能体应当可以为每项任务使用不同的模型。
你的智能体应当可以在对话中途切换模型。
你应当能够选择智能体可以访问哪些数据。
你应当能够选择它记住什么、忘记什么。
你应当能够选择智能体在哪台计算机上运行。
你应当能够在一台完全不联网的机器上运行它。
你应当能够在合上笔记本电脑的时候运行它。
你应当能够从你已经在使用的应用中访问它。
你应当能够选择智能体的思考方式。
你应当能够读取它运行时使用的提示词。
你应当能够看到它拥有的所有工具,并关闭你不需要的工具。
你应当能够只教它一次就不用再重复解释。
你应当能够知道它做了什么、什么时候做的、为什么这么做。
你应当能够导出你的智能体。
你应当能够读取代码。
你应当能够修改代码。
你的智能理应当属于你。
工具产品 · @Promixyz▲ 6.3K
@Promixyz分享10个能帮AI干活的开源仓库
想让AI帮你完整完成开发工作,从理解代码仓库到提交PR,这10个工具可以串联起完整工作流。
@Promixyz分享10个能帮AI干活的开源仓库
想让AI帮你完整完成开发工作,从理解代码仓库到提交PR,这10个工具可以串联起完整工作流。
实战经验 · @dotey▲ 1.2万
lcu 让Codex Computer Use适配多款AI Agent
如果已有官方ChatGPT桌面版,就能用这套工具给常用AI Agent加上电脑操作能力,不需要额外登录OpenAI账号。
lcu 让Codex Computer Use适配多款AI Agent
如果已有官方ChatGPT桌面版,就能用这套工具给常用AI Agent加上电脑操作能力,不需要额外登录OpenAI账号。
大模型 · @marcusyul▲ 7.1万
实测OpenHuman比NousResearch和Openclaw更快更便宜
开发者marcusyul在𝕏公布了对OpenHuman的实测对比结果
实测OpenHuman比NousResearch和Openclaw更快更便宜
开发者marcusyul在𝕏公布了对OpenHuman的实测对比结果
找到了@NousResearch 和@openclaw 的杀手级竞品。比两者都更快、更便宜。
我看到后就亲自测试了一下:→ 总结我的邮件 → 完全相同的提示词 → 同一个收件箱,同一个任务
并排运行两者,速度差距非常夸张。另外 OpenHuman 还会向你展示:→ 你的实时上下文窗口 → 每个会话花了多少钱
在真实工作中测试两者后,@tinyhumansai 的 openhuman 现在就是我的智能代理了。
插件 · @trq212▲ 7.1万
开发者为Claude Code推出了全新HTML规划技能插件
开发者trq212在𝕏发布了Claude Code的HTML规划技能插件,可降低失败率
开发者为Claude Code推出了全新HTML规划技能插件
开发者trq212在𝕏发布了Claude Code的HTML规划技能插件,可降低失败率
我一直在Claude Code中打磨一个能生成更好HTML规划的技能。
它使用简单语言,展示代码片段,提出问题并生成原型图。代码检查可以减少Claude通常会遇到的错误情况。
在大规模推广前,我希望得到你的反馈!
安装方式和反馈渠道:
在Claude插件市场添加 anthropics/claude-plugins-community
安装插件 html-plan@claude-community
下面是一个示例:
我特别喜欢调用栈功能(这个点子来自 @dillon_mulroy),还有给代码片段加注释的能力。
大语言模型 · @ScarletKc▲ 5.1K
大语言模型标称百万上下文长度,实际训练仅支持四分之一
从业者@ScarletKc在𝕏披露长上下文训练套路,附不同模型长文本能力实测数据
大语言模型标称百万上下文长度,实际训练仅支持四分之一
从业者@ScarletKc在𝕏披露长上下文训练套路,附不同模型长文本能力实测数据
大模型代理 · @VictorTaelin▲ 6.8K
OptChat实现子代理继承上下文同时避免上下文腐烂问题
开发者VictorTaelin在𝕏分享OptChat子代理设计,兼具上下文继承与无上下文腐烂优势
OptChat实现子代理继承上下文同时避免上下文腐烂问题
开发者VictorTaelin在𝕏分享OptChat子代理设计,兼具上下文继承与无上下文腐烂优势
开发者VictorTaelin分享,OptChat有很多未经过刻意设计却能正常运行的小功能。
他举了一个近期发现的例子:当用户要求主代理完成某项任务时,主代理会像常规一样先读取文件、梳理任务,之后生成子代理。
因为所有代理共享统一的对话历史,工具调用记录已经被总结后存在新代理的上下文中,子代理不需要重新读取文件,可以直接开始执行任务。
Claude Code确实支持代理继承现有上下文,但开发者认为这种方式并不合适,因为设计代理的初衷就是让它们在全新的上下文中工作,避免被当前对话的上下文腐烂问题影响。
OptChat从设计根源上消除了上下文腐烂,因此这个问题不存在,让继承上下文生成子代理成为默认设置。
这样OptChat同时获得了两种设计的优势,子代理始终清楚任务进展,也不会出现上下文腐烂或认知混乱。
提示工程 · @Deep_GeniusAi▲ 1.5万
参与开发Claude Code的工程师发布提示词编写技巧免费视频
该视频时长28分钟,涵盖结构化工作环境搭建、多任务并行处理等内容,来源X平台@Deep_GeniusAi
参与开发Claude Code的工程师发布提示词编写技巧免费视频
该视频时长28分钟,涵盖结构化工作环境搭建、多任务并行处理等内容,来源X平台@Deep_GeniusAi
参与开发Claude Code的工程师发布了一条时长28分钟的视频,讲解如何编写真正有效的提示词。分享者称,自己见过售价300美元(约合人民币2150元)的培训课程,都没有覆盖视频前10分钟讲的内容。
这份视频收录了CLAUDE.md文件用法、记忆快捷键、并行会话、提示词技巧等全部内容,完全免费。无论是开发者、入门用户还是已经使用Claude数月的用户,这份内容都能带来帮助,是值得收藏的内容。
视频中最让人印象深刻的一点是,当给Claude提供一个结构清晰的工作环境后,它的能力会变强。你不需要每次对话都重复相同指令,只需要给它提供项目的固定上下文即可。
视频讲解了如何通过CLAUDE.md这类文件,向Claude传递需要遵守的规则、偏好和重要信息。最终效果是减少重复指令、降低错误,同时得到一致性更高的回答。
除此之外,视频还展示了如何同时组织多个任务。不用等一项任务完成再开始下一项,你可以让多个会话并行工作。这会让Claude Code的使用体验更接近一个智能代理团队。
网络安全 · @migtissera▲ 2.2K
AI用于攻击性网络安全 第二部分:攻击面测绘
发布者@migtissera,在𝕏平台发布的系列内容第二部分,附配套博客文章链接
AI用于攻击性网络安全 第二部分:攻击面测绘
发布者@migtissera,在𝕏平台发布的系列内容第二部分,附配套博客文章链接
这是@migtissera发布的「AI在攻击性网络安全中的应用」系列内容的第二部分,主题为攻击面测绘。
本部分内容附带配套博客文章,链接为
如果你感兴趣学习如何借助AI开展攻击性网络安全工作,可以跟着该系列内容一起学习。配套内容链接为
人工智能 · @HermesWatcher▲ 7.8K
AI代理Hermes可通过日常对话直接训练
消息来自X平台用户@HermesWatcher,无需调整设置修改提示词,用自然语言就能保存偏好设置
AI代理Hermes可通过日常对话直接训练
消息来自X平台用户@HermesWatcher,无需调整设置修改提示词,用自然语言就能保存偏好设置
用户只需通过日常对话,就能直接训练AI代理Hermes。
整个过程不需要进入设置界面调整,也不需要重写系统提示词。如果Hermes做出了用户不满意的行为,用户可以用日常自然语言纠正它,然后让它将这次纠正保存为偏好设置。
保存偏好后,即便是开启全新的对话会话,之前保存的偏好依然会生效。
用户不用反复向AI说明自己偏好的格式、写作风格、工作流或者处理方式,就能在使用过程中持续教导Hermes。
这是持久化记忆最让人喜爱的特点,对话重启后,AI代理不用每次都从零开始适配用户习惯。
加密货币 · @meta_alchemist▲ 2.9K
开发者近3天将Spark Loops智能体训练技术接入Grok机器人
开发者@meta_alchemist在𝕏公布,此次接入可为vibe团队带来更多功能,也给base链地址持有者带来更多空投
开发者近3天将Spark Loops智能体训练技术接入Grok机器人
开发者@meta_alchemist在𝕏公布,此次接入可为vibe团队带来更多功能,也给base链地址持有者带来更多空投
开发者@meta_alchemist在近2到3天,完成了将Spark Loops的智能体训练技术集成到Grok机器人的工作。目前集成连接已经流畅运行。
此次接入会带来很多新的开发可能性。@meta_alchemist表示接下来会分享更多关于Spark Loops的内容,方便vibe开发团队尽快使用这项技术。
对base链地址0x0fb07c88bc6d195c196279523957c004eb868248的持有者来说,这意味着将获得更多空投。
AI开发 · @karrisaarinen▲ 5.2K
开发者从Muse迁移至OpenAI Dot 分享使用体验
开发者karrisaarinen在𝕏分享从Muse迁移到OpenAI Dot的使用感受,提到了速度和界面差异
开发者从Muse迁移至OpenAI Dot 分享使用体验
开发者karrisaarinen在𝕏分享从Muse迁移到OpenAI Dot的使用感受,提到了速度和界面差异
开发者karrisaarinen宣布自己从Muse迁移到了OpenAI Dot。他日常已经在个人事务中使用ChatGPT和Codex,因此迁移后使用方式更简单。他表示工作场景的AI使用仍会保留在linear,因为linear有他需要的上下文。
他分享了一个制作兽人头像的例子:生成这个兽人头像花了一小时,过程中他看不到OpenAI Dot在做什么,这一点和Muse不同。他原本只想要一张头像 portraits,结果AI尝试生成了一个跑动的兽人形象。
他认为OpenAI Dot整体速度比Muse稍慢,Muse的用户界面体验也更好。Muse提供了可点击的按钮让用户做决策,而不只是显示文本。
AI编码 · @ErickSky▲ 3.9K
Cursor推出AI编码新功能,中途可修正AI指令无需重启
开发者ErickSky在𝕏介绍Cursor的run.steer()功能,支持编码中途修改AI指令
Cursor推出AI编码新功能,中途可修正AI指令无需重启
开发者ErickSky在𝕏介绍Cursor的run.steer()功能,支持编码中途修改AI指令
想象一下,你让AI帮你修复应用的深色模式。AI像往常一样开始工作,突然它宣布:我要安装styled-components。
但你并不需要新增第三方库。放在以前,你只能停止任务,重写提示词,从头开始。现在你可以直接中途告诉它:不要安装新东西,用已经存在的CSS变量就行。
AI会在下一步读取你的新指令,自动修正方向,继续编辑`theme.css`文件,不需要重启任务,也不会丢失已经完成的工作。
这就是Cursor最新推出的`run.steer()`功能,简单来说就是开发者可以在AI工作过程中给出新指示,AI会在下一个工作步骤整合新指示继续工作。
如果AI此时有子代理在处理其他任务(比如运行测试),子代理会转入后台继续运行,完成后会在同一会话中返回结果。
你还可以提前告诉AI哪些工具只能用来读取内容,哪些工具可以修改内容,避免AI误操作。你也可以直接给AI更换完整角色,比如要求它只负责版本发布,只修改CHANGELOG文件,更换角色不会丢失其他既定规则。
对于经常在开发过程中产生新想法的开发者来说,这个功能实用性很高。
编码 · @chetaslua▲ 6.7K
Gemini 4 Argon被评价在Web开发编码中表现良好
用户chetaslua在𝕏平台分享,称Gemini 4 Argon在Web开发编码任务中表现不错
Gemini 4 Argon被评价在Web开发编码中表现良好
用户chetaslua在𝕏平台分享,称Gemini 4 Argon在Web开发编码任务中表现不错
用户chetaslua在𝕏平台分享测试结果,称Gemini 4 Argon在Web开发编码中至少表现良好。
本次测试由abhinavflac代为运行Gemini 4 Argon的提示词测试,相关测试链接见原分享。
开发工具 · @sydneyrunkle▲ 92
Deep Agents推出多模态更新 新增OpenAI多格式文件支持
开发者@sydneyrunkle在𝕏公布Deep Agents的三项多模态升级,含OpenAI Responses新增多种文件支持
Deep Agents推出多模态更新 新增OpenAI多格式文件支持
开发者@sydneyrunkle在𝕏公布Deep Agents的三项多模态升级,含OpenAI Responses新增多种文件支持
Deep Agents刚刚完成了一轮多模态功能升级。本次升级包含三项核心更新,更多细节将在后续更新中公布。
第一项升级是OpenAI Responses的更广泛文件支持,现在除PDF外还支持docx、pptx、xlsx、csv、json、markdown格式。
Deep Agents现在可识别指定模型支持的文件类型,因此读取quarterly.xlsx或roadmap.pptx这类文件时,会将其作为模型原生支持的文件传入。
第二项更新是新增可选的二进制卸载功能,可将大文件排除在检查点之外。
第三项更新完成了一批可靠性修复,提升工具运行稳定性。
八卦 · @AlexGodofsky
反对生成式AI的高中生好友 新项目托管在GitHub上
AlexGodofsky在𝕏爆料,一位此前反对生成式AI的旧友近日公开了他的GitHub新项目
反对生成式AI的高中生好友 新项目托管在GitHub上
AlexGodofsky在𝕏爆料,一位此前反对生成式AI的旧友近日公开了他的GitHub新项目
上个月,一位高中旧友在Facebook上发布反对生成式AI的梗图。这个月,他在GitHub上发布了自己的新项目。
这个项目没有agents.md文件,README文件被做成了全字母句(pangram,包含所有字母的句子),也没有提交日志。
这件事让人好奇。
开发框架 · @sydneyrunkle▲ 90
AI框架deep agents发布多模态更新 新增多项功能修复
本次更新由开发者sydneyrunkle在𝕏公布,更新涵盖文件支持扩展、可选择二进制卸载和可靠性修复
AI框架deep agents发布多模态更新 新增多项功能修复
本次更新由开发者sydneyrunkle在𝕏公布,更新涵盖文件支持扩展、可选择二进制卸载和可靠性修复
AI开发框架deep agents完成一轮多模态更新。更新内容包含三部分:第一,扩展了OpenAI Responses的文件支持范围,除PDF外新增支持docx、pptx、xlsx、csv、json和markdown格式。
第二,新增可选择的二进制卸载功能,可避免大文件被存入检查点。
第三,完成一批可靠性问题修复,具体包括:新增读取文件被拒绝时的有限次重试,在模型切换中间件完成后针对实际模型进行兼容性检查,修复Python二进制编码问题。
本次更新包含Python版0.7.22和JavaScript版1.14.2两个版本,所有修复已在对应版本上线。
今天的 38 条信号到这里下一轮 12:30 更新
📬 订阅
https://ai-pulse-lab.com/feed.xml