社区讨论:部分开发者认为OpenAI分心做ChatGPT新站点这类功能,分散了做大模型本身的精力,现有网站生成工具已经很多,该功能并非必需。也有开发者认为这个功能被低估,能快速生成可用原型,很实用。有人指出该功能会挤压网页设计师等行业的生存空间,还有开发者质疑OpenAI进入应用层会抢现有客户的生意,也有人发现部分演示站点存在质量粗糙的问题。
今天发生了什么1 分钟读懂
Anthropic 工程师公开了自家 agent 架构:不再写 prompt,改写循环,错误减少 97%。拆开看,当下热门的智能体也大抵如此——不断把执行结果丢回大模型,直到任务完成为止。
来源@huxlab「Anthropic Claude团队已不写prompt,改写循环」@antiAIvo「你追捧的AI智能体,本质就是几行循环代码」
AI 开始以「共同作者」的身份进入学术论文。Meta AI 发布六篇合作研究论文,逐段标注人类或 AI 撰写;哈佛大学物理学家 Matthew Schwartz 也发布 36 篇 AI 深度参与的联名论文。作者栏里 AI 的影子正在变实。
来源@AIatMeta「Meta AI发布六篇合作研究论文(六)」xqcgrek2「哈佛大学物理学家Matthew Schwartz发布36篇联合署名论文(36)」
GPT-6 Astra 首次通过 agent-wow 进入《魔兽世界》,AI 开始端到端操控游戏。另一件是 Trillium Labs 成立,一家专注前沿 AI 开放科学的非营利机构。
来源almostlit「GPT-6 Astra首次通过agent-wow玩魔兽世界」@natolambert「Trillium Labs 成立 推动前沿AI开放科学」
02 @allen_ai 发布 AstaBrief 8B 本地可跑的开源模型 可以本地硬件运行,权重和训练数据完全开放,可以基于它二次开发。能自动整理文献,生成带引用的研究报告,省去手动整理的时间。
介绍 AstaBrief 8B,这是一个可以把复杂研究问题和文献节选转换为带引用报告的开源模型。 你可以在自己的硬件本地运行它,它提供开放权重和训练数据,你可以检查这些内容并在此基础上进行二次开发。 下载:
03 DeepSeek AI 发布 DeepSeekHarness 多平台桌面版 macOS和Windows用户可直接下载打包好的版本使用,Linux用户可以从npm获取安装包。
来看看 @DeepSeekHarness。 我们刚刚发布了适用于macOS和Windows的打包桌面版;Linux用户可以从npm上的 @deepseek-ai/dsh 包获取。
04 Redis创作者发布ds4工具 普通用户不用云端就能运行大语言模型,本地部署门槛降低,隐私性更好
社区讨论:有人好奇为什么Redis作者选择用C而非Rust开发这个工具,有人询问它和其他大语言模型运行器有什么区别,还有开发者指出目前ds4量化 checkpoint效果不佳。
今日焦点
Airbnb CEO:AI代理订房体验差,根子是缺AI操作系统
Airbnb本周推出新的AI搜索功能,属于秋季更新的一部分。CEO布莱恩·切斯基(Brian Chesky)同时给聊天机器人泼了冷水。他说,它不适合浏览或购物:一次只给几个选项,要拿到结果得来回聊很多轮。
切斯基没打算让当前版本当终点。他预想的未来界面,会落在聊天机器人和现在这个版本之间。旅行研究显示,规划旅行和期待旅行带来的乐趣,比旅行本身还多。
聊天界面装不下一群人的旅行
深度阅读
🔥 信号雷达36 条
𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)
行业动态 · Hacker News▲ 183
开发者讨论ChatGPT新站点功能
若讨论属实,ChatGPT将新增可直接访问站点的功能,直接影响日常使用ChatGPT的体验。
开发者讨论ChatGPT新站点功能
若讨论属实,ChatGPT将新增可直接访问站点的功能,直接影响日常使用ChatGPT的体验。
行业动态 · Hacker News导语出处▲ 69
GPT-6 Astra首次通过agent-wow玩魔兽世界
AI大模型开始尝试操作电子游戏,想玩AI操控的魔兽世界,可以关注这个工具后续进展
GPT-6 Astra首次通过agent-wow玩魔兽世界
AI大模型开始尝试操作电子游戏,想玩AI操控的魔兽世界,可以关注这个工具后续进展
社区讨论:多数人认同AI玩家能丰富游戏体验,有人提到如果游戏里有AI战争编队、互动性更强的世界BOSS,能打造更丰富的游戏世界,还能让已经冷清的老游戏重获活力。也有人调侃,想让AI帮自己做工作交税,自己安心玩魔兽。有人指出魔兽的自动机器人协议二十多年前就已经研究成熟并公开了,还有人好奇本次实验是否真的完成了新手区所有任务,也有人调侃暴雪一直抓不住机器人。
有人疑惑本次实验需要为大模型定制交互代码,是否说明通用模型落地始终需要定制开发。还有人好奇这会对灰色的金币产业产生什么影响。
新品发布 · @karrisaarinen▲ 1.4万
Linear推出面向产品团队的云编码工作空间
无需额外购买平台或聘请AI工程师,在Linear或Slack里即可调用自动编码代理处理任务,仅按公开API费率收费。
Linear推出面向产品团队的云编码工作空间
无需额外购买平台或聘请AI工程师,在Linear或Slack里即可调用自动编码代理处理任务,仅按公开API费率收费。
我们一直在悄悄将 @linear 打造为面向产品团队的最佳云编码工作区。
它可以配合 OA/Ant/开源工具链使用,自带自动模型路由,并且直接连接产品、你的团队、客户上下文,以及 AI 代码评审界面。
借助 Looms,你可以运行自动化工作流,按触发条件或计划修复漏洞、编写文档、清理代码等等。
你不需要购买单独的平台,也不需要专门的 AI 工程师,只需要在 Linear 或者 Slack 里使用编码代理就可以了。
你现在就能开始使用,只需要在你的工作区开启代码访问和编码会话功能。然后在 Linear 里分配任务,或者直接在 Slack 里说“@linear 请修复这个问题”。
没有平台费用、没有入门引导费用、也不对 token 加价。你只需要按照公开的 API 费率支付 token 费用和沙箱分钟费用。(即将支持用 ChatGPT 登录)
行业动态 · Hacker News导语出处▲ 47
哈佛大学物理学家Matthew Schwartz发布36篇联合署名论文(36)
AI已深入参与顶尖学术研究产出,关注AI对学术创作模式带来的改变。
哈佛大学物理学家Matthew Schwartz发布36篇联合署名论文(36)
AI已深入参与顶尖学术研究产出,关注AI对学术创作模式带来的改变。
社区讨论:不少网友调侃,这肯定是今年的论文发表配额完成了,也有人调侃如果哈佛物理学家真懂业务,Claude就相当于一群便宜高效的本科生干活。有人指出当下科研圈本身就存在验证、重复旧结果没人看重,错误结果容易发表的问题,AI会加剧这类问题。也有人认为,如果AI能搞定简单的发论文问题,人类就能去研究真正重要的问题了,还有网友调侃很多Reddit用户总觉得自己比哈佛教授还懂,上来就直接否定人家。
行业动态 · Hacker News▲ 63
leopoldj称大语言模型不具备推理能力
这个观点在Hacker News引发大量讨论,能帮你重新认识当前大语言模型的能力边界
leopoldj称大语言模型不具备推理能力
这个观点在Hacker News引发大量讨论,能帮你重新认识当前大语言模型的能力边界
社区讨论:多数认同大语言模型本质是 next token 预测引擎,推理只是规则衍生出的涌现现象,并非内置独立推理模块。有人指出人类本身也会脑补不存在的推理,误将语言模型的输出效果认作其具备推理能力。有人提出可以通过提示词工程,让大语言模型以分步迭代的方式弥补推理缺陷,还有人认为不需要推理也能解决复杂问题,争论点集中在推理是否需要独立模块实现。
前沿研究 · @wen_kaiyue▲ 8.6K
@wen_kaiyue发布Actor-Critic with Action Chunking (AC2) 研究
目前训练大语言模型的强化学习流程需要完整采样,新方法通过改进评价器只需部分采样,训练速度更快
@wen_kaiyue发布Actor-Critic with Action Chunking (AC2) 研究
目前训练大语言模型的强化学习流程需要完整采样,新方法通过改进评价器只需部分采样,训练速度更快
你真的需要在大语言模型的强化学习中完成每一轮推演吗?如果你改进了评估网络(critic)并且信任它,就不需要!
我们提出了带动作分块的演员-评论家算法(Actor-Critic with Action Chunking, AC2):用训练好的评估网络给成块的token打分,只需要部分推演,训练速度比GRPO更快!
新品发布 · @natolambert导语出处▲ 4.9万
Trillium Labs 成立 推动前沿AI开放科学
目前AI发展越来越封闭,这个新非营利机构希望聚集更多人用科学方法解决前沿AI难题,现在正在招人筹款找算力。
Trillium Labs 成立 推动前沿AI开放科学
目前AI发展越来越封闭,这个新非营利机构希望聚集更多人用科学方法解决前沿AI难题,现在正在招人筹款找算力。
行业动态 · @gabegreenberg▲ 14.5万
g2i.ai高薪远程招聘50名软件工程师
时薪200-300美元,远程办公,但是工作难度高且枯燥。想找高薪AI相关工作可以投递应聘。
g2i.ai高薪远程招聘50名软件工程师
时薪200-300美元,远程办公,但是工作难度高且枯燥。想找高薪AI相关工作可以投递应聘。
我本月要招聘50名资深软件工程师加入我们在g2i.ai的团队。
你将和顶尖前沿实验室合作,完成评估工作以及创建数据集。时薪200-300美元,远程办公。
这份工作并不轻松,而且很枯燥,但薪资丰厚。
申请链接:https://jobs.ashbyhq.com/g2i/becdfa73-ad7f-4920-8456-808cef38ff5d
前沿研究 · @AIatMeta导语出处▲ 3.0万
Meta AI发布六篇合作研究论文(六)
这次AI不只是辅助计算,而是全程参与论文撰写,每段都会标注人类或AI撰写,帮研究人员真正推进未知问题。
Meta AI发布六篇合作研究论文(六)
这次AI不只是辅助计算,而是全程参与论文撰写,每段都会标注人类或AI撰写,帮研究人员真正推进未知问题。
在我们的AI模型在数学、物理和化学五项竞赛中取得金牌级表现后,我们提出了一个更难的问题:当一个问题是真正开放的、不存在现有解题路径时,AI能做出贡献吗?
过去几个月里,数学家通过常规聊天界面,在没有定制研究框架的情况下,使用Thinking Mode的Muse Spark 1.1和Muse Spark 1.2,来寻找这类问题的解答。
我们的目标不是批量生产论文,而是赋能研究者。每一次合作都遵循相同的原则:数学家主导研究,另一组数学家随后审核工作,每篇论文都会标注哪些段落主要由人类或AI起草,并且都会标注它所基于的先前研究。如果其他团队独立发表了相同问题的解答,我们也会对他们的工作予以致谢。
今天,我们分享这次合作产出的六篇论文。🧵👇
动漫 · @imFarhanAi▲ 3.1万
AI生成多镜头动漫可保持角色一致性,开发者分享工作流
开发者@imFarhanAi在𝕏分享APOB的AI动漫生成工作流,基于Seedance 2.5实现
AI生成多镜头动漫可保持角色一致性,开发者分享工作流
开发者@imFarhanAi在𝕏分享APOB的AI动漫生成工作流,基于Seedance 2.5实现
过往AI生成多镜头动漫时,不同镜头中的角色会出现形象偏差,无法连贯讲完一个故事。APOB开发的这套新工作流解决了这个问题。
这套工作流分为三个步骤:先锁定角色形象,再制作故事板,最后向Seedance 2.5输入带时间编码的30秒创作方向。
最终生成的内容可以保持不同镜头中角色的面部、情绪和主题统一。示例短片里,女孩和猫厨师在雨天街道、餐厅柜台、特写镜头中形象都没有出现偏差。
生成的内容已经是完整的短场景,从雨天街道到温暖餐厅的过渡自然,不只是单独的好看静帧,幸运的单个片段可以拓展成完整系列。
AI开发 · @ScarletKc▲ 2.7万
游戏开发者实测:几十万行代码项目里Opus 5.5远胜GPT
开发者@ScarletKc在𝕏分享自己做游戏开发时,不同大模型处理大代码库的实际体验差异
游戏开发者实测:几十万行代码项目里Opus 5.5远胜GPT
开发者@ScarletKc在𝕏分享自己做游戏开发时,不同大模型处理大代码库的实际体验差异
做游戏开发时,Opus 5.5体验远超GPT,该开发者认为Opus 5.5表现很好,GPT体验很差。
该开发者的项目是一个包含服务端、客户端等所有内容的超大单体代码库(monorepo),代码量估计至少有几十万行。这个规模的代码可以直接占满1百万字符长度的上下文窗口。
ultracodetoken消耗速度太快,换成GPT需要对代码做多次压缩,GPT默认的Codex只有25.6万字符的上下文长度,根本满足不了需求。
之前用Opus 5修改代码需要很多轮才能完成,现在用Opus 5.5一次就能改好。客户端、服务端后端的修改可以一次全部完成,UI修改也完全符合要求。
就算自行配置Codex的上下文长度,长度也达不到1百万字符,而且GPT长上下文处理时输出效果衰减很严重,只靠压缩代码也会让结果偏离需求。最终该开发者认为Claude的表现最好。
大模型 · @huxlab导语出处▲ 1.6万
Anthropic Claude团队已不写prompt,改写循环
Anthropic工程师分享免费Agent架构分享,错误减少97%
Anthropic Claude团队已不写prompt,改写循环
Anthropic工程师分享免费Agent架构分享,错误减少97%
Anthropic 的工程师说:我们内部已经不怎么写 prompt 了,写的是循环。
她在台上花了半小时,展示了 Claude 团队如何创建能够自我提示的循环。
如果这堂课卖 400 刀,今年 Agent 课的榜单大概就是它。但它是免费的。
真正拉开代际差距的,不是谁的 Prompt 写得好,而是Agent系统架构彻底换了:
1. 记忆从一份 CLAUDE.md,进化成 Agent 自己读写的 memory/ 目录
2. 记忆待在对话里会烂掉:注意力被劈开,规律被埋住,旧笔记还在自信地用错
3. 白天各 Agent 把进展写进团队记忆
4. 夜里再跑一轮 dreaming:核对、整理、补全。第二天开工的那个,自动比昨天聪明一点
数据结果也很直观:一次通过的错误少了 97%,验收快了 30%。人回去看产品,不再一直盯着提示词。
提示词是一次性的,而循环能够持续执行。
差的不是你会不会问。
是你的 Agent 睡一觉之后,还记不记得昨天学到的东西。
技术原理 · @antiAIvo导语出处▲ 5.2K
你追捧的AI智能体,本质就是几行循环代码
拆开包装看,核心就是不断把执行结果丢回给大模型,直到任务完成,想自己做一个门槛很低。
你追捧的AI智能体,本质就是几行循环代码
拆开包装看,核心就是不断把执行结果丢回给大模型,直到任务完成,想自己做一个门槛很低。
目前所有agent的核心其实就几行代码 包括大家常用的claude code、codeX 剥开所有花哨的包装 Agent 的本质就是一个 while 循环: 1. 把任务丢给大模型(LLM) 2. 模型决定是否调用工具(Tool Calls) 3. 如果调用,执行代码,把结果塞回给模型 循环往复 直到模型觉得任务完成,不再调用工具 所以说要学习如何“自己实现一个Agent” 代码可以不用写,直接vibe 但是得能看懂代码 不然就是纸上谈兵了
行业观点 · @MollySOShea▲ 6.0K
Turing CEO说AI未来不分开源闭源,两者都需要
提出前沿大模型和开源权重模型会分别服务AI技术栈的不同部分,各自发挥作用。
Turing CEO说AI未来不分开源闭源,两者都需要
提出前沿大模型和开源权重模型会分别服务AI技术栈的不同部分,各自发挥作用。
研究 · @omarsar0▲ 5.8K
Google Research发布多智能体证明发现论文
研究发现不过度限制执行结构,搭配不同分工的智能体,能更好完成复杂的证明任务。
Google Research发布多智能体证明发现论文
研究发现不过度限制执行结构,搭配不同分工的智能体,能更好完成复杂的证明任务。
AI安全 · @maksym_andr▲ 3.2K
@maksym_andr发布AI安全相关论文
文章列举了用思维链检测奖励破解、用模型内部结构训练等常见做法,提出它们的科学性存疑。
@maksym_andr发布AI安全相关论文
文章列举了用思维链检测奖励破解、用模型内部结构训练等常见做法,提出它们的科学性存疑。
💥 新论文:AI安全领域充斥着大量「禁忌技术」(比如用CoT检测奖励破解,利用模型内部状态进行训练等等)。但这些技术真的有清晰的科学依据吗?我并不确定。
在这篇论文中,我们直接针对无害性探针和诚实性探针优化模型,结果效果还不错(前提是你要持续更新探针!)。模型学会了如何对有害查询生成无害回复,在说谎压力下生成诚实回复。
弄清楚如何正确把可解释性技术用于训练正变得越来越重要:很可能用不了多久我们就无法再用基于输出的监督来对齐模型了。
未来的模型会出于错误原因,因为它们通用的奖励寻求行为,直接把所有对齐训练场景刷到最高分。
想要获得对齐未来模型的机会,我们需要开展更多研究,研究如何利用模型内部状态来监督模型训练,同时**不丢失可监控性**!
新品发布 · @vercel▲ 3.1K
Vercel发布适用于Python的AI SDK中的Jev
开发者现在可以在Python版AI SDK中使用Jev,Vercel已经做了两个相关测试,感兴趣可前往测试使用。
Vercel发布适用于Python的AI SDK中的Jev
开发者现在可以在Python版AI SDK中使用Jev,Vercel已经做了两个相关测试,感兴趣可前往测试使用。
Jev 现已加入 AI SDK for Python。
为了测试它,我们做了两个实验:
▪︎ 在输入文本时,实时区分是 Python 还是英语
▪︎ 逐词决策编写 Python
```
uv add ai
```
前沿研究 · @EpochAIResearch▲ 5.2K
AI基础设施未来可容纳十亿级AI智能体
这个规模的AI智能体总工作时长可匹敌全球人力总工时,未来职场分工可能会因此彻底改变
AI基础设施未来可容纳十亿级AI智能体
这个规模的AI智能体总工作时长可匹敌全球人力总工时,未来职场分工可能会因此彻底改变
我们估计,AI 基础设施很快就可以支持数亿甚至数十亿个 AI 智能体。
在乐观估计下,这个规模足以和全球人类劳动力的总工作时长相匹敌。
具体能支持多少个智能体,取决于它们所运行模型的效率,以及 AI 需求的暴涨是否会持续下去。
我们分析了多种不同的情况🧵
工具产品 · @vikingmute▲ 7.0K
自然语言驱动的LLM测试框架e2e来了
做LLM应用测试的开发者可以试试这套新框架,支持Web和移动测试,操作步骤可缓存重放,不用每次都调用模型节省成本
自然语言驱动的LLM测试框架e2e来了
做LLM应用测试的开发者可以试试这套新框架,支持Web和移动测试,操作步骤可缓存重放,不用每次都调用模型节省成本
可以关注一下最近出的一个 测试框架 e2e 你没看错,名字就是叫 e2e (这名字真的不是碰瓷吗?),很火,而且它最有趣的是创新是:测试用例里面是自然语言驱动 + 传统断言混写 自然语言就是表示它是面向LLM 的测试框架 Agent 步骤可缓存回放 被后续断言验证过的 agent.act 会记下操作 下次直接重放 不再调模型 还有就是 Web 和移动同一套 API Web 引擎走 Playwright,移动引擎通过 agent-device 驱动 iOS 模拟器和 Android 模拟器 还可以托管别的模拟器 大家可以看一下测试用例,很有趣 agent.act('upgrade the workspace to the Pro plan') 这个就是自然语言的方式,第一次会让 agent 自己去探索去缓存,假如有变化再次更新。
实战经验 · @Kay2289123▲ 8.0K
Karpathy分享让AI说人话的实用方法
遇到AI输出内容晦涩难懂时,可以试试这个方法,能降低理解负担,帮你更快学会想学的内容。
Karpathy分享让AI说人话的实用方法
遇到AI输出内容晦涩难懂时,可以试试这个方法,能降低理解负担,帮你更快学会想学的内容。
治 AI 不说人话的办法,Karpathy 给出了最好的答案。我真的希望大家都能发现和用上 估计很多人和我一样,AI 解释了一大段,每个字都认识,连起来还是没懂?结果越问越偏,理解负荷不断升高 如果有,这条我真心建议使用: > 让 AI按 ASD-STE100(航空维修手册的写作规范)说人话; > 还不明白,就画图、做交互网页 > 甚至专门给你做一段视频。
我真的希望大家都用上。那些一直想学、又没学懂的东西,都试试这个方式
开发 · @shcallaway▲ 54
团队本周从代码仓库删除80万行单元测试
开发者shcallaway在𝕏发文,称@sazabi单代码库删除80万行单元测试并提出三点假设
团队本周从代码仓库删除80万行单元测试
开发者shcallaway在𝕏发文,称@sazabi单代码库删除80万行单元测试并提出三点假设
开发者shcallaway本周从@sazabi单代码库删除了总计80万行单元测试,同时分享了三点关于单元测试的假设。
第一,单元测试会锁定冗余代码,让代码更难修改或删除。
第二,单元测试拖慢开发周期,因为它需要开发者在本地完成更多工作,还会延长持续集成(CI,自动化构建测试流程)的用时。
第三,单元测试会造成资金浪费,它需要开发者生成更多代码令牌,还会增加不必要的持续集成运行次数。
shcallaway表示后续会公布这次操作的结果。
大模型 · @pankajkumar_dev▲ 9.2K
开发者实测Claude Fable 5.5 AI模型表现优秀
开发者@pankajkumar_dev在𝕏分享Claude Fable 5.5的实测体验,对比多款模型表现更优
开发者实测Claude Fable 5.5 AI模型表现优秀
开发者@pankajkumar_dev在𝕏分享Claude Fable 5.5的实测体验,对比多款模型表现更优
Claude Fable 5.5由Fable 5.1迭代而来,目前已在网络上流出。作者通过熟人拿到了可用账号,进行了实测体验。
作者认为,这是他用过的性能最强的AI模型。哪怕只给出极简短的提示词,Fable 5.5也能生成非常富有创意的输出。
它在3D设计和网页设计领域表现不错,一次就能完成多项任务。语音和声音生成能力也有明显提升,虽然还达不到真实音质水平,但进步已经非常扎实。
作者表示,Fable 5.5在动态设计和视频编辑领域,是目前最好的模型。在他的测试中,Fable 5.5的表现超过了Opus 5.5和Astra两款模型。
订阅 · @klarkxy▲ 3.8K
网友@klarkxy 公开个人AI工具订阅计划清单
来自@klarkxy 在𝕏发布的个人计划,涵盖GPT-Plus、Grok等5款AI工具
网友@klarkxy 公开个人AI工具订阅计划清单
来自@klarkxy 在𝕏发布的个人计划,涵盖GPT-Plus、Grok等5款AI工具
这是@klarkxy 在𝕏分享的个人AI工具订阅计划,清单包含5款不同定位的AI产品。
GPT Plus被用来生成图像和咨询问题,保留订阅。
Grok由super P+赠送,定位为处理繁杂事务的“高级牛马”。
Kimi年订阅费用699元,作为主要使用的代理工具。
Minimax两份订阅各119元,定位处理基础事务的“低级牛马”,同时用来生成视频。
Command Goat会被用来体验新模型。
机器人 · @andrewmccalip▲ 7.6K
用极简黑客方式给JEV接入视觉,成功了
开发者andrewmccalip在𝕏分享,用ASCII文本 trick 将视觉接入下棋机器人JEV,实现了可用效果
用极简黑客方式给JEV接入视觉,成功了
开发者andrewmccalip在𝕏分享,用ASCII文本 trick 将视觉接入下棋机器人JEV,实现了可用效果
教程 · @txbrraa▲ 2.6K
16分钟分步教程 教你用Fable 5搭建电影网站
@txbrraa在𝕏发布的教程,目标是搭建价值5万美元的电影网站,使用工具为Claude Fable 5
16分钟分步教程 教你用Fable 5搭建电影网站
@txbrraa在𝕏发布的教程,目标是搭建价值5万美元的电影网站,使用工具为Claude Fable 5
这是一个时长16分钟的分步教程,讲解如何搭建价值5万美元的电影网站。教程会用到Claude Fable 5工具。
发布者提醒用户,在内容失效前保存这条教程。教程完整链接:
AI硬件 · @metrox_eth▲ 10.0K
开发者打造模块化开源漫游车MOSS,现有硬件也可组装
开发者metrox_eth基于OpenAI Codex Physical Builds项目打造模块化机器人漫游车MOSS
开发者打造模块化开源漫游车MOSS,现有硬件也可组装
开发者metrox_eth基于OpenAI Codex Physical Builds项目打造模块化机器人漫游车MOSS
本次开发核心方向是模块化设计。MOSS从项目启动之初就采用模块化架构,入门搭建不需要完全照搬开发者在用的硬件。
如果你之前做其他项目剩下了树莓派(Raspberry Pi),可以直接使用。如果预算有限,也可以选择性价比更高的深度相机。
兼容的硬件组合包括:带或不带Hailo的树莓派5,或是Jetson;深度相机可选RealSense或Gemini。不同硬件组合可以得到同一台漫游车,这是开发者申报OpenAIdevs Codex Physical Builds项目时就确定的目标,目前这一构想已经进入成型阶段。
想要获取开源CAD文件和MOSS套件,可以加入tnkrdotai社区等候位,开发者会在内容就绪后通知参与者。
开发者拥有两年机器人搭建经验,主要依靠自身判断进行开发。AI作为辅助工具,负责部件定位、检查结构稳定性和公差是否符合标准,开发者通过小型提示词引导开发方向。
开发者表示,和Astra级模型出现之前的开发方式相比,现在的开发体验更像是跟着Instructables上的优质项目一步步搭建。
开源模型 · @MiaAI_lab▲ 6.5K
MiaAI_lab 即将淘汰旧GLM 5.3量化模型,推出替代版本
开发者@MiaAI_lab在𝕏宣布,将为TensorFold推出自研4-bit EXL3量化GLM替代旧版
MiaAI_lab 即将淘汰旧GLM 5.3量化模型,推出替代版本
开发者@MiaAI_lab在𝕏宣布,将为TensorFold推出自研4-bit EXL3量化GLM替代旧版
原方案中使用的GLM 5.3 Flash EXL3量化模型即将淘汰。它的替代版本是开发者为TensorFold构建的自研4-bit EXL3量化模型。
新模型和旧模型体积相同,都是176 GB,在2块DGX Spark上的运行速度、内存占用也完全一致。
和旧量化版本相比,新模型更接近原始模型,在所有测试集实际运行中的KL散度降低了4%-18%。数学和推理任务的提升最明显,KL散度降低18%,确定性错误最多减少37%。
在编码任务上,新模型在HumanEval+和MBPP+的整体表现和旧版持平:542道题目中,新模型做对469道,旧模型做对468道,一方略低一方略高,波动都在误差范围内。整体推理耗时缩短约10%,所有场景下的回答速度都会更快。
这款新模型会成为GLM-5.3-Flash TensorFold方案下次更新的默认选项,即将推出。
提示词 · @goan999999▲ 8.9K
付费使用ChatGPT别用模糊指令,这里有6个可直接复制的提示词
用户@goan999999在𝕏分享了6个可直接复制使用的ChatGPT清晰指令,解决模糊指令输出无效结果的问题
付费使用ChatGPT别用模糊指令,这里有6个可直接复制的提示词
用户@goan999999在𝕏分享了6个可直接复制使用的ChatGPT清晰指令,解决模糊指令输出无效结果的问题
教程 · @Av1dlive▲ 7.2K
手把手教你像顶尖用户一样使用Claude Code插件
来自X平台用户@Av1dlive分享,四步搭建绑定Jev的Claude Code插件
手把手教你像顶尖用户一样使用Claude Code插件
来自X平台用户@Av1dlive分享,四步搭建绑定Jev的Claude Code插件
AI视频 · @eternityspring▲ 1.1万
MiniMax H3生成短剧分段衔接问题可通过这个工具解决
eternityspring在𝕏分享ComfyUI-H3-Motion-Context方案,解决MiniMax H3单次15秒的分段衔接问题
MiniMax H3生成短剧分段衔接问题可通过这个工具解决
eternityspring在𝕏分享ComfyUI-H3-Motion-Context方案,解决MiniMax H3单次15秒的分段衔接问题
教程 · @skeptrune▲ 4.9K
开发者花一个周末用三款工具搭建个人AI语音助手
开发者在𝕏分享了自己用telnyx、gpt-live、cloudflare搭建的经历
开发者花一个周末用三款工具搭建个人AI语音助手
开发者在𝕏分享了自己用telnyx、gpt-live、cloudflare搭建的经历
我花了一个周末,只用 telnyx、gpt-live 和 cloudflare 搭建了一个个人 AI 语音代理。
它简洁美观,而且效果非常好。我还写了教程,介绍你如何只用几百行代码就能自己搭建一个同样的东西!
教程 · @mikepat711▲ 1.8万
用 Notion 给所有你的 AI 助手搭建统一共享记忆库
国外网友分享了可直接复制使用的搭建方法,支持多款AI
用 Notion 给所有你的 AI 助手搭建统一共享记忆库
国外网友分享了可直接复制使用的搭建方法,支持多款AI
我正在通过@NotionHQ为我所有的AI平台运行一个统一记忆库。我将这个数据库连接到了Grok Bot、Claude Code、Grok Build和Meta Muse。
它们都遵守以下指令,当出现值得记忆的内容时,就会自动写入这个数据库。它们都清楚自己在和其他AI共享这个数据库,我们正在为所有AI构建一个统一记忆库。当我问它们可能需要上下文的问题时,它们都知道要在这里查找信息。
以下是我使用的内容。你只要把这个提示词复制到你的一个AI中,就能让它搭建好这个统一记忆库。你只需要一个Notion账户,并且通过Notion连接器连接到你使用的任意AI。搭建完成后,你把它分享给其他AI,告诉它们已经搭建完成,只需要往里面写入内容即可。
前沿研究 · @AIatMeta导语出处▲ 3.0万
Meta AI发布六篇合作研究论文(六)
这次AI不只是辅助计算,而是全程参与论文撰写,每段都会标注人类或AI撰写,帮研究人员真正推进未知问题。
Meta AI发布六篇合作研究论文(六)
这次AI不只是辅助计算,而是全程参与论文撰写,每段都会标注人类或AI撰写,帮研究人员真正推进未知问题。
在我们的AI模型在数学、物理和化学五项竞赛中取得金牌级表现后,我们提出了一个更难的问题:当一个问题是真正开放的、不存在现有解题路径时,AI能做出贡献吗?
过去几个月里,数学家通过常规聊天界面,在没有定制研究框架的情况下,使用Thinking Mode的Muse Spark 1.1和Muse Spark 1.2,来寻找这类问题的解答。
我们的目标不是批量生产论文,而是赋能研究者。每一次合作都遵循相同的原则:数学家主导研究,另一组数学家随后审核工作,每篇论文都会标注哪些段落主要由人类或AI起草,并且都会标注它所基于的先前研究。如果其他团队独立发表了相同问题的解答,我们也会对他们的工作予以致谢。
今天,我们分享这次合作产出的六篇论文。🧵👇
前沿研究 · @EpochAIResearch▲ 5.2K
AI基础设施未来可容纳十亿级AI智能体
这个规模的AI智能体总工作时长可匹敌全球人力总工时,未来职场分工可能会因此彻底改变
AI基础设施未来可容纳十亿级AI智能体
这个规模的AI智能体总工作时长可匹敌全球人力总工时,未来职场分工可能会因此彻底改变
我们估计,AI 基础设施很快就可以支持数亿甚至数十亿个 AI 智能体。
在乐观估计下,这个规模足以和全球人类劳动力的总工作时长相匹敌。
具体能支持多少个智能体,取决于它们所运行模型的效率,以及 AI 需求的暴涨是否会持续下去。
我们分析了多种不同的情况🧵
前沿研究 · @wen_kaiyue▲ 8.6K
@wen_kaiyue发布Actor-Critic with Action Chunking (AC2) 研究
目前训练大语言模型的强化学习流程需要完整采样,新方法通过改进评价器只需部分采样,训练速度更快
@wen_kaiyue发布Actor-Critic with Action Chunking (AC2) 研究
目前训练大语言模型的强化学习流程需要完整采样,新方法通过改进评价器只需部分采样,训练速度更快
你真的需要在大语言模型的强化学习中完成每一轮推演吗?如果你改进了评估网络(critic)并且信任它,就不需要!
我们提出了带动作分块的演员-评论家算法(Actor-Critic with Action Chunking, AC2):用训练好的评估网络给成块的token打分,只需要部分推演,训练速度比GRPO更快!
新品发布 · @natolambert导语出处▲ 4.9万
Trillium Labs 成立 推动前沿AI开放科学
目前AI发展越来越封闭,这个新非营利机构希望聚集更多人用科学方法解决前沿AI难题,现在正在招人筹款找算力。
Trillium Labs 成立 推动前沿AI开放科学
目前AI发展越来越封闭,这个新非营利机构希望聚集更多人用科学方法解决前沿AI难题,现在正在招人筹款找算力。
新品发布 · @deepseek_ai▲ 26.9万
DeepSeek AI 发布 DeepSeekHarness 多平台桌面版
macOS和Windows用户可直接下载打包好的版本使用,Linux用户可以从npm获取安装包。
DeepSeek AI 发布 DeepSeekHarness 多平台桌面版
macOS和Windows用户可直接下载打包好的版本使用,Linux用户可以从npm获取安装包。
来看看 @DeepSeekHarness。
我们刚刚发布了适用于macOS和Windows的打包桌面版;Linux用户可以从npm上的 @deepseek-ai/dsh 包获取。
新品发布 · @allen_ai▲ 8.8K
@allen_ai 发布 AstaBrief 8B 本地可跑的开源模型
可以本地硬件运行,权重和训练数据完全开放,可以基于它二次开发。能自动整理文献,生成带引用的研究报告,省去手动整理的时间。
@allen_ai 发布 AstaBrief 8B 本地可跑的开源模型
可以本地硬件运行,权重和训练数据完全开放,可以基于它二次开发。能自动整理文献,生成带引用的研究报告,省去手动整理的时间。
介绍 AstaBrief 8B,这是一个可以把复杂研究问题和文献节选转换为带引用报告的开源模型。
你可以在自己的硬件本地运行它,它提供开放权重和训练数据,你可以检查这些内容并在此基础上进行二次开发。
下载:
新品发布 · @vercel▲ 3.1K
Vercel发布适用于Python的AI SDK中的Jev
开发者现在可以在Python版AI SDK中使用Jev,Vercel已经做了两个相关测试,感兴趣可前往测试使用。
Vercel发布适用于Python的AI SDK中的Jev
开发者现在可以在Python版AI SDK中使用Jev,Vercel已经做了两个相关测试,感兴趣可前往测试使用。
Jev 现已加入 AI SDK for Python。
为了测试它,我们做了两个实验:
▪︎ 在输入文本时,实时区分是 Python 还是英语
▪︎ 逐词决策编写 Python
```
uv add ai
```
新品发布 · @karrisaarinen▲ 1.4万
Linear推出面向产品团队的云编码工作空间
无需额外购买平台或聘请AI工程师,在Linear或Slack里即可调用自动编码代理处理任务,仅按公开API费率收费。
Linear推出面向产品团队的云编码工作空间
无需额外购买平台或聘请AI工程师,在Linear或Slack里即可调用自动编码代理处理任务,仅按公开API费率收费。
我们一直在悄悄将 @linear 打造为面向产品团队的最佳云编码工作区。
它可以配合 OA/Ant/开源工具链使用,自带自动模型路由,并且直接连接产品、你的团队、客户上下文,以及 AI 代码评审界面。
借助 Looms,你可以运行自动化工作流,按触发条件或计划修复漏洞、编写文档、清理代码等等。
你不需要购买单独的平台,也不需要专门的 AI 工程师,只需要在 Linear 或者 Slack 里使用编码代理就可以了。
你现在就能开始使用,只需要在你的工作区开启代码访问和编码会话功能。然后在 Linear 里分配任务,或者直接在 Slack 里说“@linear 请修复这个问题”。
没有平台费用、没有入门引导费用、也不对 token 加价。你只需要按照公开的 API 费率支付 token 费用和沙箱分钟费用。(即将支持用 ChatGPT 登录)
行业动态 · @gabegreenberg▲ 14.5万
g2i.ai高薪远程招聘50名软件工程师
时薪200-300美元,远程办公,但是工作难度高且枯燥。想找高薪AI相关工作可以投递应聘。
g2i.ai高薪远程招聘50名软件工程师
时薪200-300美元,远程办公,但是工作难度高且枯燥。想找高薪AI相关工作可以投递应聘。
我本月要招聘50名资深软件工程师加入我们在g2i.ai的团队。
你将和顶尖前沿实验室合作,完成评估工作以及创建数据集。时薪200-300美元,远程办公。
这份工作并不轻松,而且很枯燥,但薪资丰厚。
申请链接:https://jobs.ashbyhq.com/g2i/becdfa73-ad7f-4920-8456-808cef38ff5d
技术原理 · @antiAIvo导语出处▲ 5.2K
你追捧的AI智能体,本质就是几行循环代码
拆开包装看,核心就是不断把执行结果丢回给大模型,直到任务完成,想自己做一个门槛很低。
你追捧的AI智能体,本质就是几行循环代码
拆开包装看,核心就是不断把执行结果丢回给大模型,直到任务完成,想自己做一个门槛很低。
目前所有agent的核心其实就几行代码 包括大家常用的claude code、codeX 剥开所有花哨的包装 Agent 的本质就是一个 while 循环: 1. 把任务丢给大模型(LLM) 2. 模型决定是否调用工具(Tool Calls) 3. 如果调用,执行代码,把结果塞回给模型 循环往复 直到模型觉得任务完成,不再调用工具 所以说要学习如何“自己实现一个Agent” 代码可以不用写,直接vibe 但是得能看懂代码 不然就是纸上谈兵了
行业观点 · @MollySOShea▲ 6.0K
Turing CEO说AI未来不分开源闭源,两者都需要
提出前沿大模型和开源权重模型会分别服务AI技术栈的不同部分,各自发挥作用。
Turing CEO说AI未来不分开源闭源,两者都需要
提出前沿大模型和开源权重模型会分别服务AI技术栈的不同部分,各自发挥作用。
研究 · @omarsar0▲ 5.8K
Google Research发布多智能体证明发现论文
研究发现不过度限制执行结构,搭配不同分工的智能体,能更好完成复杂的证明任务。
Google Research发布多智能体证明发现论文
研究发现不过度限制执行结构,搭配不同分工的智能体,能更好完成复杂的证明任务。
AI安全 · @maksym_andr▲ 3.2K
@maksym_andr发布AI安全相关论文
文章列举了用思维链检测奖励破解、用模型内部结构训练等常见做法,提出它们的科学性存疑。
@maksym_andr发布AI安全相关论文
文章列举了用思维链检测奖励破解、用模型内部结构训练等常见做法,提出它们的科学性存疑。
💥 新论文:AI安全领域充斥着大量「禁忌技术」(比如用CoT检测奖励破解,利用模型内部状态进行训练等等)。但这些技术真的有清晰的科学依据吗?我并不确定。
在这篇论文中,我们直接针对无害性探针和诚实性探针优化模型,结果效果还不错(前提是你要持续更新探针!)。模型学会了如何对有害查询生成无害回复,在说谎压力下生成诚实回复。
弄清楚如何正确把可解释性技术用于训练正变得越来越重要:很可能用不了多久我们就无法再用基于输出的监督来对齐模型了。
未来的模型会出于错误原因,因为它们通用的奖励寻求行为,直接把所有对齐训练场景刷到最高分。
想要获得对齐未来模型的机会,我们需要开展更多研究,研究如何利用模型内部状态来监督模型训练,同时**不丢失可监控性**!
行业动态 · Hacker News▲ 63
leopoldj称大语言模型不具备推理能力
这个观点在Hacker News引发大量讨论,能帮你重新认识当前大语言模型的能力边界
leopoldj称大语言模型不具备推理能力
这个观点在Hacker News引发大量讨论,能帮你重新认识当前大语言模型的能力边界
社区讨论:多数认同大语言模型本质是 next token 预测引擎,推理只是规则衍生出的涌现现象,并非内置独立推理模块。有人指出人类本身也会脑补不存在的推理,误将语言模型的输出效果认作其具备推理能力。有人提出可以通过提示词工程,让大语言模型以分步迭代的方式弥补推理缺陷,还有人认为不需要推理也能解决复杂问题,争论点集中在推理是否需要独立模块实现。
行业动态 · Hacker News导语出处▲ 47
哈佛大学物理学家Matthew Schwartz发布36篇联合署名论文(36)
AI已深入参与顶尖学术研究产出,关注AI对学术创作模式带来的改变。
哈佛大学物理学家Matthew Schwartz发布36篇联合署名论文(36)
AI已深入参与顶尖学术研究产出,关注AI对学术创作模式带来的改变。
社区讨论:不少网友调侃,这肯定是今年的论文发表配额完成了,也有人调侃如果哈佛物理学家真懂业务,Claude就相当于一群便宜高效的本科生干活。有人指出当下科研圈本身就存在验证、重复旧结果没人看重,错误结果容易发表的问题,AI会加剧这类问题。也有人认为,如果AI能搞定简单的发论文问题,人类就能去研究真正重要的问题了,还有网友调侃很多Reddit用户总觉得自己比哈佛教授还懂,上来就直接否定人家。
行业动态 · Hacker News▲ 117
Redis创作者发布ds4工具
普通用户不用云端就能运行大语言模型,本地部署门槛降低,隐私性更好
Redis创作者发布ds4工具
普通用户不用云端就能运行大语言模型,本地部署门槛降低,隐私性更好
社区讨论:有人好奇为什么Redis作者选择用C而非Rust开发这个工具,有人询问它和其他大语言模型运行器有什么区别,还有开发者指出目前ds4量化 checkpoint效果不佳。有用户实测反馈,在128GB M5 Max上运行Qwen 3.8 Flash Next速度很快,支持超长上下文窗口,体验很好。还有开发者分享了自己的二次开发成果,包括给ds4增加Fused TQ支持1M上下文长度、做FFI多语言绑定分支等。
行业动态 · Hacker News导语出处▲ 69
GPT-6 Astra首次通过agent-wow玩魔兽世界
AI大模型开始尝试操作电子游戏,想玩AI操控的魔兽世界,可以关注这个工具后续进展
GPT-6 Astra首次通过agent-wow玩魔兽世界
AI大模型开始尝试操作电子游戏,想玩AI操控的魔兽世界,可以关注这个工具后续进展
社区讨论:多数人认同AI玩家能丰富游戏体验,有人提到如果游戏里有AI战争编队、互动性更强的世界BOSS,能打造更丰富的游戏世界,还能让已经冷清的老游戏重获活力。也有人调侃,想让AI帮自己做工作交税,自己安心玩魔兽。有人指出魔兽的自动机器人协议二十多年前就已经研究成熟并公开了,还有人好奇本次实验是否真的完成了新手区所有任务,也有人调侃暴雪一直抓不住机器人。
有人疑惑本次实验需要为大模型定制交互代码,是否说明通用模型落地始终需要定制开发。还有人好奇这会对灰色的金币产业产生什么影响。
行业动态 · Hacker News▲ 183
开发者讨论ChatGPT新站点功能
若讨论属实,ChatGPT将新增可直接访问站点的功能,直接影响日常使用ChatGPT的体验。
开发者讨论ChatGPT新站点功能
若讨论属实,ChatGPT将新增可直接访问站点的功能,直接影响日常使用ChatGPT的体验。
社区讨论:部分开发者认为OpenAI分心做ChatGPT新站点这类功能,分散了做大模型本身的精力,现有网站生成工具已经很多,该功能并非必需。也有开发者认为这个功能被低估,能快速生成可用原型,很实用。有人指出该功能会挤压网页设计师等行业的生存空间,还有开发者质疑OpenAI进入应用层会抢现有客户的生意,也有人发现部分演示站点存在质量粗糙的问题。
工具产品 · @vikingmute▲ 7.0K
自然语言驱动的LLM测试框架e2e来了
做LLM应用测试的开发者可以试试这套新框架,支持Web和移动测试,操作步骤可缓存重放,不用每次都调用模型节省成本
自然语言驱动的LLM测试框架e2e来了
做LLM应用测试的开发者可以试试这套新框架,支持Web和移动测试,操作步骤可缓存重放,不用每次都调用模型节省成本
可以关注一下最近出的一个 测试框架 e2e 你没看错,名字就是叫 e2e (这名字真的不是碰瓷吗?),很火,而且它最有趣的是创新是:测试用例里面是自然语言驱动 + 传统断言混写 自然语言就是表示它是面向LLM 的测试框架 Agent 步骤可缓存回放 被后续断言验证过的 agent.act 会记下操作 下次直接重放 不再调模型 还有就是 Web 和移动同一套 API Web 引擎走 Playwright,移动引擎通过 agent-device 驱动 iOS 模拟器和 Android 模拟器 还可以托管别的模拟器 大家可以看一下测试用例,很有趣 agent.act('upgrade the workspace to the Pro plan') 这个就是自然语言的方式,第一次会让 agent 自己去探索去缓存,假如有变化再次更新。
实战经验 · @Kay2289123▲ 8.0K
Karpathy分享让AI说人话的实用方法
遇到AI输出内容晦涩难懂时,可以试试这个方法,能降低理解负担,帮你更快学会想学的内容。
Karpathy分享让AI说人话的实用方法
遇到AI输出内容晦涩难懂时,可以试试这个方法,能降低理解负担,帮你更快学会想学的内容。
治 AI 不说人话的办法,Karpathy 给出了最好的答案。我真的希望大家都能发现和用上 估计很多人和我一样,AI 解释了一大段,每个字都认识,连起来还是没懂?结果越问越偏,理解负荷不断升高 如果有,这条我真心建议使用: > 让 AI按 ASD-STE100(航空维修手册的写作规范)说人话; > 还不明白,就画图、做交互网页 > 甚至专门给你做一段视频。
我真的希望大家都用上。那些一直想学、又没学懂的东西,都试试这个方式
教程 · @mikepat711▲ 1.8万
用 Notion 给所有你的 AI 助手搭建统一共享记忆库
国外网友分享了可直接复制使用的搭建方法,支持多款AI
用 Notion 给所有你的 AI 助手搭建统一共享记忆库
国外网友分享了可直接复制使用的搭建方法,支持多款AI
我正在通过@NotionHQ为我所有的AI平台运行一个统一记忆库。我将这个数据库连接到了Grok Bot、Claude Code、Grok Build和Meta Muse。
它们都遵守以下指令,当出现值得记忆的内容时,就会自动写入这个数据库。它们都清楚自己在和其他AI共享这个数据库,我们正在为所有AI构建一个统一记忆库。当我问它们可能需要上下文的问题时,它们都知道要在这里查找信息。
以下是我使用的内容。你只要把这个提示词复制到你的一个AI中,就能让它搭建好这个统一记忆库。你只需要一个Notion账户,并且通过Notion连接器连接到你使用的任意AI。搭建完成后,你把它分享给其他AI,告诉它们已经搭建完成,只需要往里面写入内容即可。
开源 · @undefinedKi▲ 1.3万
前谷歌工程师将整套工程工作流打包为Claude Code代理技能
前谷歌工程师Addy Osmani开源25个结构化Claude Code代理技能。
前谷歌工程师将整套工程工作流打包为Claude Code代理技能
前谷歌工程师Addy Osmani开源25个结构化Claude Code代理技能。
Anthropic 一名工程师把自己完整的工程工作流打包成了智能体技能,任何人都可以复用这套流程。
Addy Osmani 之前在 Google 工作,现在负责 Claude Code。他的仓库能把一个编码智能体变成高级工程师。
每个技能都是结构化工作流:说明使用时机、具体步骤,还列出了智能体会找哪些借口跳过步骤,并针对每个借口给出反驳,同时列有警示信号,以及完成这项工作前需要提供的验证证据。
目前共有 25 项技能,按阶段分类:
- 定义:明确要构建什么
- 规划:拆分成小任务
- 构建:先写测试再写代码
- 验证:调试并证明功能正常
- 评审:质量、安全、性能
- 发布:上线、持续集成、文档
技能还会自动激活。你开始设计 API 时,API 技能就会自动启动。
如果你是独自使用智能体开发,或者希望团队里每个智能体都保持相同标准,这个工具非常有用。
使用命令:npx skills add addyosmani/agent-skills
教程 · @skeptrune▲ 4.9K
开发者花一个周末用三款工具搭建个人AI语音助手
开发者在𝕏分享了自己用telnyx、gpt-live、cloudflare搭建的经历
开发者花一个周末用三款工具搭建个人AI语音助手
开发者在𝕏分享了自己用telnyx、gpt-live、cloudflare搭建的经历
我花了一个周末,只用 telnyx、gpt-live 和 cloudflare 搭建了一个个人 AI 语音代理。
它简洁美观,而且效果非常好。我还写了教程,介绍你如何只用几百行代码就能自己搭建一个同样的东西!
大模型 · @huxlab导语出处▲ 1.6万
Anthropic Claude团队已不写prompt,改写循环
Anthropic工程师分享免费Agent架构分享,错误减少97%
Anthropic Claude团队已不写prompt,改写循环
Anthropic工程师分享免费Agent架构分享,错误减少97%
Anthropic 的工程师说:我们内部已经不怎么写 prompt 了,写的是循环。
她在台上花了半小时,展示了 Claude 团队如何创建能够自我提示的循环。
如果这堂课卖 400 刀,今年 Agent 课的榜单大概就是它。但它是免费的。
真正拉开代际差距的,不是谁的 Prompt 写得好,而是Agent系统架构彻底换了:
1. 记忆从一份 CLAUDE.md,进化成 Agent 自己读写的 memory/ 目录
2. 记忆待在对话里会烂掉:注意力被劈开,规律被埋住,旧笔记还在自信地用错
3. 白天各 Agent 把进展写进团队记忆
4. 夜里再跑一轮 dreaming:核对、整理、补全。第二天开工的那个,自动比昨天聪明一点
数据结果也很直观:一次通过的错误少了 97%,验收快了 30%。人回去看产品,不再一直盯着提示词。
提示词是一次性的,而循环能够持续执行。
差的不是你会不会问。
是你的 Agent 睡一觉之后,还记不记得昨天学到的东西。
AI视频 · @eternityspring▲ 1.1万
MiniMax H3生成短剧分段衔接问题可通过这个工具解决
eternityspring在𝕏分享ComfyUI-H3-Motion-Context方案,解决MiniMax H3单次15秒的分段衔接问题
MiniMax H3生成短剧分段衔接问题可通过这个工具解决
eternityspring在𝕏分享ComfyUI-H3-Motion-Context方案,解决MiniMax H3单次15秒的分段衔接问题
教程 · @Av1dlive▲ 7.2K
手把手教你像顶尖用户一样使用Claude Code插件
来自X平台用户@Av1dlive分享,四步搭建绑定Jev的Claude Code插件
手把手教你像顶尖用户一样使用Claude Code插件
来自X平台用户@Av1dlive分享,四步搭建绑定Jev的Claude Code插件
提示词 · @goan999999▲ 8.9K
付费使用ChatGPT别用模糊指令,这里有6个可直接复制的提示词
用户@goan999999在𝕏分享了6个可直接复制使用的ChatGPT清晰指令,解决模糊指令输出无效结果的问题
付费使用ChatGPT别用模糊指令,这里有6个可直接复制的提示词
用户@goan999999在𝕏分享了6个可直接复制使用的ChatGPT清晰指令,解决模糊指令输出无效结果的问题
开源模型 · @MiaAI_lab▲ 6.5K
MiaAI_lab 即将淘汰旧GLM 5.3量化模型,推出替代版本
开发者@MiaAI_lab在𝕏宣布,将为TensorFold推出自研4-bit EXL3量化GLM替代旧版
MiaAI_lab 即将淘汰旧GLM 5.3量化模型,推出替代版本
开发者@MiaAI_lab在𝕏宣布,将为TensorFold推出自研4-bit EXL3量化GLM替代旧版
原方案中使用的GLM 5.3 Flash EXL3量化模型即将淘汰。它的替代版本是开发者为TensorFold构建的自研4-bit EXL3量化模型。
新模型和旧模型体积相同,都是176 GB,在2块DGX Spark上的运行速度、内存占用也完全一致。
和旧量化版本相比,新模型更接近原始模型,在所有测试集实际运行中的KL散度降低了4%-18%。数学和推理任务的提升最明显,KL散度降低18%,确定性错误最多减少37%。
在编码任务上,新模型在HumanEval+和MBPP+的整体表现和旧版持平:542道题目中,新模型做对469道,旧模型做对468道,一方略低一方略高,波动都在误差范围内。整体推理耗时缩短约10%,所有场景下的回答速度都会更快。
这款新模型会成为GLM-5.3-Flash TensorFold方案下次更新的默认选项,即将推出。
AI开发 · @ScarletKc▲ 2.7万
游戏开发者实测:几十万行代码项目里Opus 5.5远胜GPT
开发者@ScarletKc在𝕏分享自己做游戏开发时,不同大模型处理大代码库的实际体验差异
游戏开发者实测:几十万行代码项目里Opus 5.5远胜GPT
开发者@ScarletKc在𝕏分享自己做游戏开发时,不同大模型处理大代码库的实际体验差异
做游戏开发时,Opus 5.5体验远超GPT,该开发者认为Opus 5.5表现很好,GPT体验很差。
该开发者的项目是一个包含服务端、客户端等所有内容的超大单体代码库(monorepo),代码量估计至少有几十万行。这个规模的代码可以直接占满1百万字符长度的上下文窗口。
ultracodetoken消耗速度太快,换成GPT需要对代码做多次压缩,GPT默认的Codex只有25.6万字符的上下文长度,根本满足不了需求。
之前用Opus 5修改代码需要很多轮才能完成,现在用Opus 5.5一次就能改好。客户端、服务端后端的修改可以一次全部完成,UI修改也完全符合要求。
就算自行配置Codex的上下文长度,长度也达不到1百万字符,而且GPT长上下文处理时输出效果衰减很严重,只靠压缩代码也会让结果偏离需求。最终该开发者认为Claude的表现最好。
AI硬件 · @metrox_eth▲ 10.0K
开发者打造模块化开源漫游车MOSS,现有硬件也可组装
开发者metrox_eth基于OpenAI Codex Physical Builds项目打造模块化机器人漫游车MOSS
开发者打造模块化开源漫游车MOSS,现有硬件也可组装
开发者metrox_eth基于OpenAI Codex Physical Builds项目打造模块化机器人漫游车MOSS
本次开发核心方向是模块化设计。MOSS从项目启动之初就采用模块化架构,入门搭建不需要完全照搬开发者在用的硬件。
如果你之前做其他项目剩下了树莓派(Raspberry Pi),可以直接使用。如果预算有限,也可以选择性价比更高的深度相机。
兼容的硬件组合包括:带或不带Hailo的树莓派5,或是Jetson;深度相机可选RealSense或Gemini。不同硬件组合可以得到同一台漫游车,这是开发者申报OpenAIdevs Codex Physical Builds项目时就确定的目标,目前这一构想已经进入成型阶段。
想要获取开源CAD文件和MOSS套件,可以加入tnkrdotai社区等候位,开发者会在内容就绪后通知参与者。
开发者拥有两年机器人搭建经验,主要依靠自身判断进行开发。AI作为辅助工具,负责部件定位、检查结构稳定性和公差是否符合标准,开发者通过小型提示词引导开发方向。
开发者表示,和Astra级模型出现之前的开发方式相比,现在的开发体验更像是跟着Instructables上的优质项目一步步搭建。
动漫 · @imFarhanAi▲ 3.1万
AI生成多镜头动漫可保持角色一致性,开发者分享工作流
开发者@imFarhanAi在𝕏分享APOB的AI动漫生成工作流,基于Seedance 2.5实现
AI生成多镜头动漫可保持角色一致性,开发者分享工作流
开发者@imFarhanAi在𝕏分享APOB的AI动漫生成工作流,基于Seedance 2.5实现
过往AI生成多镜头动漫时,不同镜头中的角色会出现形象偏差,无法连贯讲完一个故事。APOB开发的这套新工作流解决了这个问题。
这套工作流分为三个步骤:先锁定角色形象,再制作故事板,最后向Seedance 2.5输入带时间编码的30秒创作方向。
最终生成的内容可以保持不同镜头中角色的面部、情绪和主题统一。示例短片里,女孩和猫厨师在雨天街道、餐厅柜台、特写镜头中形象都没有出现偏差。
生成的内容已经是完整的短场景,从雨天街道到温暖餐厅的过渡自然,不只是单独的好看静帧,幸运的单个片段可以拓展成完整系列。
教程 · @txbrraa▲ 2.6K
16分钟分步教程 教你用Fable 5搭建电影网站
@txbrraa在𝕏发布的教程,目标是搭建价值5万美元的电影网站,使用工具为Claude Fable 5
16分钟分步教程 教你用Fable 5搭建电影网站
@txbrraa在𝕏发布的教程,目标是搭建价值5万美元的电影网站,使用工具为Claude Fable 5
这是一个时长16分钟的分步教程,讲解如何搭建价值5万美元的电影网站。教程会用到Claude Fable 5工具。
发布者提醒用户,在内容失效前保存这条教程。教程完整链接:
机器人 · @andrewmccalip▲ 7.6K
用极简黑客方式给JEV接入视觉,成功了
开发者andrewmccalip在𝕏分享,用ASCII文本 trick 将视觉接入下棋机器人JEV,实现了可用效果
用极简黑客方式给JEV接入视觉,成功了
开发者andrewmccalip在𝕏分享,用ASCII文本 trick 将视觉接入下棋机器人JEV,实现了可用效果
订阅 · @klarkxy▲ 3.8K
网友@klarkxy 公开个人AI工具订阅计划清单
来自@klarkxy 在𝕏发布的个人计划,涵盖GPT-Plus、Grok等5款AI工具
网友@klarkxy 公开个人AI工具订阅计划清单
来自@klarkxy 在𝕏发布的个人计划,涵盖GPT-Plus、Grok等5款AI工具
这是@klarkxy 在𝕏分享的个人AI工具订阅计划,清单包含5款不同定位的AI产品。
GPT Plus被用来生成图像和咨询问题,保留订阅。
Grok由super P+赠送,定位为处理繁杂事务的“高级牛马”。
Kimi年订阅费用699元,作为主要使用的代理工具。
Minimax两份订阅各119元,定位处理基础事务的“低级牛马”,同时用来生成视频。
Command Goat会被用来体验新模型。
大模型 · @pankajkumar_dev▲ 9.2K
开发者实测Claude Fable 5.5 AI模型表现优秀
开发者@pankajkumar_dev在𝕏分享Claude Fable 5.5的实测体验,对比多款模型表现更优
开发者实测Claude Fable 5.5 AI模型表现优秀
开发者@pankajkumar_dev在𝕏分享Claude Fable 5.5的实测体验,对比多款模型表现更优
Claude Fable 5.5由Fable 5.1迭代而来,目前已在网络上流出。作者通过熟人拿到了可用账号,进行了实测体验。
作者认为,这是他用过的性能最强的AI模型。哪怕只给出极简短的提示词,Fable 5.5也能生成非常富有创意的输出。
它在3D设计和网页设计领域表现不错,一次就能完成多项任务。语音和声音生成能力也有明显提升,虽然还达不到真实音质水平,但进步已经非常扎实。
作者表示,Fable 5.5在动态设计和视频编辑领域,是目前最好的模型。在他的测试中,Fable 5.5的表现超过了Opus 5.5和Astra两款模型。
开发 · @shcallaway▲ 54
团队本周从代码仓库删除80万行单元测试
开发者shcallaway在𝕏发文,称@sazabi单代码库删除80万行单元测试并提出三点假设
团队本周从代码仓库删除80万行单元测试
开发者shcallaway在𝕏发文,称@sazabi单代码库删除80万行单元测试并提出三点假设
开发者shcallaway本周从@sazabi单代码库删除了总计80万行单元测试,同时分享了三点关于单元测试的假设。
第一,单元测试会锁定冗余代码,让代码更难修改或删除。
第二,单元测试拖慢开发周期,因为它需要开发者在本地完成更多工作,还会延长持续集成(CI,自动化构建测试流程)的用时。
第三,单元测试会造成资金浪费,它需要开发者生成更多代码令牌,还会增加不必要的持续集成运行次数。
shcallaway表示后续会公布这次操作的结果。
今天的 36 条信号到这里下一轮 12:30 更新
📬 订阅
https://ai-pulse-lab.com/feed.xml