社区讨论:多数开发者认可这类专用模型的方向,认为可以让子代理调用对应领域的专用模型完成任务,符合“给不同任务搭配合适模型”的思路,已有Claude code做过类似尝试。有测试者发现小模型在文档事实检索上的表现优于大模型,推测原因是大模型容易过度思考。也有人提出质疑,指出该测试没有使用通用检索基准,也未说明评测指标,还没验证更大规模语料库下的检索效果。
今天发生了什么1 分钟读懂
谷歌DeepMind高管换岗,Jeff Dean确认离职。他是Google Brain和TensorFlow的核心缔造者,这次人事地震发生在DeepMind与Google Brain合并后首次重大调整期,后续模型研发节奏和开源策略都可能转向。
Prime Intellect把Prime Agent开源了,ARC-AGI-3跑分95.5%,略高于人类专家基准线95.4%。这是第一个在复杂推理基准上明确超过人类专家的开源代理,token效率做了专门优化。
03 GLM-5.2上线Theta EdgeCloud,性能逼近闭源顶尖模型 它采用纯MIT许可,支持1M token上下文,适合长时间大项目工作,开发者可以直接通过标准API调用使用
我们无比兴奋地宣布,GLM-5.2 现已登陆 Theta EdgeCloud。 这款 @Zai_org 的旗舰模型采用纯 MIT 许可证发布,拥有 1M 令牌上下文窗口,专为时长数小时的项目级工作构建。
04 Teneo 不用迁移数据就能直接用现有AI工具 不用迁移整套工作流就能提前验证数据质量,按调用次数付费,不需要固定订阅,适合不想换现有工具的使用者尝试
大多数AI数据工具都要求你先迁移进入它们的技术栈,才能确认数据质量好不好。 Teneo 的 CLI 支持 MCP 协议。只需要一条命令,就能接入你已经在运行的任何工具。 Claude Code。Cursor。终端。
今日焦点
Arena推出结合事实准确性的AI模型排行榜
事实准确性一直是用户使用AI模型时最常遇到的问题之一。7月15日,Arena推出全新排行榜,不仅根据人类偏好排序,还会加入模型回答的事实准确性进行排名。
人类偏好从一开始就是Arena模型排名的核心依据,但模型质量的部分维度很难靠人工评估,事实准确性就是其中之一。人工核查事实速度慢、人力成本高,因此事实准确性并不总能体现在人类偏好投票中。新排行榜结合人类偏好与事实准确性两个互补维度生成排名,单一维度单独使用都只能反映部分情况。
此次新增的事实准确性排名首先应用在文本竞技场和搜索竞技场中。初始阶段,该排名会作为非默认选项,用户可在排行榜界面手动开启。
深度阅读
🔥 信号雷达38 条
𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)
行业动态 · Hacker News▲ 179
便宜100倍的开源模型 居然赢了GPT-5.6 Sol
想省钱又想获得不错的检索效果,不用只盯着最贵的闭源模型。这个方向已经有人跑出了可行结果。
便宜100倍的开源模型 居然赢了GPT-5.6 Sol
想省钱又想获得不错的检索效果,不用只盯着最贵的闭源模型。这个方向已经有人跑出了可行结果。
行业动态 · Hacker News▲ 60
微软AI收入大部分来自OpenAI,持股关系被公开
这项披露能帮普通人看懂微软和OpenAI的绑定程度,想投资或关注科技行业格局的人,可以参考这个数据
微软AI收入大部分来自OpenAI,持股关系被公开
这项披露能帮普通人看懂微软和OpenAI的绑定程度,想投资或关注科技行业格局的人,可以参考这个数据
编码 · @WSJ▲ 7.6万
Meta推出首个AI编码代理,比竞品价格更低
这款叫Muse Code的产品,主打对标 Claude Code 和 OpenAI Codex 做平替
Meta推出首个AI编码代理,比竞品价格更低
这款叫Muse Code的产品,主打对标 Claude Code 和 OpenAI Codex 做平替
突发消息:Meta 正在推出其首款 AI 编程智能体,名为 Muse Code。
该产品将自身定位为 Claude Code 和 OpenAI 的 Codex 的更便宜替代选项。
行业动态 · Hacker News▲ 98
开发者分享了自制的高级智能体框架
目前只公开了项目名称,还没放出更多细节,关注开源智能体开发可以蹲后续更新
开发者分享了自制的高级智能体框架
目前只公开了项目名称,还没放出更多细节,关注开源智能体开发可以蹲后续更新
社区讨论:多数开发者都提到,技能、记忆系统、智能体编排这类概念听起来很好,但实际用起来大多没用,甚至会因为额外环节降低性能。有人质疑该框架没有公开基准测试数据,没法证明它能提升解决问题的能力、降低错误率。有人指出它本质是智能体工作流构建工具,不是宣传的高级智能体框架,动态生成DAG还容易让大模型过度拆分任务,忽略整体目标。
也有人分享了自己用REPL循环替代DAG的实践经验。
行业动态 · Hacker News▲ 115
业余编程圈集体反对使用LLM,你怎么看
不少编程爱好者排斥用LLM写代码,不同创作群体对AI工具的态度分化,正在改变编程社区的规则。
业余编程圈集体反对使用LLM,你怎么看
不少编程爱好者排斥用LLM写代码,不同创作群体对AI工具的态度分化,正在改变编程社区的规则。
社区讨论:多数人认同业余编程的核心是享受过程而非只求结果,做项目的目的是学习和创作,LLM跳过了过程,不符合业余编程的本质,就像编织圈不欢迎批量机器编织,没人把只做个成品当爱好。有人补充,很多反对的语境是针对有人用LLM抄别人代码洗稿,AI生成的低质废弃项目泛滥,也挤占了编程社区原本互助交流的氛围。另有经济压力大的普通人表示,对大多数人为了结果用LLM节省时间是合理选择,没必要强求所有人都花时间从零摸索。
新品发布 · @adcock_brett▲ 49.2万
Hark Handoff 称表现超过ChatGPT 5.4和Opus 4.8
它主打服务日常生活场景,不是做代码开发,想抢普通用户的日常AI使用需求
Hark Handoff 称表现超过ChatGPT 5.4和Opus 4.8
它主打服务日常生活场景,不是做代码开发,想抢普通用户的日常AI使用需求
今天我们推出 Hark Handoff。
Handoff 经独立验证,是有史以来性能最佳的互联网使用模型,表现优于 ChatGPT 5.4 和 Opus 4.8。
其他开发者专注于编码,我们专注于日常生活场景:订餐、预订航班、购物和网页导航。
行业动态 · Hacker News▲ 190
通义千问新出 Qwen Image 3.0 Pro 图像模型
Hacker News 社区用户分享了这个新模型,相关讨论已经超过五十条,可以等后续更新的使用信息。
通义千问新出 Qwen Image 3.0 Pro 图像模型
Hacker News 社区用户分享了这个新模型,相关讨论已经超过五十条,可以等后续更新的使用信息。
社区讨论:不少用户吐槽官方测试体验差,测试需要先添加支付方法、上传驾照身份验证才能使用,还有用户吐槽本次发布没有附上实际输出样图。大家普遍关心模型是否会开源权重开放到HuggingFace,方便本地部署。有用户根据Arena.ai评分和实际测试指出,该模型相比通义千问前代有提升,但生成效果弱于GPT-Image 2,在高密度UI设计上差距明显。
行业动态 · Hacker News▲ 396
谷歌DeepMind高管换岗,Jeff Dean确认离职
全球头部AI研发团队核心领导层变动,后续战略方向调整,都会影响普通用户能用到的AI产品功能和更新节奏。
谷歌DeepMind高管换岗,Jeff Dean确认离职
全球头部AI研发团队核心领导层变动,后续战略方向调整,都会影响普通用户能用到的AI产品功能和更新节奏。
https://www.axios.com/2026/08/05/google-deepmind-demis-hassa...
https://www.reuters.com/business/google-shakes-up-ai-leaders...
https://www.discoveryloop.com/, https://news.ycombinator.com/item?id=49184960
https://twitter.com/JeffDean/status/2085034604172603724, https://xcancel.com/JeffDean/status/2085034604172603724
社区讨论:多数用户认为杰夫·迪恩等多位谷歌核心AI人才接连出走,是谷歌AI业务陷入困境的标志。有人指出DeepMind人才激励远低于OpenAI、Anthropic这类初创AI公司,谷歌本身更像人才孵化器,产品优先级一直靠后。也有人纠正称原公告并未明确说杰夫·迪恩完全离开谷歌。消息传出后谷歌股价随即下跌5%,市值蒸发2000亿美元。
新品发布 · @finkd▲ 86.1万
finkd 推出测试版终端编程代理 Muse Code
它能独立完成大代码仓库里的完整开发任务,包括规划改法、写代码和验证结果,由专为编程优化的 Muse Spark 1.2 驱动,开发效率有望大幅提升
finkd 推出测试版终端编程代理 Muse Code
它能独立完成大代码仓库里的完整开发任务,包括规划改法、写代码和验证结果,由专为编程优化的 Muse Spark 1.2 驱动,开发效率有望大幅提升
今日发布 Muse Code beta 测试版。
它是一款终端编码代理,可以处理大型代码库上完整的软件工程任务:规划变更、编写代码、验证结果。
由专注编码的模型更新版本 Muse Spark 1.2 提供支持。
新品发布 · @PrimeIntellect▲ 25.8万
PrimeIntellect推出Prime Agent,能自我优化
它针对编码和长期自主任务设计,优化了token效率,想体验可以访问原文链接
PrimeIntellect推出Prime Agent,能自我优化
它针对编码和长期自主任务设计,优化了token效率,想体验可以访问原文链接
隆重介绍 Prime Agent:这是一个用于编码和长期自主任务的自我改进型 RLM 框架。
它通过程序化工具调用、上下文作为变量、多智能体消息传递和可自我修改的框架状态,实现了 token 效率与表现力的兼顾。
新品发布 · @AIatMeta▲ 8.9万
Meta推出Muse Code,能处理大型项目多文件改码
对需要处理大型代码仓库的开发者来说,这是Meta推出的全新原生终端编码智能体,能自主完成复杂改码工作
Meta推出Muse Code,能处理大型项目多文件改码
对需要处理大型代码仓库的开发者来说,这是Meta推出的全新原生终端编码智能体,能自主完成复杂改码工作
我们推出 Muse Code (beta):一款为长期软件工程任务打造的终端编码智能体,由我们全新的 Muse Spark 1.2 模型提供支持。
Muse Code 可以规划、实现并验证大型代码库中复杂的多文件改动,它搭载持久性子智能体,能够更快、更准确地解决难题,且需要人工干预更少。🧵👇
🔥 热点追踪 · @finkd▲ 86.1万
finkd 发布终端编码代理Muse Code beta版
finkd发布测试版Muse Code,它是一款终端编码代理,可处理大型代码库的完整软件工程任务,由编码专属模型Muse Spark 1.2驱动。行业参与者都在围绕自有模型开发配套工具,后续演进方向有待观察。
finkd 发布终端编码代理Muse Code beta版
finkd发布测试版Muse Code,它是一款终端编码代理,可处理大型代码库的完整软件工程任务,由编码专属模型Muse Spark 1.2驱动。行业参与者都在围绕自有模型开发配套工具,后续演进方向有待观察。
教育 · @lidangzzz▲ 3.3万
除了清北复交浙,其他高校AI本科都是诈骗?
有人称这类学校开不出大语言模型、AI智能体、机器学习系统的完整课程,只能掺进很多过时内容凑数
除了清北复交浙,其他高校AI本科都是诈骗?
有人称这类学校开不出大语言模型、AI智能体、机器学习系统的完整课程,只能掺进很多过时内容凑数
我再多说一句,昨天直播时提了一句, 在全中国范围内,除了清华、北大、复旦、交大、浙大,剩下所有学校���本科“人工智能专业”,都是诈骗,都是李鬼专业。 简单来说,这个档次的大学,开不了LLM的课,开不了AI Agent的课,开不全mlsys的课, 就开始往里疯狂兑水,什么传统deep learning、 baysian ML、各种古典RL、各种模式识别、图像处理、信号处理、各种垃圾数学、上个世纪的古典AI、蒙���卡洛、随机森林、贪心算法、模糊控制、大数据,还有一堆数学里面的各种分析和代数几何, 全往本科生专业的培养计划里面添加,让孩子学一堆没用的1960~2020年的所谓“AI”专业课,真正有用的课一门都没有上, 结果就是,这种本科专业彻底把孩子全毁了。 记住,全中国只有清华、北大、复旦、上交、浙大能大概开出来,剩下的学校没有一所有能力、有师资、有水平、有时间把这些课程开出来,那么就可以认为全都是垃圾,不如老老实实学个计算机。
模型 · @pidotdev▲ 3.0万
DeepSeek V4 Flash成了Ollama增长最快的模型
它同时是本周OpenRouter上最受欢迎的模型,多家服务商都可以通过Pi调用它
DeepSeek V4 Flash成了Ollama增长最快的模型
它同时是本周OpenRouter上最受欢迎的模型,多家服务商都可以通过Pi调用它
DeepSeek V4 Flash 是 Ollama 历史上 token 使用量增长最快的模型,也是本周 OpenRouter 上最受欢迎的模型。
它可以在 Pi 上通过多个不同的服务商使用。
如果你还从未在开源框架中试用过开放权重模型,现在是开始尝试的好时机。
提示词 · @hx831126▲ 1.7万
好的AI绘图提示词,不用写满所有细节
有人做生成天宫的图时,只给核心方向不规定具体场景、构图,让模型自己发挥想象
好的AI绘图提示词,不用写满所有细节
有人做生成天宫的图时,只给核心方向不规定具体场景、构图,让模型自己发挥想象
开发工具 · @clairevo▲ 1.1万
开发者做了自动审核合并PR的AI机器人
它会给拉取请求做风险评分,自动通过低风险的修改,解决开发者被审核请求淹没的问题
开发者做了自动审核合并PR的AI机器人
它会给拉取请求做风险评分,自动通过低风险的修改,解决开发者被审核请求淹没的问题
隆重介绍……我的 @evedev_ PR 审核 + 自动 approve 机器人:MERGE MOMMY。
和大家一样,我之前也被拉取请求淹没了,所以我做了一个小代理来给 PR 做风险评级,给低风险 PR 自动批准。这个项目的灵感来自前 How I AI 嘉宾 @brian_scanlan,以及 @intercom 团队的工作。
在这集短小节目里,我会教你这些内容:
02:35 为什么你不该手动审核每一个 PR
06:10 eve 代理框架是如何工作的
11:36 设计你的 PR 审核代理
13:07 搭配 codel browser use 搭建 + 部署 eve
17:25 Merge Mommy 实战演示
我推荐所有工程团队都试试——如果你还没做过一个这样的工具,今天就是动手的好日子。
一如既往,非常感谢我们出色的赞助商 @WorkOS —— 今天就让你的应用做好企业级就绪吧。
新品发布 · @kimmonismus▲ 2.5万
Prime Intellect 开源Prime Agent,跑分超人类专家
在长任务、长上下文测试中它获得了明显提升,用Opus 5在ARC-AGI-3拿到95.5%,略高于人类专家基准线95.4%。
Prime Intellect 开源Prime Agent,跑分超人类专家
在长任务、长上下文测试中它获得了明显提升,用Opus 5在ARC-AGI-3拿到95.5%,略高于人类专家基准线95.4%。
太激动人心了:Prime Intellect 发布了 Prime Agent,这是一个开源编程框架,可将长时间运行的 AI 会话转化为编程问题。
它唯一的工具是一个持久化 IPython 内核。模型可以通过编程搜索自身历史、调用工具、启动持久化子代理,并在活跃上下文之外存储有用状态。
Prime Intellect 表示:“RLM 将上下文视为变量,把子代理委托看作 REPL 内的函数调用。”他们报告称,该模型在长上下文和长周期任务上都取得了显著提升。
搭配 Opus 5 使用时,Prime Agent 在 ARC-AGI-3 上得分 95.5%,略高于基准测试公布的 95.4% 人类专家基线。它还在一个预览基准测试中,用 Rust 从头构建出了可运行的 SEGA Genesis 和 Game Boy Color 模拟器:D
深度观点 · @TheSherpaDAO▲ 1.3万
TheSherpaDAO 说下一轮AI竞争核心不止是能力
现在很多AI Agent没有明确身份,难以建立信任,当AI进入真实协作和交易场景,能被信任的身份,可能才是竞争的关键
TheSherpaDAO 说下一轮AI竞争核心不止是能力
现在很多AI Agent没有明确身份,难以建立信任,当AI进入真实协作和交易场景,能被信任的身份,可能才是竞争的关键
过去两年,AI Agent 赛道高速发展,但大量 Bot 更像匿名玩家:能行动,却缺少身份;有能力,却难以建立信任。而随着 Agent 开始进入社交、交易和真实协作场景,身份正在成为新的基础设施。本期节目邀请 AMIKO产品总监Sophie,一起拆解 Agent 时代最关键的问题:身份如何定义价值?
没有身份的 AI 是否正在失去未来?欢迎参与讨论,也许下一轮 AI 竞争的核心,不只是能力,而是谁真正被信任。👀
深度观点 · @jackmallers▲ 2.5万
Strike 用AI红队全天候测试自己的安全系统
AI大幅降低了找漏洞的成本,现在单个攻击者就能做到专家团队才能做的事。提前主动测试才能守住安全信任
Strike 用AI红队全天候测试自己的安全系统
AI大幅降低了找漏洞的成本,现在单个攻击者就能做到专家团队才能做的事。提前主动测试才能守住安全信任
在@Strike,我们组建了一支由前沿AI智能体组成的红队,全天候对我们的系统发起挑战。
AI已经大幅降低了发现漏洞的成本。
现在单个攻击者就能像专业团队一样排查软件。
信任要靠你在攻击者之前主动挑战自己来赢得。
前沿研究 · @_orcaman▲ 2.2万
Accomplish.ai 开源新基准,测AI代理真实性能
现有通用排行榜的测试条件不符合企业安全要求,企业都是靠不准的数字做部署和风险决策,这个开源基准能帮企业测出真实性能。
Accomplish.ai 开源新基准,测AI代理真实性能
现有通用排行榜的测试条件不符合企业安全要求,企业都是靠不准的数字做部署和风险决策,这个开源基准能帮企业测出真实性能。
今天我们开源了 @boundarybench,这是一套全新的论文、基准测试与 GitHub 仓库,企业可以用它来测出自身智能体的真实性能。
Boundary-Bench 由来自 @Accomplish_ai 和纽约大学的研究人员开发,我们在大约 10,000 次测试运行中检验了 12 个前沿智能体,测试采用真实企业策略,在由 EDR、SASE 和 DLP 安全工具执行这些策略的模拟环境中完成。
我们这么做的原因是,通用排行榜分数的生成条件,是任何安全团队都绝对不会允许的。这意味着企业目前是基于站不住脚的数字来做出部署与风险决策。
结果出人意料 >>
行业动态 · @MelvinInvests▲ 3.1万
摩根士丹利梳理AI供应链,钱不止被GPU厂商赚走
想参与AI产业投资,不止要关注GPU厂商。大买家的资本开支已经分散到七个实体层,冷却、电网、发电领域都出现了新机会。
摩根士丹利梳理AI供应链,钱不止被GPU厂商赚走
想参与AI产业投资,不止要关注GPU厂商。大买家的资本开支已经分散到七个实体层,冷却、电网、发电领域都出现了新机会。
工具产品 · @mattshumer_▲ 3.7万
mattshumer_ 做了个工具,做游戏比以前简单多了
想做游戏的人不用自己写复杂的 Gauntlet Loop 提示词,把需求告诉它就能生成,而且永久免费
mattshumer_ 做了个工具,做游戏比以前简单多了
想做游戏的人不用自己写复杂的 Gauntlet Loop 提示词,把需求告诉它就能生成,而且永久免费
想要开发这样的游戏吗?我把这件事变得超级简单。
你只需要告诉这个工具你想做什么 → 它会生成 Gauntlet Loop 提示词 → 你直接运行就行。
永久免费:
实战经验 · @freeCodeCamp▲ 8.7K
freeCodeCamp 推出了AI编程工具系统使用课程
想要用好AI提速写代码,却不知道选什么工具怎么用,这门整理了多款热门工具的课程,可以直接跟着学。
freeCodeCamp 推出了AI编程工具系统使用课程
想要用好AI提速写代码,却不知道选什么工具怎么用,这门整理了多款热门工具的课程,可以直接跟着学。
只要你能选对适用场景,AI工具就可以加快编码、代码审查和终端工作流的速度。
在本课程中,你将学习如何使用 GitHub Copilot、Claude Code、Gemini CLI、OpenClaw 和 CodeRabbit。
你还将学习AI“结对编程”、智能终端工作流、自托管自动化以及其他实用技术。
AI生成视频 · @Dheepanratnam▲ 1.0K
AI生成30秒动画《雨伞大逃亡》分镜脚本公开
用户Dheepanratnam用seedance 2.5生成30秒3D动画,公开完整提示词与分镜
AI生成30秒动画《雨伞大逃亡》分镜脚本公开
用户Dheepanratnam用seedance 2.5生成30秒3D动画,公开完整提示词与分镜
用户Dheepanratnam在𝕏分享了由seedance 2.5生成的30秒动画《雨伞大逃亡》,并公开了完整生成提示词。动画设定为皮克斯风格3D家庭动画,故事发生在雨天午后的城市,湿滑路面倒映出鲜亮色彩,是一段动作喜剧追逐戏。
脚本共分为10个分镜段落,对应不同时间区间,包含运镜要求、动作设计和角色对话。故事从穿黄色雨衣的小孩撑开亮红色雨伞开始,一阵强风将翻转的雨伞吹走,雨伞开启了它的自由逃亡。
雨伞躲过行人、穿过鸽群,冲过马路积水后撞到路灯,又被清扫车弹出,最终落在树枝上不肯回去。小孩用选电影观影权说服雨伞跟自己回家,最后两人一起踩水坑走回家,结尾放出标题卡。
这条内容标记了AI项目dreamina_ai的相关话题#DreaminaCPP。
AI视频 · @YourAlphaMom▲ 2.4万
Seedance 2.0生成AI视频的完整提示词设定曝光
这是用户@YourAlphaMom发布的15秒AI生活蒙太奇视频的完整生成提示词
Seedance 2.0生成AI视频的完整提示词设定曝光
这是用户@YourAlphaMom发布的15秒AI生活蒙太奇视频的完整生成提示词
AI开发 · @yulikay▲ 922
开发者yulikay用Claude Code开发个人首个应用
yulikay分享开发过程,称过程并不顺畅但每次都有新收获,还记录了开发历程
开发者yulikay用Claude Code开发个人首个应用
yulikay分享开发过程,称过程并不顺畅但每次都有新收获,还记录了开发历程
这是开发者yulikay在𝕏发布的内容,是她使用Claude Code搭建的个人第一个应用。
她表示开发过程并不顺畅,但每次开发会话都能让她学到新东西。
她期待未来自己开发的某款应用能迎来第一批真实用户,也正是因为这个目标,她选择公开记录整个开发历程。
相关内容链接:
视频生成 · @MinLiBuilds▲ 6.4K
短剧厂商部署Minimax H3本地版 音视频同生成优化口播
网友称Minimax H3本地版是视频生成Deepseek时刻,归纳了当前四种口视频生成流派
短剧厂商部署Minimax H3本地版 音视频同生成优化口播
网友称Minimax H3本地版是视频生成Deepseek时刻,归纳了当前四种口视频生成流派
有消息称,国内短剧公司都在部署Minimax H3本地部署版本。发言者认为,这是视频生成领域的Deepseek时刻,该模型可同步生成音频与视频,性能表现与海外产品不同。
当前做AI口播共有四种技术流派。第一种是不露脸方案,第二种是嘴唇同步模型,分为本地部署和线上服务两种形式,第三种是专属数字人模型,第四种是视频生成模型。
接下来发言者计划用这款音视频同出的模型制作数字人口播,测试能否保持人物形象一致性,发言者认为大概率不会出现问题。
AI工具 · @petergyang▲ 1.1万
开发者petergyang推出AI辅助人工审查编辑工具
可直接编辑HTML和Markdown文件,适配Codex与Claude Code,三步完成使用流程
开发者petergyang推出AI辅助人工审查编辑工具
可直接编辑HTML和Markdown文件,适配Codex与Claude Code,三步完成使用流程
这是开发者petergyang分享的一款名为/human-review的新技能,可配合AI代码工具直接编辑HTML和Markdown文件。
使用流程分为四步,首先向Codex或Claude Code输入指令,要求安装该工具,安装链接为
之后输入指令“/human-review (你的文档名称)”,工具会打开一个可视化编辑器。你可以在编辑器内直接编辑、格式化文本,调整图片尺寸,还能像在Google Doc里添加评论一样,给AI留下反馈。
完成修改后,点击“发送给代理”,工具就会自动应用所有修改。
这款工具可用来编辑产品需求文档、落地页等各类内容。很多人都习惯让AI代理完成工作,但最终收尾的10%打磨往往需要人工参与调整。如果你喜欢这个工具,可以去GitHub给它点星支持,链接同样为
游戏开发 · @fofrAI▲ 1.1K
8岁儿童借助AI Studio四小时自制平台游戏
一名8岁儿童用AI Studio花费四小时搭建出含32关的平台游戏
8岁儿童借助AI Studio四小时自制平台游戏
一名8岁儿童用AI Studio花费四小时搭建出含32关的平台游戏
开源 · @witcheer▲ 5.2K
Hermes Agent完成官方文档大规模更新,新增多项内容
Hermes Agent依据用户提问完成文档重大更新,新增多项实用内容
Hermes Agent完成官方文档大规模更新,新增多项内容
Hermes Agent依据用户提问完成文档重大更新,新增多项实用内容
Hermes Agent 的文档今天完成了一次扎实的更新,所有更新内容都来自过去几个月里你们在 X、Reddit、GitHub 和 Discord 上提出的问题。
文档网站新增内容:
- 一份关于在个人或工作设备上安全运行 Hermes 的指南
- 当你的 Agent 表现不如往常灵敏时的故障排查清单
- 解释为什么本地模型的第一次响应会耗时较长,以及哪些方法可以改善这个问题
- 一份单页文件功能总览:SOUL.md、USER.md、MEMORY.md、AGENTS.md
- 面向订阅服务商的按方案计费表
- 关于让两个 Agent 指向同一个 Hermes 主目录的警告
记住,当你遇到问题或故障时,先直接问你的 Hermes Agent。它自带一项可以读取自身在线文档的技能,因此它可以直接查到答案,一步步带你完成修复。
数据处理 · @charlesmurray▲ 4.1K
大模型可简化在线时间序列数据库构建流程
研究者分享:LLM可自动完成时间序列数据整理工作
大模型可简化在线时间序列数据库构建流程
研究者分享:LLM可自动完成时间序列数据整理工作
这段话写给那些从在线来源整理时间序列数据库,却迟迟没意识到AI潜力的人。
你再也不用亲自上网下载半打来源(比如从好几卷《统计摘要》里扒表格),再亲手把它们拼接在一起了。
你只需要告诉你的LLM(我用的是Grok)你想要一个包含指定年份范围、指定变量集合的电子表格,事情就做完了。
除了一张你可以复制粘贴进电子表格的表格之外,Grok还会自动提供这些数据来源的细节,以及你需要注意的跨时间可能存在的不一致问题。
这简直是魔法。
开发测试 · @steipete▲ 4.9万
开发者为Codex配置带视频远程KVM 自动化测试iMessage
开发者为大模型Codex配置远程KVM,实现iMessage端到端自动化测试
开发者为Codex配置带视频远程KVM 自动化测试iMessage
开发者为大模型Codex配置远程KVM,实现iMessage端到端自动化测试
我给 codex 配置了带视频功能的远程 KVM,这样它就能自动对 OpenClaw 上的 iMessage 集成进行端到端测试。
(iMessage 在虚拟机中不稳定,而且已读回执这类特定功能需要禁用 SIP 才能使用)
AI编程 · @levelsio▲ 9.6万
开发者分享AI编码Gauntlet Loop实践失败经历
独立开发者称Gauntlet Loop模式AI编码易出混乱,浪费成本
开发者分享AI编码Gauntlet Loop实践失败经历
独立开发者称Gauntlet Loop模式AI编码易出混乱,浪费成本
每次我跑 Gauntlet Loop,最后出来的全是一团乱麻:低效代码,逻辑混乱,什么都堆在一起,没有东西能正常运行。
我还烧掉了 500 美元,最后只能手动清理所有东西,回到我原来的代码状态。对我来说,用 AI 写代码唯一可行的方法就是一步步来,一个功能一个功能来,一个对象一个对象来,我得自己控住节奏,不然 AI就会彻底失控。
在我看来,Gauntlet Loop 这套东西纯粹就是用来在 X 上涨流量博 viral 的东西,技术上还远没成熟。哪怕是最好的 AI,一次塞太多东西进去,它也直接就懵了。
实际上我这次烧掉了 900 美元,最后出来的彻底一团糟。我不得不删掉它生成内容的 95%,回到我原来的代码状态!
🔥 热点追踪 · @JeffDean▲ 7.9万
JeffDean 提出自动化实验环路可解决多数工程科学问题
JeffDean 提出将实验环路自动化,该方法可覆盖多领域,首先会聚焦在ML研究与工程领域,能处理14项NAE Grand Challenge中的多数子问题。目前已有从业者关注该方向的进展。
JeffDean 提出自动化实验环路可解决多数工程科学问题
JeffDean 提出将实验环路自动化,该方法可覆盖多领域,首先会聚焦在ML研究与工程领域,能处理14项NAE Grand Challenge中的多数子问题。目前已有从业者关注该方向的进展。
新品发布 · @AIatMeta▲ 8.9万
Meta推出Muse Code,能处理大型项目多文件改码
对需要处理大型代码仓库的开发者来说,这是Meta推出的全新原生终端编码智能体,能自主完成复杂改码工作
Meta推出Muse Code,能处理大型项目多文件改码
对需要处理大型代码仓库的开发者来说,这是Meta推出的全新原生终端编码智能体,能自主完成复杂改码工作
我们推出 Muse Code (beta):一款为长期软件工程任务打造的终端编码智能体,由我们全新的 Muse Spark 1.2 模型提供支持。
Muse Code 可以规划、实现并验证大型代码库中复杂的多文件改动,它搭载持久性子智能体,能够更快、更准确地解决难题,且需要人工干预更少。🧵👇
新品发布 · @PrimeIntellect▲ 25.8万
PrimeIntellect推出Prime Agent,能自我优化
它针对编码和长期自主任务设计,优化了token效率,想体验可以访问原文链接
PrimeIntellect推出Prime Agent,能自我优化
它针对编码和长期自主任务设计,优化了token效率,想体验可以访问原文链接
隆重介绍 Prime Agent:这是一个用于编码和长期自主任务的自我改进型 RLM 框架。
它通过程序化工具调用、上下文作为变量、多智能体消息传递和可自我修改的框架状态,实现了 token 效率与表现力的兼顾。
新品发布 · @finkd▲ 86.1万
finkd 推出测试版终端编程代理 Muse Code
它能独立完成大代码仓库里的完整开发任务,包括规划改法、写代码和验证结果,由专为编程优化的 Muse Spark 1.2 驱动,开发效率有望大幅提升
finkd 推出测试版终端编程代理 Muse Code
它能独立完成大代码仓库里的完整开发任务,包括规划改法、写代码和验证结果,由专为编程优化的 Muse Spark 1.2 驱动,开发效率有望大幅提升
今日发布 Muse Code beta 测试版。
它是一款终端编码代理,可以处理大型代码库上完整的软件工程任务:规划变更、编写代码、验证结果。
由专注编码的模型更新版本 Muse Spark 1.2 提供支持。
新品发布 · @elonmusk▲ 44.5万
马斯克的Grok系列产品公开征集用户反馈
开发中的Grok Build框架、Grok基础模型和Imagine都在收集批评意见,想参与产品迭代的普通用户可以借机发声
马斯克的Grok系列产品公开征集用户反馈
开发中的Grok Build框架、Grok基础模型和Imagine都在收集批评意见,想参与产品迭代的普通用户可以借机发声
新品发布 · @adcock_brett▲ 49.2万
Hark Handoff 称表现超过ChatGPT 5.4和Opus 4.8
它主打服务日常生活场景,不是做代码开发,想抢普通用户的日常AI使用需求
Hark Handoff 称表现超过ChatGPT 5.4和Opus 4.8
它主打服务日常生活场景,不是做代码开发,想抢普通用户的日常AI使用需求
今天我们推出 Hark Handoff。
Handoff 经独立验证,是有史以来性能最佳的互联网使用模型,表现优于 ChatGPT 5.4 和 Opus 4.8。
其他开发者专注于编码,我们专注于日常生活场景:订餐、预订航班、购物和网页导航。
新品发布 · @kimmonismus▲ 2.5万
Prime Intellect 开源Prime Agent,跑分超人类专家
在长任务、长上下文测试中它获得了明显提升,用Opus 5在ARC-AGI-3拿到95.5%,略高于人类专家基准线95.4%。
Prime Intellect 开源Prime Agent,跑分超人类专家
在长任务、长上下文测试中它获得了明显提升,用Opus 5在ARC-AGI-3拿到95.5%,略高于人类专家基准线95.4%。
太激动人心了:Prime Intellect 发布了 Prime Agent,这是一个开源编程框架,可将长时间运行的 AI 会话转化为编程问题。
它唯一的工具是一个持久化 IPython 内核。模型可以通过编程搜索自身历史、调用工具、启动持久化子代理,并在活跃上下文之外存储有用状态。
Prime Intellect 表示:“RLM 将上下文视为变量,把子代理委托看作 REPL 内的函数调用。”他们报告称,该模型在长上下文和长周期任务上都取得了显著提升。
搭配 Opus 5 使用时,Prime Agent 在 ARC-AGI-3 上得分 95.5%,略高于基准测试公布的 95.4% 人类专家基线。它还在一个预览基准测试中,用 Rust 从头构建出了可运行的 SEGA Genesis 和 Game Boy Color 模拟器:D
新品发布 · @Theta_Network▲ 6.2K
GLM-5.2上线Theta EdgeCloud,性能逼近闭源顶尖模型
它采用纯MIT许可,支持1M token上下文,适合长时间大项目工作,开发者可以直接通过标准API调用使用
GLM-5.2上线Theta EdgeCloud,性能逼近闭源顶尖模型
它采用纯MIT许可,支持1M token上下文,适合长时间大项目工作,开发者可以直接通过标准API调用使用
我们无比兴奋地宣布,GLM-5.2 现已登陆 Theta EdgeCloud。
这款 @Zai_org 的旗舰模型采用纯 MIT 许可证发布,拥有 1M 令牌上下文窗口,专为时长数小时的项目级工作构建。
在高要求的长周期编码基准测试中,它的得分与 Claude Opus 4.8 仅相差 1 到 2 分,在 FrontierSWE 上仅落后 1%,是目前综合排名最高的开源模型。
开发者现在就可以通过 Theta EdgeCloud 网站,用单一标准 API 直接访问该模型。
这款模型对 Theta EdgeCloud 而言意义非凡。GLM-5.2 专为应对漫长复杂的智能体运行轨迹设计。
它适用于大规模代码构建、自动化研究、性能优化,以及需要数小时而非数分钟才能完成的调试工作。而 Theta EdgeCloud 的设计目标,正是在开放的全球分布式边缘网络上分发这类计算能力。
点击此处了解更多:
🔥 热点追踪 · @finkd▲ 86.1万
finkd 发布终端编码代理Muse Code beta版
finkd发布测试版Muse Code,它是一款终端编码代理,可处理大型代码库的完整软件工程任务,由编码专属模型Muse Spark 1.2驱动。行业参与者都在围绕自有模型开发配套工具,后续演进方向有待观察。
finkd 发布终端编码代理Muse Code beta版
finkd发布测试版Muse Code,它是一款终端编码代理,可处理大型代码库的完整软件工程任务,由编码专属模型Muse Spark 1.2驱动。行业参与者都在围绕自有模型开发配套工具,后续演进方向有待观察。
🔥 热点追踪 · @JeffDean▲ 7.9万
JeffDean 提出自动化实验环路可解决多数工程科学问题
JeffDean 提出将实验环路自动化,该方法可覆盖多领域,首先会聚焦在ML研究与工程领域,能处理14项NAE Grand Challenge中的多数子问题。目前已有从业者关注该方向的进展。
JeffDean 提出自动化实验环路可解决多数工程科学问题
JeffDean 提出将实验环路自动化,该方法可覆盖多领域,首先会聚焦在ML研究与工程领域,能处理14项NAE Grand Challenge中的多数子问题。目前已有从业者关注该方向的进展。
行业动态 · @MelvinInvests▲ 3.1万
摩根士丹利梳理AI供应链,钱不止被GPU厂商赚走
想参与AI产业投资,不止要关注GPU厂商。大买家的资本开支已经分散到七个实体层,冷却、电网、发电领域都出现了新机会。
摩根士丹利梳理AI供应链,钱不止被GPU厂商赚走
想参与AI产业投资,不止要关注GPU厂商。大买家的资本开支已经分散到七个实体层,冷却、电网、发电领域都出现了新机会。
教育 · @lidangzzz▲ 3.3万
除了清北复交浙,其他高校AI本科都是诈骗?
有人称这类学校开不出大语言模型、AI智能体、机器学习系统的完整课程,只能掺进很多过时内容凑数
除了清北复交浙,其他高校AI本科都是诈骗?
有人称这类学校开不出大语言模型、AI智能体、机器学习系统的完整课程,只能掺进很多过时内容凑数
我再多说一句,昨天直播时提了一句, 在全中国范围内,除了清华、北大、复旦、交大、浙大,剩下所有学校���本科“人工智能专业”,都是诈骗,都是李鬼专业。 简单来说,这个档次的大学,开不了LLM的课,开不了AI Agent的课,开不全mlsys的课, 就开始往里疯狂兑水,什么传统deep learning、 baysian ML、各种古典RL、各种模式识别、图像处理、信号处理、各种垃圾数学、上个世纪的古典AI、蒙���卡洛、随机森林、贪心算法、模糊控制、大数据,还有一堆数学里面的各种分析和代数几何, 全往本科生专业的培养计划里面添加,让孩子学一堆没用的1960~2020年的所谓“AI”专业课,真正有用的课一门都没有上, 结果就是,这种本科专业彻底把孩子全毁了。 记住,全中国只有清华、北大、复旦、上交、浙大能大概开出来,剩下的学校没有一所有能力、有师资、有水平、有时间把这些课程开出来,那么就可以认为全都是垃圾,不如老老实实学个计算机。
模型 · @pidotdev▲ 3.0万
DeepSeek V4 Flash成了Ollama增长最快的模型
它同时是本周OpenRouter上最受欢迎的模型,多家服务商都可以通过Pi调用它
DeepSeek V4 Flash成了Ollama增长最快的模型
它同时是本周OpenRouter上最受欢迎的模型,多家服务商都可以通过Pi调用它
DeepSeek V4 Flash 是 Ollama 历史上 token 使用量增长最快的模型,也是本周 OpenRouter 上最受欢迎的模型。
它可以在 Pi 上通过多个不同的服务商使用。
如果你还从未在开源框架中试用过开放权重模型,现在是开始尝试的好时机。
编码 · @WSJ▲ 7.6万
Meta推出首个AI编码代理,比竞品价格更低
这款叫Muse Code的产品,主打对标 Claude Code 和 OpenAI Codex 做平替
Meta推出首个AI编码代理,比竞品价格更低
这款叫Muse Code的产品,主打对标 Claude Code 和 OpenAI Codex 做平替
突发消息:Meta 正在推出其首款 AI 编程智能体,名为 Muse Code。
该产品将自身定位为 Claude Code 和 OpenAI 的 Codex 的更便宜替代选项。
提示词 · @hx831126▲ 1.7万
好的AI绘图提示词,不用写满所有细节
有人做生成天宫的图时,只给核心方向不规定具体场景、构图,让模型自己发挥想象
好的AI绘图提示词,不用写满所有细节
有人做生成天宫的图时,只给核心方向不规定具体场景、构图,让模型自己发挥想象
开发工具 · @clairevo▲ 1.1万
开发者做了自动审核合并PR的AI机器人
它会给拉取请求做风险评分,自动通过低风险的修改,解决开发者被审核请求淹没的问题
开发者做了自动审核合并PR的AI机器人
它会给拉取请求做风险评分,自动通过低风险的修改,解决开发者被审核请求淹没的问题
隆重介绍……我的 @evedev_ PR 审核 + 自动 approve 机器人:MERGE MOMMY。
和大家一样,我之前也被拉取请求淹没了,所以我做了一个小代理来给 PR 做风险评级,给低风险 PR 自动批准。这个项目的灵感来自前 How I AI 嘉宾 @brian_scanlan,以及 @intercom 团队的工作。
在这集短小节目里,我会教你这些内容:
02:35 为什么你不该手动审核每一个 PR
06:10 eve 代理框架是如何工作的
11:36 设计你的 PR 审核代理
13:07 搭配 codel browser use 搭建 + 部署 eve
17:25 Merge Mommy 实战演示
我推荐所有工程团队都试试——如果你还没做过一个这样的工具,今天就是动手的好日子。
一如既往,非常感谢我们出色的赞助商 @WorkOS —— 今天就让你的应用做好企业级就绪吧。
行业动态 · Hacker News▲ 396
谷歌DeepMind高管换岗,Jeff Dean确认离职
全球头部AI研发团队核心领导层变动,后续战略方向调整,都会影响普通用户能用到的AI产品功能和更新节奏。
谷歌DeepMind高管换岗,Jeff Dean确认离职
全球头部AI研发团队核心领导层变动,后续战略方向调整,都会影响普通用户能用到的AI产品功能和更新节奏。
https://www.axios.com/2026/08/05/google-deepmind-demis-hassa...
https://www.reuters.com/business/google-shakes-up-ai-leaders...
https://www.discoveryloop.com/, https://news.ycombinator.com/item?id=49184960
https://twitter.com/JeffDean/status/2085034604172603724, https://xcancel.com/JeffDean/status/2085034604172603724
社区讨论:多数用户认为杰夫·迪恩等多位谷歌核心AI人才接连出走,是谷歌AI业务陷入困境的标志。有人指出DeepMind人才激励远低于OpenAI、Anthropic这类初创AI公司,谷歌本身更像人才孵化器,产品优先级一直靠后。也有人纠正称原公告并未明确说杰夫·迪恩完全离开谷歌。消息传出后谷歌股价随即下跌5%,市值蒸发2000亿美元。
行业动态 · Hacker News▲ 190
通义千问新出 Qwen Image 3.0 Pro 图像模型
Hacker News 社区用户分享了这个新模型,相关讨论已经超过五十条,可以等后续更新的使用信息。
通义千问新出 Qwen Image 3.0 Pro 图像模型
Hacker News 社区用户分享了这个新模型,相关讨论已经超过五十条,可以等后续更新的使用信息。
社区讨论:不少用户吐槽官方测试体验差,测试需要先添加支付方法、上传驾照身份验证才能使用,还有用户吐槽本次发布没有附上实际输出样图。大家普遍关心模型是否会开源权重开放到HuggingFace,方便本地部署。有用户根据Arena.ai评分和实际测试指出,该模型相比通义千问前代有提升,但生成效果弱于GPT-Image 2,在高密度UI设计上差距明显。
行业动态 · Hacker News▲ 115
业余编程圈集体反对使用LLM,你怎么看
不少编程爱好者排斥用LLM写代码,不同创作群体对AI工具的态度分化,正在改变编程社区的规则。
业余编程圈集体反对使用LLM,你怎么看
不少编程爱好者排斥用LLM写代码,不同创作群体对AI工具的态度分化,正在改变编程社区的规则。
社区讨论:多数人认同业余编程的核心是享受过程而非只求结果,做项目的目的是学习和创作,LLM跳过了过程,不符合业余编程的本质,就像编织圈不欢迎批量机器编织,没人把只做个成品当爱好。有人补充,很多反对的语境是针对有人用LLM抄别人代码洗稿,AI生成的低质废弃项目泛滥,也挤占了编程社区原本互助交流的氛围。另有经济压力大的普通人表示,对大多数人为了结果用LLM节省时间是合理选择,没必要强求所有人都花时间从零摸索。
行业动态 · Hacker News▲ 98
开发者分享了自制的高级智能体框架
目前只公开了项目名称,还没放出更多细节,关注开源智能体开发可以蹲后续更新
开发者分享了自制的高级智能体框架
目前只公开了项目名称,还没放出更多细节,关注开源智能体开发可以蹲后续更新
社区讨论:多数开发者都提到,技能、记忆系统、智能体编排这类概念听起来很好,但实际用起来大多没用,甚至会因为额外环节降低性能。有人质疑该框架没有公开基准测试数据,没法证明它能提升解决问题的能力、降低错误率。有人指出它本质是智能体工作流构建工具,不是宣传的高级智能体框架,动态生成DAG还容易让大模型过度拆分任务,忽略整体目标。
也有人分享了自己用REPL循环替代DAG的实践经验。
行业动态 · Hacker News▲ 60
微软AI收入大部分来自OpenAI,持股关系被公开
这项披露能帮普通人看懂微软和OpenAI的绑定程度,想投资或关注科技行业格局的人,可以参考这个数据
微软AI收入大部分来自OpenAI,持股关系被公开
这项披露能帮普通人看懂微软和OpenAI的绑定程度,想投资或关注科技行业格局的人,可以参考这个数据
行业动态 · Hacker News▲ 179
便宜100倍的开源模型 居然赢了GPT-5.6 Sol
想省钱又想获得不错的检索效果,不用只盯着最贵的闭源模型。这个方向已经有人跑出了可行结果。
便宜100倍的开源模型 居然赢了GPT-5.6 Sol
想省钱又想获得不错的检索效果,不用只盯着最贵的闭源模型。这个方向已经有人跑出了可行结果。
社区讨论:多数开发者认可这类专用模型的方向,认为可以让子代理调用对应领域的专用模型完成任务,符合“给不同任务搭配合适模型”的思路,已有Claude code做过类似尝试。有测试者发现小模型在文档事实检索上的表现优于大模型,推测原因是大模型容易过度思考。也有人提出质疑,指出该测试没有使用通用检索基准,也未说明评测指标,还没验证更大规模语料库下的检索效果。
深度观点 · @jackmallers▲ 2.5万
Strike 用AI红队全天候测试自己的安全系统
AI大幅降低了找漏洞的成本,现在单个攻击者就能做到专家团队才能做的事。提前主动测试才能守住安全信任
Strike 用AI红队全天候测试自己的安全系统
AI大幅降低了找漏洞的成本,现在单个攻击者就能做到专家团队才能做的事。提前主动测试才能守住安全信任
在@Strike,我们组建了一支由前沿AI智能体组成的红队,全天候对我们的系统发起挑战。
AI已经大幅降低了发现漏洞的成本。
现在单个攻击者就能像专业团队一样排查软件。
信任要靠你在攻击者之前主动挑战自己来赢得。
深度观点 · @TheSherpaDAO▲ 1.3万
TheSherpaDAO 说下一轮AI竞争核心不止是能力
现在很多AI Agent没有明确身份,难以建立信任,当AI进入真实协作和交易场景,能被信任的身份,可能才是竞争的关键
TheSherpaDAO 说下一轮AI竞争核心不止是能力
现在很多AI Agent没有明确身份,难以建立信任,当AI进入真实协作和交易场景,能被信任的身份,可能才是竞争的关键
过去两年,AI Agent 赛道高速发展,但大量 Bot 更像匿名玩家:能行动,却缺少身份;有能力,却难以建立信任。而随着 Agent 开始进入社交、交易和真实协作场景,身份正在成为新的基础设施。本期节目邀请 AMIKO产品总监Sophie,一起拆解 Agent 时代最关键的问题:身份如何定义价值?
没有身份的 AI 是否正在失去未来?欢迎参与讨论,也许下一轮 AI 竞争的核心,不只是能力,而是谁真正被信任。👀
工具产品 · @mattshumer_▲ 3.7万
mattshumer_ 做了个工具,做游戏比以前简单多了
想做游戏的人不用自己写复杂的 Gauntlet Loop 提示词,把需求告诉它就能生成,而且永久免费
mattshumer_ 做了个工具,做游戏比以前简单多了
想做游戏的人不用自己写复杂的 Gauntlet Loop 提示词,把需求告诉它就能生成,而且永久免费
想要开发这样的游戏吗?我把这件事变得超级简单。
你只需要告诉这个工具你想做什么 → 它会生成 Gauntlet Loop 提示词 → 你直接运行就行。
永久免费:
工具产品 · @teneo_protocol▲ 5.2K
Teneo 不用迁移数据就能直接用现有AI工具
不用迁移整套工作流就能提前验证数据质量,按调用次数付费,不需要固定订阅,适合不想换现有工具的使用者尝试
Teneo 不用迁移数据就能直接用现有AI工具
不用迁移整套工作流就能提前验证数据质量,按调用次数付费,不需要固定订阅,适合不想换现有工具的使用者尝试
大多数AI数据工具都要求你先迁移进入它们的技术栈,才能确认数据质量好不好。
Teneo 的 CLI 支持 MCP 协议。只需要一条命令,就能接入你已经在运行的任何工具。
Claude Code。Cursor。终端。像 OpenClaw 这样的自托管网关。像 Hermes 这样的独立运行时。
它的后端有数百个实时代理。涵盖市场数据、链上分析、实时公开 X 数据。
通过 x402 协议用 USDC 按调用付费。没有 API 密钥,没有订阅,没有席位限制。不需要迁移任何东西!
在这里查看我们的入门指南:👇
工具产品 · @REMIX_KSA▲ 5.2K
这个网站整理了数千种现成的AI编程Agent技能
给Claude Code等编程工具用,只要一条命令就能给AI添加新能力,不用每次重复写提示词,常靠AI写代码的人可以试试
这个网站整理了数千种现成的AI编程Agent技能
给Claude Code等编程工具用,只要一条命令就能给AI添加新能力,不用每次重复写提示词,常靠AI写代码的人可以试试
我给你们找到了一个网站,它汇集了数千个现成的 Agent Skills,适用于 Claude Code、Cursor、Codex 等其他工具。 你只需要用一条命令,就能为你的智能 Agent 添加全新能力和技能,不用每次都重复写提示词。 如果你在编程时依赖 AI,这款工具值得一试 👌 🌐
前沿研究 · @_orcaman▲ 2.2万
Accomplish.ai 开源新基准,测AI代理真实性能
现有通用排行榜的测试条件不符合企业安全要求,企业都是靠不准的数字做部署和风险决策,这个开源基准能帮企业测出真实性能。
Accomplish.ai 开源新基准,测AI代理真实性能
现有通用排行榜的测试条件不符合企业安全要求,企业都是靠不准的数字做部署和风险决策,这个开源基准能帮企业测出真实性能。
今天我们开源了 @boundarybench,这是一套全新的论文、基准测试与 GitHub 仓库,企业可以用它来测出自身智能体的真实性能。
Boundary-Bench 由来自 @Accomplish_ai 和纽约大学的研究人员开发,我们在大约 10,000 次测试运行中检验了 12 个前沿智能体,测试采用真实企业策略,在由 EDR、SASE 和 DLP 安全工具执行这些策略的模拟环境中完成。
我们这么做的原因是,通用排行榜分数的生成条件,是任何安全团队都绝对不会允许的。这意味着企业目前是基于站不住脚的数字来做出部署与风险决策。
结果出人意料 >>
实战经验 · @freeCodeCamp▲ 8.7K
freeCodeCamp 推出了AI编程工具系统使用课程
想要用好AI提速写代码,却不知道选什么工具怎么用,这门整理了多款热门工具的课程,可以直接跟着学。
freeCodeCamp 推出了AI编程工具系统使用课程
想要用好AI提速写代码,却不知道选什么工具怎么用,这门整理了多款热门工具的课程,可以直接跟着学。
只要你能选对适用场景,AI工具就可以加快编码、代码审查和终端工作流的速度。
在本课程中,你将学习如何使用 GitHub Copilot、Claude Code、Gemini CLI、OpenClaw 和 CodeRabbit。
你还将学习AI“结对编程”、智能终端工作流、自托管自动化以及其他实用技术。
AI编程 · @levelsio▲ 9.6万
开发者分享AI编码Gauntlet Loop实践失败经历
独立开发者称Gauntlet Loop模式AI编码易出混乱,浪费成本
开发者分享AI编码Gauntlet Loop实践失败经历
独立开发者称Gauntlet Loop模式AI编码易出混乱,浪费成本
每次我跑 Gauntlet Loop,最后出来的全是一团乱麻:低效代码,逻辑混乱,什么都堆在一起,没有东西能正常运行。
我还烧掉了 500 美元,最后只能手动清理所有东西,回到我原来的代码状态。对我来说,用 AI 写代码唯一可行的方法就是一步步来,一个功能一个功能来,一个对象一个对象来,我得自己控住节奏,不然 AI就会彻底失控。
在我看来,Gauntlet Loop 这套东西纯粹就是用来在 X 上涨流量博 viral 的东西,技术上还远没成熟。哪怕是最好的 AI,一次塞太多东西进去,它也直接就懵了。
实际上我这次烧掉了 900 美元,最后出来的彻底一团糟。我不得不删掉它生成内容的 95%,回到我原来的代码状态!
开发测试 · @steipete▲ 4.9万
开发者为Codex配置带视频远程KVM 自动化测试iMessage
开发者为大模型Codex配置远程KVM,实现iMessage端到端自动化测试
开发者为Codex配置带视频远程KVM 自动化测试iMessage
开发者为大模型Codex配置远程KVM,实现iMessage端到端自动化测试
我给 codex 配置了带视频功能的远程 KVM,这样它就能自动对 OpenClaw 上的 iMessage 集成进行端到端测试。
(iMessage 在虚拟机中不稳定,而且已读回执这类特定功能需要禁用 SIP 才能使用)
数据处理 · @charlesmurray▲ 4.1K
大模型可简化在线时间序列数据库构建流程
研究者分享:LLM可自动完成时间序列数据整理工作
大模型可简化在线时间序列数据库构建流程
研究者分享:LLM可自动完成时间序列数据整理工作
这段话写给那些从在线来源整理时间序列数据库,却迟迟没意识到AI潜力的人。
你再也不用亲自上网下载半打来源(比如从好几卷《统计摘要》里扒表格),再亲手把它们拼接在一起了。
你只需要告诉你的LLM(我用的是Grok)你想要一个包含指定年份范围、指定变量集合的电子表格,事情就做完了。
除了一张你可以复制粘贴进电子表格的表格之外,Grok还会自动提供这些数据来源的细节,以及你需要注意的跨时间可能存在的不一致问题。
这简直是魔法。
开源 · @witcheer▲ 5.2K
Hermes Agent完成官方文档大规模更新,新增多项内容
Hermes Agent依据用户提问完成文档重大更新,新增多项实用内容
Hermes Agent完成官方文档大规模更新,新增多项内容
Hermes Agent依据用户提问完成文档重大更新,新增多项实用内容
Hermes Agent 的文档今天完成了一次扎实的更新,所有更新内容都来自过去几个月里你们在 X、Reddit、GitHub 和 Discord 上提出的问题。
文档网站新增内容:
- 一份关于在个人或工作设备上安全运行 Hermes 的指南
- 当你的 Agent 表现不如往常灵敏时的故障排查清单
- 解释为什么本地模型的第一次响应会耗时较长,以及哪些方法可以改善这个问题
- 一份单页文件功能总览:SOUL.md、USER.md、MEMORY.md、AGENTS.md
- 面向订阅服务商的按方案计费表
- 关于让两个 Agent 指向同一个 Hermes 主目录的警告
记住,当你遇到问题或故障时,先直接问你的 Hermes Agent。它自带一项可以读取自身在线文档的技能,因此它可以直接查到答案,一步步带你完成修复。
游戏开发 · @fofrAI▲ 1.1K
8岁儿童借助AI Studio四小时自制平台游戏
一名8岁儿童用AI Studio花费四小时搭建出含32关的平台游戏
8岁儿童借助AI Studio四小时自制平台游戏
一名8岁儿童用AI Studio花费四小时搭建出含32关的平台游戏
AI工具 · @petergyang▲ 1.1万
开发者petergyang推出AI辅助人工审查编辑工具
可直接编辑HTML和Markdown文件,适配Codex与Claude Code,三步完成使用流程
开发者petergyang推出AI辅助人工审查编辑工具
可直接编辑HTML和Markdown文件,适配Codex与Claude Code,三步完成使用流程
这是开发者petergyang分享的一款名为/human-review的新技能,可配合AI代码工具直接编辑HTML和Markdown文件。
使用流程分为四步,首先向Codex或Claude Code输入指令,要求安装该工具,安装链接为
之后输入指令“/human-review (你的文档名称)”,工具会打开一个可视化编辑器。你可以在编辑器内直接编辑、格式化文本,调整图片尺寸,还能像在Google Doc里添加评论一样,给AI留下反馈。
完成修改后,点击“发送给代理”,工具就会自动应用所有修改。
这款工具可用来编辑产品需求文档、落地页等各类内容。很多人都习惯让AI代理完成工作,但最终收尾的10%打磨往往需要人工参与调整。如果你喜欢这个工具,可以去GitHub给它点星支持,链接同样为
视频生成 · @MinLiBuilds▲ 6.4K
短剧厂商部署Minimax H3本地版 音视频同生成优化口播
网友称Minimax H3本地版是视频生成Deepseek时刻,归纳了当前四种口视频生成流派
短剧厂商部署Minimax H3本地版 音视频同生成优化口播
网友称Minimax H3本地版是视频生成Deepseek时刻,归纳了当前四种口视频生成流派
有消息称,国内短剧公司都在部署Minimax H3本地部署版本。发言者认为,这是视频生成领域的Deepseek时刻,该模型可同步生成音频与视频,性能表现与海外产品不同。
当前做AI口播共有四种技术流派。第一种是不露脸方案,第二种是嘴唇同步模型,分为本地部署和线上服务两种形式,第三种是专属数字人模型,第四种是视频生成模型。
接下来发言者计划用这款音视频同出的模型制作数字人口播,测试能否保持人物形象一致性,发言者认为大概率不会出现问题。
AI开发 · @yulikay▲ 922
开发者yulikay用Claude Code开发个人首个应用
yulikay分享开发过程,称过程并不顺畅但每次都有新收获,还记录了开发历程
开发者yulikay用Claude Code开发个人首个应用
yulikay分享开发过程,称过程并不顺畅但每次都有新收获,还记录了开发历程
这是开发者yulikay在𝕏发布的内容,是她使用Claude Code搭建的个人第一个应用。
她表示开发过程并不顺畅,但每次开发会话都能让她学到新东西。
她期待未来自己开发的某款应用能迎来第一批真实用户,也正是因为这个目标,她选择公开记录整个开发历程。
相关内容链接:
AI视频 · @YourAlphaMom▲ 2.4万
Seedance 2.0生成AI视频的完整提示词设定曝光
这是用户@YourAlphaMom发布的15秒AI生活蒙太奇视频的完整生成提示词
Seedance 2.0生成AI视频的完整提示词设定曝光
这是用户@YourAlphaMom发布的15秒AI生活蒙太奇视频的完整生成提示词
AI生成视频 · @Dheepanratnam▲ 1.0K
AI生成30秒动画《雨伞大逃亡》分镜脚本公开
用户Dheepanratnam用seedance 2.5生成30秒3D动画,公开完整提示词与分镜
AI生成30秒动画《雨伞大逃亡》分镜脚本公开
用户Dheepanratnam用seedance 2.5生成30秒3D动画,公开完整提示词与分镜
用户Dheepanratnam在𝕏分享了由seedance 2.5生成的30秒动画《雨伞大逃亡》,并公开了完整生成提示词。动画设定为皮克斯风格3D家庭动画,故事发生在雨天午后的城市,湿滑路面倒映出鲜亮色彩,是一段动作喜剧追逐戏。
脚本共分为10个分镜段落,对应不同时间区间,包含运镜要求、动作设计和角色对话。故事从穿黄色雨衣的小孩撑开亮红色雨伞开始,一阵强风将翻转的雨伞吹走,雨伞开启了它的自由逃亡。
雨伞躲过行人、穿过鸽群,冲过马路积水后撞到路灯,又被清扫车弹出,最终落在树枝上不肯回去。小孩用选电影观影权说服雨伞跟自己回家,最后两人一起踩水坑走回家,结尾放出标题卡。
这条内容标记了AI项目dreamina_ai的相关话题#DreaminaCPP。
今天的 38 条信号到这里下一轮 12:30 更新
📬 订阅
https://ai-pulse-lab.com/feed.xml