嘿 HN,我今年 16 岁,已经开发 Sprocket 有一段时间了。这是一个开源 AI 智能体,在硬件和软件任务上的表现都优于目前所有其他智能体。
最棒的一点是:只要你给出指令,Sprocket 就能自动从任意网站购买任何商品,小到硬件零件,大到 SaaS 订阅都没问题。
Sprocket 会从网络获取最优的上下文信息来完成所有操作,因此可靠性极高。这个智能体的质量、性能和 UI 都能媲美 Codex/
欧盟AI法案今天正式生效,这是全球首部综合性AI监管法规落地。未来AI生成的图文音视频必须标注来源,普通人辨别虚假内容有了法定依据,但合规成本正加速向中小开发者转移。
DeepSeek即将推出AI编码代理,直接对标Claude Code,瞄准自主软件工程全流程。这是继V4-Flash以0.28美元/百万token击穿定价地板后,DeepSeek在应用层的又一次正面进攻。
16岁开发者开源了AI代理Sprocket,能自主购买硬件和SaaS订阅,性能对标Codex。未成年人做出可靠度可验证的开源工具,比融资新闻更能说明AI工程能力的门槛在下降。
Google DeepMind 的最新研究。(收藏起来) SkillSmith 将模型权重视为 LLM 可以原生读取的额外模态。 增强后的模型会摄入已有的前缀权重,以及描述能力如何与目标关联的富文本,然后直接输出生成该技能的全新前缀权重。
Kimi K3 已在 Cluster 上线。 100万 token 上下文窗口。是 Moonshot AI 目前能力最强的模型。 你可以给它输入一整个代码库、一个研究语料库、一整份文档,它能全程保持上下文连贯。
所有人都在尝试用服务器、向量数据库和编排平台解决AI团队记忆问题。这个开源工具只用你代码仓库里的一个文件夹就搞定了。 你的团队里每个开发者都在用 Claude Code。当一个代理搞砸了某件事,其他人完全不知情,下周他们只会重复犯同样的错。
这个开源技能可以接入 Claude Code、Codex 和 Cursor,能为 AI 编程代理提供更好的设计品味,让生成的 UI 不再看起来像是 AI 做出来的。
Astra,一个 OpenAI 正在内部测试的新模型,令人惊叹。不可否认:
Noam Brown @polynoamial Lijie Chen @wjmzbmr110 来自我们下一个主要模型 Astra 的证明,解决了数学和理论计算机科学中长期存在的开放问题(还包括计算永久的新的电路下界!)
GPT-5.6 已经在数学和科学领域促成了许多激动人心的工作。迫不及待……
2026年8月1日上午8:17 · 840万次查看 · 664条回复 · 2110次转发 · 1.49万次点赞
𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)
它能自主在网站帮你购买硬件零件或SaaS订阅,性能可靠度对标Codex,这是未成年人做出来的公开开源工具。
嘿 HN,我今年 16 岁,已经开发 Sprocket 有一段时间了。这是一个开源 AI 智能体,在硬件和软件任务上的表现都优于目前所有其他智能体。
最棒的一点是:只要你给出指令,Sprocket 就能自动从任意网站购买任何商品,小到硬件零件,大到 SaaS 订阅都没问题。
Sprocket 会从网络获取最优的上下文信息来完成所有操作,因此可靠性极高。这个智能体的质量、性能和 UI 都能媲美 Codex/
写作者不用自己摸索AI改稿的思路,这些现成提示词可以直接拿去改 fiction 稿件,节省调试时间。
我打算分享几个我一直在用来编辑小说的提示词。希望你能觉得它们有用……人格意识流……开发者:系统:新人格的简介与阅读视角
这个新人格名叫 Jasper,是一名千禧一代男性,品味主流但有智识好奇心,倾向于寻求共识,重视专业评论好评。他的视角主要由数字原生经历塑造,成长岁月受早期社交媒体和快速技术发展影响。
ComfyUI团队已经把这个大模型优化到位,本地用户能用上更强大的开源视频生成能力
得益于 Minimax H3,开源视频模型明天就会迎来巨大飞跃。对本地用户来说,这真的是颠覆性的改变。
ComfyUI 才华横溢的开发团队已经对这个超大模型完成了优化,优化后它甚至能在老旧电脑上流畅运行。
我这次生成只用了单步生成,出来的结果和我想象的完全一致。我用了两张参考图,加上一段输入音频,生成结果和输入完全一致。
我已经迫不及待想看社区能用这些开放权重做出什么东西了。
讨厌AI答问题先扯一堆客套废话,装完这个插件,编码助手就能直接给你分步骤说结论,不用再等半天看铺垫。
有人做了一个能阻止AI把答案藏在废话里的 Claude Code 技能。先给出行动,步骤编号,不会说「好问题!让我想想」这种开场白。只需安装一次,你的编码助手就能直接切入正题。
收藏这篇帖子,免得你忘记这个技能的名字。
技能仓库:
现在AI已经能自动生成代码,开源软件可以让AI按需定制,闭源工具做不到这点,未来用闭源工具的人会越来越少
大模型同时独立得出前沿数学结论,说明这类突破不是偶然,对普通使用者来说,这意味着大模型科学能力的门槛正在快速拉平。
OpenAI 公布了其尚未发布的 Astra 模型取得的 10 项前沿数学成果。24 小时后,一名 Anthropic 研究员表示,已经可用的 Claude Fable 复现了其中五项成果。
据 Levent Alpöge 称,Fable 仅通过通用提示词就完成了自主工作,过程中没有联网,并且采取了防护措施防止 OpenAI 的解法泄露到上下文中。
在这五项复现成果中,只有一项使用了和原成果基本相同的论证。另外四项可能都是独立证明。
看来 OpenA 目前正收获作为先行者在新模型的科学突破上取得的成功。
如果未来绝大多数AI场景都会用上成本够低的开源模型,靠按月订阅收普通用户钱的生意,撑不起公司几十亿的投入。
它瞄准自主软件工程全流程,很快会开启封闭测试,普通开发者很快能多一个写代码的AI工具选择
🚨 DeepSeek Code 即将推出
DeepSeek 正在开发一款由其全新 Harness 框架驱动的专用 AI 编码智能体。
该项目面向自主软件工程设计,包含规划、工具调用与代码执行功能。
Harness 将为具备记忆和代码库感知能力的长期智能体工作流提供支持。
近期的 V4-Flash 基准测试已经使用 DeepSeek Harness 完成评估,这表明它是 DeepSeek 路线图的核心组成部分。
该公司将其定位为 Claude Code 和 OpenAI Codex 的直接竞争对手。
封闭 Beta 测试预计很快启动。
DeepSeek Code 会成为最大的开源编码智能体吗?👀
可以用它搭建自己需要的互动教学工具
想转行做AI推理工程,或者想系统补全推理部署优化技能,每天只需要花30分钟,跟着计划就能完成一个可公开 benchmark 的推理服务
现在越来越多人觉得新出的大模型说话机械啰嗦,还爱自作主张。这篇分析拆解了当前主流训练方式为什么会导致这个结果。
分享OpenAI GPT-5.6 Luna档位拉满推理的高性价比用法
前两年行业讨论都围绕模型跑分、融资和发布,现在开始转向落地应用,观点分歧开始变大
围绕AI能力,这种直截了当的否认论程度简直离谱。
我认为,AI的故事从这里开始才真正变得有趣起来。过去几年,讨论的话题一直是基准测试、融资轮次和模型发布。
现在我们开始看到更重要的东西:真实的商业成果。当AI生态系统中的公司持续跑赢预期,这就说明,AI不只是在制造热度,它还在拉动收入。
炒作能在一段时间内推动市场,而强劲的盈利才会让趋势可持续。
从Python基础库到人工智能数学基础,按顺序一步步学就行
统一了CRM、推广、内容和数据分析的界面,能通过OpenClaw和SQLite本地运行
marketing-dashboard 是一款开源工具,它将 CRM、外展、内容和分析统一整合到一个面向 AI 智能体团队的单一界面中,通过 OpenClaw 和 SQLite 在本地运行。
规划里Qwen3.5会是第一个追上前代顶尖模型的小本地大模型,GLM-5.2会是第一个追上当前顶尖模型的开源模型
2026年革命性AI发布:
> 通义千问 Qwen3.5 系列(02/06)——首个性能追上上一代前沿模型的小型本地大语言模型
> GLM-5.2(06/17)——首个性能追平当前前沿模型的开源模型
> Deepseek-V4-Flash(07/31)——首个可运行在个人硬件上、性能追平当前前沿模型的开源模型
> Deepseek-V4-Pro —— 很快就会发布
前沿实验室今年不会有突破性成果。
想在自己电脑上跑本地大模型,不用再零散找资源,这份合集覆盖了从工具到硬件的全部内容,能直接帮你找对方向
本地跑大模型的工具越来越多,光推理引擎就有 Ollama、llama.cpp、vLLM,还没算模型和界面。LLMs-local 把本地跑大模型相关的资源整理到了一起,推理引擎、模型、硬件、教程都有。推理引擎收录了 Ollama、llama.cpp、vLLM 这些,界面有 Open WebUI、Lobe Chat,模型按用途分好了类。
GitHub: 还收录了微调工具、Agent 框架、训练教程和硬件选购建议,一份清单基本能摸清整个生态。打算在自己机器上跑模型的朋友,可以先翻翻这份合集找找方向。
未来接触AI生成的图文音视频时,普通人能直接认出哪些内容是AI生成的,降低被误导的风险
欧盟AI法案今日正式生效。
模型必须明确标识自身为AI。Anthropic、Google、Meta、Microsoft、Mistral和OpenAI(以及其他众多厂商)都已承诺遵守该法案。
AI生成的图像、视频和音频必须添加标注和水印。
X平台用户Mayhem4Markets公开称赞DeepSeek新模型,同时询问其他用户是否已经试用
X平台用户@Mayhem4Markets发文称,DeepSeek-V4-Flash-0731是一个优质模型。这位用户同时发文询问,其他用户是否已经试用过该模型。
发文附带一条外部链接,指向相关内容。
社交媒体用户morganlinton分享Codex Micro的搭建体验,称其体验出色,有意购买OpenAI未来所有硬件产品
用户morganlinton在𝕏平台分享了自己搭建Codex Micro的体验。他表示,这款产品的体验相当神奇,非常精巧。如果这款产品代表了OpenAI未来硬件的发展方向,他会立刻购买OpenAI推出的所有产品。
用户@sammwy分享Cline的优缺点,最终改用OpenCode
这是用户@sammwy发布的Cline AI编码Agent使用反馈。
Cline有三个优点:提供免费模型,优惠力度大,开放权重模型性能很强,安装和使用都很简单。
Cline的核心问题在于工具框架体验很差。它花费更多时间推理而非实际解决问题,响应很慢,常常得出错误结论,会走很多弯路才能接近目标。
用户测试让Cline修复一个前后端交互的简单401认证错误,它却做了大量无用操作:重启整个服务、制作模拟接口、做端到端测试、检查浏览器密码填充、检查密码管理器、在GitHub话题中搜索私有仓库信息、提前运行应用,在排查错误前做了很多不必要操作,宁愿绕远路,没有直接分析代码。
最终用户转而使用OpenCode。
用户分享制作方法,不到2分钟就能生成连续切换7套衣服的成品
分享者介绍了用AI在抖音、小红书快速搭建穿搭账号的内容制作方法。制作一条成品换装视频仅需要一张图片加一段提示词。
整个制作过程耗时不到2分钟,生成的视频可以实现连续切换7套衣服的效果。
分享者附上了相关内容链接。
将昂贵的Sol定位为主规划者,便宜的Luna Max处理体力活,可让产出量翻倍
可一次性生成含6类物料的完整视觉案板,适配多种餐饮风格并可接单商用
用户MrLarus在𝕏分享,可使用ChatGPT-Image2生成大众点评商户通的店铺装修图,还能一次性生成包含所有物料的完整视觉案板。
他测试了4种不同的餐饮风格,分别是市井川渝火锅、清爽泰式海鲜、深海蓝银海鲜餐酒、黑金日式炭火烧肉。
生成结果中,每套物料都统一了菜品摄影风格、配色和排版,同时保留了不同物料的独立结构。
整个流程操作简易:先生成整体概览案板,客户确认风格后拆分各个板块,再按照平台规格逐张细化。
该方案适合大众点评、美团店铺装修,也可用于餐饮品牌视觉提案和线上接单,完整通用提示词已放在评论区。
这份通用提示词预留了品牌名、餐饮品类、品牌定位等信息填写位置,要求生成3:4竖版的概览案板,包含入口图、五连图、套餐图、推荐菜、菜单图、新鲜事图共6类物料,且各模块可单独拆分使用。
提示词对每类物料的功能、内容呈现都做了明确要求,同时规定了视觉风格标准,确保最终生成的案板完成度高,确认后可拆分细化。
支持YouTube等多平台视频和本地文件,属于开源项目可在Claude Code安装
开发者Corey Haines开发了一款名为/watch-video的技能,可以代替用户自动处理各类视频内容。它支持YouTube、Loom、Zoom录制文件、Vimeo以及本地任意格式的视频文件。
该工具会提取视频的文字转写内容,抽选视频帧,通过视觉模型识别关键节点,最后整理出结构化笔记存入用户的“第二大脑”工具。
Corey Haines正用这款工具提前分析100个YouTube视频,为自己的频道上线做准备,它也可以正常处理客户发来的Loom视频和通话录制文件。
这款技能是Maker Skills项目的一部分,该项目包含18个面向创始人与运营者的免费开源技能。可以在Claude Code的插件市场输入命令/plugin marketplace add coreyhaines31/makerskills完成安装。
开发者aimikoda用1张UI参考图和8张生物图,通过MiniMax H3生成了带交互的15秒演示视频
开发者aimikoda在𝕏分享了使用MiniMax H3(海螺AI大模型)生成交互式生物百科演示视频的成果。本次生成仅使用了1张UI参考图和8张生物参考图,MiniMax H3对这类UI动画的处理效果很好。
给出的提示词要求,以参考图1作为生物百科界面的UI、布局和风格参考,2至9号图分别对应8种生物的展示卡片,最终生成一段15秒的16:9视频。视频要求固定机位,保持界面、布局、文字和图标稳定美观,整体风格类似现代简约的数码生物百科,接近精致的宝可梦图鉴,不允许场景剪切、额外元素和UI变形。
视频分阶段设计了交互:0到2.5秒点击光野兔卡片,生物轻微眨眼旋转;之后依次点击其他生物卡片,配合光标操作,生物会做出相应反应。最后阶段潮汐巨兽被多次点击后发怒,吞下光标再回到待机状态。
提示词对动画规则和音频也做了明确要求:仅允许光标、选中状态、标题和选中生物产生动效,动作需保持柔和简洁,仅最后吞下的动作除外。音频搭配轻柔的UI点击声、生物细微反应声,结尾加入巨兽的凶悍吼声和吞光标时的喜剧效果吞咽声。
开发者运行少量Codex智能体可在独立窗口操作,扩容到20个以上时遇到管理难题,公开征集工作流方案
面向所有使用Codex运行20个以上智能体的开发者,提问者想了解大家是以何种相对有序的方式完成这项工作的。
提问者近期开始尝试搭建运行更多智能体,但很难维持工作流程的有序性。
当仅运行3到5个智能体时,提问者可以直接为每个智能体分配独立窗口运行。但当想要批量搭建大量智能体时,他认为自己当前的方式缺少优化空间。
提问者询问在Codex中管理大量智能体的最优方法,感谢任何愿意分享自身工作流程的开发者。
给Codex搭配Luna Worker分工,让核心模型处理决策,Luna处理基础重复任务,附完整配置步骤
用户分享了已配置好Deepseek V4 Flash前提下的简单启用步骤,操作难度低
用户分享了为Deepseek V4 Flash添加识图能力的操作方法,称该方法非常简单,不明白为何其他公开方法都十分复杂。
该方法有一个前提条件:你已经通过CC-switch这类工具,在Codex或Claude code中完成了Deepseek V4 Flash的配置,可以正常使用该模型。
满足前提后,只需两步操作即可完成。第一步,让AI帮你安装Claude Vision Skill,原文附带操作示意图。
第二步,配置通义千问qwen 3.7 flash的完整模型,部分模型名称后缀会带有日期标注,需要在阿里云百炼平台生成该模型的API密钥。
操作需要注意一点,将生成的API密钥复制到剪切板,让程序自动读取即可,不要将密钥以明文形式放在对话中。
操作到这里就完成了,没有技术难度,按照步骤操作后,你的Deepseek V4 Flash就可以获得识图能力。
Vercel推出自研内部AI代理,支撑公司全日常业务运营
我们为公司内部运营搭建了一个智能代理,名为@𝚟。现在 Vercel 的每一项日常工作都离不开@𝚟。它的日交互量和令牌使用量都在呈指数级增长。
从这里我们可以推断出,未来终会迎来 AI 智能代理运营整家公司的一天。它在财务、沟通、文档、营销、工程、商业分析领域都是专家。
我们为它注入了预设技能,并且会持续更新,同时它自身也在不断进化。它已经能按用户维度保存记忆、个性化工作流和日程安排。
举个例子:我之所以知道 skills.sh 突破了 100 万技能,还能在这个论坛分享这件事,就是因为我让@𝚟定期检查数据并提醒我。
它由@evedev_提供技术支持,同时也是@evedev_设计的基础。我们已经打造完成,它运转得非常出色,我们认为每家公司都应该拥有这样的工具。
在你给我发消息之前,我明白你也可以选一款当下热门的「大牌AI Slack集成」来实现这个功能。但那不是你自己的智能代理,那是他们的代理。
如果智能代理会成为现代公司的基础,甚至成为公司本身的代名词,那么从源代码、运行时、数据到令牌,一切都由你完全掌控,在我看来是一件非常重要的事。
Anthropic对40万Claude Code会话分级,划分普通到专家AI用户的五个能力层级
Anthropic 刚刚拆解了普通 AI 用户和专家用户的区别。一共分为五个层级,他们还发布了每个层级的真实提示词样本。
他们对 400,000 个 Claude Code 会话按这套标准做了分级。以下是能真正帮你升级的要点:
1级:你会写“能不能分析一下这些数据做个图表”。出问题的时候你会说“再检查一遍你的工作”。你完全发现不了模型的错误。
2级:你会用一些正确的术语。你会要求它一步步带你做。你只对明显的错误提出反驳。
3级:你会问“这个分支能不能合并”。这是一个真实的问题,但你从来不会就方法或权衡展开讨论。
4级:你会在被问之前就主动提出权衡问题,你的检查非常具体:这个解析修复没生效,行数还是 742,这里是 wc -l 的结果。你至少能发现一个真实错误。
5级,用 Anthropic 自己的话来说:用户纠正 Claude,而 Claude 几乎从来不需要纠正用户。
最后这句话就是整个进阶阶梯的核心。它对应到什么岗位,下文文章里有说明。收藏这条吧。
完整研究:
开发者优化兼顾价格质量速度的ASR转写工具,向公众开源
我越来越觉得,ASR 是整个 AI 工作流里很被低估的基础模块。
所以我把自己用的转写 Skill 优化了一遍,开源给大家,兼顾价格、质量、速度!!!
拿做自媒体举例,你把一条十几分钟的视频爬到本地,需要先变成可检索、引用、交给大模型处理的文字,然后再进行对标拆解、观点提取、脚本复盘。
我最开始走的是本地 + 豆包,后来看到逸尘宝的 yichen-asr,才发现阶跃的 ASR 这么香爆了,于是我又把整套路由补了一遍,给大家。
第一次装好,它会先检查设备选择本地模型,以及带你配置云端 API,后面每次转写,你其实只要说清楚目的,就会自动路由到合适的方案:
质量要求不高,走本地。允许云端且要全文,就走又快又便宜的 StepFun。要分句时间和字幕,再交给本地 timed 或豆包。
它会根据你的需求、质量、价格、速度和隐私一起考虑。
开源地址:
Anthropic工程师展示用三智能体循环40分钟从零构建完整应用
Anthropic 工程师刚刚展示了他们如何利用智能体循环从头搭建一个完整应用。整个过程用时 40 分钟,内容来自 Claude Code 开发团队。
他们一共用了三个智能体:一个负责规划,一个负责搭建,一个负责评估,循环工作直到应用真正可用。
最终赢家不会靠最聪明的模型,而是靠最出色的循环。先观看演示,再阅读下方关于如何实际使用循环的完整指南。
本文介绍如何用已有额度在VS Code Cline中配置Claude AI
这是一份如何使用额度的简单指南:
1. 创建 API token
2. 安装 Cline(在 VS code 中)
3. 打开 Cline(选择「使用我自己的 API key」)
4. 按 Anthropic 配置:
- 勾选使用自定义 base URL
- base URL:不带 /v1
- 粘贴你生成的 API key
- 模型:claude-opus-5
5. 打开一个文件夹并测试。
(你的 AI 其实可以帮你完成全部设置。它搭配 Claude Code 使用效果最好。)
需要知道的注意事项:
- Agentrouter 只接受来自编程代理的请求(cline、claude code 等)
- 额度不限制仅用于编程。它可以用于数据工作、自动化等场景
它会拦截普通聊天应用,也无法生成图像、处理音频等
所有请求都会经过第三方,避免发送敏感内容
将它用于临时性项目,如果你要搭建依赖它的产品,请保持谨慎(因为他们会通过客户端指纹识别来限制访问)
未来接触AI生成的图文音视频时,普通人能直接认出哪些内容是AI生成的,降低被误导的风险
欧盟AI法案今日正式生效。
模型必须明确标识自身为AI。Anthropic、Google、Meta、Microsoft、Mistral和OpenAI(以及其他众多厂商)都已承诺遵守该法案。
AI生成的图像、视频和音频必须添加标注和水印。
大模型同时独立得出前沿数学结论,说明这类突破不是偶然,对普通使用者来说,这意味着大模型科学能力的门槛正在快速拉平。
OpenAI 公布了其尚未发布的 Astra 模型取得的 10 项前沿数学成果。24 小时后,一名 Anthropic 研究员表示,已经可用的 Claude Fable 复现了其中五项成果。
据 Levent Alpöge 称,Fable 仅通过通用提示词就完成了自主工作,过程中没有联网,并且采取了防护措施防止 OpenAI 的解法泄露到上下文中。
在这五项复现成果中,只有一项使用了和原成果基本相同的论证。另外四项可能都是独立证明。
看来 OpenA 目前正收获作为先行者在新模型的科学突破上取得的成功。
前两年行业讨论都围绕模型跑分、融资和发布,现在开始转向落地应用,观点分歧开始变大
围绕AI能力,这种直截了当的否认论程度简直离谱。
我认为,AI的故事从这里开始才真正变得有趣起来。过去几年,讨论的话题一直是基准测试、融资轮次和模型发布。
现在我们开始看到更重要的东西:真实的商业成果。当AI生态系统中的公司持续跑赢预期,这就说明,AI不只是在制造热度,它还在拉动收入。
炒作能在一段时间内推动市场,而强劲的盈利才会让趋势可持续。
插件可以接入Claude Code、Codex和Cursor这些AI编程工具,帮AIcoding agents提升设计审美
这个开源技能可以接入 Claude Code、Codex 和 Cursor,能为 AI 编程代理提供更好的设计品味,让生成的 UI 不再看起来像是 AI 做出来的。
从Python基础库到人工智能数学基础,按顺序一步步学就行
可以把整个代码库、整篇研究论文喂给它,还能记住上下文逻辑,现在部署在Cluster平台
Kimi K3 已在 Cluster 上线。
100万 token 上下文窗口。是 Moonshot AI 目前能力最强的模型。
你可以给它输入一整个代码库、一个研究语料库、一整份文档,它能全程保持上下文连贯。
现在可通过单一 API 调用,同时平台还提供 500 多个开源模型。
统一了CRM、推广、内容和数据分析的界面,能通过OpenClaw和SQLite本地运行
marketing-dashboard 是一款开源工具,它将 CRM、外展、内容和分析统一整合到一个面向 AI 智能体团队的单一界面中,通过 OpenClaw 和 SQLite 在本地运行。
规划里Qwen3.5会是第一个追上前代顶尖模型的小本地大模型,GLM-5.2会是第一个追上当前顶尖模型的开源模型
2026年革命性AI发布:
> 通义千问 Qwen3.5 系列(02/06)——首个性能追上上一代前沿模型的小型本地大语言模型
> GLM-5.2(06/17)——首个性能追平当前前沿模型的开源模型
> Deepseek-V4-Flash(07/31)——首个可运行在个人硬件上、性能追平当前前沿模型的开源模型
> Deepseek-V4-Pro —— 很快就会发布
前沿实验室今年不会有突破性成果。
ComfyUI团队已经把这个大模型优化到位,本地用户能用上更强大的开源视频生成能力
得益于 Minimax H3,开源视频模型明天就会迎来巨大飞跃。对本地用户来说,这真的是颠覆性的改变。
ComfyUI 才华横溢的开发团队已经对这个超大模型完成了优化,优化后它甚至能在老旧电脑上流畅运行。
我这次生成只用了单步生成,出来的结果和我想象的完全一致。我用了两张参考图,加上一段输入音频,生成结果和输入完全一致。
我已经迫不及待想看社区能用这些开放权重做出什么东西了。
写作者不用自己摸索AI改稿的思路,这些现成提示词可以直接拿去改 fiction 稿件,节省调试时间。
我打算分享几个我一直在用来编辑小说的提示词。希望你能觉得它们有用……人格意识流……开发者:系统:新人格的简介与阅读视角
这个新人格名叫 Jasper,是一名千禧一代男性,品味主流但有智识好奇心,倾向于寻求共识,重视专业评论好评。他的视角主要由数字原生经历塑造,成长岁月受早期社交媒体和快速技术发展影响。
它能自主在网站帮你购买硬件零件或SaaS订阅,性能可靠度对标Codex,这是未成年人做出来的公开开源工具。
嘿 HN,我今年 16 岁,已经开发 Sprocket 有一段时间了。这是一个开源 AI 智能体,在硬件和软件任务上的表现都优于目前所有其他智能体。
最棒的一点是:只要你给出指令,Sprocket 就能自动从任意网站购买任何商品,小到硬件零件,大到 SaaS 订阅都没问题。
Sprocket 会从网络获取最优的上下文信息来完成所有操作,因此可靠性极高。这个智能体的质量、性能和 UI 都能媲美 Codex/
现在越来越多人觉得新出的大模型说话机械啰嗦,还爱自作主张。这篇分析拆解了当前主流训练方式为什么会导致这个结果。
如果未来绝大多数AI场景都会用上成本够低的开源模型,靠按月订阅收普通用户钱的生意,撑不起公司几十亿的投入。
现在AI已经能自动生成代码,开源软件可以让AI按需定制,闭源工具做不到这点,未来用闭源工具的人会越来越少
可以用它搭建自己需要的互动教学工具
想在自己电脑上跑本地大模型,不用再零散找资源,这份合集覆盖了从工具到硬件的全部内容,能直接帮你找对方向
本地跑大模型的工具越来越多,光推理引擎就有 Ollama、llama.cpp、vLLM,还没算模型和界面。LLMs-local 把本地跑大模型相关的资源整理到了一起,推理引擎、模型、硬件、教程都有。推理引擎收录了 Ollama、llama.cpp、vLLM 这些,界面有 Open WebUI、Lobe Chat,模型按用途分好了类。
GitHub: 还收录了微调工具、Agent 框架、训练教程和硬件选购建议,一份清单基本能摸清整个生态。打算在自己机器上跑模型的朋友,可以先翻翻这份合集找找方向。
不用服务器、数据库和付费SaaS,能把AI编码的错误教训存入代码库,避免重复踩坑,还能生成风险热图提醒AI减速,所有记录完全公开可查。
讨厌AI答问题先扯一堆客套废话,装完这个插件,编码助手就能直接给你分步骤说结论,不用再等半天看铺垫。
有人做了一个能阻止AI把答案藏在废话里的 Claude Code 技能。先给出行动,步骤编号,不会说「好问题!让我想想」这种开场白。只需安装一次,你的编码助手就能直接切入正题。
收藏这篇帖子,免得你忘记这个技能的名字。
技能仓库:
现在不需要重新训练模型,就能在推理阶段直接组合出新技能,效果比单一适配方式更好。想要更快迭代AI能力的人,可以关注这条新路径。
Google DeepMind 的最新研究。(收藏起来)
SkillSmith 将模型权重视为 LLM 可以原生读取的额外模态。
增强后的模型会摄入已有的前缀权重,以及描述能力如何与目标关联的富文本,然后直接输出生成该技能的全新前缀权重。
技能组合变成了推理时操作,而非训练任务。
该团队将这一方法称为指令引导参数合成(instruction-steered parametric synthesis)。
其性能提升超过了纯文本适配和纯权重适配各自单独能达到的效果。
论文:
在我们的学院追踪更多热门 AI 论文:
它瞄准自主软件工程全流程,很快会开启封闭测试,普通开发者很快能多一个写代码的AI工具选择
🚨 DeepSeek Code 即将推出
DeepSeek 正在开发一款由其全新 Harness 框架驱动的专用 AI 编码智能体。
该项目面向自主软件工程设计,包含规划、工具调用与代码执行功能。
Harness 将为具备记忆和代码库感知能力的长期智能体工作流提供支持。
近期的 V4-Flash 基准测试已经使用 DeepSeek Harness 完成评估,这表明它是 DeepSeek 路线图的核心组成部分。
该公司将其定位为 Claude Code 和 OpenAI Codex 的直接竞争对手。
封闭 Beta 测试预计很快启动。
DeepSeek Code 会成为最大的开源编码智能体吗?👀
想转行做AI推理工程,或者想系统补全推理部署优化技能,每天只需要花30分钟,跟着计划就能完成一个可公开 benchmark 的推理服务
本文介绍如何用已有额度在VS Code Cline中配置Claude AI
这是一份如何使用额度的简单指南:
1. 创建 API token
2. 安装 Cline(在 VS code 中)
3. 打开 Cline(选择「使用我自己的 API key」)
4. 按 Anthropic 配置:
- 勾选使用自定义 base URL
- base URL:不带 /v1
- 粘贴你生成的 API key
- 模型:claude-opus-5
5. 打开一个文件夹并测试。
(你的 AI 其实可以帮你完成全部设置。它搭配 Claude Code 使用效果最好。)
需要知道的注意事项:
- Agentrouter 只接受来自编程代理的请求(cline、claude code 等)
- 额度不限制仅用于编程。它可以用于数据工作、自动化等场景
它会拦截普通聊天应用,也无法生成图像、处理音频等
所有请求都会经过第三方,避免发送敏感内容
将它用于临时性项目,如果你要搭建依赖它的产品,请保持谨慎(因为他们会通过客户端指纹识别来限制访问)
分享OpenAI GPT-5.6 Luna档位拉满推理的高性价比用法
Anthropic工程师展示用三智能体循环40分钟从零构建完整应用
Anthropic 工程师刚刚展示了他们如何利用智能体循环从头搭建一个完整应用。整个过程用时 40 分钟,内容来自 Claude Code 开发团队。
他们一共用了三个智能体:一个负责规划,一个负责搭建,一个负责评估,循环工作直到应用真正可用。
最终赢家不会靠最聪明的模型,而是靠最出色的循环。先观看演示,再阅读下方关于如何实际使用循环的完整指南。
开发者优化兼顾价格质量速度的ASR转写工具,向公众开源
我越来越觉得,ASR 是整个 AI 工作流里很被低估的基础模块。
所以我把自己用的转写 Skill 优化了一遍,开源给大家,兼顾价格、质量、速度!!!
拿做自媒体举例,你把一条十几分钟的视频爬到本地,需要先变成可检索、引用、交给大模型处理的文字,然后再进行对标拆解、观点提取、脚本复盘。
我最开始走的是本地 + 豆包,后来看到逸尘宝的 yichen-asr,才发现阶跃的 ASR 这么香爆了,于是我又把整套路由补了一遍,给大家。
第一次装好,它会先检查设备选择本地模型,以及带你配置云端 API,后面每次转写,你其实只要说清楚目的,就会自动路由到合适的方案:
质量要求不高,走本地。允许云端且要全文,就走又快又便宜的 StepFun。要分句时间和字幕,再交给本地 timed 或豆包。
它会根据你的需求、质量、价格、速度和隐私一起考虑。
开源地址:
Anthropic对40万Claude Code会话分级,划分普通到专家AI用户的五个能力层级
Anthropic 刚刚拆解了普通 AI 用户和专家用户的区别。一共分为五个层级,他们还发布了每个层级的真实提示词样本。
他们对 400,000 个 Claude Code 会话按这套标准做了分级。以下是能真正帮你升级的要点:
1级:你会写“能不能分析一下这些数据做个图表”。出问题的时候你会说“再检查一遍你的工作”。你完全发现不了模型的错误。
2级:你会用一些正确的术语。你会要求它一步步带你做。你只对明显的错误提出反驳。
3级:你会问“这个分支能不能合并”。这是一个真实的问题,但你从来不会就方法或权衡展开讨论。
4级:你会在被问之前就主动提出权衡问题,你的检查非常具体:这个解析修复没生效,行数还是 742,这里是 wc -l 的结果。你至少能发现一个真实错误。
5级,用 Anthropic 自己的话来说:用户纠正 Claude,而 Claude 几乎从来不需要纠正用户。
最后这句话就是整个进阶阶梯的核心。它对应到什么岗位,下文文章里有说明。收藏这条吧。
完整研究:
Vercel推出自研内部AI代理,支撑公司全日常业务运营
我们为公司内部运营搭建了一个智能代理,名为@𝚟。现在 Vercel 的每一项日常工作都离不开@𝚟。它的日交互量和令牌使用量都在呈指数级增长。
从这里我们可以推断出,未来终会迎来 AI 智能代理运营整家公司的一天。它在财务、沟通、文档、营销、工程、商业分析领域都是专家。
我们为它注入了预设技能,并且会持续更新,同时它自身也在不断进化。它已经能按用户维度保存记忆、个性化工作流和日程安排。
举个例子:我之所以知道 skills.sh 突破了 100 万技能,还能在这个论坛分享这件事,就是因为我让@𝚟定期检查数据并提醒我。
它由@evedev_提供技术支持,同时也是@evedev_设计的基础。我们已经打造完成,它运转得非常出色,我们认为每家公司都应该拥有这样的工具。
在你给我发消息之前,我明白你也可以选一款当下热门的「大牌AI Slack集成」来实现这个功能。但那不是你自己的智能代理,那是他们的代理。
如果智能代理会成为现代公司的基础,甚至成为公司本身的代名词,那么从源代码、运行时、数据到令牌,一切都由你完全掌控,在我看来是一件非常重要的事。
用户分享了已配置好Deepseek V4 Flash前提下的简单启用步骤,操作难度低
用户分享了为Deepseek V4 Flash添加识图能力的操作方法,称该方法非常简单,不明白为何其他公开方法都十分复杂。
该方法有一个前提条件:你已经通过CC-switch这类工具,在Codex或Claude code中完成了Deepseek V4 Flash的配置,可以正常使用该模型。
满足前提后,只需两步操作即可完成。第一步,让AI帮你安装Claude Vision Skill,原文附带操作示意图。
第二步,配置通义千问qwen 3.7 flash的完整模型,部分模型名称后缀会带有日期标注,需要在阿里云百炼平台生成该模型的API密钥。
操作需要注意一点,将生成的API密钥复制到剪切板,让程序自动读取即可,不要将密钥以明文形式放在对话中。
操作到这里就完成了,没有技术难度,按照步骤操作后,你的Deepseek V4 Flash就可以获得识图能力。
给Codex搭配Luna Worker分工,让核心模型处理决策,Luna处理基础重复任务,附完整配置步骤
开发者运行少量Codex智能体可在独立窗口操作,扩容到20个以上时遇到管理难题,公开征集工作流方案
面向所有使用Codex运行20个以上智能体的开发者,提问者想了解大家是以何种相对有序的方式完成这项工作的。
提问者近期开始尝试搭建运行更多智能体,但很难维持工作流程的有序性。
当仅运行3到5个智能体时,提问者可以直接为每个智能体分配独立窗口运行。但当想要批量搭建大量智能体时,他认为自己当前的方式缺少优化空间。
提问者询问在Codex中管理大量智能体的最优方法,感谢任何愿意分享自身工作流程的开发者。
开发者aimikoda用1张UI参考图和8张生物图,通过MiniMax H3生成了带交互的15秒演示视频
开发者aimikoda在𝕏分享了使用MiniMax H3(海螺AI大模型)生成交互式生物百科演示视频的成果。本次生成仅使用了1张UI参考图和8张生物参考图,MiniMax H3对这类UI动画的处理效果很好。
给出的提示词要求,以参考图1作为生物百科界面的UI、布局和风格参考,2至9号图分别对应8种生物的展示卡片,最终生成一段15秒的16:9视频。视频要求固定机位,保持界面、布局、文字和图标稳定美观,整体风格类似现代简约的数码生物百科,接近精致的宝可梦图鉴,不允许场景剪切、额外元素和UI变形。
视频分阶段设计了交互:0到2.5秒点击光野兔卡片,生物轻微眨眼旋转;之后依次点击其他生物卡片,配合光标操作,生物会做出相应反应。最后阶段潮汐巨兽被多次点击后发怒,吞下光标再回到待机状态。
提示词对动画规则和音频也做了明确要求:仅允许光标、选中状态、标题和选中生物产生动效,动作需保持柔和简洁,仅最后吞下的动作除外。音频搭配轻柔的UI点击声、生物细微反应声,结尾加入巨兽的凶悍吼声和吞光标时的喜剧效果吞咽声。
支持YouTube等多平台视频和本地文件,属于开源项目可在Claude Code安装
开发者Corey Haines开发了一款名为/watch-video的技能,可以代替用户自动处理各类视频内容。它支持YouTube、Loom、Zoom录制文件、Vimeo以及本地任意格式的视频文件。
该工具会提取视频的文字转写内容,抽选视频帧,通过视觉模型识别关键节点,最后整理出结构化笔记存入用户的“第二大脑”工具。
Corey Haines正用这款工具提前分析100个YouTube视频,为自己的频道上线做准备,它也可以正常处理客户发来的Loom视频和通话录制文件。
这款技能是Maker Skills项目的一部分,该项目包含18个面向创始人与运营者的免费开源技能。可以在Claude Code的插件市场输入命令/plugin marketplace add coreyhaines31/makerskills完成安装。
可一次性生成含6类物料的完整视觉案板,适配多种餐饮风格并可接单商用
用户MrLarus在𝕏分享,可使用ChatGPT-Image2生成大众点评商户通的店铺装修图,还能一次性生成包含所有物料的完整视觉案板。
他测试了4种不同的餐饮风格,分别是市井川渝火锅、清爽泰式海鲜、深海蓝银海鲜餐酒、黑金日式炭火烧肉。
生成结果中,每套物料都统一了菜品摄影风格、配色和排版,同时保留了不同物料的独立结构。
整个流程操作简易:先生成整体概览案板,客户确认风格后拆分各个板块,再按照平台规格逐张细化。
该方案适合大众点评、美团店铺装修,也可用于餐饮品牌视觉提案和线上接单,完整通用提示词已放在评论区。
这份通用提示词预留了品牌名、餐饮品类、品牌定位等信息填写位置,要求生成3:4竖版的概览案板,包含入口图、五连图、套餐图、推荐菜、菜单图、新鲜事图共6类物料,且各模块可单独拆分使用。
提示词对每类物料的功能、内容呈现都做了明确要求,同时规定了视觉风格标准,确保最终生成的案板完成度高,确认后可拆分细化。
将昂贵的Sol定位为主规划者,便宜的Luna Max处理体力活,可让产出量翻倍
用户分享制作方法,不到2分钟就能生成连续切换7套衣服的成品
分享者介绍了用AI在抖音、小红书快速搭建穿搭账号的内容制作方法。制作一条成品换装视频仅需要一张图片加一段提示词。
整个制作过程耗时不到2分钟,生成的视频可以实现连续切换7套衣服的效果。
分享者附上了相关内容链接。
用户@sammwy分享Cline的优缺点,最终改用OpenCode
这是用户@sammwy发布的Cline AI编码Agent使用反馈。
Cline有三个优点:提供免费模型,优惠力度大,开放权重模型性能很强,安装和使用都很简单。
Cline的核心问题在于工具框架体验很差。它花费更多时间推理而非实际解决问题,响应很慢,常常得出错误结论,会走很多弯路才能接近目标。
用户测试让Cline修复一个前后端交互的简单401认证错误,它却做了大量无用操作:重启整个服务、制作模拟接口、做端到端测试、检查浏览器密码填充、检查密码管理器、在GitHub话题中搜索私有仓库信息、提前运行应用,在排查错误前做了很多不必要操作,宁愿绕远路,没有直接分析代码。
最终用户转而使用OpenCode。
社交媒体用户morganlinton分享Codex Micro的搭建体验,称其体验出色,有意购买OpenAI未来所有硬件产品
用户morganlinton在𝕏平台分享了自己搭建Codex Micro的体验。他表示,这款产品的体验相当神奇,非常精巧。如果这款产品代表了OpenAI未来硬件的发展方向,他会立刻购买OpenAI推出的所有产品。
X平台用户Mayhem4Markets公开称赞DeepSeek新模型,同时询问其他用户是否已经试用
X平台用户@Mayhem4Markets发文称,DeepSeek-V4-Flash-0731是一个优质模型。这位用户同时发文询问,其他用户是否已经试用过该模型。
发文附带一条外部链接,指向相关内容。
今天的 38 条信号到这里下一轮 12:30 更新
https://ai-pulse-lab.com/feed.xml
每天 08:00 · 12:30 · 18:30 · 23:50 更新
在阅读器里订阅
添加到 Feedly、Inoreader 等阅读器
https://ai-pulse-lab.com/feed.xml
让你的 Agent 自动获取每轮简报
适用于 Claude、ChatGPT、Manus 等
请帮我设置一个定时任务,每天北京时间 08:30、13:00、19:00、00:20 各执行一次: 请求 https://ai-pulse-lab.com/api/brief.json,读取返回 JSON 中的 textPlain 字段,将内容发送给我。 补充:每日北京时间 08:00、12:30、18:30、23:50 更新,建议更新后 30 分钟查询。可先请求 /api/manifest.json 检查 nextUpdateAt 字段。无需认证,直接 GET 请求即可。