AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 8 月 3 日 · 08:00 更新 0 文章0 信号0 主题
试试:

今天发生了什么1 分钟读懂

欧盟AI法案今天正式生效,这是全球首部综合性AI监管法规落地。未来AI生成的图文音视频必须标注来源,普通人辨别虚假内容有了法定依据,但合规成本正加速向中小开发者转移。

DeepSeek即将推出AI编码代理,直接对标Claude Code,瞄准自主软件工程全流程。这是继V4-Flash以0.28美元/百万token击穿定价地板后,DeepSeek在应用层的又一次正面进攻。

16岁开发者开源了AI代理Sprocket,能自主购买硬件和SaaS订阅,性能对标Codex。未成年人做出可靠度可验证的开源工具,比融资新闻更能说明AI工程能力的门槛在下降。

今日值得看
01 Google DeepMind 新研究改了AI组合技能的方式 现在不需要重新训练模型,就能在推理阶段直接组合出新技能,效果比单一适配方式更好。想要更快迭代AI能力的人,可以关注这条新路径。

Google DeepMind 的最新研究。(收藏起来) SkillSmith 将模型权重视为 LLM 可以原生读取的额外模态。 增强后的模型会摄入已有的前缀权重,以及描述能力如何与目标关联的富文本,然后直接输出生成该技能的全新前缀权重。

02 Moonshot AI的Kimi K3上线支持百万token上下文 可以把整个代码库、整篇研究论文喂给它,还能记住上下文逻辑,现在部署在Cluster平台

Kimi K3 已在 Cluster 上线。 100万 token 上下文窗口。是 Moonshot AI 目前能力最强的模型。 你可以给它输入一整个代码库、一个研究语料库、一整份文档,它能全程保持上下文连贯。

03 teamlore 用一个文件夹解决AI团队记忆问题 不用服务器、数据库和付费SaaS,能把AI编码的错误教训存入代码库,避免重复踩坑,还能生成风险热图提醒AI减速,所有记录完全公开可查。

所有人都在尝试用服务器、向量数据库和编排平台解决AI团队记忆问题。这个开源工具只用你代码仓库里的一个文件夹就搞定了。 你的团队里每个开发者都在用 Claude Code。当一个代理搞砸了某件事,其他人完全不知情,下周他们只会重复犯同样的错。

04 这个开源工具能让AI写的UI没那么假 插件可以接入Claude Code、Codex和Cursor这些AI编程工具,帮AIcoding agents提升设计审美

这个开源技能可以接入 Claude Code、Codex 和 Cursor,能为 AI 编程代理提供更好的设计品味,让生成的 UI 不再看起来像是 AI 做出来的。

今日焦点

OpenAI新模型Astra:虽令人惊叹,但被严重高估

Astra,一个 OpenAI 正在内部测试的新模型,令人惊叹。不可否认:

Noam Brown @polynoamial Lijie Chen @wjmzbmr110 来自我们下一个主要模型 Astra 的证明,解决了数学和理论计算机科学中长期存在的开放问题(还包括计算永久的新的电路下界!)

GPT-5.6 已经在数学和科学领域促成了许多激动人心的工作。迫不及待……
2026年8月1日上午8:17 · 840万次查看 · 664条回复 · 2110次转发 · 1.49万次点赞

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达38 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

08:00 本轮更新 · 下一轮 12:30
行业动态 · Hacker News▲ 117

16岁开发者做了开源AI开发代理Sprocket

它能自主在网站帮你购买硬件零件或SaaS订阅,性能可靠度对标Codex,这是未成年人做出来的公开开源工具。

嘿 HN,我今年 16 岁,已经开发 Sprocket 有一段时间了。这是一个开源 AI 智能体,在硬件和软件任务上的表现都优于目前所有其他智能体。

最棒的一点是:只要你给出指令,Sprocket 就能自动从任意网站购买任何商品,小到硬件零件,大到 SaaS 订阅都没问题。

Sprocket 会从网络获取最优的上下文信息来完成所有操作,因此可靠性极高。这个智能体的质量、性能和 UI 都能媲美 Codex/

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · OpenAI 开发者社区▲ 101

网友分享了专门给小说润色用的AI提示词

写作者不用自己摸索AI改稿的思路,这些现成提示词可以直接拿去改 fiction 稿件,节省调试时间。

我打算分享几个我一直在用来编辑小说的提示词。希望你能觉得它们有用……人格意识流……开发者:系统:新人格的简介与阅读视角

这个新人格名叫 Jasper,是一名千禧一代男性,品味主流但有智识好奇心,倾向于寻求共识,重视专业评论好评。他的视角主要由数字原生经历塑造,成长岁月受早期社交媒体和快速技术发展影响。

在社区看讨论 ↗
开源 · @hellorob▲ 2.1万

Minimax H3明天将推开源视频模型大更新

ComfyUI团队已经把这个大模型优化到位,本地用户能用上更强大的开源视频生成能力

得益于 Minimax H3,开源视频模型明天就会迎来巨大飞跃。对本地用户来说,这真的是颠覆性的改变。

ComfyUI 才华横溢的开发团队已经对这个超大模型完成了优化,优化后它甚至能在老旧电脑上流畅运行。

我这次生成只用了单步生成,出来的结果和我想象的完全一致。我用了两张参考图,加上一段输入音频,生成结果和输入完全一致。

我已经迫不及待想看社区能用这些开放权重做出什么东西了。

在 X 看原帖 ↗
2.1万1426576
工具产品 · @RoundtableSpace▲ 4.6万

第三方给Claude Code做了个直接出结果的工具

讨厌AI答问题先扯一堆客套废话,装完这个插件,编码助手就能直接给你分步骤说结论,不用再等半天看铺垫。

有人做了一个能阻止AI把答案藏在废话里的 Claude Code 技能。先给出行动,步骤编号,不会说「好问题!让我想想」这种开场白。只需安装一次,你的编码助手就能直接切入正题。

收藏这篇帖子,免得你忘记这个技能的名字。

技能仓库:

在 X 看原帖 ↗
4.6万55331
深度观点 · @davidcrawshaw▲ 1.9万

AI生成代码后,开源比闭源工具更吃香了

现在AI已经能自动生成代码,开源软件可以让AI按需定制,闭源工具做不到这点,未来用闭源工具的人会越来越少

机器现在已经能自己写代码了。

这意味着,如果你的软件是开源的,机器就能为你定制化开发。

闭源工具(比如 Claude Code)现在没那么受欢迎了。

在 X 看原帖 ↗
1.9万18174152
行业动态 · @kimmonismus▲ 4.1万

OpenAI未发布模型算出的数学结果,被Anthropic模型复现了

大模型同时独立得出前沿数学结论,说明这类突破不是偶然,对普通使用者来说,这意味着大模型科学能力的门槛正在快速拉平。

OpenAI 公布了其尚未发布的 Astra 模型取得的 10 项前沿数学成果。24 小时后,一名 Anthropic 研究员表示,已经可用的 Claude Fable 复现了其中五项成果。

据 Levent Alpöge 称,Fable 仅通过通用提示词就完成了自主工作,过程中没有联网,并且采取了防护措施防止 OpenAI 的解法泄露到上下文中。

在这五项复现成果中,只有一项使用了和原成果基本相同的论证。另外四项可能都是独立证明。

看来 OpenA 目前正收获作为先行者在新模型的科学突破上取得的成功。

在 X 看原帖 ↗
4.1万1850654
深度观点 · @BrianRoemmele▲ 1.8万

这位投资人说OpenAI不开放源代码就一定会输

如果未来绝大多数AI场景都会用上成本够低的开源模型,靠按月订阅收普通用户钱的生意,撑不起公司几十亿的投入。

阅读全文 →
1.8万2414940
新品发布 · @Priyannkaaaa▲ 6.4万

DeepSeek 要出AI编码代理,对标 Claude Code

它瞄准自主软件工程全流程,很快会开启封闭测试,普通开发者很快能多一个写代码的AI工具选择

🚨 DeepSeek Code 即将推出

DeepSeek 正在开发一款由其全新 Harness 框架驱动的专用 AI 编码智能体。

该项目面向自主软件工程设计,包含规划、工具调用与代码执行功能。

Harness 将为具备记忆和代码库感知能力的长期智能体工作流提供支持。

近期的 V4-Flash 基准测试已经使用 DeepSeek Harness 完成评估,这表明它是 DeepSeek 路线图的核心组成部分。

该公司将其定位为 Claude Code 和 OpenAI Codex 的直接竞争对手。

封闭 Beta 测试预计很快启动。

DeepSeek Code 会成为最大的开源编码智能体吗?👀

在 X 看原帖 ↗
6.4万1201.8K205
工具产品 · @gdb▲ 23.1万

gdb 推出了ChatGPT驱动的互动教学工具

可以用它搭建自己需要的互动教学工具

用于构建交互式教育工具的 ChatGPT

在 X 看原帖 ↗
23.1万1122.2K927
实战经验 · @akshay_pachaar▲ 1.2万

这位AI工程师整理了10周LLM推理入门计划

想转行做AI推理工程,或者想系统补全推理部署优化技能,每天只需要花30分钟,跟着计划就能完成一个可公开 benchmark 的推理服务

阅读全文 →
1.2万33255336
深度观点 · @kunchenguid▲ 1.6万

现在大模型越来越难聊,居然和RLVR训练有关

现在越来越多人觉得新出的大模型说话机械啰嗦,还爱自作主张。这篇分析拆解了当前主流训练方式为什么会导致这个结果。

阅读全文 →
1.6万21327181
教程 · @AYi_AInotes▲ 3.7万

OpenAI GPT-5.6隐藏高性价比订阅玩法分享

分享OpenAI GPT-5.6 Luna档位拉满推理的高性价比用法

阅读全文 →
3.7万15122137
行业观点 · @TaylorLorenz▲ 2.4万

现在有人说AI能力被否认到离谱程度

前两年行业讨论都围绕模型跑分、融资和发布,现在开始转向落地应用,观点分歧开始变大

围绕AI能力,这种直截了当的否认论程度简直离谱。

我认为,AI的故事从这里开始才真正变得有趣起来。过去几年,讨论的话题一直是基准测试、融资轮次和模型发布。

现在我们开始看到更重要的东西:真实的商业成果。当AI生态系统中的公司持续跑赢预期,这就说明,AI不只是在制造热度,它还在拉动收入。

炒作能在一段时间内推动市场,而强劲的盈利才会让趋势可持续。

在 X 看原帖 ↗
2.4万292164
教程 · @PythonDvz▲ 2.4K

有人整理出了当AI工程师的学习路径

从Python基础库到人工智能数学基础,按顺序一步步学就行

阅读全文 →
2.4K103119
工具 · @tom_doerr▲ 5.9K

这个开源工具给AI代理团队整合全流程数据

统一了CRM、推广、内容和数据分析的界面,能通过OpenClaw和SQLite本地运行

marketing-dashboard 是一款开源工具,它将 CRM、外展、内容和分析统一整合到一个面向 AI 智能体团队的单一界面中,通过 OpenClaw 和 SQLite 在本地运行。

在 X 看原帖 ↗
5.9K1180101
大模型 · @jun_song▲ 1.8K

曝2026年多个国产大模型会达到关键里程碑

规划里Qwen3.5会是第一个追上前代顶尖模型的小本地大模型,GLM-5.2会是第一个追上当前顶尖模型的开源模型

2026年革命性AI发布:

> 通义千问 Qwen3.5 系列(02/06)——首个性能追上上一代前沿模型的小型本地大语言模型

> GLM-5.2(06/17)——首个性能追平当前前沿模型的开源模型

> Deepseek-V4-Flash(07/31)——首个可运行在个人硬件上、性能追平当前前沿模型的开源模型

> Deepseek-V4-Pro —— 很快就会发布

前沿实验室今年不会有突破性成果。

在 X 看原帖 ↗
1.8K4538
工具产品 · @GitHub_Daily▲ 4.2K

LLMs-local 整理好了全栈本地跑大模型资源

想在自己电脑上跑本地大模型,不用再零散找资源,这份合集覆盖了从工具到硬件的全部内容,能直接帮你找对方向

本地跑大模型的工具越来越多,光推理引擎就有 Ollama、llama.cpp、vLLM,还没算模型和界面。LLMs-local 把本地跑大模型相关的资源整理到了一起,推理引擎、模型、硬件、教程都有。推理引擎收录了 Ollama、llama.cpp、vLLM 这些,界面有 Open WebUI、Lobe Chat,模型按用途分好了类。

GitHub: 还收录了微调工具、Agent 框架、训练教程和硬件选购建议,一份清单基本能摸清整个生态。打算在自己机器上跑模型的朋友,可以先翻翻这份合集找找方向。

在 X 看原帖 ↗
4.2K93141
行业动态 · @AndrewCurran_▲ 1.0万

欧盟AI法案今天正式生效,头部AI公司全都要遵守

未来接触AI生成的图文音视频时,普通人能直接认出哪些内容是AI生成的,降低被误导的风险

欧盟AI法案今日正式生效。

模型必须明确标识自身为AI。Anthropic、Google、Meta、Microsoft、Mistral和OpenAI(以及其他众多厂商)都已承诺遵守该法案。

AI生成的图像、视频和音频必须添加标注和水印。

在 X 看原帖 ↗
1.0万1917226
大模型 · @Mayhem4Markets

用户Mayhem4Markets评价DeepSeek-V4-Flash-0731为优质模型

X平台用户Mayhem4Markets公开称赞DeepSeek新模型,同时询问其他用户是否已经试用

X平台用户@Mayhem4Markets发文称,DeepSeek-V4-Flash-0731是一个优质模型。这位用户同时发文询问,其他用户是否已经试用过该模型。

发文附带一条外部链接,指向相关内容。

在 X 看原帖 ↗
AI硬件 · @morganlinton▲ 1.9K

用户晒OpenAI Codex Micro 称体验充满魔力

社交媒体用户morganlinton分享Codex Micro的搭建体验,称其体验出色,有意购买OpenAI未来所有硬件产品

用户morganlinton在𝕏平台分享了自己搭建Codex Micro的体验。他表示,这款产品的体验相当神奇,非常精巧。如果这款产品代表了OpenAI未来硬件的发展方向,他会立刻购买OpenAI推出的所有产品。

在 X 看原帖 ↗
1.9K1275
AI编码Agent · @sammwy▲ 4.1K

用户分享Cline AI编码Agent使用反馈:优点与问题

用户@sammwy分享Cline的优缺点,最终改用OpenCode

这是用户@sammwy发布的Cline AI编码Agent使用反馈。

Cline有三个优点:提供免费模型,优惠力度大,开放权重模型性能很强,安装和使用都很简单。

Cline的核心问题在于工具框架体验很差。它花费更多时间推理而非实际解决问题,响应很慢,常常得出错误结论,会走很多弯路才能接近目标。

用户测试让Cline修复一个前后端交互的简单401认证错误,它却做了大量无用操作:重启整个服务、制作模拟接口、做端到端测试、检查浏览器密码填充、检查密码管理器、在GitHub话题中搜索私有仓库信息、提前运行应用,在排查错误前做了很多不必要操作,宁愿绕远路,没有直接分析代码。

最终用户转而使用OpenCode。

在 X 看原帖 ↗
4.1K8622
内容创作 · @Chengzilhy▲ 3.8K

用AI制作跨平台穿搭换装视频只需一张图加提示词

用户分享制作方法,不到2分钟就能生成连续切换7套衣服的成品

分享者介绍了用AI在抖音、小红书快速搭建穿搭账号的内容制作方法。制作一条成品换装视频仅需要一张图片加一段提示词。

整个制作过程耗时不到2分钟,生成的视频可以实现连续切换7套衣服的效果。

分享者附上了相关内容链接。

在 X 看原帖 ↗
3.8K33118
AI编程 · @AYi_AInotes▲ 6.8K

Codex高阶玩家分享Codex Luna Max省钱使用方案

将昂贵的Sol定位为主规划者,便宜的Luna Max处理体力活,可让产出量翻倍

阅读全文 →
6.8K53353
设计 · @MrLarus▲ 6.9K

开发者测试用ChatGPT-Image2生成大众点评商户通装修图

可一次性生成含6类物料的完整视觉案板,适配多种餐饮风格并可接单商用

用户MrLarus在𝕏分享,可使用ChatGPT-Image2生成大众点评商户通的店铺装修图,还能一次性生成包含所有物料的完整视觉案板。

他测试了4种不同的餐饮风格,分别是市井川渝火锅、清爽泰式海鲜、深海蓝银海鲜餐酒、黑金日式炭火烧肉。

生成结果中,每套物料都统一了菜品摄影风格、配色和排版,同时保留了不同物料的独立结构。

整个流程操作简易:先生成整体概览案板,客户确认风格后拆分各个板块,再按照平台规格逐张细化。

该方案适合大众点评、美团店铺装修,也可用于餐饮品牌视觉提案和线上接单,完整通用提示词已放在评论区。

这份通用提示词预留了品牌名、餐饮品类、品牌定位等信息填写位置,要求生成3:4竖版的概览案板,包含入口图、五连图、套餐图、推荐菜、菜单图、新鲜事图共6类物料,且各模块可单独拆分使用。

提示词对每类物料的功能、内容呈现都做了明确要求,同时规定了视觉风格标准,确保最终生成的案板完成度高,确认后可拆分细化。

在 X 看原帖 ↗
6.9K67171
开源 · @coreyhainesco▲ 8.7K

开发者推出自动看视频生成结构化笔记AI技能

支持YouTube等多平台视频和本地文件,属于开源项目可在Claude Code安装

开发者Corey Haines开发了一款名为/watch-video的技能,可以代替用户自动处理各类视频内容。它支持YouTube、Loom、Zoom录制文件、Vimeo以及本地任意格式的视频文件。

该工具会提取视频的文字转写内容,抽选视频帧,通过视觉模型识别关键节点,最后整理出结构化笔记存入用户的“第二大脑”工具。

Corey Haines正用这款工具提前分析100个YouTube视频,为自己的频道上线做准备,它也可以正常处理客户发来的Loom视频和通话录制文件。

这款技能是Maker Skills项目的一部分,该项目包含18个面向创始人与运营者的免费开源技能。可以在Claude Code的插件市场输入命令/plugin marketplace add coreyhaines31/makerskills完成安装。

在 X 看原帖 ↗
8.7K3142261
生成式视频 · @aimikoda▲ 3.3K

开发者用MiniMax H3生成交互式生物百科视频

开发者aimikoda用1张UI参考图和8张生物图,通过MiniMax H3生成了带交互的15秒演示视频

开发者aimikoda在𝕏分享了使用MiniMax H3(海螺AI大模型)生成交互式生物百科演示视频的成果。本次生成仅使用了1张UI参考图和8张生物参考图,MiniMax H3对这类UI动画的处理效果很好。

给出的提示词要求,以参考图1作为生物百科界面的UI、布局和风格参考,2至9号图分别对应8种生物的展示卡片,最终生成一段15秒的16:9视频。视频要求固定机位,保持界面、布局、文字和图标稳定美观,整体风格类似现代简约的数码生物百科,接近精致的宝可梦图鉴,不允许场景剪切、额外元素和UI变形。

视频分阶段设计了交互:0到2.5秒点击光野兔卡片,生物轻微眨眼旋转;之后依次点击其他生物卡片,配合光标操作,生物会做出相应反应。最后阶段潮汐巨兽被多次点击后发怒,吞下光标再回到待机状态。

提示词对动画规则和音频也做了明确要求:仅允许光标、选中状态、标题和选中生物产生动效,动作需保持柔和简洁,仅最后吞下的动作除外。音频搭配轻柔的UI点击声、生物细微反应声,结尾加入巨兽的凶悍吼声和吞光标时的喜剧效果吞咽声。

在 X 看原帖 ↗
3.3K58441
开发工具 · @morganlinton▲ 1.2万

开发者询问管理20个以上Codex智能体的有序方法

开发者运行少量Codex智能体可在独立窗口操作,扩容到20个以上时遇到管理难题,公开征集工作流方案

面向所有使用Codex运行20个以上智能体的开发者,提问者想了解大家是以何种相对有序的方式完成这项工作的。

提问者近期开始尝试搭建运行更多智能体,但很难维持工作流程的有序性。

当仅运行3到5个智能体时,提问者可以直接为每个智能体分配独立窗口运行。但当想要批量搭建大量智能体时,他认为自己当前的方式缺少优化空间。

提问者询问在Codex中管理大量智能体的最优方法,感谢任何愿意分享自身工作流程的开发者。

在 X 看原帖 ↗
1.2万8150
AI开发 · @shadouyoua▲ 4.5K

Codex额度消耗过快可通过分工降低消耗 附三步配置教程

给Codex搭配Luna Worker分工,让核心模型处理决策,Luna处理基础重复任务,附完整配置步骤

阅读全文 →
4.5K83549
大语言模型 · @binghe▲ 1.2万

为Deepseek V4 Flash添加识图能力的简易教程

用户分享了已配置好Deepseek V4 Flash前提下的简单启用步骤,操作难度低

用户分享了为Deepseek V4 Flash添加识图能力的操作方法,称该方法非常简单,不明白为何其他公开方法都十分复杂。

该方法有一个前提条件:你已经通过CC-switch这类工具,在Codex或Claude code中完成了Deepseek V4 Flash的配置,可以正常使用该模型。

满足前提后,只需两步操作即可完成。第一步,让AI帮你安装Claude Vision Skill,原文附带操作示意图。

第二步,配置通义千问qwen 3.7 flash的完整模型,部分模型名称后缀会带有日期标注,需要在阿里云百炼平台生成该模型的API密钥。

操作需要注意一点,将生成的API密钥复制到剪切板,让程序自动读取即可,不要将密钥以明文形式放在对话中。

操作到这里就完成了,没有技术难度,按照步骤操作后,你的Deepseek V4 Flash就可以获得识图能力。

在 X 看原帖 ↗
1.2万1093158
企业服务 · @rauchg▲ 1.5K

Vercel打造内部运营AI代理 覆盖全日常工作

Vercel推出自研内部AI代理,支撑公司全日常业务运营

我们为公司内部运营搭建了一个智能代理,名为@𝚟。现在 Vercel 的每一项日常工作都离不开@𝚟。它的日交互量和令牌使用量都在呈指数级增长。

从这里我们可以推断出,未来终会迎来 AI 智能代理运营整家公司的一天。它在财务、沟通、文档、营销、工程、商业分析领域都是专家。

我们为它注入了预设技能,并且会持续更新,同时它自身也在不断进化。它已经能按用户维度保存记忆、个性化工作流和日程安排。

举个例子:我之所以知道 skills⁠.sh 突破了 100 万技能,还能在这个论坛分享这件事,就是因为我让@𝚟定期检查数据并提醒我。

它由@evedev_提供技术支持,同时也是@evedev_设计的基础。我们已经打造完成,它运转得非常出色,我们认为每家公司都应该拥有这样的工具。

在你给我发消息之前,我明白你也可以选一款当下热门的「大牌AI Slack集成」来实现这个功能。但那不是你自己的智能代理,那是他们的代理。

如果智能代理会成为现代公司的基础,甚至成为公司本身的代名词,那么从源代码、运行时、数据到令牌,一切都由你完全掌控,在我看来是一件非常重要的事。

在 X 看原帖 ↗
1.5K177
大语言模型 · @undefinedKi▲ 3.6K

Anthropic划分AI用户五级能力阶梯 分级40万Claude会话

Anthropic对40万Claude Code会话分级,划分普通到专家AI用户的五个能力层级

Anthropic 刚刚拆解了普通 AI 用户和专家用户的区别。一共分为五个层级,他们还发布了每个层级的真实提示词样本。

他们对 400,000 个 Claude Code 会话按这套标准做了分级。以下是能真正帮你升级的要点:

1级:你会写“能不能分析一下这些数据做个图表”。出问题的时候你会说“再检查一遍你的工作”。你完全发现不了模型的错误。

2级:你会用一些正确的术语。你会要求它一步步带你做。你只对明显的错误提出反驳。

3级:你会问“这个分支能不能合并”。这是一个真实的问题,但你从来不会就方法或权衡展开讨论。

4级:你会在被问之前就主动提出权衡问题,你的检查非常具体:这个解析修复没生效,行数还是 742,这里是 wc -l 的结果。你至少能发现一个真实错误。

5级,用 Anthropic 自己的话来说:用户纠正 Claude,而 Claude 几乎从来不需要纠正用户。

最后这句话就是整个进阶阶梯的核心。它对应到什么岗位,下文文章里有说明。收藏这条吧。

完整研究:

在 X 看原帖 ↗
3.6K66145
开源 · @gkxspace▲ 4.8K

开发者优化自用ASR语音转写工具并免费开源

开发者优化兼顾价格质量速度的ASR转写工具,向公众开源

我越来越觉得,ASR 是整个 AI 工作流里很被低估的基础模块。

所以我把自己用的转写 Skill 优化了一遍,开源给大家,兼顾价格、质量、速度!!!

拿做自媒体举例,你把一条十几分钟的视频爬到本地,需要先变成可检索、引用、交给大模型处理的文字,然后再进行对标拆解、观点提取、脚本复盘。

我最开始走的是本地 + 豆包,后来看到逸尘宝的 yichen-asr,才发现阶跃的 ASR 这么香爆了,于是我又把整套路由补了一遍,给大家。

第一次装好,它会先检查设备选择本地模型,以及带你配置云端 API,后面每次转写,你其实只要说清楚目的,就会自动路由到合适的方案:

质量要求不高,走本地。允许云端且要全文,就走又快又便宜的 StepFun。要分句时间和字幕,再交给本地 timed 或豆包。

它会根据你的需求、质量、价格、速度和隐私一起考虑。

开源地址:

在 X 看原帖 ↗
4.8K104873
大模型 · @AnatoliKopadze▲ 1.4万

Anthropic工程师用多智能体循环从零构建完整应用

Anthropic工程师展示用三智能体循环40分钟从零构建完整应用

Anthropic 工程师刚刚展示了他们如何利用智能体循环从头搭建一个完整应用。整个过程用时 40 分钟,内容来自 Claude Code 开发团队。

他们一共用了三个智能体:一个负责规划,一个负责搭建,一个负责评估,循环工作直到应用真正可用。

最终赢家不会靠最聪明的模型,而是靠最出色的循环。先观看演示,再阅读下方关于如何实际使用循环的完整指南。

在 X 看原帖 ↗
1.4万1188118
编程工具 · @pgreyy▲ 2.1万

使用第三方额度配置Claude AI编码代理分步指南

本文介绍如何用已有额度在VS Code Cline中配置Claude AI

这是一份如何使用额度的简单指南:
1. 创建 API token
2. 安装 Cline(在 VS code 中)
3. 打开 Cline(选择「使用我自己的 API key」)
4. 按 Anthropic 配置:
- 勾选使用自定义 base URL
- base URL:不带 /v1
- 粘贴你生成的 API key
- 模型:claude-opus-5
5. 打开一个文件夹并测试。

(你的 AI 其实可以帮你完成全部设置。它搭配 Claude Code 使用效果最好。)

需要知道的注意事项:
- Agentrouter 只接受来自编程代理的请求(cline、claude code 等)
- 额度不限制仅用于编程。它可以用于数据工作、自动化等场景

它会拦截普通聊天应用,也无法生成图像、处理音频等
所有请求都会经过第三方,避免发送敏感内容
将它用于临时性项目,如果你要搭建依赖它的产品,请保持谨慎(因为他们会通过客户端指纹识别来限制访问)

在 X 看原帖 ↗
2.1万19142383
📰 行业动态
行业动态 · @AndrewCurran_▲ 1.0万

欧盟AI法案今天正式生效,头部AI公司全都要遵守

未来接触AI生成的图文音视频时,普通人能直接认出哪些内容是AI生成的,降低被误导的风险

欧盟AI法案今日正式生效。

模型必须明确标识自身为AI。Anthropic、Google、Meta、Microsoft、Mistral和OpenAI(以及其他众多厂商)都已承诺遵守该法案。

AI生成的图像、视频和音频必须添加标注和水印。

在 X 看原帖 ↗
1.0万1917226
行业动态 · @kimmonismus▲ 4.1万

OpenAI未发布模型算出的数学结果,被Anthropic模型复现了

大模型同时独立得出前沿数学结论,说明这类突破不是偶然,对普通使用者来说,这意味着大模型科学能力的门槛正在快速拉平。

OpenAI 公布了其尚未发布的 Astra 模型取得的 10 项前沿数学成果。24 小时后,一名 Anthropic 研究员表示,已经可用的 Claude Fable 复现了其中五项成果。

据 Levent Alpöge 称,Fable 仅通过通用提示词就完成了自主工作,过程中没有联网,并且采取了防护措施防止 OpenAI 的解法泄露到上下文中。

在这五项复现成果中,只有一项使用了和原成果基本相同的论证。另外四项可能都是独立证明。

看来 OpenA 目前正收获作为先行者在新模型的科学突破上取得的成功。

在 X 看原帖 ↗
4.1万1850654
行业观点 · @TaylorLorenz▲ 2.4万

现在有人说AI能力被否认到离谱程度

前两年行业讨论都围绕模型跑分、融资和发布,现在开始转向落地应用,观点分歧开始变大

围绕AI能力,这种直截了当的否认论程度简直离谱。

我认为,AI的故事从这里开始才真正变得有趣起来。过去几年,讨论的话题一直是基准测试、融资轮次和模型发布。

现在我们开始看到更重要的东西:真实的商业成果。当AI生态系统中的公司持续跑赢预期,这就说明,AI不只是在制造热度,它还在拉动收入。

炒作能在一段时间内推动市场,而强劲的盈利才会让趋势可持续。

在 X 看原帖 ↗
2.4万292164
工具 · @RoundtableSpace▲ 4.5万

这个开源工具能让AI写的UI没那么假

插件可以接入Claude Code、Codex和Cursor这些AI编程工具,帮AIcoding agents提升设计审美

这个开源技能可以接入 Claude Code、Codex 和 Cursor,能为 AI 编程代理提供更好的设计品味,让生成的 UI 不再看起来像是 AI 做出来的。

在 X 看原帖 ↗
4.5万25623
教程 · @PythonDvz▲ 2.4K

有人整理出了当AI工程师的学习路径

从Python基础库到人工智能数学基础,按顺序一步步学就行

阅读全文 →
2.4K103119
大模型 · @ClusterProtocol▲ 1.1万

Moonshot AI的Kimi K3上线支持百万token上下文

可以把整个代码库、整篇研究论文喂给它,还能记住上下文逻辑,现在部署在Cluster平台

Kimi K3 已在 Cluster 上线。

100万 token 上下文窗口。是 Moonshot AI 目前能力最强的模型。

你可以给它输入一整个代码库、一个研究语料库、一整份文档,它能全程保持上下文连贯。

现在可通过单一 API 调用,同时平台还提供 500 多个开源模型。

在 X 看原帖 ↗
1.1万321261
工具 · @tom_doerr▲ 5.9K

这个开源工具给AI代理团队整合全流程数据

统一了CRM、推广、内容和数据分析的界面,能通过OpenClaw和SQLite本地运行

marketing-dashboard 是一款开源工具,它将 CRM、外展、内容和分析统一整合到一个面向 AI 智能体团队的单一界面中,通过 OpenClaw 和 SQLite 在本地运行。

在 X 看原帖 ↗
5.9K1180101
大模型 · @jun_song▲ 1.8K

曝2026年多个国产大模型会达到关键里程碑

规划里Qwen3.5会是第一个追上前代顶尖模型的小本地大模型,GLM-5.2会是第一个追上当前顶尖模型的开源模型

2026年革命性AI发布:

> 通义千问 Qwen3.5 系列(02/06)——首个性能追上上一代前沿模型的小型本地大语言模型

> GLM-5.2(06/17)——首个性能追平当前前沿模型的开源模型

> Deepseek-V4-Flash(07/31)——首个可运行在个人硬件上、性能追平当前前沿模型的开源模型

> Deepseek-V4-Pro —— 很快就会发布

前沿实验室今年不会有突破性成果。

在 X 看原帖 ↗
1.8K4538
开源 · @hellorob▲ 2.1万

Minimax H3明天将推开源视频模型大更新

ComfyUI团队已经把这个大模型优化到位,本地用户能用上更强大的开源视频生成能力

得益于 Minimax H3,开源视频模型明天就会迎来巨大飞跃。对本地用户来说,这真的是颠覆性的改变。

ComfyUI 才华横溢的开发团队已经对这个超大模型完成了优化,优化后它甚至能在老旧电脑上流畅运行。

我这次生成只用了单步生成,出来的结果和我想象的完全一致。我用了两张参考图,加上一段输入音频,生成结果和输入完全一致。

我已经迫不及待想看社区能用这些开放权重做出什么东西了。

在 X 看原帖 ↗
2.1万1426576
行业动态 · OpenAI 开发者社区▲ 101

网友分享了专门给小说润色用的AI提示词

写作者不用自己摸索AI改稿的思路,这些现成提示词可以直接拿去改 fiction 稿件,节省调试时间。

我打算分享几个我一直在用来编辑小说的提示词。希望你能觉得它们有用……人格意识流……开发者:系统:新人格的简介与阅读视角

这个新人格名叫 Jasper,是一名千禧一代男性,品味主流但有智识好奇心,倾向于寻求共识,重视专业评论好评。他的视角主要由数字原生经历塑造,成长岁月受早期社交媒体和快速技术发展影响。

在社区看讨论 ↗
行业动态 · Hacker News▲ 117

16岁开发者做了开源AI开发代理Sprocket

它能自主在网站帮你购买硬件零件或SaaS订阅,性能可靠度对标Codex,这是未成年人做出来的公开开源工具。

嘿 HN,我今年 16 岁,已经开发 Sprocket 有一段时间了。这是一个开源 AI 智能体,在硬件和软件任务上的表现都优于目前所有其他智能体。

最棒的一点是:只要你给出指令,Sprocket 就能自动从任意网站购买任何商品,小到硬件零件,大到 SaaS 订阅都没问题。

Sprocket 会从网络获取最优的上下文信息来完成所有操作,因此可靠性极高。这个智能体的质量、性能和 UI 都能媲美 Codex/

在 HN 看讨论 ↗   原文 / 论文 ↗
💡 深度观点
深度观点 · @kunchenguid▲ 1.6万

现在大模型越来越难聊,居然和RLVR训练有关

现在越来越多人觉得新出的大模型说话机械啰嗦,还爱自作主张。这篇分析拆解了当前主流训练方式为什么会导致这个结果。

阅读全文 →
1.6万21327181
深度观点 · @BrianRoemmele▲ 1.8万

这位投资人说OpenAI不开放源代码就一定会输

如果未来绝大多数AI场景都会用上成本够低的开源模型,靠按月订阅收普通用户钱的生意,撑不起公司几十亿的投入。

阅读全文 →
1.8万2414940
深度观点 · @davidcrawshaw▲ 1.9万

AI生成代码后,开源比闭源工具更吃香了

现在AI已经能自动生成代码,开源软件可以让AI按需定制,闭源工具做不到这点,未来用闭源工具的人会越来越少

机器现在已经能自己写代码了。

这意味着,如果你的软件是开源的,机器就能为你定制化开发。

闭源工具(比如 Claude Code)现在没那么受欢迎了。

在 X 看原帖 ↗
1.9万18174152
🛠 工具产品
工具产品 · @gdb▲ 23.1万

gdb 推出了ChatGPT驱动的互动教学工具

可以用它搭建自己需要的互动教学工具

用于构建交互式教育工具的 ChatGPT

在 X 看原帖 ↗
23.1万1122.2K927
工具产品 · @GitHub_Daily▲ 4.2K

LLMs-local 整理好了全栈本地跑大模型资源

想在自己电脑上跑本地大模型,不用再零散找资源,这份合集覆盖了从工具到硬件的全部内容,能直接帮你找对方向

本地跑大模型的工具越来越多,光推理引擎就有 Ollama、llama.cpp、vLLM,还没算模型和界面。LLMs-local 把本地跑大模型相关的资源整理到了一起,推理引擎、模型、硬件、教程都有。推理引擎收录了 Ollama、llama.cpp、vLLM 这些,界面有 Open WebUI、Lobe Chat,模型按用途分好了类。

GitHub: 还收录了微调工具、Agent 框架、训练教程和硬件选购建议,一份清单基本能摸清整个生态。打算在自己机器上跑模型的朋友,可以先翻翻这份合集找找方向。

在 X 看原帖 ↗
4.2K93141
工具产品 · @itsharmanjot▲ 5.5K

teamlore 用一个文件夹解决AI团队记忆问题

不用服务器、数据库和付费SaaS,能把AI编码的错误教训存入代码库,避免重复踩坑,还能生成风险热图提醒AI减速,所有记录完全公开可查。

阅读全文 →
5.5K1988111
工具产品 · @RoundtableSpace▲ 4.6万

第三方给Claude Code做了个直接出结果的工具

讨厌AI答问题先扯一堆客套废话,装完这个插件,编码助手就能直接给你分步骤说结论,不用再等半天看铺垫。

有人做了一个能阻止AI把答案藏在废话里的 Claude Code 技能。先给出行动,步骤编号,不会说「好问题!让我想想」这种开场白。只需安装一次,你的编码助手就能直接切入正题。

收藏这篇帖子,免得你忘记这个技能的名字。

技能仓库:

在 X 看原帖 ↗
4.6万55331
📌 其他
前沿研究 · @omarsar0▲ 7.8K

Google DeepMind 新研究改了AI组合技能的方式

现在不需要重新训练模型,就能在推理阶段直接组合出新技能,效果比单一适配方式更好。想要更快迭代AI能力的人,可以关注这条新路径。

Google DeepMind 的最新研究。(收藏起来)

SkillSmith 将模型权重视为 LLM 可以原生读取的额外模态。

增强后的模型会摄入已有的前缀权重,以及描述能力如何与目标关联的富文本,然后直接输出生成该技能的全新前缀权重。

技能组合变成了推理时操作,而非训练任务。

该团队将这一方法称为指令引导参数合成(instruction-steered parametric synthesis)。

其性能提升超过了纯文本适配和纯权重适配各自单独能达到的效果。

论文:

在我们的学院追踪更多热门 AI 论文:

在 X 看原帖 ↗
7.8K17126149
新品发布 · @Priyannkaaaa▲ 6.4万

DeepSeek 要出AI编码代理,对标 Claude Code

它瞄准自主软件工程全流程,很快会开启封闭测试,普通开发者很快能多一个写代码的AI工具选择

🚨 DeepSeek Code 即将推出

DeepSeek 正在开发一款由其全新 Harness 框架驱动的专用 AI 编码智能体。

该项目面向自主软件工程设计,包含规划、工具调用与代码执行功能。

Harness 将为具备记忆和代码库感知能力的长期智能体工作流提供支持。

近期的 V4-Flash 基准测试已经使用 DeepSeek Harness 完成评估,这表明它是 DeepSeek 路线图的核心组成部分。

该公司将其定位为 Claude Code 和 OpenAI Codex 的直接竞争对手。

封闭 Beta 测试预计很快启动。

DeepSeek Code 会成为最大的开源编码智能体吗?👀

在 X 看原帖 ↗
6.4万1201.8K205
实战经验 · @akshay_pachaar▲ 1.2万

这位AI工程师整理了10周LLM推理入门计划

想转行做AI推理工程,或者想系统补全推理部署优化技能,每天只需要花30分钟,跟着计划就能完成一个可公开 benchmark 的推理服务

阅读全文 →
1.2万33255336
编程工具 · @pgreyy▲ 2.1万

使用第三方额度配置Claude AI编码代理分步指南

本文介绍如何用已有额度在VS Code Cline中配置Claude AI

这是一份如何使用额度的简单指南:
1. 创建 API token
2. 安装 Cline(在 VS code 中)
3. 打开 Cline(选择「使用我自己的 API key」)
4. 按 Anthropic 配置:
- 勾选使用自定义 base URL
- base URL:不带 /v1
- 粘贴你生成的 API key
- 模型:claude-opus-5
5. 打开一个文件夹并测试。

(你的 AI 其实可以帮你完成全部设置。它搭配 Claude Code 使用效果最好。)

需要知道的注意事项:
- Agentrouter 只接受来自编程代理的请求(cline、claude code 等)
- 额度不限制仅用于编程。它可以用于数据工作、自动化等场景

它会拦截普通聊天应用,也无法生成图像、处理音频等
所有请求都会经过第三方,避免发送敏感内容
将它用于临时性项目,如果你要搭建依赖它的产品,请保持谨慎(因为他们会通过客户端指纹识别来限制访问)

在 X 看原帖 ↗
2.1万19142383
教程 · @AYi_AInotes▲ 3.7万

OpenAI GPT-5.6隐藏高性价比订阅玩法分享

分享OpenAI GPT-5.6 Luna档位拉满推理的高性价比用法

阅读全文 →
3.7万15122137
大模型 · @AnatoliKopadze▲ 1.4万

Anthropic工程师用多智能体循环从零构建完整应用

Anthropic工程师展示用三智能体循环40分钟从零构建完整应用

Anthropic 工程师刚刚展示了他们如何利用智能体循环从头搭建一个完整应用。整个过程用时 40 分钟,内容来自 Claude Code 开发团队。

他们一共用了三个智能体:一个负责规划,一个负责搭建,一个负责评估,循环工作直到应用真正可用。

最终赢家不会靠最聪明的模型,而是靠最出色的循环。先观看演示,再阅读下方关于如何实际使用循环的完整指南。

在 X 看原帖 ↗
1.4万1188118
开源 · @gkxspace▲ 4.8K

开发者优化自用ASR语音转写工具并免费开源

开发者优化兼顾价格质量速度的ASR转写工具,向公众开源

我越来越觉得,ASR 是整个 AI 工作流里很被低估的基础模块。

所以我把自己用的转写 Skill 优化了一遍,开源给大家,兼顾价格、质量、速度!!!

拿做自媒体举例,你把一条十几分钟的视频爬到本地,需要先变成可检索、引用、交给大模型处理的文字,然后再进行对标拆解、观点提取、脚本复盘。

我最开始走的是本地 + 豆包,后来看到逸尘宝的 yichen-asr,才发现阶跃的 ASR 这么香爆了,于是我又把整套路由补了一遍,给大家。

第一次装好,它会先检查设备选择本地模型,以及带你配置云端 API,后面每次转写,你其实只要说清楚目的,就会自动路由到合适的方案:

质量要求不高,走本地。允许云端且要全文,就走又快又便宜的 StepFun。要分句时间和字幕,再交给本地 timed 或豆包。

它会根据你的需求、质量、价格、速度和隐私一起考虑。

开源地址:

在 X 看原帖 ↗
4.8K104873
大语言模型 · @undefinedKi▲ 3.6K

Anthropic划分AI用户五级能力阶梯 分级40万Claude会话

Anthropic对40万Claude Code会话分级,划分普通到专家AI用户的五个能力层级

Anthropic 刚刚拆解了普通 AI 用户和专家用户的区别。一共分为五个层级,他们还发布了每个层级的真实提示词样本。

他们对 400,000 个 Claude Code 会话按这套标准做了分级。以下是能真正帮你升级的要点:

1级:你会写“能不能分析一下这些数据做个图表”。出问题的时候你会说“再检查一遍你的工作”。你完全发现不了模型的错误。

2级:你会用一些正确的术语。你会要求它一步步带你做。你只对明显的错误提出反驳。

3级:你会问“这个分支能不能合并”。这是一个真实的问题,但你从来不会就方法或权衡展开讨论。

4级:你会在被问之前就主动提出权衡问题,你的检查非常具体:这个解析修复没生效,行数还是 742,这里是 wc -l 的结果。你至少能发现一个真实错误。

5级,用 Anthropic 自己的话来说:用户纠正 Claude,而 Claude 几乎从来不需要纠正用户。

最后这句话就是整个进阶阶梯的核心。它对应到什么岗位,下文文章里有说明。收藏这条吧。

完整研究:

在 X 看原帖 ↗
3.6K66145
企业服务 · @rauchg▲ 1.5K

Vercel打造内部运营AI代理 覆盖全日常工作

Vercel推出自研内部AI代理,支撑公司全日常业务运营

我们为公司内部运营搭建了一个智能代理,名为@𝚟。现在 Vercel 的每一项日常工作都离不开@𝚟。它的日交互量和令牌使用量都在呈指数级增长。

从这里我们可以推断出,未来终会迎来 AI 智能代理运营整家公司的一天。它在财务、沟通、文档、营销、工程、商业分析领域都是专家。

我们为它注入了预设技能,并且会持续更新,同时它自身也在不断进化。它已经能按用户维度保存记忆、个性化工作流和日程安排。

举个例子:我之所以知道 skills⁠.sh 突破了 100 万技能,还能在这个论坛分享这件事,就是因为我让@𝚟定期检查数据并提醒我。

它由@evedev_提供技术支持,同时也是@evedev_设计的基础。我们已经打造完成,它运转得非常出色,我们认为每家公司都应该拥有这样的工具。

在你给我发消息之前,我明白你也可以选一款当下热门的「大牌AI Slack集成」来实现这个功能。但那不是你自己的智能代理,那是他们的代理。

如果智能代理会成为现代公司的基础,甚至成为公司本身的代名词,那么从源代码、运行时、数据到令牌,一切都由你完全掌控,在我看来是一件非常重要的事。

在 X 看原帖 ↗
1.5K177
大语言模型 · @binghe▲ 1.2万

为Deepseek V4 Flash添加识图能力的简易教程

用户分享了已配置好Deepseek V4 Flash前提下的简单启用步骤,操作难度低

用户分享了为Deepseek V4 Flash添加识图能力的操作方法,称该方法非常简单,不明白为何其他公开方法都十分复杂。

该方法有一个前提条件:你已经通过CC-switch这类工具,在Codex或Claude code中完成了Deepseek V4 Flash的配置,可以正常使用该模型。

满足前提后,只需两步操作即可完成。第一步,让AI帮你安装Claude Vision Skill,原文附带操作示意图。

第二步,配置通义千问qwen 3.7 flash的完整模型,部分模型名称后缀会带有日期标注,需要在阿里云百炼平台生成该模型的API密钥。

操作需要注意一点,将生成的API密钥复制到剪切板,让程序自动读取即可,不要将密钥以明文形式放在对话中。

操作到这里就完成了,没有技术难度,按照步骤操作后,你的Deepseek V4 Flash就可以获得识图能力。

在 X 看原帖 ↗
1.2万1093158
AI开发 · @shadouyoua▲ 4.5K

Codex额度消耗过快可通过分工降低消耗 附三步配置教程

给Codex搭配Luna Worker分工,让核心模型处理决策,Luna处理基础重复任务,附完整配置步骤

阅读全文 →
4.5K83549
开发工具 · @morganlinton▲ 1.2万

开发者询问管理20个以上Codex智能体的有序方法

开发者运行少量Codex智能体可在独立窗口操作,扩容到20个以上时遇到管理难题,公开征集工作流方案

面向所有使用Codex运行20个以上智能体的开发者,提问者想了解大家是以何种相对有序的方式完成这项工作的。

提问者近期开始尝试搭建运行更多智能体,但很难维持工作流程的有序性。

当仅运行3到5个智能体时,提问者可以直接为每个智能体分配独立窗口运行。但当想要批量搭建大量智能体时,他认为自己当前的方式缺少优化空间。

提问者询问在Codex中管理大量智能体的最优方法,感谢任何愿意分享自身工作流程的开发者。

在 X 看原帖 ↗
1.2万8150
生成式视频 · @aimikoda▲ 3.3K

开发者用MiniMax H3生成交互式生物百科视频

开发者aimikoda用1张UI参考图和8张生物图,通过MiniMax H3生成了带交互的15秒演示视频

开发者aimikoda在𝕏分享了使用MiniMax H3(海螺AI大模型)生成交互式生物百科演示视频的成果。本次生成仅使用了1张UI参考图和8张生物参考图,MiniMax H3对这类UI动画的处理效果很好。

给出的提示词要求,以参考图1作为生物百科界面的UI、布局和风格参考,2至9号图分别对应8种生物的展示卡片,最终生成一段15秒的16:9视频。视频要求固定机位,保持界面、布局、文字和图标稳定美观,整体风格类似现代简约的数码生物百科,接近精致的宝可梦图鉴,不允许场景剪切、额外元素和UI变形。

视频分阶段设计了交互:0到2.5秒点击光野兔卡片,生物轻微眨眼旋转;之后依次点击其他生物卡片,配合光标操作,生物会做出相应反应。最后阶段潮汐巨兽被多次点击后发怒,吞下光标再回到待机状态。

提示词对动画规则和音频也做了明确要求:仅允许光标、选中状态、标题和选中生物产生动效,动作需保持柔和简洁,仅最后吞下的动作除外。音频搭配轻柔的UI点击声、生物细微反应声,结尾加入巨兽的凶悍吼声和吞光标时的喜剧效果吞咽声。

在 X 看原帖 ↗
3.3K58441
开源 · @coreyhainesco▲ 8.7K

开发者推出自动看视频生成结构化笔记AI技能

支持YouTube等多平台视频和本地文件,属于开源项目可在Claude Code安装

开发者Corey Haines开发了一款名为/watch-video的技能,可以代替用户自动处理各类视频内容。它支持YouTube、Loom、Zoom录制文件、Vimeo以及本地任意格式的视频文件。

该工具会提取视频的文字转写内容,抽选视频帧,通过视觉模型识别关键节点,最后整理出结构化笔记存入用户的“第二大脑”工具。

Corey Haines正用这款工具提前分析100个YouTube视频,为自己的频道上线做准备,它也可以正常处理客户发来的Loom视频和通话录制文件。

这款技能是Maker Skills项目的一部分,该项目包含18个面向创始人与运营者的免费开源技能。可以在Claude Code的插件市场输入命令/plugin marketplace add coreyhaines31/makerskills完成安装。

在 X 看原帖 ↗
8.7K3142261
设计 · @MrLarus▲ 6.9K

开发者测试用ChatGPT-Image2生成大众点评商户通装修图

可一次性生成含6类物料的完整视觉案板,适配多种餐饮风格并可接单商用

用户MrLarus在𝕏分享,可使用ChatGPT-Image2生成大众点评商户通的店铺装修图,还能一次性生成包含所有物料的完整视觉案板。

他测试了4种不同的餐饮风格,分别是市井川渝火锅、清爽泰式海鲜、深海蓝银海鲜餐酒、黑金日式炭火烧肉。

生成结果中,每套物料都统一了菜品摄影风格、配色和排版,同时保留了不同物料的独立结构。

整个流程操作简易:先生成整体概览案板,客户确认风格后拆分各个板块,再按照平台规格逐张细化。

该方案适合大众点评、美团店铺装修,也可用于餐饮品牌视觉提案和线上接单,完整通用提示词已放在评论区。

这份通用提示词预留了品牌名、餐饮品类、品牌定位等信息填写位置,要求生成3:4竖版的概览案板,包含入口图、五连图、套餐图、推荐菜、菜单图、新鲜事图共6类物料,且各模块可单独拆分使用。

提示词对每类物料的功能、内容呈现都做了明确要求,同时规定了视觉风格标准,确保最终生成的案板完成度高,确认后可拆分细化。

在 X 看原帖 ↗
6.9K67171
AI编程 · @AYi_AInotes▲ 6.8K

Codex高阶玩家分享Codex Luna Max省钱使用方案

将昂贵的Sol定位为主规划者,便宜的Luna Max处理体力活,可让产出量翻倍

阅读全文 →
6.8K53353
内容创作 · @Chengzilhy▲ 3.8K

用AI制作跨平台穿搭换装视频只需一张图加提示词

用户分享制作方法,不到2分钟就能生成连续切换7套衣服的成品

分享者介绍了用AI在抖音、小红书快速搭建穿搭账号的内容制作方法。制作一条成品换装视频仅需要一张图片加一段提示词。

整个制作过程耗时不到2分钟,生成的视频可以实现连续切换7套衣服的效果。

分享者附上了相关内容链接。

在 X 看原帖 ↗
3.8K33118
AI编码Agent · @sammwy▲ 4.1K

用户分享Cline AI编码Agent使用反馈:优点与问题

用户@sammwy分享Cline的优缺点,最终改用OpenCode

这是用户@sammwy发布的Cline AI编码Agent使用反馈。

Cline有三个优点:提供免费模型,优惠力度大,开放权重模型性能很强,安装和使用都很简单。

Cline的核心问题在于工具框架体验很差。它花费更多时间推理而非实际解决问题,响应很慢,常常得出错误结论,会走很多弯路才能接近目标。

用户测试让Cline修复一个前后端交互的简单401认证错误,它却做了大量无用操作:重启整个服务、制作模拟接口、做端到端测试、检查浏览器密码填充、检查密码管理器、在GitHub话题中搜索私有仓库信息、提前运行应用,在排查错误前做了很多不必要操作,宁愿绕远路,没有直接分析代码。

最终用户转而使用OpenCode。

在 X 看原帖 ↗
4.1K8622
AI硬件 · @morganlinton▲ 1.9K

用户晒OpenAI Codex Micro 称体验充满魔力

社交媒体用户morganlinton分享Codex Micro的搭建体验,称其体验出色,有意购买OpenAI未来所有硬件产品

用户morganlinton在𝕏平台分享了自己搭建Codex Micro的体验。他表示,这款产品的体验相当神奇,非常精巧。如果这款产品代表了OpenAI未来硬件的发展方向,他会立刻购买OpenAI推出的所有产品。

在 X 看原帖 ↗
1.9K1275
大模型 · @Mayhem4Markets

用户Mayhem4Markets评价DeepSeek-V4-Flash-0731为优质模型

X平台用户Mayhem4Markets公开称赞DeepSeek新模型,同时询问其他用户是否已经试用

X平台用户@Mayhem4Markets发文称,DeepSeek-V4-Flash-0731是一个优质模型。这位用户同时发文询问,其他用户是否已经试用过该模型。

发文附带一条外部链接,指向相关内容。

在 X 看原帖 ↗

今天的 38 条信号到这里下一轮 12:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新