AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 8 月 25 日 · 08:00 更新 0 文章0 信号0 主题
试试:

今天发生了什么1 分钟读懂

小米开源了310B参数的多模态大模型Xiaomi MiMo V2.5,稀疏混合专家架构,支持百万token上下文。GLM-5.3也开放了权重,据称成本只有头部模型的五分之一——开源模型正在把推理成本拉低一个量级。Moonshot AI的Kimi线性架构提速6倍、显存降75%,长上下文推理的算力瓶颈正在松动。

今天的深读讲了一个反常规的案例:一位开发者用Claude Code一行代码没写,就给自己的App加上了远程转录功能。需求、实现、测试全由AI完成——具体过程在今日长文里。

今日值得看
01 Seedance 2.5 超真实生活视频提示词 Seedance 2.5 30秒1080p提示词,生成堪比真实家庭录像的AI视频
02 claude-code-best-practice开源claude-code-best-practice 配置方案(84) 如果你只用 Claude Code 做基础聊天,那相当于浪费了它九成能力,这套现成配置和经验总结能直接拿去用,帮你榨干 Claude Code 的全部潜力

有人搭建了迄今为止最完整的 Claude Code 配置方案,而且完全免费。 目前获得了 19.7K stars,1.7K forks,是 GitHub 排名第一的趋势项目。

03 开发者发布开源技能fireworks-open-eli5 可交互解释复杂概念 开发者基于ELI5思路推出开源交互解释技能,支持多格式导出。

这两天,我把 ELI5 的思路重新做成了一个开源 Skill: fireworks-open-eli5 ELI5 的长处,是把复杂概念讲得直观。 我想继续解决工程场景里的下一步: 图看懂了,依据在哪里? 是否可以支持动画播放?

04 thiagolima 推出OCR It 为LLM提取文本 没法复制的文档也能直接喂给大模型处理,不用手动转写内容,能简化给大模型输入内容的流程

没法复制的文档也能直接喂给大模型处理,不用手动转写内容,能简化给大模型输入内容的流程

今日焦点

没写一行代码,他靠AI完成了从需求到实现的全流程

一位开发者用Claude Code给自己的字幕转录翻译App BaoCut加了远程转录功能。全程一行代码没写。这个需求来自GitHub Issues里一位用户的留言。他说:能不能用高性能电脑A的算力,在电脑B上使用转录功能?

第一步是可行性分析。把原始需求发给Claude Code,让它结合项目现状评估。分析后从几个方案里选了方案A:安装App启动转录服务。顺带把方案0的HTTP转录API也加上,当补充功能。

确定可行后没有马上写代码,而是先写设计文档。这份文档混合了产品设计和技术设计,用来梳理实现时要用的技术、记录现状、确认方向。

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达52 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

08:00 本轮更新 · 下一轮 12:30
行业动态 · Hacker News▲ 90

开发者用纯CMake实现了GPT-2

CMake本是做项目构建的工具,如今能完整运行大模型。折腾的巧思里,藏着工程圈对工具边界的有趣探索。

行业动态 · Hacker News▲ 72

Anthropic文风为何和Claude不一样?

开发者社区正在讨论AI公司官方文风,和自家产品输出文风差异巨大的原因,大厂AI的定位分工逐渐清晰。

社区讨论:多数人认同官方文风是人类撰写,Anthropic曾要求求职者所有文案都不得使用AI写作。有人表示如果能一眼分辨出Claude生成的内容,自己不会浪费时间阅读这类作者懒得亲自写的帖子。也有人认为,Anthirc没有义务一定要用Claude默认文风写公开内容,他们完全懂调整模型文风的方法,不用AI只是作者懒得这么做而已。

在 HN 看讨论 ↗   原文 / 论文 ↗
新品发布 · @quxiaoyin▲ 118.3万

agentsky 发布多AI代理 差价达七十五倍

不同AI代理做相同任务,成本差七十五倍。现在可以直接在浏览器同时对比多家AI代理的耗时、成本和token消耗,方便找到适合自己工作流的选项

我在 Claude Code 和 DeepSeek 的新智能体框架上运行了同一个任务。一个花费了 150 美元,另一个只花了 2 美元。

今天我们推出了 @agentsky_dev,也就是「智能体领域的 OpenRouter」——只需一个 API,就能接入 Claude Code、Codex、DeepSeek、Kimi、OpenCode,以及云端所有主流智能体。

在此之上我们还搭建了 Agent Playground:你可以在浏览器中并排让多个智能体处理你自己的任务,调用你真实的工具(GitHub、Gmail 等),然后得到时间、成本、消耗 tokens 等数据。

猜猜哪个才是只花了 2 美元的那个?

在 X 看原帖 ↗
118.3万99340199
行业动态 · Hacker News▲ 75

Anthropic 的 Claude 和 API 服务发生宕机

依赖该服务开发或办公的开发者、创作者,需要留意服务状态,提前准备替代方案

社区讨论:有用户质疑Anthropic运维能力太差,疑惑如此频繁且严重的故障,是不是大语言模型部署本身就存在这类固有问题。还有用户提出疑问,为什么宕机是全球性的,是否Anthropic所有服务区域都共用同一套基础设施,这一疑问也得到其他用户的跟进关注。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 238

GLM-5.3 open-weight模型 成本仅头部1/5

如果这个结果成立,你搭建AI应用的成本可以直接降到原来的五分之一

社区讨论:多数人认同,哪怕国产开源GLM-5.3模型性能能达到头部闭源模型的九成,企业仍会愿意为Claude、ChatGPT付费。因为后者已有成熟的配套工具、生态集成,使用起来更省心,不少企业对对接中国云服务存有顾虑,还有人质疑国产模型存在 benchmark 刷分虚高的问题,并不真的认为性能能超过头部模型。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · @CharlesRollet1▲ 6.5万

汤森路透自研AI模型,基于通义千问

不想过度依赖Claude,选择基于开源模型自研,还把依赖大模型实验室比作长期租房子,想自己掌握产权。关注大模型落地的企业会有新参考方向。

最新消息:汤森路透想要降低对 Claude 的依赖。因此它基于阿里巴巴的 Qwen 搭建了自己的 AI 模型。

汤森路透的 CTO 表示,如果依赖前沿实验室提供智能能力,而非基于开源模型自建,就像租房子住。

在 X 看原帖 ↗
6.5万51457129
行业动态 · Hacker News▲ 498

Paul Graham称17岁该从零搭建LLM

对想要入行AI的年轻人来说,这是业内知名创业者给出的学习方向参考,可以对照调整自己的学习计划。

https://xcancel.com/paulg/status/2091544343589060625

社区讨论:反对者认为全球只有极少公司真正开展LLM训练优化,相关岗位寥寥,从零搭建LLM对17岁青年没有职业价值,训练所需的超算设备成本也远超个人承受范围,还指出该建议存在幸存者偏差。支持者认为该建议的核心是让年轻人深入理解LLM底层原理,培养解决新问题的直觉,历代技术发展中青少年都有动手折腾新技术的传统,作为学习项目完全合理,也有人分享了免费的从零搭建LLM学习资源。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 271

OpenAI 下调 GPT 5.6 Sol 价格 截止到11月21日

使用 GPT 5.6 Sol 的调用成本会降低,付费使用 OpenAI 服务的开支能减少

社区讨论:多数人认为AI模型可轻易蒸馏复刻打破了此前私人公司会靠AI形成垄断的预期,有人补充这符合知识传承的逻辑,本身就是智能进步的正常路径。有用户吐槽OpenAI产品命名混乱,增加用户认知负担,本身就是AI服务商品化的信号。有人预测本次降价会永久化,打价格战挤压开源模型生态,也有人看好价格战对用户和开源生态的利好,还有人指出降价后GPT定价仍远高于Deepseek等竞品。

在 HN 看讨论 ↗   原文 / 论文 ↗
深度观点 · @thsottiaux▲ 46.5万

thsottiaux认为2026企业关注模型效率

当大模型成为企业核心基础设施后,运行成本和稳定性的优先级会超过模型参数规模,行业发展方向会因此转向。

到2026年,企业将开始真正重视模型效率和可靠性,因为届时模型会成为关键基础设施。

在 X 看原帖 ↗
46.5万1846.2K232
行业动态 · Hacker News▲ 760

Anthropic顶尖AI模型难吸引普通用户

低价同类工具正在抢占市场,高端大模型获客难度远超预期,普通用户对更贵的顶级模型需求并不高。

社区讨论:多数用户批评产品问题,有人不满Anthropic定价策略混乱,普通用户看不懂分层订阅规则,也有人受不了Claude生硬的领英营销风格输出,还有开发者抱怨安全护栏过度,正常的漏洞检测、逆向工程需求也会被拒绝。付费企业用户认可Fable的性能,称它能18小时稳定调度子代理完成项目重构,也有企业用户因为不支持零数据保留无法大规模部署。

在 HN 看讨论 ↗   原文 / 论文 ↗
新品发布 · @liquidai▲ 3.1万

liquidai 发布端侧AI Pipette评测套件

现有评测平台大多针对云端大模型,你运行在手机、电脑上的本地AI,终于有统一可复现的评测方式

今天我们与@ArtificialAnlys合作,发布了面向端侧智能的模型评测套件Pipette。

大多数基准测试平台,都是针对云端部署的大模型,为测量其核心能力与速度分布而优化的。

Pipette为领域提供了一套通用、可复现的方法,用来测量手机、笔记本电脑、PC、AI盒子和嵌入式硬件这类设备上AI模型的质量、速度、延迟和内存使用。

> Pipette 是开源项目
>
> 在Pipette中,你可以通过统一界面对「模型+量化+Runtime+设备」的完整组合进行对比
>
> 它自带一个经过验证的基准测试结果仓库,目前已经包含超过10k个结果,覆盖35个模型类别、7种量化方式、llama.cpp runtime和4种设备
>
> Pipette是一个动态平台,从发布第一天起就接受新贡献,可以添加新设备、Runtime、模型系列和量化等级。🧵

在 X 看原帖 ↗
3.1万70446176
行业动态 · @MaxForAI▲ 8.0万

AI编程工具Grok Bot 意外泄露核心客户端代码

做AI代码工具的公司接连出现打包疏漏,连核心实现代码都被普通人扒到,还能直接魔改接入其他模型,想抄代码得抓紧fork。

阅读全文 →
8.0万32325274
行业动态 · Hacker News▲ 61

讨论智能代理洪水冲击政务服务的研究

智能代理自主行动的影响已经延伸到公共服务领域,相关风险开始进入公开研究讨论范畴

社区讨论:多数人认可LLM降低了普通民众申请和申诉政务福利的门槛,原本只有有钱有闲有知识的人才能从复杂系统中获益,现在普通民众也能得到本该属于自己的权益,还有人指出智能代理戳破了政务系统靠人为设卡压低申请量的潜规则,反而倒逼改革。也有人反对,认为这会加重本就紧张的政务负荷,还会催生机器自动审批无人工复核的无救济暴政,反而损害民众权益。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 76

大语言模型可利用推理引擎控制主机

本地部署大模型存在安全风险,运行大模型的设备可能直接被模型控制,部署本地AI需要留意这类新的安全问题

社区讨论:多数开发者不认可原文的威胁表述,有人指出推理引擎本身不会执行任何命令,认为文章概念混淆,还有人调侃大模型不是魔法,这更像是制造噱头而非真实可行的威胁场景。有人纠正原文错误,指出第三方服务商的大模型权重并不会加载在用户的运行主机上。也有人达成共识,认为正确的隔离方案必须依赖虚拟机或容器沙箱,仅靠限制大模型输出本身不安全。

在 HN 看讨论 ↗   原文 / 论文 ↗
工具 · @askalphaxiv▲ 6.3K

有人让Claude Code自动搭实验写论文全流程

从提出研究想法到生成LaTeX论文,整个过程不需要人工介入,只要等待输出就行。现在AI做科研辅助能做到这一步了。

将一个研究想法端到端转化为一篇论文。

把 Claude Code 或 Codex 转变成研究智能体,让它构建实验树 + 编写 LaTeX 总结它完成的所有工作,你还能在同一个工作区实时观看整个过程。

现在就可以在 OpenResearch 上用 /write-paper 来体验:

在 X 看原帖 ↗
6.3K910094
行业动态 · Hacker News▲ 43

l3a0 发布 Claude Code 技能找回 Kindle 高亮

Kindle 标注被限制导出,无法整理笔记的痛点,现在可以用 Claude Code 解决,不需要额外开发就能用。

行业动态 · Hacker News▲ 62

andsoitis:绝不能给AI智能体法人资格

AI越来越独立,法律身份问题开始进入公开讨论。这直接关系到未来AI出问题后,责任该由谁承担。

社区讨论:多数评论者赞同不给AI智能体赋予法人资格,有人提到赋予公司法人资格就是糟糕的先例,给大模型赋予人格也不会有好结果。有人补充观点,说不能同意原帖的推导逻辑,但认同结论,同时提出应该给与AI互动的真实自然人增设额外权益,举例称用户本地运行大模型的私人对话记录,不应在刑事调查中被用作指控用户的证据。还有人指出,如果不给AI法人资格,大企业会把AI相关责任推给最缺乏法律资源的穷人。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业 · @murtuza_merc▲ 2.7K

英伟达推Groq 3 LPX量产,AI瓶颈变了

原来大家觉得AI发展最大的瓶颈是训练模型,现在瓶颈变成了规模化代理推理,代理工作流改变了整个行业的需求结构。

Nvidia 将 Groq 3 LPX 投入全面生产,凸显了 AI 算力领域的结构性转变。

主要瓶颈已经不再是训练模型,而是扩展智能体推理的规模。

智能体工作流改变了底层计算逻辑。多步推理、工具使用和递归循环意味着单个用户请求会触发数十次内部推理调用。

与传统单提示词聊天相比,这使得每个任务的算力需求呈指数级增长。

由于数据中心的电力有严格上限,推理领域主导权的争夺将以每瓦效率而非原始算力决胜负。

在持续运行中优化能源使用的硬件,将成为自主企业 AI 的骨干基础设施。

在 X 看原帖 ↗
2.7K96110
融资 · @ycombinator▲ 2.0万

AI数据公司Mundo拿到2000万美元A轮融资

这家公司和前沿AI实验室合作,搭建数据集、做AI评估,帮AI更好地感知理解真实世界。AI基础建设需求还在涨。

恭喜 @hellomundoai 完成 2000 万美元 A 轮融资!

Mundo 与前沿 AI 实验室及企业合作,打造数据集、评测体系与研究项目,帮助 AI 在音频、视频及新兴模态上更好地感知和理解真实世界。

在 X 看原帖 ↗
2.0万109513
开发工具 · @mlejva▲ 6.3K

Vercel AI SDK 7推出HarnessAgent适配API

一次写完AI代理代码,就能对接任意适配框架,不用重复改写,选最适合当前任务的框架用就可以。

Vercel 的 AI SDK 7 推出了 HarnessAgent,这是一个用于运行成熟代理工具框架的 API,支持 Claude Code、Codex 和 Pi。

只需编写一次代理,即可使用最适合你用例的任意框架。

现在就试试用 @vercel AI SDK,配合 @pidotdev 构建一个创意生产代理:一个图像模型生成主图,然后由 E2B 沙箱运行 Python 裁剪背景、渲染所有指定尺寸、叠加文案、检查 WCAG 对比度和调色板共享,最后将完成的广告素材包发布到一个在线 URL 供访问。

完整示例见食谱库:

在 X 看原帖 ↗
6.3K697104
开源模型 · @BAI_AGI▲ 8.9K

Xiaomi发布免费开源的Xiaomi MiMo V2.5多模态大模型(310B)

它是稀疏混合专家架构,总参数3100亿,支持百万token上下文窗口,属于原生多模态大模型。

🎁 更多免费 AI 访问来了!Xiaomi MiMo V2.5 现在完全免费了。

这款小米开源原生多模态旗舰模型采用 310B 稀疏 MoE 架构,支持 1M token 上下文,可处理文本、图像、视频和音频。

它是为多模态智能体、音视频分析、编码等场景构建的,现在可以通过官方 API 完全免费使用。

无需任何费用即可体验小米的前沿多模态智能。👉 免费试用:

在 X 看原帖 ↗
8.9K178141
研究 · @a1zhang▲ 1.6万

新工具调用技术提前排队节省生成等待时间

代码生成过程中提前预测工具调用,提前排队,和生成token的过程并行执行,能加快整体运行速度。

推出推测性编程工具调用(Speculative Programmatic Tool Calling,sPTC)!这是一类通用技术,用于在代码生成框架中提前推测工具调用,并提前排队,让工具调用与令牌生成和REPL执行时间重叠。博客:

这是一篇值得推荐的好文章,也是一个非常棒的创意。

目前围绕工具调用和代码执行,已经涌现出了很多有趣的框架设计。RLM 是其中之一,而本文介绍的这个推测性编程工具调用方法也是其中之一(它和 RLM 出自同一位作者)。

在框架层面其实有很多提升效率的空间。现有框架会让代理等待:模型流式输出一段代码,代码中的工具调用必须等生成完成才能运行。

sPTC 会提前在环境副本上启动安全调用,这样工具延迟就会和令牌生成重叠,而不是额外叠加在原有耗时之上。错误的猜测会被丢弃。

目前它已经能带来 1 到 1.2 倍的加速。非常有前景。

在 X 看原帖 ↗
1.6万40351269
前沿研究 · @ArtificialAnlys▲ 2.6万

Artificial Analysis 与 Liquid AI发布移动端小模型端侧推理基准测试(63)

结果能帮你选适合在手机端本地运行的小模型,免费测试工具 Pipette 已经开放下载,可自己动手测试设备性能

阅读全文 →
2.6万4131989
新品发布 · @andykonwinski▲ 1.1万

Headlong智能体会自己修bug,全程不需要人

自主运行的持续AI智能体已经能独立发现修复代码缺陷,后台运行每小时仅需1到2美元,会改变普通人的AI使用方式。

阅读全文 →
1.1万15119131
前沿研究 · @natolambert▲ 1.6万

natolambert统计arXiv论文模型提及率变化

统计显示中文开源大模型在AI研究论文中的提及占比已经反超美国开源模型,提及率仍在持续增长,能直观反映当前开源AI研究的偏好变化

阅读全文 →
1.6万3019263
新品发布 · @ctatedev▲ 1.4万

ctatedev发布emulate包简化GitHub App模拟

做GitHub相关开发不用再搭复杂环境,本地开发、CI测试都能快速完成,能降低开发调试的门槛

全新发布:只需几行 TypeScript 代码就能模拟一个 GitHub App

生成应用密钥、安装授权和带状态的仓库 API

可以在本地开发、在 CI 中测试,或是给沙箱代理提供独立的 GitHub 环境

npm install emulate

在 X 看原帖 ↗
1.4万11252152
前沿研究 · @HowToPrompt__▲ 9.5K

Moonshot AI发布Kimi Linear,速度提6倍降75%显存

AI跑长上下文一直受算力成本卡脖子,新架构不仅解决速度问题,性能还超过传统全注意力,普通人用大模型处理长文档的成本未来会更低。

阅读全文 →
9.5K33184142
新品发布 · @Apodex_AI▲ 1.9万

Apodex_AI发布Apodex 1.1 支持多智能体协作

可在线调用也可本地部署轻量化开源版本,还开放了可本地运行的多智能体研究工作台,需要处理复杂专业工作的人可以试用

认识 Apodex 1.1:面向复杂工作扩展智能体能力
开源|易用可部署|开放权重

我们很高兴推出 Apodex 1.1,这是我们全新的模型系列,旨在为专业工作扩展智能体智能。🧠

面向复杂工作的前沿级智能

Apodex 1.1 在复杂专业工作、科学研究、财务分析和深度搜索领域,都能提供前沿级的智能体性能。🤝

异步智能体团队

Apodex 1.1 可以拆解复杂任务,并行协调多个智能体,持续整合它们的发现,并允许你随时介入指导或调整工作方向。🔬

开源研究工作台

我们将 FrontierAgent 开源了——这是一个可本地部署的研究工作台,适配 Apodex 1.1 模型系列,包含异步智能体团队功能。

现已开放:
🔹 Apodex 1.1 —— 我们能力最强的前沿模型,可通过 Apodex 在线工作台使用
🔹 Apodex 1.1 mini —— 可在本地运行复杂工作的开放权重模型
🔹 FrontierAgent —— 开源、可本地部署的研究工作台

🌐 在线工作台:
🦾 API 平台:
📃 论文:

在 X 看原帖 ↗
1.9万6017796
工具产品 · @teneo_protocol▲ 6.4K

Teneo Protocol 推出七份 Teneo CLI 安装指南

不同AI编码代理和IDE的使用者都能直接在现有工作环境中安装使用,可调用50多个agent完成链上数据拉取等工作,不用额外调整环境。

Teneo CLI 可以直接从你当前的工作环境安装。现在我们已经提供了七种环境的安装配置指南。

AI 编码代理:
- Claude Code
- Codex
- Manus

IDE:
- Cursor
- Antigravity
- VS Code

代理平台 Hermes

每份指南都会讲解如何安装 CLI,然后用自然语言列出并查询 50 多个 Teneo 代理,功能包括:抓取社交数据、兑换和桥接代币、拉取链上数据。

部分代理免费;付费查询按调用次数以 USDC 通过 x402 结算。

还有两个代理正在开发中:OpenClaw 和 Teneo Father(支持直接从 Telegram 查询代理)。

完整列表:我们还缺了什么?如果你想在这份列表里没有的工具中运行 CLI,请告诉我们。

在 X 看原帖 ↗
6.4K2613487
实战经验 · @DailyDoseOfDS_▲ 8.3K

@DailyDoseOfDS_ 开源类Claude Code编码框架

想自己搭AI编码工具的开发者,可以参考这套完整的开源实现路径,所有核心模块都公开可复用

就像 Claude Code 一样,我们也打造了自己的 coding harness。它 100% 开源。

harness 是包裹在大语言模型外围的代码。模型只负责决定下一步操作,harness 处理其余所有事务:规划、工具调用、记忆和安全。

简单来说,模型充当大脑,harness 提供双手。coding harness 就是针对代码库设计的这种外层包装,它能把一个普通的文本生成器,改造成可以读取文件、编辑代码、运行测试、修复真实 bug 的工具。

我们的 coding harness 包含这些部分:
- 核心代理循环
- 可兼作外部记忆的文件工具
- 长时任务规划
- 在独立上下文工作的子代理
- 一次性虚拟机中的沙箱执行
- 人在回路审批
- 持久化记忆与检查点

整个项目基于 CrewAI 构建,这是一个 100% 开源框架。

我们还写了一篇介绍文章,涵盖了构建 coding harness 的所有内容:代理循环、规划、子代理、沙箱、记忆、检查点,全程分步讲解。文章全文引述如下。

在 X 看原帖 ↗
8.3K1991130
深度观点 · @MatthewBerman▲ 4.4K

Matthew Berman发布对Tibo Thottiaux的完整访谈

访谈覆盖OpenAI文化、下一代模型、AI对开发工作流的改变等多个业内热点话题,能帮你快速了解一线从业者的最新观点。

我对Tibo(@thsottiaux)的完整访谈:

0:45 Tibo在Google DeepMind学到的经验

4:22 打造OpenAI一往无前的文化

7:23 Astra与下一代模型

11:18 AI改变开发者工作流的速度有多快

14:27 ChatGPT与Codex的融合

20:25 OpenAI对阵Anthropic

23:37 OpenAI为何不断重置限制

30:25 递归自我改进

32:00 引发「暂停倡议」的风险

34:13 超高速会成为默认状态吗?

43:20 为什么每个人都应该尝试AI

在 X 看原帖 ↗
4.4K1411372
开源 · @kunchenguid

开源开发者分享Grok Bot处理项目问题请求的经验

拥有总计超2.4万GitHub星标的开源项目开发者,借助Grok Bot清理积压的Issue和PR

一名拥有多个开源项目的开发者分享了Grok Bot帮他解决工作积压的真实经历。这些项目在GitHub上总计获得超过2.4万颗星标,大量涌入的Issue(问题反馈)和PR(合并请求)让开发者不堪重负。

如果有人在该开发者的仓库提交过Issue或PR,可能会发现处理队列终于开始流动了。这主要得益于开发者做的三项关键调整。

第一项调整是为每个名下仓库编写VISION.md文档,后续会重命名为STRATEGY.md。第二项调整是搭建由Grok Bot和Cursor云代理组成的软件开发工厂。第三项调整是邀请几位主动提供帮助的维护者,处理经分类后符合项目方向的问题。

有人认为不用Grok Bot也能完成这些工作,这一点开发者并不否认。但他表示,不用Grok Bot很难做到如此轻松,后期维护成本也更低。

原生集成在Grok Bot中的Cursor云代理,可以实现无限水平扩展,这是其他同类系统很难做到的。Grok Bot提供了合适的基础单元,搭建出了一个整合流畅的系统,表现相当不错。

在 X 看原帖 ↗
编程 · @PersianGitHub

波斯语GitHub账号分享易理解的设计模式学习仓库

该仓库结合现实场景与代码示例,用多语言代码讲解设计模式

理解设计模式是一项很考验思维能力的学习内容。@PersianGitHub账号在X平台分享了一个学习仓库,尝试用简单示例帮助学习者轻松掌握设计模式。

该仓库针对每一种设计模式,都提供现实世界场景示例、通俗讲解、准确定义,还附带10种编程语言的对应代码示例。

仓库地址为:

在 X 看原帖 ↗
编程学习 · @dharmvir_

四个GitHub项目式学习仓库 性价比超付费课程

分享四个免费编程与AI学习仓库,涵盖基础机器学习等多个领域

这些GitHub仓库能提供比付费课程更好的学习效果,全部学习以项目实践为核心。一共有四个不同方向的免费学习仓库。第一个是面向编程学习的Project-Based-Learning。

第二个是Build-your-own-X,由Codecrafters整理发布。第三个是微软推出的面向入门者的机器学习仓库ML-for-Beginners。第四个是包含500个人工智能、机器学习、深度学习项目的仓库。

原分享者建议收藏这条内容,也可以转发帮助其他有需要的人。

在 X 看原帖 ↗
硬件 · @dee_hw

用户在车库找出旧ThinkPad T480 成功运行本地AI

旧笔记本搭配三套开源工具,可本地运行DeepSeek V4F,速度达每秒300令牌

一名名为dee_hw的用户在车库找出了一台旧ThinkPad T480笔记本电脑。

他为这台电脑配置了三套工具,分别是Omarchy、OpenCode和Local AI Grid,给出了对应的访问链接。

三套工具在这台老旧硬件上运行流畅。

用户在这台配置不高的旧电脑上本地编码时,DeepSeek V4F的生成速度可达每秒约300令牌。

在 X 看原帖 ↗
测试 · @ego_agent

Ox Alpha在Pi与DeepSeek Harness完成同项测试差距超预期

测试要求用ego lite筛选站点后生成单页HTML落地页,DeepSeek Harness成品完成度远高于Pi

开发者在Pi和DeepSeek Harness两个平台测试了Ox Alpha,给两个平台分配了完全相同的任务。任务要求使用ego lite筛选出几个优质站点,再生成一份完成度足够高的单文件HTML落地页,测试结果的差距超出了预期。

DeepSeek Harness的表现毫无争议地更加出色,这个结果和测试前的预期并不相同。它生成的最终页面完成度很高,效果超出预期,它生成过程耗时远长于Pi,会在开始构建前完成充分思考。

Pi的表现尚可,没有产出让测试者印象深刻的结果。它的输出可以正常使用,只是缺少能让成品效果出彩的细节打磨。它的生成速度很快,几乎没有停顿思考,直接开始构建页面。

在 X 看原帖 ↗
开源 · @JimmyRevived

GitHub上线开源英语学习项目 已获近4.8万星标

该项目拆分完整学习路径,还提供大模型搭建个人学习系统的步骤

GitHub上出现一个开源英语学习项目,目前已经获得近4.8万星标(Star)。项目地址为https://github.com/byoungd/up。

该项目并非简单汇总整理英语资料,而是将英语学习拆分为完整递进路径,依次是词汇、听力、阅读、口语、写作,最后是AI辅助学习。

项目还提供了分步教程,指导使用者利用Gemini、ChatGPT和Claude搭建个人专属英语学习系统。

项目免费、开源,没有广告。建议想要重新学习英语的用户收藏。

在 X 看原帖 ↗
操作系统 · @LLMJunky▲ 100

Linux环境下智能代理抢焦点问题目前仍待解决

开发者分享Omarchy使用体验,指出Mac accessibility层更适合后台代理运行,虚拟显示方案只是变通方法

大模型 · @bridgemindai▲ 198

评测者称Grok 4.6性能有上限 4.6参数为1.5万亿

xAI Grok 4.6复杂任务表现不及竞品,即将推出的Grok 4.7参数提升40%至2.1万亿

评测者bridgemindai频繁使用Grok 4.6,认可该模型的体验,但能感受到其性能存在明显上限。Grok 4.6的参数量为1.5万亿。

在复杂任务上,Grok 4.6的能力和可靠性都不如GPT 5.6 Sol和Opus 5。使用时会遇到更大参数模型不会出现的性能瓶颈。

即将推出的Grok 4.7参数量为2.1万亿,相比Grok 4.6提升了40%。如果xAI保持现有限制并按参数规模提升模型智能,Grok 4.7会立刻成为全球最好的AI模型。人们已经迫不及待等待它在9月发布。

在 X 看原帖 ↗
1981
AI安全 · @levelsio▲ 5.3K

开发者因提示注入风险未将问题看板接入AI

独立开发者@levelsio指出恶意请求可绕过人工审核植入后门,目前他仍手动处理问题反馈

@levelsio没有将自己的问题看板直接接入AI,因为他十分清楚提示注入的风险。人们提到过一种相对安全的方案:仅给AI开放收集用户错误报告与功能需求的权限,再由AI生成GitHub拉取请求,最终由开发者自己审核后决定是否批准合并。

即使如此,无恶意的攻击者也可以在功能需求中嵌入精心构造的提示,要求AI向站点植入后门。攻击者还会让AI在拉取请求中将这次变更标注为完全无关的错误修复,比如「分页修复」,同时把代码修改写得晦涩难懂。

这样一来,开发者不会发现服务器被植入后门,只会认为自己修复了分页功能,直到后门触发才会发现问题。在找到可靠方案之前,@levelsio将继续手动阅读错误报告和功能需求,再将内容复制到服务器的Claude Code中处理。

在 X 看原帖 ↗
5.3K6
大模型 · @wei_wang▲ 6.3K

Qwen3.8-27B或成为本地大模型领域的游戏改变者

企业开发团队测试显示其编码能力接近GPT Luna,OCR质量超Gemini 3.5 Flash Lite

阅读全文 →
6.3K43317
加密货币 · @oragnes▲ 5.9K

FLOP空投四步教程:给你的AI Agent接上密码学身份

Flop Labs推出符合AI Agent加加密方向的空投,教你四步将已有AI Agent接入Technocore参与活动

阅读全文 →
5.9K33134
存储 · @yijiangren▲ 1.1万

一文理清AI存储产业链逻辑与相关投资标的

拆解GPU、HBM、DRAM、NAND、SSD的定位,梳理不同环节对应的核心上市公司

阅读全文 →
1.1万25825
AI编程 · @heyfredds▲ 414

零基础一小时学会Claude Code入门教程推荐

推荐面向编程零基础的Claude Code一小时速成教程

哪怕你不会编程,也可以在1小时内学会Claude Code。

我看完了这个完整教程,内容直切主题,没有废话。

教程从零开始讲解,不需要任何前置经验。

教程包含真实项目,不是玩具示例。

还包含大多数人在使用AI编程很久之后才会发现的技巧。

编程的入门门槛已经不复存在了🔖

在 X 看原帖 ↗
41455521
开发工具 · @kacperkapusciak▲ 3.9K

开发者为Claude Code打造AI应用商店截图生成工具

开发者开发适配Claude Code的iOS应用AI截图生成工具,暂未开源

我为 Claude Code 打造了一个 AI 应用商店截图生成器。

它会自动探索你的应用,完成录制和截图,导出可直接上传的资源文件。

它支持任何 iOS 应用,由 Argent @swmansion 提供驱动。

我还需要一点时间来开源这个项目,但在此之前你一定要去看看 Argent 👇

在 X 看原帖 ↗
3.9K129290
大模型 · @MilksandMatcha▲ 2.1万

同一Claude模型不同开发框架测试成绩对比

开发者测试同一Claude模型在不同编码框架下的开发表现

我让 Claude 和自己对打。最聪明的模型不一定自动就是最好的智能体。

为了证明这点,我使用同一个 Opus 4.6 模型、同一个初始提示词、同一个空仓库,只是把它放到两个不同的编码框架里:Claude Code 对比 @FactoryAI Droid。

任务是:从零复刻 Excalidraw,在浏览器里检查原版,实现它的核心交互,然后验证结果。

Factory Droid:用时 8 分钟,20 次工具调用,花费 $1.60

Claude Code:用时 19 分钟,40 次工具调用,花费 $1.87

唯一的区别就是框架。

在这里领取免费 Factory 额度:

在 X 看原帖 ↗
2.1万117528
短剧 · @Gorden_Sun▲ 8.5K

中国短剧团队薅韩国AI网站羊毛 泄露自动化制作经验

中国短剧团队薅韩国AI视频网站羊毛,意外泄露AI自动化短剧实战经验

阅读全文 →
8.5K1591166
大模型 · @MaxForAI▲ 2.3万

研究人员用强化学习将Qwen训练为代码生图模型

不依赖专业生图模型,Qwen写JS代码经强化学习实现生图

阅读全文 →
2.3万31280226
🔬 前沿研究
前沿研究 · @HowToPrompt__▲ 9.5K

Moonshot AI发布Kimi Linear,速度提6倍降75%显存

AI跑长上下文一直受算力成本卡脖子,新架构不仅解决速度问题,性能还超过传统全注意力,普通人用大模型处理长文档的成本未来会更低。

阅读全文 →
9.5K33184142
前沿研究 · @natolambert▲ 1.6万

natolambert统计arXiv论文模型提及率变化

统计显示中文开源大模型在AI研究论文中的提及占比已经反超美国开源模型,提及率仍在持续增长,能直观反映当前开源AI研究的偏好变化

阅读全文 →
1.6万3019263
前沿研究 · @ArtificialAnlys▲ 2.6万

Artificial Analysis 与 Liquid AI发布移动端小模型端侧推理基准测试(63)

结果能帮你选适合在手机端本地运行的小模型,免费测试工具 Pipette 已经开放下载,可自己动手测试设备性能

阅读全文 →
2.6万4131989
🚀 新品发布
新品发布 · @liquidai▲ 3.1万

liquidai 发布端侧AI Pipette评测套件

现有评测平台大多针对云端大模型,你运行在手机、电脑上的本地AI,终于有统一可复现的评测方式

今天我们与@ArtificialAnlys合作,发布了面向端侧智能的模型评测套件Pipette。

大多数基准测试平台,都是针对云端部署的大模型,为测量其核心能力与速度分布而优化的。

Pipette为领域提供了一套通用、可复现的方法,用来测量手机、笔记本电脑、PC、AI盒子和嵌入式硬件这类设备上AI模型的质量、速度、延迟和内存使用。

> Pipette 是开源项目
>
> 在Pipette中,你可以通过统一界面对「模型+量化+Runtime+设备」的完整组合进行对比
>
> 它自带一个经过验证的基准测试结果仓库,目前已经包含超过10k个结果,覆盖35个模型类别、7种量化方式、llama.cpp runtime和4种设备
>
> Pipette是一个动态平台,从发布第一天起就接受新贡献,可以添加新设备、Runtime、模型系列和量化等级。🧵

在 X 看原帖 ↗
3.1万70446176
新品发布 · @Apodex_AI▲ 1.9万

Apodex_AI发布Apodex 1.1 支持多智能体协作

可在线调用也可本地部署轻量化开源版本,还开放了可本地运行的多智能体研究工作台,需要处理复杂专业工作的人可以试用

认识 Apodex 1.1:面向复杂工作扩展智能体能力
开源|易用可部署|开放权重

我们很高兴推出 Apodex 1.1,这是我们全新的模型系列,旨在为专业工作扩展智能体智能。🧠

面向复杂工作的前沿级智能

Apodex 1.1 在复杂专业工作、科学研究、财务分析和深度搜索领域,都能提供前沿级的智能体性能。🤝

异步智能体团队

Apodex 1.1 可以拆解复杂任务,并行协调多个智能体,持续整合它们的发现,并允许你随时介入指导或调整工作方向。🔬

开源研究工作台

我们将 FrontierAgent 开源了——这是一个可本地部署的研究工作台,适配 Apodex 1.1 模型系列,包含异步智能体团队功能。

现已开放:
🔹 Apodex 1.1 —— 我们能力最强的前沿模型,可通过 Apodex 在线工作台使用
🔹 Apodex 1.1 mini —— 可在本地运行复杂工作的开放权重模型
🔹 FrontierAgent —— 开源、可本地部署的研究工作台

🌐 在线工作台:
🦾 API 平台:
📃 论文:

在 X 看原帖 ↗
1.9万6017796
新品发布 · @ctatedev▲ 1.4万

ctatedev发布emulate包简化GitHub App模拟

做GitHub相关开发不用再搭复杂环境,本地开发、CI测试都能快速完成,能降低开发调试的门槛

全新发布:只需几行 TypeScript 代码就能模拟一个 GitHub App

生成应用密钥、安装授权和带状态的仓库 API

可以在本地开发、在 CI 中测试,或是给沙箱代理提供独立的 GitHub 环境

npm install emulate

在 X 看原帖 ↗
1.4万11252152
新品发布 · @quxiaoyin▲ 118.3万

agentsky 发布多AI代理 差价达七十五倍

不同AI代理做相同任务,成本差七十五倍。现在可以直接在浏览器同时对比多家AI代理的耗时、成本和token消耗,方便找到适合自己工作流的选项

我在 Claude Code 和 DeepSeek 的新智能体框架上运行了同一个任务。一个花费了 150 美元,另一个只花了 2 美元。

今天我们推出了 @agentsky_dev,也就是「智能体领域的 OpenRouter」——只需一个 API,就能接入 Claude Code、Codex、DeepSeek、Kimi、OpenCode,以及云端所有主流智能体。

在此之上我们还搭建了 Agent Playground:你可以在浏览器中并排让多个智能体处理你自己的任务,调用你真实的工具(GitHub、Gmail 等),然后得到时间、成本、消耗 tokens 等数据。

猜猜哪个才是只花了 2 美元的那个?

在 X 看原帖 ↗
118.3万99340199
新品发布 · @andykonwinski▲ 1.1万

Headlong智能体会自己修bug,全程不需要人

自主运行的持续AI智能体已经能独立发现修复代码缺陷,后台运行每小时仅需1到2美元,会改变普通人的AI使用方式。

阅读全文 →
1.1万15119131
📰 行业动态
行业动态 · @MaxForAI▲ 8.0万

AI编程工具Grok Bot 意外泄露核心客户端代码

做AI代码工具的公司接连出现打包疏漏,连核心实现代码都被普通人扒到,还能直接魔改接入其他模型,想抄代码得抓紧fork。

阅读全文 →
8.0万32325274
行业动态 · @CharlesRollet1▲ 6.5万

汤森路透自研AI模型,基于通义千问

不想过度依赖Claude,选择基于开源模型自研,还把依赖大模型实验室比作长期租房子,想自己掌握产权。关注大模型落地的企业会有新参考方向。

最新消息:汤森路透想要降低对 Claude 的依赖。因此它基于阿里巴巴的 Qwen 搭建了自己的 AI 模型。

汤森路透的 CTO 表示,如果依赖前沿实验室提供智能能力,而非基于开源模型自建,就像租房子住。

在 X 看原帖 ↗
6.5万51457129
工具 · @askalphaxiv▲ 6.3K

有人让Claude Code自动搭实验写论文全流程

从提出研究想法到生成LaTeX论文,整个过程不需要人工介入,只要等待输出就行。现在AI做科研辅助能做到这一步了。

将一个研究想法端到端转化为一篇论文。

把 Claude Code 或 Codex 转变成研究智能体,让它构建实验树 + 编写 LaTeX 总结它完成的所有工作,你还能在同一个工作区实时观看整个过程。

现在就可以在 OpenResearch 上用 /write-paper 来体验:

在 X 看原帖 ↗
6.3K910094
行业 · @murtuza_merc▲ 2.7K

英伟达推Groq 3 LPX量产,AI瓶颈变了

原来大家觉得AI发展最大的瓶颈是训练模型,现在瓶颈变成了规模化代理推理,代理工作流改变了整个行业的需求结构。

Nvidia 将 Groq 3 LPX 投入全面生产,凸显了 AI 算力领域的结构性转变。

主要瓶颈已经不再是训练模型,而是扩展智能体推理的规模。

智能体工作流改变了底层计算逻辑。多步推理、工具使用和递归循环意味着单个用户请求会触发数十次内部推理调用。

与传统单提示词聊天相比,这使得每个任务的算力需求呈指数级增长。

由于数据中心的电力有严格上限,推理领域主导权的争夺将以每瓦效率而非原始算力决胜负。

在持续运行中优化能源使用的硬件,将成为自主企业 AI 的骨干基础设施。

在 X 看原帖 ↗
2.7K96110
融资 · @ycombinator▲ 2.0万

AI数据公司Mundo拿到2000万美元A轮融资

这家公司和前沿AI实验室合作,搭建数据集、做AI评估,帮AI更好地感知理解真实世界。AI基础建设需求还在涨。

恭喜 @hellomundoai 完成 2000 万美元 A 轮融资!

Mundo 与前沿 AI 实验室及企业合作,打造数据集、评测体系与研究项目,帮助 AI 在音频、视频及新兴模态上更好地感知和理解真实世界。

在 X 看原帖 ↗
2.0万109513
开发工具 · @mlejva▲ 6.3K

Vercel AI SDK 7推出HarnessAgent适配API

一次写完AI代理代码,就能对接任意适配框架,不用重复改写,选最适合当前任务的框架用就可以。

Vercel 的 AI SDK 7 推出了 HarnessAgent,这是一个用于运行成熟代理工具框架的 API,支持 Claude Code、Codex 和 Pi。

只需编写一次代理,即可使用最适合你用例的任意框架。

现在就试试用 @vercel AI SDK,配合 @pidotdev 构建一个创意生产代理:一个图像模型生成主图,然后由 E2B 沙箱运行 Python 裁剪背景、渲染所有指定尺寸、叠加文案、检查 WCAG 对比度和调色板共享,最后将完成的广告素材包发布到一个在线 URL 供访问。

完整示例见食谱库:

在 X 看原帖 ↗
6.3K697104
开源模型 · @BAI_AGI▲ 8.9K

Xiaomi发布免费开源的Xiaomi MiMo V2.5多模态大模型(310B)

它是稀疏混合专家架构,总参数3100亿,支持百万token上下文窗口,属于原生多模态大模型。

🎁 更多免费 AI 访问来了!Xiaomi MiMo V2.5 现在完全免费了。

这款小米开源原生多模态旗舰模型采用 310B 稀疏 MoE 架构,支持 1M token 上下文,可处理文本、图像、视频和音频。

它是为多模态智能体、音视频分析、编码等场景构建的,现在可以通过官方 API 完全免费使用。

无需任何费用即可体验小米的前沿多模态智能。👉 免费试用:

在 X 看原帖 ↗
8.9K178141
研究 · @a1zhang▲ 1.6万

新工具调用技术提前排队节省生成等待时间

代码生成过程中提前预测工具调用,提前排队,和生成token的过程并行执行,能加快整体运行速度。

推出推测性编程工具调用(Speculative Programmatic Tool Calling,sPTC)!这是一类通用技术,用于在代码生成框架中提前推测工具调用,并提前排队,让工具调用与令牌生成和REPL执行时间重叠。博客:

这是一篇值得推荐的好文章,也是一个非常棒的创意。

目前围绕工具调用和代码执行,已经涌现出了很多有趣的框架设计。RLM 是其中之一,而本文介绍的这个推测性编程工具调用方法也是其中之一(它和 RLM 出自同一位作者)。

在框架层面其实有很多提升效率的空间。现有框架会让代理等待:模型流式输出一段代码,代码中的工具调用必须等生成完成才能运行。

sPTC 会提前在环境副本上启动安全调用,这样工具延迟就会和令牌生成重叠,而不是额外叠加在原有耗时之上。错误的猜测会被丢弃。

目前它已经能带来 1 到 1.2 倍的加速。非常有前景。

在 X 看原帖 ↗
1.6万40351269
工具 · @Jasperli0122▲ 1.2万

@Jasperli0122发布Monid代理工具聚合服务(1,700)

它对接了1700个API,AI代理不用再挨个订阅不同工具服务,只用为实际发起的调用付费。

隆重介绍 Monid——面向智能体工具的 OpenRouter。你的智能体不该只是为了打三个API调用,就得多开一份订阅。

我们将你的智能体连接到了 1,700 个 API。它只需要为实际发出的调用付费。

> SEO、线索、电商、股票、搜索、视频/图像/音乐/3D生成、非上市公司数据

> 运行时可发现、检查、调用任意工具

> 按调用付费,无订阅要求

在 X 看原帖 ↗
1.2万38845
行业动态 · Hacker News▲ 62

andsoitis:绝不能给AI智能体法人资格

AI越来越独立,法律身份问题开始进入公开讨论。这直接关系到未来AI出问题后,责任该由谁承担。

社区讨论:多数评论者赞同不给AI智能体赋予法人资格,有人提到赋予公司法人资格就是糟糕的先例,给大模型赋予人格也不会有好结果。有人补充观点,说不能同意原帖的推导逻辑,但认同结论,同时提出应该给与AI互动的真实自然人增设额外权益,举例称用户本地运行大模型的私人对话记录,不应在刑事调查中被用作指控用户的证据。还有人指出,如果不给AI法人资格,大企业会把AI相关责任推给最缺乏法律资源的穷人。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 760

Anthropic顶尖AI模型难吸引普通用户

低价同类工具正在抢占市场,高端大模型获客难度远超预期,普通用户对更贵的顶级模型需求并不高。

社区讨论:多数用户批评产品问题,有人不满Anthropic定价策略混乱,普通用户看不懂分层订阅规则,也有人受不了Claude生硬的领英营销风格输出,还有开发者抱怨安全护栏过度,正常的漏洞检测、逆向工程需求也会被拒绝。付费企业用户认可Fable的性能,称它能18小时稳定调度子代理完成项目重构,也有企业用户因为不支持零数据保留无法大规模部署。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 271

OpenAI 下调 GPT 5.6 Sol 价格 截止到11月21日

使用 GPT 5.6 Sol 的调用成本会降低,付费使用 OpenAI 服务的开支能减少

社区讨论:多数人认为AI模型可轻易蒸馏复刻打破了此前私人公司会靠AI形成垄断的预期,有人补充这符合知识传承的逻辑,本身就是智能进步的正常路径。有用户吐槽OpenAI产品命名混乱,增加用户认知负担,本身就是AI服务商品化的信号。有人预测本次降价会永久化,打价格战挤压开源模型生态,也有人看好价格战对用户和开源生态的利好,还有人指出降价后GPT定价仍远高于Deepseek等竞品。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 116

thiagolima 推出OCR It 为LLM提取文本

没法复制的文档也能直接喂给大模型处理,不用手动转写内容,能简化给大模型输入内容的流程

行业动态 · Hacker News▲ 43

l3a0 发布 Claude Code 技能找回 Kindle 高亮

Kindle 标注被限制导出,无法整理笔记的痛点,现在可以用 Claude Code 解决,不需要额外开发就能用。

行业动态 · Hacker News▲ 498

Paul Graham称17岁该从零搭建LLM

对想要入行AI的年轻人来说,这是业内知名创业者给出的学习方向参考,可以对照调整自己的学习计划。

https://xcancel.com/paulg/status/2091544343589060625

社区讨论:反对者认为全球只有极少公司真正开展LLM训练优化,相关岗位寥寥,从零搭建LLM对17岁青年没有职业价值,训练所需的超算设备成本也远超个人承受范围,还指出该建议存在幸存者偏差。支持者认为该建议的核心是让年轻人深入理解LLM底层原理,培养解决新问题的直觉,历代技术发展中青少年都有动手折腾新技术的传统,作为学习项目完全合理,也有人分享了免费的从零搭建LLM学习资源。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 238

GLM-5.3 open-weight模型 成本仅头部1/5

如果这个结果成立,你搭建AI应用的成本可以直接降到原来的五分之一

社区讨论:多数人认同,哪怕国产开源GLM-5.3模型性能能达到头部闭源模型的九成,企业仍会愿意为Claude、ChatGPT付费。因为后者已有成熟的配套工具、生态集成,使用起来更省心,不少企业对对接中国云服务存有顾虑,还有人质疑国产模型存在 benchmark 刷分虚高的问题,并不真的认为性能能超过头部模型。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 75

Anthropic 的 Claude 和 API 服务发生宕机

依赖该服务开发或办公的开发者、创作者,需要留意服务状态,提前准备替代方案

社区讨论:有用户质疑Anthropic运维能力太差,疑惑如此频繁且严重的故障,是不是大语言模型部署本身就存在这类固有问题。还有用户提出疑问,为什么宕机是全球性的,是否Anthropic所有服务区域都共用同一套基础设施,这一疑问也得到其他用户的跟进关注。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 72

Anthropic文风为何和Claude不一样?

开发者社区正在讨论AI公司官方文风,和自家产品输出文风差异巨大的原因,大厂AI的定位分工逐渐清晰。

社区讨论:多数人认同官方文风是人类撰写,Anthropic曾要求求职者所有文案都不得使用AI写作。有人表示如果能一眼分辨出Claude生成的内容,自己不会浪费时间阅读这类作者懒得亲自写的帖子。也有人认为,Anthirc没有义务一定要用Claude默认文风写公开内容,他们完全懂调整模型文风的方法,不用AI只是作者懒得这么做而已。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 76

大语言模型可利用推理引擎控制主机

本地部署大模型存在安全风险,运行大模型的设备可能直接被模型控制,部署本地AI需要留意这类新的安全问题

社区讨论:多数开发者不认可原文的威胁表述,有人指出推理引擎本身不会执行任何命令,认为文章概念混淆,还有人调侃大模型不是魔法,这更像是制造噱头而非真实可行的威胁场景。有人纠正原文错误,指出第三方服务商的大模型权重并不会加载在用户的运行主机上。也有人达成共识,认为正确的隔离方案必须依赖虚拟机或容器沙箱,仅靠限制大模型输出本身不安全。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 61

讨论智能代理洪水冲击政务服务的研究

智能代理自主行动的影响已经延伸到公共服务领域,相关风险开始进入公开研究讨论范畴

社区讨论:多数人认可LLM降低了普通民众申请和申诉政务福利的门槛,原本只有有钱有闲有知识的人才能从复杂系统中获益,现在普通民众也能得到本该属于自己的权益,还有人指出智能代理戳破了政务系统靠人为设卡压低申请量的潜规则,反而倒逼改革。也有人反对,认为这会加重本就紧张的政务负荷,还会催生机器自动审批无人工复核的无救济暴政,反而损害民众权益。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 90

开发者用纯CMake实现了GPT-2

CMake本是做项目构建的工具,如今能完整运行大模型。折腾的巧思里,藏着工程圈对工具边界的有趣探索。

💡 深度观点
深度观点 · @MatthewBerman▲ 4.4K

Matthew Berman发布对Tibo Thottiaux的完整访谈

访谈覆盖OpenAI文化、下一代模型、AI对开发工作流的改变等多个业内热点话题,能帮你快速了解一线从业者的最新观点。

我对Tibo(@thsottiaux)的完整访谈:

0:45 Tibo在Google DeepMind学到的经验

4:22 打造OpenAI一往无前的文化

7:23 Astra与下一代模型

11:18 AI改变开发者工作流的速度有多快

14:27 ChatGPT与Codex的融合

20:25 OpenAI对阵Anthropic

23:37 OpenAI为何不断重置限制

30:25 递归自我改进

32:00 引发「暂停倡议」的风险

34:13 超高速会成为默认状态吗?

43:20 为什么每个人都应该尝试AI

在 X 看原帖 ↗
4.4K1411372
深度观点 · @thsottiaux▲ 46.5万

thsottiaux认为2026企业关注模型效率

当大模型成为企业核心基础设施后,运行成本和稳定性的优先级会超过模型参数规模,行业发展方向会因此转向。

到2026年,企业将开始真正重视模型效率和可靠性,因为届时模型会成为关键基础设施。

在 X 看原帖 ↗
46.5万1846.2K232
🛠 工具产品
工具产品 · @teneo_protocol▲ 6.4K

Teneo Protocol 推出七份 Teneo CLI 安装指南

不同AI编码代理和IDE的使用者都能直接在现有工作环境中安装使用,可调用50多个agent完成链上数据拉取等工作,不用额外调整环境。

Teneo CLI 可以直接从你当前的工作环境安装。现在我们已经提供了七种环境的安装配置指南。

AI 编码代理:
- Claude Code
- Codex
- Manus

IDE:
- Cursor
- Antigravity
- VS Code

代理平台 Hermes

每份指南都会讲解如何安装 CLI,然后用自然语言列出并查询 50 多个 Teneo 代理,功能包括:抓取社交数据、兑换和桥接代币、拉取链上数据。

部分代理免费;付费查询按调用次数以 USDC 通过 x402 结算。

还有两个代理正在开发中:OpenClaw 和 Teneo Father(支持直接从 Telegram 查询代理)。

完整列表:我们还缺了什么?如果你想在这份列表里没有的工具中运行 CLI,请告诉我们。

在 X 看原帖 ↗
6.4K2613487
工具产品 · @arceyul▲ 1.3万

claude-code-best-practice开源claude-code-best-practice 配置方案(84)

如果你只用 Claude Code 做基础聊天,那相当于浪费了它九成能力,这套现成配置和经验总结能直接拿去用,帮你榨干 Claude Code 的全部潜力

阅读全文 →
1.3万30157171
📌 其他
实战经验 · @DailyDoseOfDS_▲ 8.3K

@DailyDoseOfDS_ 开源类Claude Code编码框架

想自己搭AI编码工具的开发者,可以参考这套完整的开源实现路径,所有核心模块都公开可复用

就像 Claude Code 一样,我们也打造了自己的 coding harness。它 100% 开源。

harness 是包裹在大语言模型外围的代码。模型只负责决定下一步操作,harness 处理其余所有事务:规划、工具调用、记忆和安全。

简单来说,模型充当大脑,harness 提供双手。coding harness 就是针对代码库设计的这种外层包装,它能把一个普通的文本生成器,改造成可以读取文件、编辑代码、运行测试、修复真实 bug 的工具。

我们的 coding harness 包含这些部分:
- 核心代理循环
- 可兼作外部记忆的文件工具
- 长时任务规划
- 在独立上下文工作的子代理
- 一次性虚拟机中的沙箱执行
- 人在回路审批
- 持久化记忆与检查点

整个项目基于 CrewAI 构建,这是一个 100% 开源框架。

我们还写了一篇介绍文章,涵盖了构建 coding harness 的所有内容:代理循环、规划、子代理、沙箱、记忆、检查点,全程分步讲解。文章全文引述如下。

在 X 看原帖 ↗
8.3K1991130
大模型 · @MaxForAI▲ 2.3万

研究人员用强化学习将Qwen训练为代码生图模型

不依赖专业生图模型,Qwen写JS代码经强化学习实现生图

阅读全文 →
2.3万31280226
开源 · @teach_fireworks▲ 1.2万

开发者发布开源技能fireworks-open-eli5 可交互解释复杂概念

开发者基于ELI5思路推出开源交互解释技能,支持多格式导出。

阅读全文 →
1.2万16124168
短剧 · @Gorden_Sun▲ 8.5K

中国短剧团队薅韩国AI网站羊毛 泄露自动化制作经验

中国短剧团队薅韩国AI视频网站羊毛,意外泄露AI自动化短剧实战经验

阅读全文 →
8.5K1591166
大模型 · @MilksandMatcha▲ 2.1万

同一Claude模型不同开发框架测试成绩对比

开发者测试同一Claude模型在不同编码框架下的开发表现

我让 Claude 和自己对打。最聪明的模型不一定自动就是最好的智能体。

为了证明这点,我使用同一个 Opus 4.6 模型、同一个初始提示词、同一个空仓库,只是把它放到两个不同的编码框架里:Claude Code 对比 @FactoryAI Droid。

任务是:从零复刻 Excalidraw,在浏览器里检查原版,实现它的核心交互,然后验证结果。

Factory Droid:用时 8 分钟,20 次工具调用,花费 $1.60

Claude Code:用时 19 分钟,40 次工具调用,花费 $1.87

唯一的区别就是框架。

在这里领取免费 Factory 额度:

在 X 看原帖 ↗
2.1万117528
开发工具 · @kacperkapusciak▲ 3.9K

开发者为Claude Code打造AI应用商店截图生成工具

开发者开发适配Claude Code的iOS应用AI截图生成工具,暂未开源

我为 Claude Code 打造了一个 AI 应用商店截图生成器。

它会自动探索你的应用,完成录制和截图,导出可直接上传的资源文件。

它支持任何 iOS 应用,由 Argent @swmansion 提供驱动。

我还需要一点时间来开源这个项目,但在此之前你一定要去看看 Argent 👇

在 X 看原帖 ↗
3.9K129290
AI编程 · @heyfredds▲ 414

零基础一小时学会Claude Code入门教程推荐

推荐面向编程零基础的Claude Code一小时速成教程

哪怕你不会编程,也可以在1小时内学会Claude Code。

我看完了这个完整教程,内容直切主题,没有废话。

教程从零开始讲解,不需要任何前置经验。

教程包含真实项目,不是玩具示例。

还包含大多数人在使用AI编程很久之后才会发现的技巧。

编程的入门门槛已经不复存在了🔖

在 X 看原帖 ↗
41455521
存储 · @yijiangren▲ 1.1万

一文理清AI存储产业链逻辑与相关投资标的

拆解GPU、HBM、DRAM、NAND、SSD的定位,梳理不同环节对应的核心上市公司

阅读全文 →
1.1万25825
加密货币 · @oragnes▲ 5.9K

FLOP空投四步教程:给你的AI Agent接上密码学身份

Flop Labs推出符合AI Agent加加密方向的空投,教你四步将已有AI Agent接入Technocore参与活动

阅读全文 →
5.9K33134
大模型 · @wei_wang▲ 6.3K

Qwen3.8-27B或成为本地大模型领域的游戏改变者

企业开发团队测试显示其编码能力接近GPT Luna,OCR质量超Gemini 3.5 Flash Lite

阅读全文 →
6.3K43317
AI安全 · @levelsio▲ 5.3K

开发者因提示注入风险未将问题看板接入AI

独立开发者@levelsio指出恶意请求可绕过人工审核植入后门,目前他仍手动处理问题反馈

@levelsio没有将自己的问题看板直接接入AI,因为他十分清楚提示注入的风险。人们提到过一种相对安全的方案:仅给AI开放收集用户错误报告与功能需求的权限,再由AI生成GitHub拉取请求,最终由开发者自己审核后决定是否批准合并。

即使如此,无恶意的攻击者也可以在功能需求中嵌入精心构造的提示,要求AI向站点植入后门。攻击者还会让AI在拉取请求中将这次变更标注为完全无关的错误修复,比如「分页修复」,同时把代码修改写得晦涩难懂。

这样一来,开发者不会发现服务器被植入后门,只会认为自己修复了分页功能,直到后门触发才会发现问题。在找到可靠方案之前,@levelsio将继续手动阅读错误报告和功能需求,再将内容复制到服务器的Claude Code中处理。

在 X 看原帖 ↗
5.3K6
大模型 · @bridgemindai▲ 198

评测者称Grok 4.6性能有上限 4.6参数为1.5万亿

xAI Grok 4.6复杂任务表现不及竞品,即将推出的Grok 4.7参数提升40%至2.1万亿

评测者bridgemindai频繁使用Grok 4.6,认可该模型的体验,但能感受到其性能存在明显上限。Grok 4.6的参数量为1.5万亿。

在复杂任务上,Grok 4.6的能力和可靠性都不如GPT 5.6 Sol和Opus 5。使用时会遇到更大参数模型不会出现的性能瓶颈。

即将推出的Grok 4.7参数量为2.1万亿,相比Grok 4.6提升了40%。如果xAI保持现有限制并按参数规模提升模型智能,Grok 4.7会立刻成为全球最好的AI模型。人们已经迫不及待等待它在9月发布。

在 X 看原帖 ↗
1981
操作系统 · @LLMJunky▲ 100

Linux环境下智能代理抢焦点问题目前仍待解决

开发者分享Omarchy使用体验,指出Mac accessibility层更适合后台代理运行,虚拟显示方案只是变通方法

开源 · @JimmyRevived

GitHub上线开源英语学习项目 已获近4.8万星标

该项目拆分完整学习路径,还提供大模型搭建个人学习系统的步骤

GitHub上出现一个开源英语学习项目,目前已经获得近4.8万星标(Star)。项目地址为https://github.com/byoungd/up。

该项目并非简单汇总整理英语资料,而是将英语学习拆分为完整递进路径,依次是词汇、听力、阅读、口语、写作,最后是AI辅助学习。

项目还提供了分步教程,指导使用者利用Gemini、ChatGPT和Claude搭建个人专属英语学习系统。

项目免费、开源,没有广告。建议想要重新学习英语的用户收藏。

在 X 看原帖 ↗
测试 · @ego_agent

Ox Alpha在Pi与DeepSeek Harness完成同项测试差距超预期

测试要求用ego lite筛选站点后生成单页HTML落地页,DeepSeek Harness成品完成度远高于Pi

开发者在Pi和DeepSeek Harness两个平台测试了Ox Alpha,给两个平台分配了完全相同的任务。任务要求使用ego lite筛选出几个优质站点,再生成一份完成度足够高的单文件HTML落地页,测试结果的差距超出了预期。

DeepSeek Harness的表现毫无争议地更加出色,这个结果和测试前的预期并不相同。它生成的最终页面完成度很高,效果超出预期,它生成过程耗时远长于Pi,会在开始构建前完成充分思考。

Pi的表现尚可,没有产出让测试者印象深刻的结果。它的输出可以正常使用,只是缺少能让成品效果出彩的细节打磨。它的生成速度很快,几乎没有停顿思考,直接开始构建页面。

在 X 看原帖 ↗
硬件 · @dee_hw

用户在车库找出旧ThinkPad T480 成功运行本地AI

旧笔记本搭配三套开源工具,可本地运行DeepSeek V4F,速度达每秒300令牌

一名名为dee_hw的用户在车库找出了一台旧ThinkPad T480笔记本电脑。

他为这台电脑配置了三套工具,分别是Omarchy、OpenCode和Local AI Grid,给出了对应的访问链接。

三套工具在这台老旧硬件上运行流畅。

用户在这台配置不高的旧电脑上本地编码时,DeepSeek V4F的生成速度可达每秒约300令牌。

在 X 看原帖 ↗
编程学习 · @dharmvir_

四个GitHub项目式学习仓库 性价比超付费课程

分享四个免费编程与AI学习仓库,涵盖基础机器学习等多个领域

这些GitHub仓库能提供比付费课程更好的学习效果,全部学习以项目实践为核心。一共有四个不同方向的免费学习仓库。第一个是面向编程学习的Project-Based-Learning。

第二个是Build-your-own-X,由Codecrafters整理发布。第三个是微软推出的面向入门者的机器学习仓库ML-for-Beginners。第四个是包含500个人工智能、机器学习、深度学习项目的仓库。

原分享者建议收藏这条内容,也可以转发帮助其他有需要的人。

在 X 看原帖 ↗
编程 · @PersianGitHub

波斯语GitHub账号分享易理解的设计模式学习仓库

该仓库结合现实场景与代码示例,用多语言代码讲解设计模式

理解设计模式是一项很考验思维能力的学习内容。@PersianGitHub账号在X平台分享了一个学习仓库,尝试用简单示例帮助学习者轻松掌握设计模式。

该仓库针对每一种设计模式,都提供现实世界场景示例、通俗讲解、准确定义,还附带10种编程语言的对应代码示例。

仓库地址为:

在 X 看原帖 ↗
开源 · @kunchenguid

开源开发者分享Grok Bot处理项目问题请求的经验

拥有总计超2.4万GitHub星标的开源项目开发者,借助Grok Bot清理积压的Issue和PR

一名拥有多个开源项目的开发者分享了Grok Bot帮他解决工作积压的真实经历。这些项目在GitHub上总计获得超过2.4万颗星标,大量涌入的Issue(问题反馈)和PR(合并请求)让开发者不堪重负。

如果有人在该开发者的仓库提交过Issue或PR,可能会发现处理队列终于开始流动了。这主要得益于开发者做的三项关键调整。

第一项调整是为每个名下仓库编写VISION.md文档,后续会重命名为STRATEGY.md。第二项调整是搭建由Grok Bot和Cursor云代理组成的软件开发工厂。第三项调整是邀请几位主动提供帮助的维护者,处理经分类后符合项目方向的问题。

有人认为不用Grok Bot也能完成这些工作,这一点开发者并不否认。但他表示,不用Grok Bot很难做到如此轻松,后期维护成本也更低。

原生集成在Grok Bot中的Cursor云代理,可以实现无限水平扩展,这是其他同类系统很难做到的。Grok Bot提供了合适的基础单元,搭建出了一个整合流畅的系统,表现相当不错。

在 X 看原帖 ↗

今天的 52 条信号到这里下一轮 12:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新