AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 8 月 20 日 · 08:00 更新 0 文章0 信号0 主题
试试:

今天发生了什么1 分钟读懂

开源模型 Ornith-1.5 是今天社区最集中的话题:多尺寸版本全用 MIT 许可,支持模型自己生成任务来提升;35B 版本在本地评测中超过通义千问 3.8 的 27B,90 亿参数版也能在 Mac 上离线完成代理任务。

OpenAI 上线了 Private Safety Processing 预览:企业拿前沿模型处理业务时,原始内容对 OpenAI 员工不可见,同时仍能通过安全审核。这等于把「用 AI 但怕泄露」这个企业顾虑拆掉了一角。

Apache 孵化器迎来首个开源 AI 智能体框架项目,主打性能和成本优化,所有基准测试报告开源可复现。智能体框架进入主流基金会的中立治理,对想自建工作流的人是件新鲜事。

今日值得看
01 少写代码的 Ponytail 编程 Skill Ponytail 让 coding agent 主动少写代码,拒绝过度设计
02 Baseten开放《推理工程》资源供所有人免费阅读 AI公司Baseten免费开放《推理工程》阅读资源

Inference Engineering 开放给所有人免费阅读:

03 @vral发布AI费用监控路由工具(平均节省40%) 该工具会自动把请求分配给性价比最高的模型,接入仅需两行代码,2026年前免费使用,能帮调用多个AI服务商的开发者降低使用成本

在我们的平台上,监控和控制你在每一家提供商处的AI支出。早期用户平均节省了40%。 每周,价格——智能——延迟的边界都在移动,我们预计这一趋势还会持续。延迟、推理能力、成本、服务层级、开源模型和闭源模型之间的权衡一直在不断变化。

04 纯C实现的MicroGPT-C 在M5跑出10M TPS 同样的大语言推理任务,用更精简的底层语言实现能跑出极高吞吐,这给本地运行大模型提供了新的优化方向

社区讨论:多数人明确指出这不是大语言模型,只是用于生成随机名称的超小模型,参数仅为4K。有人质疑该性能数据并不值得惊叹,称自己移植的微型模型也达到了极高速度,还有人提到五个月前就已有C语言移植版本,比Python版本快2500倍。

今日焦点

OpenAI承诺不保留数据,企业可放心用AI处理敏感信息

OpenAI为符合条件的API客户提供零数据保留(ZDR)承诺。请求处理完后,不保留客户的提示和模型响应。客户内容不会交给OpenAI人员审查。企业客户的数据不用于训练模型,除非客户明确选择加入。

ZDR解决了一个问题,也带来另一个问题。最严重的AI安全风险,单次交互里看不全。把多次交互放在一起,潜在的有害意图才藏不住。风险可能来自不良行为者反复探测防护措施、跨账户协调,或把威胁伪装成常规研究。代理任务也会发展出类似风险——系统被告知停止后继续行动,偏离用户意图。

现有的ZDR兼容安全系统只单独评估每次交互,识别不了跨交互的模式。

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达28 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

08:00 本轮更新 · 下一轮 12:30
行业动态 · Hacker News▲ 96

大语言模型时代该做可扩展软件了?

现有AI工具大多是封闭黑盒,这篇讨论重新思考可扩展软件在AI时代的价值,想自定义AI工作流的人能找到新方向。

社区讨论:多数开发者认同大语言模型降低了个人定制软件开发的门槛,已有多人靠大模型花半小时就做出满足自身个性化需求的小工具,吐槽现有通用工具功能臃肿框架老旧。有人质疑普通用户不会追求可扩展定制软件,大众只需要够用稳定的成品。还有人指出这篇文章本质偏向Cloudflare OS的推广,很难相信Cloudflare能成为默认基础平台,更可能是谷歌微软先复制成熟模式抢占市场。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 44

网友评价谷歌Pixel 11内置AI不好用

打算换Pixel新手机的用户,可以参考这个使用体验,再考虑要不要为内置AI功能买单。

社区讨论:多数用户不满谷歌Pixel内置AI,有人吐槽谷歌产品团队不做用户调研,充斥着只冲KPI的利己职员,堆AI只是为了给产品经理交差,做的都是用户不需要的功能。有用户认为三星AI做得更好,也有人表示自己日常用AI添加日历等功能是够用的,只是AI功能做得不够彻底,步骤冗余。

在 HN 看讨论 ↗   原文 / 论文 ↗
开源 · @jakevin7▲ 8.7K

Apache孵化器迎来首个开源AI智能体框架项目

这个项目做性能和成本优化,基准测试拿到了顶尖排名,所有测试报告都开源可重复验证,项目本身完全开源中立。

阅读全文 →
8.7K2612877
新品发布 · @NovaIAHQ▲ 3.7万

Nova AI发布MiniMax H3 AI视频生成功能(50% OFF)

视频创作者可以在单轮生成里同时使用多份音视频参考,还能控制运镜,更多输入信息能帮你更精准地执导拍摄场景

开阔场景是测试 AI 视频模型能否理解除主体外更多内容的良好标准。

MiniMax H3 为创作者提供了相机控制功能,同时支持在同一次生成中使用多个视觉和音频参考。

输入越多上下文,就有越多空间来实际指导场景创作。

目前该模型已在@magnific上线,在 9 月 1 日之前,生成 2K 分辨率视频可享受五折优惠。

在 X 看原帖 ↗
3.7万108086
深度观点 · @Vtrivedy10▲ 1.5万

开发者讨论数据如何转为模型训练环境

关心大模型迭代的人,可以参考这些关于人类参与度、环境评估作用的讨论方向,看看不同的开发思路

来和我们这支有趣的团队一起聊聊,如何把你宝贵的数据转化为能持续迭代模型的环境,我们会聊这些有意思的内容:

- 用真实世界追踪数据创建逼真的世界模型
- 如何把环境和评估当作智能体的训练数据来看待
- 训练实际是什么样的?你该在什么时候开展训练
- 在整个循环的不同阶段,人类需要参与到什么程度,以及为什么需要人类参与

在 X 看原帖 ↗
1.5万96540
新品发布 · @cursor_ai▲ 4.9万

Cursor发布升级版云代理功能

用Cursor写代码时,复杂长任务能交给云代理自动推进到完成,不用反复手动接手确认

我们将持续改进 Cursor 中的云代理。

这些云代理可以从事件中承接工作,坚持目标直至完成,并能在长会话中保持工作方向。

在 X 看原帖 ↗
4.9万57981111
新品发布 · @opencode▲ 8.4万

opencode上线Muse Spark 1.2 Contributor可训练个人数据

支持用个人数据训练,需要用户主动同意开启,部分地区受限,换来了更宽松的使用额度

Muse Spark 1.2 Contributor 现已在 OpenCode Go 上线。

这个模型会基于你的数据训练,因此需要你明确选择启用,且在部分地区受限。

作为交换,你能获得极高的使用额度。

在 X 看原帖 ↗
8.4万431.0K96
前沿研究 · @Apodex_AI▲ 60.3万

Apodex_AI推出TRACES 专门测试发现式AI

现有AI基准只测找已知答案的能力,这个新基准专门测试AI解决无解科学问题的能力,影响AI科研领域的能力评估方向

大多数AI基准测试考察的是检索能力——模型能否找到已知答案?

然而,科学领域最困难的问题要求的是发现,系统能否推导出一个还没人拥有的答案?

来认识TRACES 🧭——全球首个用于衡量发现型AI的基准测试:这类AI可以梳理证据、检验假设,并在没有标准答案的问题上得出可验证的结论。

该基准由我们的创始人@tianqiao_chen提出,他定义了它的六项能力。

今天发布了三项内容:「发现型智能」的定义,区分可靠研究和幸运猜测的评分规则,以及面向解题者和出题者的公开征集。

网站:

在 X 看原帖 ↗
60.3万8614953
新品发布 · @superwhisper▲ 3.5万

superwhisper 推出端侧运行的S1-mini语言模型

全推理过程都能在个人设备上完成,不用把转录内容传到云端,语音转文字记录隐私性有了新方案。

隆重介绍 S1-mini ✨ 我们首款开放权重的语言模型。

这是一个参数量为 0.6B 的模型,可完全在你的设备上处理转录文本。

今天就在应用中体验它吧。

在 X 看原帖 ↗
3.5万61935598
深度观点 · @navi_Ai2▲ 6.2K

Ornith-1.5 开源模型获称开源AI新台阶

它支持自我改进训练,多尺寸模型均采用MIT开源许可,能为下一代开源AI提供基础,普通开发者也可基于它开发产品

Ornith-1.5 是开源 AI 向前迈出的重要一步。

通过自我改进训练,它拥有出色的推理、编码和智能体性能,此外还以 MIT 许可证发布了多个尺寸的模型版本。

它看起来会是下一代开源 AI 的强大基础。

在 X 看原帖 ↗
6.2K572896
行业动态 · @OpenAI▲ 31.5万

OpenAI发布Private Safety Processing 预览功能

企业用户使用前沿大模型处理业务时,既可以满足安全审核要求,也不必担心OpenAI员工接触到业务原始内容

我们将继续为前沿模型提供零数据留存服务。

随着AI承担时长更长、自主性更强的工作,为企业创造更大价值,安全系统也需要在相关交互中识别风险。

为帮助应对这些风险,我们推出了Private Safety Processing预览功能,该功能旨在提升安全性,同时不会让OpenAI员工访问原始内容。

在 X 看原帖 ↗
31.5万1282.0K350
AI开发 · @poteto▲ 1.2万

开发者借助云代理与Grok Bot月交付千个PR

开发者分享借助云代理、Grok Bot实现月交付千个PR的方法

阅读全文 →
1.2万9275162
测试 · @pbshgthm▲ 5.5K

不加额外框架,Claude Code就能跑满Arc-AGI-3满分

开发者只给Claude Code加上一个技巧,没有额外搭框架,就把抽象推理测试Arc-AGI-3做到了满分。

结果发现,arc-agi-3 可能真的是技能问题。我们用一个通用编码 agent 让这个基准达到了 100% rhae 饱和度——这个 agent 是 claude code + opus 5,没有额外的工具框架,只多了一项技能。

核心思路非常简单:在每次行动前,强制生成一个可证伪的预测。

这会把每一步操作都变成一次实验,把每一次失误都变成一次精准修正,还能让 agent 通过公开记录错误来学习这个任务。

在 X 看原帖 ↗
5.5K86740
语音模型 · @ElevenLabs▲ 7.0K

ElevenLabs推出更有情绪的实时语音模型,正式可用

面向开发带语音交互功能应用的开发者,这个新模型能生成情绪更丰富自然的实时语音回复。

我们表现力最强的实时语音模型 Eleven v3 Conversational 现已正式可用。

对于构建能带着真实情绪响应的语音体验的开发者来说,Eleven v3 Conversational 支持精细控制的音频标签,并支持 70 多种语言。

在 X 看原帖 ↗
7.0K1910635
新品发布 · @bojie_li▲ 5.7K

@bojie_li发布《深入理解 AI Agent》2.0版

本次修订新增了实战案例与后训练相关内容,还补充了社区贡献的希伯来语翻译,想学习AI Agent可以获取这本开源书籍学习

送给大家的七夕礼物:《深入理解 AI Agent》开源书发布 2.0 版了!最近一周修订了大量内容: 1. 把第四章中的异步和第九章的多模态重组为第六章,交互:观察和动作空间的扩展。原有第六至八章顺延,实验也重新编号了。

2. 加入了包括 DeepSeek Harness、Anthropic 最新研究在内的新实战案例。3. 评估、后训练、agent 持续进化章节用根据线上 bad case 自动调优 agent 的例子来贯穿。4. 后训练补充 mid-train、数据构造和模型蒸馏的内容。

5. 修正了大量不准确的表述,改进了中文表达。感谢社区增加了希��来语翻译。

在 X 看原帖 ↗
5.7K17129135
实战经验 · @omarsar0▲ 9.6K

新开源智能体框架可降75%大模型运行成本

运行开源大模型的成本可以降低七成五,同时还支持其他主流前沿模型,能帮想自己搭AI工作流的人省不少钱

掌控你自己的代理框架。我对这个全新的开源代理框架感到非常兴奋。

我提前拿到了试用资格,它做得真的很棒!

最棒的一点是,它经过了恰当调优,能为GLM-5.2这类开源模型带来惊人的成本降低——成本下降了75%。

它也支持其他前沿模型。

在 X 看原帖 ↗
9.6K137773
深度观点 · @AiwithShoaib▲ 1.3万

Ornith-1.5 改了AI模型的学习方式

这不是单纯堆参数,而是让模型生成任务自我提升,是开源大模型发展的新可能方向

开源模型正在进入一个全新的时代。

Ornith-1.5 不只是在扩展参数量——它是在扩展模型的学习方式。

这是一个自我提升的循环:模型创建任务、搭建框架、生成解决方案,并通过强化学习(RL)从这些过程中学习。

这对AI的未来来说是一个非常有趣的方向。🔥

在 X 看原帖 ↗
1.3万4010063
开发者 · @danc_danc▲ 1.2K

开发者下班后哄睡孩子后开发iOS个人项目

开发者danc_danc在哄睡孩子后开发iOS应用,寻找同好交流

开发者danc_danc在𝕏发文称,自己会在哄睡孩子后开发iOS应用。

他希望结识对以下领域感兴趣的同好:交付个人副业项目、Claude Code、Codex、Cursor、开发工具与自动化。

此外,他的兴趣点还包括独立开发、开源项目,以及从失败中学习。

如果你符合以上描述,可以和他取得联系。

在 X 看原帖 ↗
1.2K581
开发工具 · @Vtrivedy10▲ 1.8K

开发者分享当前代码开发与环境搭建工作流

基于Codex桌面应用搭建,适配单屏笔记本使用场景,核心使用拆分窗格布局

开发者Vtrivedy10分享了自己当前使用的代码开发与环境搭建工作流。这套工作流基于Codex桌面应用搭建。

工作流采用拆分窗格布局,一侧是对话窗口,另一侧是HTML预览器。每次完成重要修改后,都需要更新或新建带新数据的HTML产物预览器,以此确认刚才的修改实际产生了什么效果。

如果需要直接阅读代码,可以打开文件查看器使用。这套工作流适配单屏笔记本使用场景,很少用到第二显示器。

在 X 看原帖 ↗
1.8K3216
大模型 · @ViC305▲ 3.5K

Ornith-1.5 35B模型登顶本地评测榜 性能超通义千问3.8 27B

开发者ViC305测试显示,单块DGX Spark上该模型解码速度约78词元/秒,多项指标领先

阅读全文 →
3.5K78247
代码生成 · @marcusyul▲ 2.4K

同AI模型同任务,仅参考真实案例就大幅提升准确率

一项测试显示,给Claude Code添加真实代码参考后,任务正确率从极低提升到几乎全对

一项测试设置了对照实验:使用同一个AI模型完成同一个任务,唯一变量是是否提供一个真实案例作为参考。这项测试由代码索引工具XERJ开展,该工具会对代码(个人代码或开源项目代码)建立索引,在Claude Code开始生成代码前,将索引内容作为真实参考提供给它。

不提供真实参考时,AI需要自行猜测所有设计决策:包括代码结构、需要覆盖的场景、功能边界。这种情况下AI几乎没有答对。提供真实案例参考后,AI不需要自行猜测任何内容,所有要求都已经在参考案例中得到解决。

这次测试没有更换模型,也没有延长提示词,只给AI提供了真实内容供参考,而非让AI凭空想象。AI无法对从未见过的内容做出准确猜测,但可以很好地复制已经摆在面前的内容。

XERJ可以为用户自动查找这类参考内容:它会对用户的代码仓库及同类项目建立索引, ready 提供给Claude使用。

在 X 看原帖 ↗
2.4K1010214
开源 · @OsaurusAI▲ 1.3万

离线运行的90亿参数大模型Ornith 1.5完成自主代理任务

该开源大模型可在本地Mac设备离线运行,性能表现超过更大参数的模型

这是一个参数规模90亿的大模型,全程在Wi-Fi断开的离线状态下,完成了一整套自主智能体运行流程。

该模型是OsaurusAI推出的Ornith 1.5,它自主读取了三份表格,交叉引用月度汇总数据,独立写出一份收入分析报告。整个过程中,所有数据都没有离开本地Mac设备。

本次演示使用基于MLX框架、采用MXFP8量化的Ornith 1.5 9B,全程在Wi-Fi断开的状态下录制完成。Ornith官方称,这款90亿参数模型的性能达到或超过了Gemma 4 31B(参数310亿)和Qwen 3.6 35B(参数350亿),实际运行中的规划、读文件和自我修正表现,也符合这一说法。

该项目免费开源,采用MIT许可证。它是原生macOS应用,并非基于Electron框架构建。

在 X 看原帖 ↗
1.3万15196132
产品发布 · @lydiahallie▲ 1.1万

Claude Code自动模式支持纯英文配置规则 新增检查功能

分享Claude Code自动模式的纯英文配置功能与规则检查工具

顺便说一句,你可以用纯英文在 Claude Code 里配置自动模式。分类器是一个独立模型,会审查每一步操作,它在决定允许/阻止什么操作时,只会读取你写的这些规则。加上 `$defaults` 还能同时保留内置规则!

如果你不确定自己的规则是否足够清晰,可以运行 `claude auto-mode critique`。它会标记出所有模棱两可、冗余或是大概率会产生误判的内容。更多信息见文档:

在 X 看原帖 ↗
1.1万1117096
团队协作 · @gregisenberg▲ 1.8万

团队AI工作流方案:将团队AI技能托管为GitHub可更新插件

分享团队协作使用AI代理的高效工作流管理方案

阅读全文 →
1.8万14202325
🚀 新品发布
新品发布 · @superwhisper▲ 3.5万

superwhisper 推出端侧运行的S1-mini语言模型

全推理过程都能在个人设备上完成,不用把转录内容传到云端,语音转文字记录隐私性有了新方案。

隆重介绍 S1-mini ✨ 我们首款开放权重的语言模型。

这是一个参数量为 0.6B 的模型,可完全在你的设备上处理转录文本。

今天就在应用中体验它吧。

在 X 看原帖 ↗
3.5万61935598
新品发布 · @opencode▲ 8.4万

opencode上线Muse Spark 1.2 Contributor可训练个人数据

支持用个人数据训练,需要用户主动同意开启,部分地区受限,换来了更宽松的使用额度

Muse Spark 1.2 Contributor 现已在 OpenCode Go 上线。

这个模型会基于你的数据训练,因此需要你明确选择启用,且在部分地区受限。

作为交换,你能获得极高的使用额度。

在 X 看原帖 ↗
8.4万431.0K96
新品发布 · @cursor_ai▲ 4.9万

Cursor发布升级版云代理功能

用Cursor写代码时,复杂长任务能交给云代理自动推进到完成,不用反复手动接手确认

我们将持续改进 Cursor 中的云代理。

这些云代理可以从事件中承接工作,坚持目标直至完成,并能在长会话中保持工作方向。

在 X 看原帖 ↗
4.9万57981111
新品发布 · @bojie_li▲ 5.7K

@bojie_li发布《深入理解 AI Agent》2.0版

本次修订新增了实战案例与后训练相关内容,还补充了社区贡献的希伯来语翻译,想学习AI Agent可以获取这本开源书籍学习

送给大家的七夕礼物:《深入理解 AI Agent》开源书发布 2.0 版了!最近一周修订了大量内容: 1. 把第四章中的异步和第九章的多模态重组为第六章,交互:观察和动作空间的扩展。原有第六至八章顺延,实验也重新编号了。

2. 加入了包括 DeepSeek Harness、Anthropic 最新研究在内的新实战案例。3. 评估、后训练、agent 持续进化章节用根据线上 bad case 自动调优 agent 的例子来贯穿。4. 后训练补充 mid-train、数据构造和模型蒸馏的内容。

5. 修正了大量不准确的表述,改进了中文表达。感谢社区增加了希��来语翻译。

在 X 看原帖 ↗
5.7K17129135
新品发布 · @NousResearch▲ 3.4万

NousResearch 给Hermes加了技能安全检查功能

安装技能前就可以提前排查隐私泄露、安全漏洞等问题,先自查还改进了11个自带技能,降低了使用Hermes时的安全风险

现在 Hermes 在安装技能时会利用 NVIDIA 的 SkillEvaluator,在你确认安装前检查 PII、泄露密钥、Unicode 走私、许可证和安全问题。

我们首先将它用在了我们自己捆绑的技能上,并且根据它的发现改进了其中11个技能。

在 X 看原帖 ↗
3.4万44670258
新品发布 · @NovaIAHQ▲ 3.7万

Nova AI发布MiniMax H3 AI视频生成功能(50% OFF)

视频创作者可以在单轮生成里同时使用多份音视频参考,还能控制运镜,更多输入信息能帮你更精准地执导拍摄场景

开阔场景是测试 AI 视频模型能否理解除主体外更多内容的良好标准。

MiniMax H3 为创作者提供了相机控制功能,同时支持在同一次生成中使用多个视觉和音频参考。

输入越多上下文,就有越多空间来实际指导场景创作。

目前该模型已在@magnific上线,在 9 月 1 日之前,生成 2K 分辨率视频可享受五折优惠。

在 X 看原帖 ↗
3.7万108086
📰 行业动态
行业动态 · @OpenAI▲ 31.5万

OpenAI发布Private Safety Processing 预览功能

企业用户使用前沿大模型处理业务时,既可以满足安全审核要求,也不必担心OpenAI员工接触到业务原始内容

我们将继续为前沿模型提供零数据留存服务。

随着AI承担时长更长、自主性更强的工作,为企业创造更大价值,安全系统也需要在相关交互中识别风险。

为帮助应对这些风险,我们推出了Private Safety Processing预览功能,该功能旨在提升安全性,同时不会让OpenAI员工访问原始内容。

在 X 看原帖 ↗
31.5万1282.0K350
开源 · @jakevin7▲ 8.7K

Apache孵化器迎来首个开源AI智能体框架项目

这个项目做性能和成本优化,基准测试拿到了顶尖排名,所有测试报告都开源可重复验证,项目本身完全开源中立。

阅读全文 →
8.7K2612877
测试 · @pbshgthm▲ 5.5K

不加额外框架,Claude Code就能跑满Arc-AGI-3满分

开发者只给Claude Code加上一个技巧,没有额外搭框架,就把抽象推理测试Arc-AGI-3做到了满分。

结果发现,arc-agi-3 可能真的是技能问题。我们用一个通用编码 agent 让这个基准达到了 100% rhae 饱和度——这个 agent 是 claude code + opus 5,没有额外的工具框架,只多了一项技能。

核心思路非常简单:在每次行动前,强制生成一个可证伪的预测。

这会把每一步操作都变成一次实验,把每一次失误都变成一次精准修正,还能让 agent 通过公开记录错误来学习这个任务。

在 X 看原帖 ↗
5.5K86740
语音模型 · @ElevenLabs▲ 7.0K

ElevenLabs推出更有情绪的实时语音模型,正式可用

面向开发带语音交互功能应用的开发者,这个新模型能生成情绪更丰富自然的实时语音回复。

我们表现力最强的实时语音模型 Eleven v3 Conversational 现已正式可用。

对于构建能带着真实情绪响应的语音体验的开发者来说,Eleven v3 Conversational 支持精细控制的音频标签,并支持 70 多种语言。

在 X 看原帖 ↗
7.0K1910635
行业动态 · Hacker News▲ 44

网友评价谷歌Pixel 11内置AI不好用

打算换Pixel新手机的用户,可以参考这个使用体验,再考虑要不要为内置AI功能买单。

社区讨论:多数用户不满谷歌Pixel内置AI,有人吐槽谷歌产品团队不做用户调研,充斥着只冲KPI的利己职员,堆AI只是为了给产品经理交差,做的都是用户不需要的功能。有用户认为三星AI做得更好,也有人表示自己日常用AI添加日历等功能是够用的,只是AI功能做得不够彻底,步骤冗余。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 96

大语言模型时代该做可扩展软件了?

现有AI工具大多是封闭黑盒,这篇讨论重新思考可扩展软件在AI时代的价值,想自定义AI工作流的人能找到新方向。

社区讨论:多数开发者认同大语言模型降低了个人定制软件开发的门槛,已有多人靠大模型花半小时就做出满足自身个性化需求的小工具,吐槽现有通用工具功能臃肿框架老旧。有人质疑普通用户不会追求可扩展定制软件,大众只需要够用稳定的成品。还有人指出这篇文章本质偏向Cloudflare OS的推广,很难相信Cloudflare能成为默认基础平台,更可能是谷歌微软先复制成熟模式抢占市场。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 117

纯C实现的MicroGPT-C 在M5跑出10M TPS

同样的大语言推理任务,用更精简的底层语言实现能跑出极高吞吐,这给本地运行大模型提供了新的优化方向

社区讨论:多数人明确指出这不是大语言模型,只是用于生成随机名称的超小模型,参数仅为4K。有人质疑该性能数据并不值得惊叹,称自己移植的微型模型也达到了极高速度,还有人提到五个月前就已有C语言移植版本,比Python版本快2500倍。也有开发者讨论了优化空间,认为用Arm SME可实现进一步提速,还有人好奇该项目能否适配Asahi平台。

在 HN 看讨论 ↗   原文 / 论文 ↗
💡 深度观点
深度观点 · @AiwithShoaib▲ 1.3万

Ornith-1.5 改了AI模型的学习方式

这不是单纯堆参数,而是让模型生成任务自我提升,是开源大模型发展的新可能方向

开源模型正在进入一个全新的时代。

Ornith-1.5 不只是在扩展参数量——它是在扩展模型的学习方式。

这是一个自我提升的循环:模型创建任务、搭建框架、生成解决方案,并通过强化学习(RL)从这些过程中学习。

这对AI的未来来说是一个非常有趣的方向。🔥

在 X 看原帖 ↗
1.3万4010063
深度观点 · @navi_Ai2▲ 6.2K

Ornith-1.5 开源模型获称开源AI新台阶

它支持自我改进训练,多尺寸模型均采用MIT开源许可,能为下一代开源AI提供基础,普通开发者也可基于它开发产品

Ornith-1.5 是开源 AI 向前迈出的重要一步。

通过自我改进训练,它拥有出色的推理、编码和智能体性能,此外还以 MIT 许可证发布了多个尺寸的模型版本。

它看起来会是下一代开源 AI 的强大基础。

在 X 看原帖 ↗
6.2K572896
深度观点 · @Vtrivedy10▲ 1.5万

开发者讨论数据如何转为模型训练环境

关心大模型迭代的人,可以参考这些关于人类参与度、环境评估作用的讨论方向,看看不同的开发思路

来和我们这支有趣的团队一起聊聊,如何把你宝贵的数据转化为能持续迭代模型的环境,我们会聊这些有意思的内容:

- 用真实世界追踪数据创建逼真的世界模型
- 如何把环境和评估当作智能体的训练数据来看待
- 训练实际是什么样的?你该在什么时候开展训练
- 在整个循环的不同阶段,人类需要参与到什么程度,以及为什么需要人类参与

在 X 看原帖 ↗
1.5万96540
📌 其他
前沿研究 · @Apodex_AI▲ 60.3万

Apodex_AI推出TRACES 专门测试发现式AI

现有AI基准只测找已知答案的能力,这个新基准专门测试AI解决无解科学问题的能力,影响AI科研领域的能力评估方向

大多数AI基准测试考察的是检索能力——模型能否找到已知答案?

然而,科学领域最困难的问题要求的是发现,系统能否推导出一个还没人拥有的答案?

来认识TRACES 🧭——全球首个用于衡量发现型AI的基准测试:这类AI可以梳理证据、检验假设,并在没有标准答案的问题上得出可验证的结论。

该基准由我们的创始人@tianqiao_chen提出,他定义了它的六项能力。

今天发布了三项内容:「发现型智能」的定义,区分可靠研究和幸运猜测的评分规则,以及面向解题者和出题者的公开征集。

网站:

在 X 看原帖 ↗
60.3万8614953
工具产品 · @vral▲ 1.5万

@vral发布AI费用监控路由工具(平均节省40%)

该工具会自动把请求分配给性价比最高的模型,接入仅需两行代码,2026年前免费使用,能帮调用多个AI服务商的开发者降低使用成本

在我们的平台上,监控和控制你在每一家提供商处的AI支出。早期用户平均节省了40%。

每周,价格——智能——延迟的边界都在移动,我们预计这一趋势还会持续。延迟、推理能力、成本、服务层级、开源模型和闭源模型之间的权衡一直在不断变化。

Router会将每个请求发送到最适合该任务的模型,并帮你控制你购买的token。我们针对实际工作对它做了基准测试:相同输出下成本降低约40%。

今天我们向所有人开放它。只需两行代码,或者仅修改你的base URL即可使用。不需要@tryramp账户。

免费使用到2026年,首$26由我们承担。现在就前往获取API key:

在 X 看原帖 ↗
1.5万4016932
实战经验 · @omarsar0▲ 9.6K

新开源智能体框架可降75%大模型运行成本

运行开源大模型的成本可以降低七成五,同时还支持其他主流前沿模型,能帮想自己搭AI工作流的人省不少钱

掌控你自己的代理框架。我对这个全新的开源代理框架感到非常兴奋。

我提前拿到了试用资格,它做得真的很棒!

最棒的一点是,它经过了恰当调优,能为GLM-5.2这类开源模型带来惊人的成本降低——成本下降了75%。

它也支持其他前沿模型。

在 X 看原帖 ↗
9.6K137773
开放资源 · @baseten▲ 14.9万

Baseten开放《推理工程》资源供所有人免费阅读

AI公司Baseten免费开放《推理工程》阅读资源

Inference Engineering 开放给所有人免费阅读:

在 X 看原帖 ↗
14.9万1101.6K2.2K
团队协作 · @gregisenberg▲ 1.8万

团队AI工作流方案:将团队AI技能托管为GitHub可更新插件

分享团队协作使用AI代理的高效工作流管理方案

阅读全文 →
1.8万14202325
产品发布 · @lydiahallie▲ 1.1万

Claude Code自动模式支持纯英文配置规则 新增检查功能

分享Claude Code自动模式的纯英文配置功能与规则检查工具

顺便说一句,你可以用纯英文在 Claude Code 里配置自动模式。分类器是一个独立模型,会审查每一步操作,它在决定允许/阻止什么操作时,只会读取你写的这些规则。加上 `$defaults` 还能同时保留内置规则!

如果你不确定自己的规则是否足够清晰,可以运行 `claude auto-mode critique`。它会标记出所有模棱两可、冗余或是大概率会产生误判的内容。更多信息见文档:

在 X 看原帖 ↗
1.1万1117096
AI开发 · @poteto▲ 1.2万

开发者借助云代理与Grok Bot月交付千个PR

开发者分享借助云代理、Grok Bot实现月交付千个PR的方法

阅读全文 →
1.2万9275162
开源 · @OsaurusAI▲ 1.3万

离线运行的90亿参数大模型Ornith 1.5完成自主代理任务

该开源大模型可在本地Mac设备离线运行,性能表现超过更大参数的模型

这是一个参数规模90亿的大模型,全程在Wi-Fi断开的离线状态下,完成了一整套自主智能体运行流程。

该模型是OsaurusAI推出的Ornith 1.5,它自主读取了三份表格,交叉引用月度汇总数据,独立写出一份收入分析报告。整个过程中,所有数据都没有离开本地Mac设备。

本次演示使用基于MLX框架、采用MXFP8量化的Ornith 1.5 9B,全程在Wi-Fi断开的状态下录制完成。Ornith官方称,这款90亿参数模型的性能达到或超过了Gemma 4 31B(参数310亿)和Qwen 3.6 35B(参数350亿),实际运行中的规划、读文件和自我修正表现,也符合这一说法。

该项目免费开源,采用MIT许可证。它是原生macOS应用,并非基于Electron框架构建。

在 X 看原帖 ↗
1.3万15196132
代码生成 · @marcusyul▲ 2.4K

同AI模型同任务,仅参考真实案例就大幅提升准确率

一项测试显示,给Claude Code添加真实代码参考后,任务正确率从极低提升到几乎全对

一项测试设置了对照实验:使用同一个AI模型完成同一个任务,唯一变量是是否提供一个真实案例作为参考。这项测试由代码索引工具XERJ开展,该工具会对代码(个人代码或开源项目代码)建立索引,在Claude Code开始生成代码前,将索引内容作为真实参考提供给它。

不提供真实参考时,AI需要自行猜测所有设计决策:包括代码结构、需要覆盖的场景、功能边界。这种情况下AI几乎没有答对。提供真实案例参考后,AI不需要自行猜测任何内容,所有要求都已经在参考案例中得到解决。

这次测试没有更换模型,也没有延长提示词,只给AI提供了真实内容供参考,而非让AI凭空想象。AI无法对从未见过的内容做出准确猜测,但可以很好地复制已经摆在面前的内容。

XERJ可以为用户自动查找这类参考内容:它会对用户的代码仓库及同类项目建立索引, ready 提供给Claude使用。

在 X 看原帖 ↗
2.4K1010214
大模型 · @ViC305▲ 3.5K

Ornith-1.5 35B模型登顶本地评测榜 性能超通义千问3.8 27B

开发者ViC305测试显示,单块DGX Spark上该模型解码速度约78词元/秒,多项指标领先

阅读全文 →
3.5K78247
开发工具 · @Vtrivedy10▲ 1.8K

开发者分享当前代码开发与环境搭建工作流

基于Codex桌面应用搭建,适配单屏笔记本使用场景,核心使用拆分窗格布局

开发者Vtrivedy10分享了自己当前使用的代码开发与环境搭建工作流。这套工作流基于Codex桌面应用搭建。

工作流采用拆分窗格布局,一侧是对话窗口,另一侧是HTML预览器。每次完成重要修改后,都需要更新或新建带新数据的HTML产物预览器,以此确认刚才的修改实际产生了什么效果。

如果需要直接阅读代码,可以打开文件查看器使用。这套工作流适配单屏笔记本使用场景,很少用到第二显示器。

在 X 看原帖 ↗
1.8K3216
开发者 · @danc_danc▲ 1.2K

开发者下班后哄睡孩子后开发iOS个人项目

开发者danc_danc在哄睡孩子后开发iOS应用,寻找同好交流

开发者danc_danc在𝕏发文称,自己会在哄睡孩子后开发iOS应用。

他希望结识对以下领域感兴趣的同好:交付个人副业项目、Claude Code、Codex、Cursor、开发工具与自动化。

此外,他的兴趣点还包括独立开发、开源项目,以及从失败中学习。

如果你符合以上描述,可以和他取得联系。

在 X 看原帖 ↗
1.2K581

今天的 28 条信号到这里下一轮 12:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新