社区讨论:多数开发者认同大语言模型降低了个人定制软件开发的门槛,已有多人靠大模型花半小时就做出满足自身个性化需求的小工具,吐槽现有通用工具功能臃肿框架老旧。有人质疑普通用户不会追求可扩展定制软件,大众只需要够用稳定的成品。还有人指出这篇文章本质偏向Cloudflare OS的推广,很难相信Cloudflare能成为默认基础平台,更可能是谷歌微软先复制成熟模式抢占市场。
今天发生了什么1 分钟读懂
开源模型 Ornith-1.5 是今天社区最集中的话题:多尺寸版本全用 MIT 许可,支持模型自己生成任务来提升;35B 版本在本地评测中超过通义千问 3.8 的 27B,90 亿参数版也能在 Mac 上离线完成代理任务。
OpenAI 上线了 Private Safety Processing 预览:企业拿前沿模型处理业务时,原始内容对 OpenAI 员工不可见,同时仍能通过安全审核。这等于把「用 AI 但怕泄露」这个企业顾虑拆掉了一角。
Apache 孵化器迎来首个开源 AI 智能体框架项目,主打性能和成本优化,所有基准测试报告开源可复现。智能体框架进入主流基金会的中立治理,对想自建工作流的人是件新鲜事。
02 Baseten开放《推理工程》资源供所有人免费阅读 AI公司Baseten免费开放《推理工程》阅读资源
Inference Engineering 开放给所有人免费阅读:
03 @vral发布AI费用监控路由工具(平均节省40%) 该工具会自动把请求分配给性价比最高的模型,接入仅需两行代码,2026年前免费使用,能帮调用多个AI服务商的开发者降低使用成本
在我们的平台上,监控和控制你在每一家提供商处的AI支出。早期用户平均节省了40%。 每周,价格——智能——延迟的边界都在移动,我们预计这一趋势还会持续。延迟、推理能力、成本、服务层级、开源模型和闭源模型之间的权衡一直在不断变化。
04 纯C实现的MicroGPT-C 在M5跑出10M TPS 同样的大语言推理任务,用更精简的底层语言实现能跑出极高吞吐,这给本地运行大模型提供了新的优化方向
社区讨论:多数人明确指出这不是大语言模型,只是用于生成随机名称的超小模型,参数仅为4K。有人质疑该性能数据并不值得惊叹,称自己移植的微型模型也达到了极高速度,还有人提到五个月前就已有C语言移植版本,比Python版本快2500倍。
今日焦点
OpenAI承诺不保留数据,企业可放心用AI处理敏感信息
OpenAI为符合条件的API客户提供零数据保留(ZDR)承诺。请求处理完后,不保留客户的提示和模型响应。客户内容不会交给OpenAI人员审查。企业客户的数据不用于训练模型,除非客户明确选择加入。
ZDR解决了一个问题,也带来另一个问题。最严重的AI安全风险,单次交互里看不全。把多次交互放在一起,潜在的有害意图才藏不住。风险可能来自不良行为者反复探测防护措施、跨账户协调,或把威胁伪装成常规研究。代理任务也会发展出类似风险——系统被告知停止后继续行动,偏离用户意图。
现有的ZDR兼容安全系统只单独评估每次交互,识别不了跨交互的模式。
深度阅读
🔥 信号雷达28 条
𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)
行业动态 · Hacker News▲ 96
大语言模型时代该做可扩展软件了?
现有AI工具大多是封闭黑盒,这篇讨论重新思考可扩展软件在AI时代的价值,想自定义AI工作流的人能找到新方向。
大语言模型时代该做可扩展软件了?
现有AI工具大多是封闭黑盒,这篇讨论重新思考可扩展软件在AI时代的价值,想自定义AI工作流的人能找到新方向。
行业动态 · Hacker News▲ 44
网友评价谷歌Pixel 11内置AI不好用
打算换Pixel新手机的用户,可以参考这个使用体验,再考虑要不要为内置AI功能买单。
网友评价谷歌Pixel 11内置AI不好用
打算换Pixel新手机的用户,可以参考这个使用体验,再考虑要不要为内置AI功能买单。
社区讨论:多数用户不满谷歌Pixel内置AI,有人吐槽谷歌产品团队不做用户调研,充斥着只冲KPI的利己职员,堆AI只是为了给产品经理交差,做的都是用户不需要的功能。有用户认为三星AI做得更好,也有人表示自己日常用AI添加日历等功能是够用的,只是AI功能做得不够彻底,步骤冗余。
开源 · @jakevin7▲ 8.7K
Apache孵化器迎来首个开源AI智能体框架项目
这个项目做性能和成本优化,基准测试拿到了顶尖排名,所有测试报告都开源可重复验证,项目本身完全开源中立。
Apache孵化器迎来首个开源AI智能体框架项目
这个项目做性能和成本优化,基准测试拿到了顶尖排名,所有测试报告都开源可重复验证,项目本身完全开源中立。
新品发布 · @NovaIAHQ▲ 3.7万
Nova AI发布MiniMax H3 AI视频生成功能(50% OFF)
视频创作者可以在单轮生成里同时使用多份音视频参考,还能控制运镜,更多输入信息能帮你更精准地执导拍摄场景
Nova AI发布MiniMax H3 AI视频生成功能(50% OFF)
视频创作者可以在单轮生成里同时使用多份音视频参考,还能控制运镜,更多输入信息能帮你更精准地执导拍摄场景
开阔场景是测试 AI 视频模型能否理解除主体外更多内容的良好标准。
MiniMax H3 为创作者提供了相机控制功能,同时支持在同一次生成中使用多个视觉和音频参考。
输入越多上下文,就有越多空间来实际指导场景创作。
目前该模型已在@magnific上线,在 9 月 1 日之前,生成 2K 分辨率视频可享受五折优惠。
深度观点 · @Vtrivedy10▲ 1.5万
开发者讨论数据如何转为模型训练环境
关心大模型迭代的人,可以参考这些关于人类参与度、环境评估作用的讨论方向,看看不同的开发思路
开发者讨论数据如何转为模型训练环境
关心大模型迭代的人,可以参考这些关于人类参与度、环境评估作用的讨论方向,看看不同的开发思路
来和我们这支有趣的团队一起聊聊,如何把你宝贵的数据转化为能持续迭代模型的环境,我们会聊这些有意思的内容:
- 用真实世界追踪数据创建逼真的世界模型
- 如何把环境和评估当作智能体的训练数据来看待
- 训练实际是什么样的?你该在什么时候开展训练
- 在整个循环的不同阶段,人类需要参与到什么程度,以及为什么需要人类参与
新品发布 · @cursor_ai▲ 4.9万
Cursor发布升级版云代理功能
用Cursor写代码时,复杂长任务能交给云代理自动推进到完成,不用反复手动接手确认
Cursor发布升级版云代理功能
用Cursor写代码时,复杂长任务能交给云代理自动推进到完成,不用反复手动接手确认
新品发布 · @opencode▲ 8.4万
opencode上线Muse Spark 1.2 Contributor可训练个人数据
支持用个人数据训练,需要用户主动同意开启,部分地区受限,换来了更宽松的使用额度
opencode上线Muse Spark 1.2 Contributor可训练个人数据
支持用个人数据训练,需要用户主动同意开启,部分地区受限,换来了更宽松的使用额度
Muse Spark 1.2 Contributor 现已在 OpenCode Go 上线。
这个模型会基于你的数据训练,因此需要你明确选择启用,且在部分地区受限。
作为交换,你能获得极高的使用额度。
前沿研究 · @Apodex_AI▲ 60.3万
Apodex_AI推出TRACES 专门测试发现式AI
现有AI基准只测找已知答案的能力,这个新基准专门测试AI解决无解科学问题的能力,影响AI科研领域的能力评估方向
Apodex_AI推出TRACES 专门测试发现式AI
现有AI基准只测找已知答案的能力,这个新基准专门测试AI解决无解科学问题的能力,影响AI科研领域的能力评估方向
大多数AI基准测试考察的是检索能力——模型能否找到已知答案?
然而,科学领域最困难的问题要求的是发现,系统能否推导出一个还没人拥有的答案?
来认识TRACES 🧭——全球首个用于衡量发现型AI的基准测试:这类AI可以梳理证据、检验假设,并在没有标准答案的问题上得出可验证的结论。
该基准由我们的创始人@tianqiao_chen提出,他定义了它的六项能力。
今天发布了三项内容:「发现型智能」的定义,区分可靠研究和幸运猜测的评分规则,以及面向解题者和出题者的公开征集。
网站:
新品发布 · @superwhisper▲ 3.5万
superwhisper 推出端侧运行的S1-mini语言模型
全推理过程都能在个人设备上完成,不用把转录内容传到云端,语音转文字记录隐私性有了新方案。
superwhisper 推出端侧运行的S1-mini语言模型
全推理过程都能在个人设备上完成,不用把转录内容传到云端,语音转文字记录隐私性有了新方案。
深度观点 · @navi_Ai2▲ 6.2K
Ornith-1.5 开源模型获称开源AI新台阶
它支持自我改进训练,多尺寸模型均采用MIT开源许可,能为下一代开源AI提供基础,普通开发者也可基于它开发产品
Ornith-1.5 开源模型获称开源AI新台阶
它支持自我改进训练,多尺寸模型均采用MIT开源许可,能为下一代开源AI提供基础,普通开发者也可基于它开发产品
Ornith-1.5 是开源 AI 向前迈出的重要一步。
通过自我改进训练,它拥有出色的推理、编码和智能体性能,此外还以 MIT 许可证发布了多个尺寸的模型版本。
它看起来会是下一代开源 AI 的强大基础。
行业动态 · @OpenAI▲ 31.5万
OpenAI发布Private Safety Processing 预览功能
企业用户使用前沿大模型处理业务时,既可以满足安全审核要求,也不必担心OpenAI员工接触到业务原始内容
OpenAI发布Private Safety Processing 预览功能
企业用户使用前沿大模型处理业务时,既可以满足安全审核要求,也不必担心OpenAI员工接触到业务原始内容
我们将继续为前沿模型提供零数据留存服务。
随着AI承担时长更长、自主性更强的工作,为企业创造更大价值,安全系统也需要在相关交互中识别风险。
为帮助应对这些风险,我们推出了Private Safety Processing预览功能,该功能旨在提升安全性,同时不会让OpenAI员工访问原始内容。
AI开发 · @poteto▲ 1.2万
开发者借助云代理与Grok Bot月交付千个PR
开发者分享借助云代理、Grok Bot实现月交付千个PR的方法
开发者借助云代理与Grok Bot月交付千个PR
开发者分享借助云代理、Grok Bot实现月交付千个PR的方法
测试 · @pbshgthm▲ 5.5K
不加额外框架,Claude Code就能跑满Arc-AGI-3满分
开发者只给Claude Code加上一个技巧,没有额外搭框架,就把抽象推理测试Arc-AGI-3做到了满分。
不加额外框架,Claude Code就能跑满Arc-AGI-3满分
开发者只给Claude Code加上一个技巧,没有额外搭框架,就把抽象推理测试Arc-AGI-3做到了满分。
结果发现,arc-agi-3 可能真的是技能问题。我们用一个通用编码 agent 让这个基准达到了 100% rhae 饱和度——这个 agent 是 claude code + opus 5,没有额外的工具框架,只多了一项技能。
核心思路非常简单:在每次行动前,强制生成一个可证伪的预测。
这会把每一步操作都变成一次实验,把每一次失误都变成一次精准修正,还能让 agent 通过公开记录错误来学习这个任务。
语音模型 · @ElevenLabs▲ 7.0K
ElevenLabs推出更有情绪的实时语音模型,正式可用
面向开发带语音交互功能应用的开发者,这个新模型能生成情绪更丰富自然的实时语音回复。
ElevenLabs推出更有情绪的实时语音模型,正式可用
面向开发带语音交互功能应用的开发者,这个新模型能生成情绪更丰富自然的实时语音回复。
我们表现力最强的实时语音模型 Eleven v3 Conversational 现已正式可用。
对于构建能带着真实情绪响应的语音体验的开发者来说,Eleven v3 Conversational 支持精细控制的音频标签,并支持 70 多种语言。
新品发布 · @bojie_li▲ 5.7K
@bojie_li发布《深入理解 AI Agent》2.0版
本次修订新增了实战案例与后训练相关内容,还补充了社区贡献的希伯来语翻译,想学习AI Agent可以获取这本开源书籍学习
@bojie_li发布《深入理解 AI Agent》2.0版
本次修订新增了实战案例与后训练相关内容,还补充了社区贡献的希伯来语翻译,想学习AI Agent可以获取这本开源书籍学习
送给大家的七夕礼物:《深入理解 AI Agent》开源书发布 2.0 版了!最近一周修订了大量内容: 1. 把第四章中的异步和第九章的多模态重组为第六章,交互:观察和动作空间的扩展。原有第六至八章顺延,实验也重新编号了。
2. 加入了包括 DeepSeek Harness、Anthropic 最新研究在内的新实战案例。3. 评估、后训练、agent 持续进化章节用根据线上 bad case 自动调优 agent 的例子来贯穿。4. 后训练补充 mid-train、数据构造和模型蒸馏的内容。
5. 修正了大量不准确的表述,改进了中文表达。感谢社区增加了希��来语翻译。
实战经验 · @omarsar0▲ 9.6K
新开源智能体框架可降75%大模型运行成本
运行开源大模型的成本可以降低七成五,同时还支持其他主流前沿模型,能帮想自己搭AI工作流的人省不少钱
新开源智能体框架可降75%大模型运行成本
运行开源大模型的成本可以降低七成五,同时还支持其他主流前沿模型,能帮想自己搭AI工作流的人省不少钱
掌控你自己的代理框架。我对这个全新的开源代理框架感到非常兴奋。
我提前拿到了试用资格,它做得真的很棒!
最棒的一点是,它经过了恰当调优,能为GLM-5.2这类开源模型带来惊人的成本降低——成本下降了75%。
它也支持其他前沿模型。
深度观点 · @AiwithShoaib▲ 1.3万
Ornith-1.5 改了AI模型的学习方式
这不是单纯堆参数,而是让模型生成任务自我提升,是开源大模型发展的新可能方向
Ornith-1.5 改了AI模型的学习方式
这不是单纯堆参数,而是让模型生成任务自我提升,是开源大模型发展的新可能方向
开源模型正在进入一个全新的时代。
Ornith-1.5 不只是在扩展参数量——它是在扩展模型的学习方式。
这是一个自我提升的循环:模型创建任务、搭建框架、生成解决方案,并通过强化学习(RL)从这些过程中学习。
这对AI的未来来说是一个非常有趣的方向。🔥
开发者 · @danc_danc▲ 1.2K
开发者下班后哄睡孩子后开发iOS个人项目
开发者danc_danc在哄睡孩子后开发iOS应用,寻找同好交流
开发者下班后哄睡孩子后开发iOS个人项目
开发者danc_danc在哄睡孩子后开发iOS应用,寻找同好交流
开发者danc_danc在𝕏发文称,自己会在哄睡孩子后开发iOS应用。
他希望结识对以下领域感兴趣的同好:交付个人副业项目、Claude Code、Codex、Cursor、开发工具与自动化。
此外,他的兴趣点还包括独立开发、开源项目,以及从失败中学习。
如果你符合以上描述,可以和他取得联系。
开发工具 · @Vtrivedy10▲ 1.8K
开发者分享当前代码开发与环境搭建工作流
基于Codex桌面应用搭建,适配单屏笔记本使用场景,核心使用拆分窗格布局
开发者分享当前代码开发与环境搭建工作流
基于Codex桌面应用搭建,适配单屏笔记本使用场景,核心使用拆分窗格布局
开发者Vtrivedy10分享了自己当前使用的代码开发与环境搭建工作流。这套工作流基于Codex桌面应用搭建。
工作流采用拆分窗格布局,一侧是对话窗口,另一侧是HTML预览器。每次完成重要修改后,都需要更新或新建带新数据的HTML产物预览器,以此确认刚才的修改实际产生了什么效果。
如果需要直接阅读代码,可以打开文件查看器使用。这套工作流适配单屏笔记本使用场景,很少用到第二显示器。
大模型 · @ViC305▲ 3.5K
Ornith-1.5 35B模型登顶本地评测榜 性能超通义千问3.8 27B
开发者ViC305测试显示,单块DGX Spark上该模型解码速度约78词元/秒,多项指标领先
Ornith-1.5 35B模型登顶本地评测榜 性能超通义千问3.8 27B
开发者ViC305测试显示,单块DGX Spark上该模型解码速度约78词元/秒,多项指标领先
代码生成 · @marcusyul▲ 2.4K
同AI模型同任务,仅参考真实案例就大幅提升准确率
一项测试显示,给Claude Code添加真实代码参考后,任务正确率从极低提升到几乎全对
同AI模型同任务,仅参考真实案例就大幅提升准确率
一项测试显示,给Claude Code添加真实代码参考后,任务正确率从极低提升到几乎全对
一项测试设置了对照实验:使用同一个AI模型完成同一个任务,唯一变量是是否提供一个真实案例作为参考。这项测试由代码索引工具XERJ开展,该工具会对代码(个人代码或开源项目代码)建立索引,在Claude Code开始生成代码前,将索引内容作为真实参考提供给它。
不提供真实参考时,AI需要自行猜测所有设计决策:包括代码结构、需要覆盖的场景、功能边界。这种情况下AI几乎没有答对。提供真实案例参考后,AI不需要自行猜测任何内容,所有要求都已经在参考案例中得到解决。
这次测试没有更换模型,也没有延长提示词,只给AI提供了真实内容供参考,而非让AI凭空想象。AI无法对从未见过的内容做出准确猜测,但可以很好地复制已经摆在面前的内容。
XERJ可以为用户自动查找这类参考内容:它会对用户的代码仓库及同类项目建立索引, ready 提供给Claude使用。
开源 · @OsaurusAI▲ 1.3万
离线运行的90亿参数大模型Ornith 1.5完成自主代理任务
该开源大模型可在本地Mac设备离线运行,性能表现超过更大参数的模型
离线运行的90亿参数大模型Ornith 1.5完成自主代理任务
该开源大模型可在本地Mac设备离线运行,性能表现超过更大参数的模型
这是一个参数规模90亿的大模型,全程在Wi-Fi断开的离线状态下,完成了一整套自主智能体运行流程。
该模型是OsaurusAI推出的Ornith 1.5,它自主读取了三份表格,交叉引用月度汇总数据,独立写出一份收入分析报告。整个过程中,所有数据都没有离开本地Mac设备。
本次演示使用基于MLX框架、采用MXFP8量化的Ornith 1.5 9B,全程在Wi-Fi断开的状态下录制完成。Ornith官方称,这款90亿参数模型的性能达到或超过了Gemma 4 31B(参数310亿)和Qwen 3.6 35B(参数350亿),实际运行中的规划、读文件和自我修正表现,也符合这一说法。
该项目免费开源,采用MIT许可证。它是原生macOS应用,并非基于Electron框架构建。
产品发布 · @lydiahallie▲ 1.1万
Claude Code自动模式支持纯英文配置规则 新增检查功能
分享Claude Code自动模式的纯英文配置功能与规则检查工具
Claude Code自动模式支持纯英文配置规则 新增检查功能
分享Claude Code自动模式的纯英文配置功能与规则检查工具
顺便说一句,你可以用纯英文在 Claude Code 里配置自动模式。分类器是一个独立模型,会审查每一步操作,它在决定允许/阻止什么操作时,只会读取你写的这些规则。加上 `$defaults` 还能同时保留内置规则!
如果你不确定自己的规则是否足够清晰,可以运行 `claude auto-mode critique`。它会标记出所有模棱两可、冗余或是大概率会产生误判的内容。更多信息见文档:
团队协作 · @gregisenberg▲ 1.8万
团队AI工作流方案:将团队AI技能托管为GitHub可更新插件
分享团队协作使用AI代理的高效工作流管理方案
团队AI工作流方案:将团队AI技能托管为GitHub可更新插件
分享团队协作使用AI代理的高效工作流管理方案
新品发布 · @superwhisper▲ 3.5万
superwhisper 推出端侧运行的S1-mini语言模型
全推理过程都能在个人设备上完成,不用把转录内容传到云端,语音转文字记录隐私性有了新方案。
superwhisper 推出端侧运行的S1-mini语言模型
全推理过程都能在个人设备上完成,不用把转录内容传到云端,语音转文字记录隐私性有了新方案。
新品发布 · @opencode▲ 8.4万
opencode上线Muse Spark 1.2 Contributor可训练个人数据
支持用个人数据训练,需要用户主动同意开启,部分地区受限,换来了更宽松的使用额度
opencode上线Muse Spark 1.2 Contributor可训练个人数据
支持用个人数据训练,需要用户主动同意开启,部分地区受限,换来了更宽松的使用额度
Muse Spark 1.2 Contributor 现已在 OpenCode Go 上线。
这个模型会基于你的数据训练,因此需要你明确选择启用,且在部分地区受限。
作为交换,你能获得极高的使用额度。
新品发布 · @cursor_ai▲ 4.9万
Cursor发布升级版云代理功能
用Cursor写代码时,复杂长任务能交给云代理自动推进到完成,不用反复手动接手确认
Cursor发布升级版云代理功能
用Cursor写代码时,复杂长任务能交给云代理自动推进到完成,不用反复手动接手确认
新品发布 · @bojie_li▲ 5.7K
@bojie_li发布《深入理解 AI Agent》2.0版
本次修订新增了实战案例与后训练相关内容,还补充了社区贡献的希伯来语翻译,想学习AI Agent可以获取这本开源书籍学习
@bojie_li发布《深入理解 AI Agent》2.0版
本次修订新增了实战案例与后训练相关内容,还补充了社区贡献的希伯来语翻译,想学习AI Agent可以获取这本开源书籍学习
送给大家的七夕礼物:《深入理解 AI Agent》开源书发布 2.0 版了!最近一周修订了大量内容: 1. 把第四章中的异步和第九章的多模态重组为第六章,交互:观察和动作空间的扩展。原有第六至八章顺延,实验也重新编号了。
2. 加入了包括 DeepSeek Harness、Anthropic 最新研究在内的新实战案例。3. 评估、后训练、agent 持续进化章节用根据线上 bad case 自动调优 agent 的例子来贯穿。4. 后训练补充 mid-train、数据构造和模型蒸馏的内容。
5. 修正了大量不准确的表述,改进了中文表达。感谢社区增加了希��来语翻译。
新品发布 · @NousResearch▲ 3.4万
NousResearch 给Hermes加了技能安全检查功能
安装技能前就可以提前排查隐私泄露、安全漏洞等问题,先自查还改进了11个自带技能,降低了使用Hermes时的安全风险
NousResearch 给Hermes加了技能安全检查功能
安装技能前就可以提前排查隐私泄露、安全漏洞等问题,先自查还改进了11个自带技能,降低了使用Hermes时的安全风险
现在 Hermes 在安装技能时会利用 NVIDIA 的 SkillEvaluator,在你确认安装前检查 PII、泄露密钥、Unicode 走私、许可证和安全问题。
我们首先将它用在了我们自己捆绑的技能上,并且根据它的发现改进了其中11个技能。
新品发布 · @NovaIAHQ▲ 3.7万
Nova AI发布MiniMax H3 AI视频生成功能(50% OFF)
视频创作者可以在单轮生成里同时使用多份音视频参考,还能控制运镜,更多输入信息能帮你更精准地执导拍摄场景
Nova AI发布MiniMax H3 AI视频生成功能(50% OFF)
视频创作者可以在单轮生成里同时使用多份音视频参考,还能控制运镜,更多输入信息能帮你更精准地执导拍摄场景
开阔场景是测试 AI 视频模型能否理解除主体外更多内容的良好标准。
MiniMax H3 为创作者提供了相机控制功能,同时支持在同一次生成中使用多个视觉和音频参考。
输入越多上下文,就有越多空间来实际指导场景创作。
目前该模型已在@magnific上线,在 9 月 1 日之前,生成 2K 分辨率视频可享受五折优惠。
行业动态 · @OpenAI▲ 31.5万
OpenAI发布Private Safety Processing 预览功能
企业用户使用前沿大模型处理业务时,既可以满足安全审核要求,也不必担心OpenAI员工接触到业务原始内容
OpenAI发布Private Safety Processing 预览功能
企业用户使用前沿大模型处理业务时,既可以满足安全审核要求,也不必担心OpenAI员工接触到业务原始内容
我们将继续为前沿模型提供零数据留存服务。
随着AI承担时长更长、自主性更强的工作,为企业创造更大价值,安全系统也需要在相关交互中识别风险。
为帮助应对这些风险,我们推出了Private Safety Processing预览功能,该功能旨在提升安全性,同时不会让OpenAI员工访问原始内容。
开源 · @jakevin7▲ 8.7K
Apache孵化器迎来首个开源AI智能体框架项目
这个项目做性能和成本优化,基准测试拿到了顶尖排名,所有测试报告都开源可重复验证,项目本身完全开源中立。
Apache孵化器迎来首个开源AI智能体框架项目
这个项目做性能和成本优化,基准测试拿到了顶尖排名,所有测试报告都开源可重复验证,项目本身完全开源中立。
测试 · @pbshgthm▲ 5.5K
不加额外框架,Claude Code就能跑满Arc-AGI-3满分
开发者只给Claude Code加上一个技巧,没有额外搭框架,就把抽象推理测试Arc-AGI-3做到了满分。
不加额外框架,Claude Code就能跑满Arc-AGI-3满分
开发者只给Claude Code加上一个技巧,没有额外搭框架,就把抽象推理测试Arc-AGI-3做到了满分。
结果发现,arc-agi-3 可能真的是技能问题。我们用一个通用编码 agent 让这个基准达到了 100% rhae 饱和度——这个 agent 是 claude code + opus 5,没有额外的工具框架,只多了一项技能。
核心思路非常简单:在每次行动前,强制生成一个可证伪的预测。
这会把每一步操作都变成一次实验,把每一次失误都变成一次精准修正,还能让 agent 通过公开记录错误来学习这个任务。
语音模型 · @ElevenLabs▲ 7.0K
ElevenLabs推出更有情绪的实时语音模型,正式可用
面向开发带语音交互功能应用的开发者,这个新模型能生成情绪更丰富自然的实时语音回复。
ElevenLabs推出更有情绪的实时语音模型,正式可用
面向开发带语音交互功能应用的开发者,这个新模型能生成情绪更丰富自然的实时语音回复。
我们表现力最强的实时语音模型 Eleven v3 Conversational 现已正式可用。
对于构建能带着真实情绪响应的语音体验的开发者来说,Eleven v3 Conversational 支持精细控制的音频标签,并支持 70 多种语言。
行业动态 · Hacker News▲ 44
网友评价谷歌Pixel 11内置AI不好用
打算换Pixel新手机的用户,可以参考这个使用体验,再考虑要不要为内置AI功能买单。
网友评价谷歌Pixel 11内置AI不好用
打算换Pixel新手机的用户,可以参考这个使用体验,再考虑要不要为内置AI功能买单。
社区讨论:多数用户不满谷歌Pixel内置AI,有人吐槽谷歌产品团队不做用户调研,充斥着只冲KPI的利己职员,堆AI只是为了给产品经理交差,做的都是用户不需要的功能。有用户认为三星AI做得更好,也有人表示自己日常用AI添加日历等功能是够用的,只是AI功能做得不够彻底,步骤冗余。
行业动态 · Hacker News▲ 96
大语言模型时代该做可扩展软件了?
现有AI工具大多是封闭黑盒,这篇讨论重新思考可扩展软件在AI时代的价值,想自定义AI工作流的人能找到新方向。
大语言模型时代该做可扩展软件了?
现有AI工具大多是封闭黑盒,这篇讨论重新思考可扩展软件在AI时代的价值,想自定义AI工作流的人能找到新方向。
社区讨论:多数开发者认同大语言模型降低了个人定制软件开发的门槛,已有多人靠大模型花半小时就做出满足自身个性化需求的小工具,吐槽现有通用工具功能臃肿框架老旧。有人质疑普通用户不会追求可扩展定制软件,大众只需要够用稳定的成品。还有人指出这篇文章本质偏向Cloudflare OS的推广,很难相信Cloudflare能成为默认基础平台,更可能是谷歌微软先复制成熟模式抢占市场。
行业动态 · Hacker News▲ 117
纯C实现的MicroGPT-C 在M5跑出10M TPS
同样的大语言推理任务,用更精简的底层语言实现能跑出极高吞吐,这给本地运行大模型提供了新的优化方向
纯C实现的MicroGPT-C 在M5跑出10M TPS
同样的大语言推理任务,用更精简的底层语言实现能跑出极高吞吐,这给本地运行大模型提供了新的优化方向
社区讨论:多数人明确指出这不是大语言模型,只是用于生成随机名称的超小模型,参数仅为4K。有人质疑该性能数据并不值得惊叹,称自己移植的微型模型也达到了极高速度,还有人提到五个月前就已有C语言移植版本,比Python版本快2500倍。也有开发者讨论了优化空间,认为用Arm SME可实现进一步提速,还有人好奇该项目能否适配Asahi平台。
深度观点 · @AiwithShoaib▲ 1.3万
Ornith-1.5 改了AI模型的学习方式
这不是单纯堆参数,而是让模型生成任务自我提升,是开源大模型发展的新可能方向
Ornith-1.5 改了AI模型的学习方式
这不是单纯堆参数,而是让模型生成任务自我提升,是开源大模型发展的新可能方向
开源模型正在进入一个全新的时代。
Ornith-1.5 不只是在扩展参数量——它是在扩展模型的学习方式。
这是一个自我提升的循环:模型创建任务、搭建框架、生成解决方案,并通过强化学习(RL)从这些过程中学习。
这对AI的未来来说是一个非常有趣的方向。🔥
深度观点 · @navi_Ai2▲ 6.2K
Ornith-1.5 开源模型获称开源AI新台阶
它支持自我改进训练,多尺寸模型均采用MIT开源许可,能为下一代开源AI提供基础,普通开发者也可基于它开发产品
Ornith-1.5 开源模型获称开源AI新台阶
它支持自我改进训练,多尺寸模型均采用MIT开源许可,能为下一代开源AI提供基础,普通开发者也可基于它开发产品
Ornith-1.5 是开源 AI 向前迈出的重要一步。
通过自我改进训练,它拥有出色的推理、编码和智能体性能,此外还以 MIT 许可证发布了多个尺寸的模型版本。
它看起来会是下一代开源 AI 的强大基础。
深度观点 · @Vtrivedy10▲ 1.5万
开发者讨论数据如何转为模型训练环境
关心大模型迭代的人,可以参考这些关于人类参与度、环境评估作用的讨论方向,看看不同的开发思路
开发者讨论数据如何转为模型训练环境
关心大模型迭代的人,可以参考这些关于人类参与度、环境评估作用的讨论方向,看看不同的开发思路
来和我们这支有趣的团队一起聊聊,如何把你宝贵的数据转化为能持续迭代模型的环境,我们会聊这些有意思的内容:
- 用真实世界追踪数据创建逼真的世界模型
- 如何把环境和评估当作智能体的训练数据来看待
- 训练实际是什么样的?你该在什么时候开展训练
- 在整个循环的不同阶段,人类需要参与到什么程度,以及为什么需要人类参与
前沿研究 · @Apodex_AI▲ 60.3万
Apodex_AI推出TRACES 专门测试发现式AI
现有AI基准只测找已知答案的能力,这个新基准专门测试AI解决无解科学问题的能力,影响AI科研领域的能力评估方向
Apodex_AI推出TRACES 专门测试发现式AI
现有AI基准只测找已知答案的能力,这个新基准专门测试AI解决无解科学问题的能力,影响AI科研领域的能力评估方向
大多数AI基准测试考察的是检索能力——模型能否找到已知答案?
然而,科学领域最困难的问题要求的是发现,系统能否推导出一个还没人拥有的答案?
来认识TRACES 🧭——全球首个用于衡量发现型AI的基准测试:这类AI可以梳理证据、检验假设,并在没有标准答案的问题上得出可验证的结论。
该基准由我们的创始人@tianqiao_chen提出,他定义了它的六项能力。
今天发布了三项内容:「发现型智能」的定义,区分可靠研究和幸运猜测的评分规则,以及面向解题者和出题者的公开征集。
网站:
工具产品 · @vral▲ 1.5万
@vral发布AI费用监控路由工具(平均节省40%)
该工具会自动把请求分配给性价比最高的模型,接入仅需两行代码,2026年前免费使用,能帮调用多个AI服务商的开发者降低使用成本
@vral发布AI费用监控路由工具(平均节省40%)
该工具会自动把请求分配给性价比最高的模型,接入仅需两行代码,2026年前免费使用,能帮调用多个AI服务商的开发者降低使用成本
在我们的平台上,监控和控制你在每一家提供商处的AI支出。早期用户平均节省了40%。
每周,价格——智能——延迟的边界都在移动,我们预计这一趋势还会持续。延迟、推理能力、成本、服务层级、开源模型和闭源模型之间的权衡一直在不断变化。
Router会将每个请求发送到最适合该任务的模型,并帮你控制你购买的token。我们针对实际工作对它做了基准测试:相同输出下成本降低约40%。
今天我们向所有人开放它。只需两行代码,或者仅修改你的base URL即可使用。不需要@tryramp账户。
免费使用到2026年,首$26由我们承担。现在就前往获取API key:
实战经验 · @omarsar0▲ 9.6K
新开源智能体框架可降75%大模型运行成本
运行开源大模型的成本可以降低七成五,同时还支持其他主流前沿模型,能帮想自己搭AI工作流的人省不少钱
新开源智能体框架可降75%大模型运行成本
运行开源大模型的成本可以降低七成五,同时还支持其他主流前沿模型,能帮想自己搭AI工作流的人省不少钱
掌控你自己的代理框架。我对这个全新的开源代理框架感到非常兴奋。
我提前拿到了试用资格,它做得真的很棒!
最棒的一点是,它经过了恰当调优,能为GLM-5.2这类开源模型带来惊人的成本降低——成本下降了75%。
它也支持其他前沿模型。
开放资源 · @baseten▲ 14.9万
Baseten开放《推理工程》资源供所有人免费阅读
AI公司Baseten免费开放《推理工程》阅读资源
Baseten开放《推理工程》资源供所有人免费阅读
AI公司Baseten免费开放《推理工程》阅读资源
团队协作 · @gregisenberg▲ 1.8万
团队AI工作流方案:将团队AI技能托管为GitHub可更新插件
分享团队协作使用AI代理的高效工作流管理方案
团队AI工作流方案:将团队AI技能托管为GitHub可更新插件
分享团队协作使用AI代理的高效工作流管理方案
产品发布 · @lydiahallie▲ 1.1万
Claude Code自动模式支持纯英文配置规则 新增检查功能
分享Claude Code自动模式的纯英文配置功能与规则检查工具
Claude Code自动模式支持纯英文配置规则 新增检查功能
分享Claude Code自动模式的纯英文配置功能与规则检查工具
顺便说一句,你可以用纯英文在 Claude Code 里配置自动模式。分类器是一个独立模型,会审查每一步操作,它在决定允许/阻止什么操作时,只会读取你写的这些规则。加上 `$defaults` 还能同时保留内置规则!
如果你不确定自己的规则是否足够清晰,可以运行 `claude auto-mode critique`。它会标记出所有模棱两可、冗余或是大概率会产生误判的内容。更多信息见文档:
AI开发 · @poteto▲ 1.2万
开发者借助云代理与Grok Bot月交付千个PR
开发者分享借助云代理、Grok Bot实现月交付千个PR的方法
开发者借助云代理与Grok Bot月交付千个PR
开发者分享借助云代理、Grok Bot实现月交付千个PR的方法
开源 · @OsaurusAI▲ 1.3万
离线运行的90亿参数大模型Ornith 1.5完成自主代理任务
该开源大模型可在本地Mac设备离线运行,性能表现超过更大参数的模型
离线运行的90亿参数大模型Ornith 1.5完成自主代理任务
该开源大模型可在本地Mac设备离线运行,性能表现超过更大参数的模型
这是一个参数规模90亿的大模型,全程在Wi-Fi断开的离线状态下,完成了一整套自主智能体运行流程。
该模型是OsaurusAI推出的Ornith 1.5,它自主读取了三份表格,交叉引用月度汇总数据,独立写出一份收入分析报告。整个过程中,所有数据都没有离开本地Mac设备。
本次演示使用基于MLX框架、采用MXFP8量化的Ornith 1.5 9B,全程在Wi-Fi断开的状态下录制完成。Ornith官方称,这款90亿参数模型的性能达到或超过了Gemma 4 31B(参数310亿)和Qwen 3.6 35B(参数350亿),实际运行中的规划、读文件和自我修正表现,也符合这一说法。
该项目免费开源,采用MIT许可证。它是原生macOS应用,并非基于Electron框架构建。
代码生成 · @marcusyul▲ 2.4K
同AI模型同任务,仅参考真实案例就大幅提升准确率
一项测试显示,给Claude Code添加真实代码参考后,任务正确率从极低提升到几乎全对
同AI模型同任务,仅参考真实案例就大幅提升准确率
一项测试显示,给Claude Code添加真实代码参考后,任务正确率从极低提升到几乎全对
一项测试设置了对照实验:使用同一个AI模型完成同一个任务,唯一变量是是否提供一个真实案例作为参考。这项测试由代码索引工具XERJ开展,该工具会对代码(个人代码或开源项目代码)建立索引,在Claude Code开始生成代码前,将索引内容作为真实参考提供给它。
不提供真实参考时,AI需要自行猜测所有设计决策:包括代码结构、需要覆盖的场景、功能边界。这种情况下AI几乎没有答对。提供真实案例参考后,AI不需要自行猜测任何内容,所有要求都已经在参考案例中得到解决。
这次测试没有更换模型,也没有延长提示词,只给AI提供了真实内容供参考,而非让AI凭空想象。AI无法对从未见过的内容做出准确猜测,但可以很好地复制已经摆在面前的内容。
XERJ可以为用户自动查找这类参考内容:它会对用户的代码仓库及同类项目建立索引, ready 提供给Claude使用。
大模型 · @ViC305▲ 3.5K
Ornith-1.5 35B模型登顶本地评测榜 性能超通义千问3.8 27B
开发者ViC305测试显示,单块DGX Spark上该模型解码速度约78词元/秒,多项指标领先
Ornith-1.5 35B模型登顶本地评测榜 性能超通义千问3.8 27B
开发者ViC305测试显示,单块DGX Spark上该模型解码速度约78词元/秒,多项指标领先
开发工具 · @Vtrivedy10▲ 1.8K
开发者分享当前代码开发与环境搭建工作流
基于Codex桌面应用搭建,适配单屏笔记本使用场景,核心使用拆分窗格布局
开发者分享当前代码开发与环境搭建工作流
基于Codex桌面应用搭建,适配单屏笔记本使用场景,核心使用拆分窗格布局
开发者Vtrivedy10分享了自己当前使用的代码开发与环境搭建工作流。这套工作流基于Codex桌面应用搭建。
工作流采用拆分窗格布局,一侧是对话窗口,另一侧是HTML预览器。每次完成重要修改后,都需要更新或新建带新数据的HTML产物预览器,以此确认刚才的修改实际产生了什么效果。
如果需要直接阅读代码,可以打开文件查看器使用。这套工作流适配单屏笔记本使用场景,很少用到第二显示器。
开发者 · @danc_danc▲ 1.2K
开发者下班后哄睡孩子后开发iOS个人项目
开发者danc_danc在哄睡孩子后开发iOS应用,寻找同好交流
开发者下班后哄睡孩子后开发iOS个人项目
开发者danc_danc在哄睡孩子后开发iOS应用,寻找同好交流
开发者danc_danc在𝕏发文称,自己会在哄睡孩子后开发iOS应用。
他希望结识对以下领域感兴趣的同好:交付个人副业项目、Claude Code、Codex、Cursor、开发工具与自动化。
此外,他的兴趣点还包括独立开发、开源项目,以及从失败中学习。
如果你符合以上描述,可以和他取得联系。
今天的 28 条信号到这里下一轮 12:30 更新
📬 订阅
https://ai-pulse-lab.com/feed.xml