OpenAI_Build_Week_16-9 3200×1800 491 KB
Build Week 是面向全球开发者、创作者、创始人和学生的全球性挑战赛,大家可以从7月13日开始,用 Codex 试验新想法并将它们落地,本次活动同期会举办超过40场活动。
参与者可以参加直播环节、参与社区活动,并将自己的项目提交到 OpenAI Build Week Challenge。
无论你是从零开始,还是基于现有项目开发,Build Week 都能给每个人提供学习的机会。
“实践者方能有所得。”——尼采
当我重新开始研究纯数学时,我的妻子提出了一个合理的问题:你做这件事为什么和Aigora无关?
她确实说得有道理。我运营着垂直领域企业AI服务公司Aigora,有客户要服务,有产品要开发,没有客户要求我证明微分几何定理。
𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌
7月13日启动,会举办四十余场活动,任何人都可以从零开始或者基于已有项目,用Codex实验新创意,提交项目参赛
OpenAI_Build_Week_16-9 3200×1800 491 KB
Build Week 是面向全球开发者、创作者、创始人和学生的全球性挑战赛,大家可以从7月13日开始,用 Codex 试验新想法并将它们落地,本次活动同期会举办超过40场活动。
参与者可以参加直播环节、参与社区活动,并将自己的项目提交到 OpenAI Build Week Challenge。
无论你是从零开始,还是基于现有项目开发,Build Week 都能给每个人提供学习的机会。
有开发者提到,Codex正在耗损日常使用的设备,这会直接增加使用AI工具的硬件成本
社区讨论:多数用户认为原帖没有实质有效信息,只是恐慌性猜测。有用户确认问题仅出现在图形界面版本,Linux用户和使用终端界面的用户不受影响,自己长期使用仅写入86TB,占SSD寿命写入限额的1%。有人补充OpenAI曾在6月22日的0.142.x版本修复该问题,但修复不彻底,仍有用户投诉,也有用户反馈GUI版会让笔记本风扇狂转、机身发烫。
想玩可成长AI智能体Hermes、配套模型、外部工具和云端智能体都打包在同一个订阅里,设置非常简单
Hermes 是能和你共同成长的智能体。
Nous Portal 是为它提供算力支持的最佳方式:它将模型、实用外部工具和云端智能体本身整合在一个统一订阅中,设置过程极其简单。
不少人遇到过这种情况:大任务全量上下文喂给Codex,改完代码越改问题越多,最后花了不少钱,生成的结果还要重写。
我觉得这个社区里很多人都遇到过这种场景。一个超大的 AGENTS.md 文件,占满了全部上下文窗口,再加一段细节满满的提示词,还有一个宏大的目标。Codex 满怀信心开始干活:它探索仓库、制定计划、修改代码。
然后范围开始膨胀,它读了一堆不必要的文件,修复一个问题又带出另一个问题,到最后我们得到的结果成本很高,还得手动重写一部分。
很长一段时间里,我都觉得解决方案是给模型提供更多信息,还要更……
热门AI产品需求超过承载能力,只能暂时停止接收新付费用户
社区讨论:多数用户认可Kimi K3在长上下文处理、代码审查等任务上的表现,不少人已经长期用它替代其他大模型处理工作。用户肯定月之暗面暂停新订阅、优先保障现有用户体验的做法,也有人提出也可以照搬Anthropic的方案,通过下调使用限额来控制压力。有试用者反馈当前模型负载过高,响应速度极慢,20美元套餐的额度也很快就会用完。
最高 $50,000 额度资助,专门支持加速罕见病治疗研发的科研人员。这是AI for Science计划首个专项招募。
我们将为加速研发罕见病疗法的研究人员提供最高额度为 $50,000 的 Claude 使用 credits 资助。
这是我们在 AI for Science 项目下首次针对性征集,该项目支持科学家使用 Claude 加快科研发现。
不用固定分配算力,需要深度推理的时候多分配,简单问题少分配,能降低推理成本
有人提出了对大模型本质的新判断,对想理清AI定位的人来说,这个不同的视角值得参考。
社区讨论:多数评论不认同原帖观点,有人指出编译器本身存在未定义行为、结果非确定,电动工具实际使用也充满不确定性,原帖对类比对象的描述本身就不准确。也有人认为原帖作者漏算了机器学习优化编译、LLM驱动编译器这类当下研究方向,还有人反对将大模型拟人化,指出大模型只会做下一词预测,会产生人类不会犯的全新错误。
积压了没做的开发项目,可以用Codex动手做了。整理好的开发灵感来自Women who Code(x)社区。
长期看美国AI公司会替代所有现有应用网站,中国头部开源AI模型正在直接对标美国闭源模型,打破技术壁垒,现在各方正在互相渗透竞争。
这一部分也非常有意思。
从长期来看,美国 AI 公司基本上会取代所有 app 和网站,你只需要向它们说出任何你需要的东西,它们就会完成/生成/制作出你要的内容。
与此同时,由中国政府主导的中国 AI 公司推出了开源模型,这些模型现在可以直接和美国的私有模型竞争,并且试图确保美国模型无法构建护城河。
所以现在是所有人都在互相蚕食。
阿里千问Qwen3.8预览版持续迭代,最新版现已上线
在预览阶段,Qwen3.8每日都在变得更强。最新版本现已上线,整体性能获得全面提升,在Web前端开发能力上更是迈进了一大步。
感谢所有人——大家对Qwen3.8-Max-Preview的反响让我们十分惊喜。🫶🫶
Qwen3.8目前仍在每日迭代更新。快来测试它,告诉我们哪些地方出了问题。
我们期待推出能力更强的正式版本,并且会为所有人开放权重。🚀🚀
创业者浏览种子孵化项目申请,称当前AI产出多平庸缺突破性创新
微软正在测试Kimi K3驱动自家的Copilot AI助手,每生成1000个token就能省下60%成本,算下来每花10亿美元推理就能省6亿美元,Kimi K3已经部署在Azure上。
说实话,如果把GPT-Live语音界面、Codex工具链和Kimi K3都整合进ChatGPT,对我目前90%的个人使用场景来说就已经很棒了。OpenAI哪怕变成一家不一样的公司,大概也能撑下去。但Anthropic……我不觉得它能。
据报道,微软正在测试用Kimi K3来驱动它的旗舰Copilot AI助手。每个token最多能节省60%的成本。也就是说,每花10亿美元做推理,就能省下6亿美元。
Kimi K3已经在Azure上运行了。K2.7 Code已经集成在GitHub Copilot里了。这对微软来说不是什么新领域,只是下一步发展而已。
而7月27日月之暗面(Moonshot)会开源完整的2.8万亿参数权重。一旦开源,微软就可以在Azure上自行部署,不用再支付API费用了。成本还会进一步下降。
美国最大的科技公司,放弃了自己合作伙伴的模型,选择了一款中国开源模型。因为数据不会骗人。开源不再只是参与竞争了。它已经在拿订单了。
做AI智能体的团队需要通盘考虑身份验证、日志审计、调用限额这些问题,这份概念指南把整个系统流程梳理清楚了。
治理智能体要求团队通盘考虑整个系统,涵盖身份验证、审计日志、速率限制、后备方案和集中化支出管控。我们最新的概念指南拆解了团队所需的基础框架。
IssueBench 是我们为 Engine 构建的详细评估套件(Engine 是 LangSmith 中的持续学习智能体,可在你的追踪数据上运行,自动优化你的智能体)。
由于 Engine 运行所需的数据类型特殊,评估 Engine 是一个棘手问题,因此我们撰写了这篇博客,介绍这个基准测试是什么,以及我们是如何构建它的:
现在的大模型训练出来就是勤快、没紧迫感,还谦虚说自己能力有限,刚好和传统程序员认可的做事风格对不上。
同时测Kimi K3、Qwen3.8等一堆新模型,还要跑所有测试用例,现在已经需要专门的调度工具来管理上百个测试任务。
在用 Kimi K3、Qwen3.8 这类模型,我想把所有模型放到所有测试框架里测试,但现在管理起来已经变得非常困难……
我的工作流是用一个编排器(比如 Hermes 或 OpenClaw)管理数百个智能体会话,但它会丢失追踪,运行效果很差。
你们都在用什么工具?我认真考虑过搭建自己的控制流,可以接入现有智能体:
创作者分享AI智能体开发相关的教学内容,最大的困扰就是网上太多对AI持负面态度的人,处理这些负面评论让人头疼。
对开源工具生态和全球技术格局感兴趣的人,可以重新认识中国AI模型的实际覆盖规模
有人认为中国开源大模型是正当竞争者,应当受到欢迎,不该被封禁或视作威胁,开源本身就是成熟的商业策略
中国开源模型是正当的竞争者,应当受到欢迎,而非被封禁或被当成威胁,开源是一种存在已久的商业策略(@bgurley / 华盛顿邮报)
(前往 Techmeme dot com 获取链接和完整上下文!)
可以从桌面或手机直接发起云端任务,调用已配置的插件跨现有工具工作,发起后能异步运行,做完再回来查看结果。
借助 ChatGPT Work,你可以直接从桌面端或移动端应用启动云端任务。
它能调用你配置好的插件,在你的代码仓库、文档、Slack 以及你已经在使用的其他工具之间协同工作。
我经常在手机上使用它:先交办一项任务,让它在云端异步运行,等工作完成后再回来查看结果。
谷歌云推出了成熟的对话式AI平台,供开发者在此基础上搭建产品。这说明业内开始更关注AI的落地整合,而非只比拼模型参数。
这套流程漫长复杂,结果也不确定,现在有人公开了评估这套系统的方法
LangSmith Engine 是我们内置在产品中的智能体,它运行在追踪数据之上,会将数据聚类成问题,再提出修复方案。
这是一个长时间运行、复杂且结果模糊的流程。
我们撰写了文章,介绍如何对它进行评估!
能在不降低性能的前提下大幅降低AI使用成本,现已提供兼容OpenAI的调用端点
@tryramp 推出了重磅功能。智能体工作流中的不同步骤可以使用不同模型。
这可以在不牺牲性能的前提下大幅降低成本。
模型路由将成为技术栈的核心组成部分。
目前该功能已可通过一个与 OpenAI 兼容的端点使用。
前沿大模型正在持续商品化,这次测试直接指向替换现有模型的工作任务
突发消息:Microsoft 正在测试 Kimi K3,以取代目前由 GPT 和 Claude 在 Copilot 内部承担的工作岗位。
前沿模型的商品化会持续进行,直到士气得到改善。
超大模型越来越普遍,能跑它推理可能会成为最后一道壁垒,目前训练数据规模已经到十万亿词元级别
鉴于现在就连开放权重模型的参数都接近3T,而有传闻称Fable的参数规模达到了6T-8T,到今年年底我们可能就会见到参数规模达到20T甚至更大的模型。
能够运行这种巨型模型的推理,可能会是仅剩的唯一护城河。
另外,训练语料的规模也达到了数十万亿token量级,因此我们大致上每一个token对应一个浮点数,这应该足以无损失地容纳整个语料库。
好人黑客比坏人黑客多,开源AI能帮好人在网络安全对抗中获得多人对一人的优势。
为满足Proof-of-Useful-Work的约束,研究人员融合三种现有方法,造出了不存在的新量化格式,内部测试表现超出预期
有用工作量证明(Proof-of-Useful-Work)迫使我们发明了一种此前不存在的量化格式。Pearl Protocol 在矩阵乘法之前,会给权重和激活值都添加噪声。
这就带来了普通推理栈没有的约束——模型值和噪声必须共同容纳在 INT8 范围内。因此我们将模型量化到有效 W7A7 范围,留出一比特的Headroom给噪声。
扰动后的操作数仍然能装进 INT8,乘法使用 INT8 输入结合 INT32 累加,之后低秩噪声可以被精准剥离,恢复出量化计算的精确结果。
现有的 INT7 量化方案都不能令人满意,所以我们打造了自己的方案——融合 GPTQ 风格权重重构、SmoothQuant 风格激活平滑与自定义推理内核的非平凡方案。
最终得到的是端到端 W7A7 管线,在我们的内部基准测试中,它的表现甚至超过了很多 FP8 基线(无论是质量还是效率)。我们正在撰写详细介绍这项技术的论文,请保持关注。
展望未来,W7A7 只是一个中间步骤。我们即将推出的升级旨在直接支持 FP8 工作负载,省去额外整数量化步骤的需求。
有人认为构建智能体框架存在巨大空间,RLM框架就是一个实例,有望带来更高效的模型泛化扩展新方式
强烈推荐。我一直说,构建智能体框架能带来巨大收益。事实证明,框架本身就是可组合的泛化工具。
RLM 框架就是这类实践的一个实例。
这有可能为模型规模化泛化带来有趣且高效的新路径。
不少年轻研究者看到AI进步会迷茫,觉得自己的研究没有意义。AI带来的研究机会没有上限,它只是工具,研究者的直觉和积累能放大它的能力。
很多年轻研究者看到这类消息后会感到迷茫和绝望。有些人可能会想:「如果AI都能做这个,我现在做的事情还有什么意义?」
我向你保证,事实恰恰相反。AI开启的机遇是无穷无尽的。别让任何人或任何公司说服你相信别的说法。
AI是一款出色的工具。用它去探索更多,走得更深。同时并行探索多个想法。用它探索横跨多个领域的想法——这类研究本来极难开展,也极其耗时。
花时间和AI一起头脑风暴。用它提出有趣且独特的研究问题。出色的研究高度依赖研究问题的质量。用它找到更好的方式来传播科学和发现。
如果让我重新读一遍博士,我肯定会这么做。花时间思考你该如何利用这类工具,这很重要。现在就是做这件事的好时机。
AI必然会带来更多这类发现,但你的直觉和研究素养可以加速AI能实现的成果。
帮你理清什么时候大模型说出来的推理真的决定结果,什么时候只是事后补的解说,对搭建AI工作流有参考意义。
// 大语言模型中的全局工作空间 //
这是 Anthropic 知名 J-space 研究的 arXiv 论文。(收藏它)
简短回顾:如果你正在研究思维链或方向向量相关工作,这项研究给出了一个机制性解释,说明什么时候语言化推理是承担核心作用的,什么时候它只是事后的叙述。
模型能转化为文字的表征就像一个共享的全局工作空间,它是一个带宽受限的通道,只会向网络其余部分广播一小组特征,进而引导网络下一步的行为。
论文链接:
在我们的学院中学习如何构建有效的 AI 智能体:
不用写复杂提示词,拿到就能直接放进AI用,包含完整脚本、评分和分析模块。
大多数团队不需要更多提示词。他们需要的是真正能支撑业务运转的可复用AI能力。
这正是我们Single Grain正在使用的开源工具包:用Claude Code构建的16个可投入生产环境使用的AI营销与销售能力。
这些不是提示词模板。它们是集成了脚本、评分与分析的完整工作流,你可以直接放到你的AI里立刻开始使用。
获取方式:关注 + 转发这条推文,评论区留下“SKILLS”,我会通过私信给你发送我免费的开源AI能力工具包。
Coinbase工程主管公开分享这套方案的搭建过程,想搭建自用AI工作流可以直接看完整分享找参考
在 Interrupt 大会上,@Coinbase 工程经理 Evan Kormos 上台分享了他们的开发者支持团队如何在自托管 LangSmith 之上搭建了一套自我改进的智能体系统。
完整演讲:
因算力缺口过大,谷歌云已开始推掉业务,该芯片最早可在2028年部署
爆料消息称,谷歌正在开发一款专门用于AI推理的定制芯片,起因是当前算力缺口问题严重,谷歌云已经因此推掉了部分业务。
这款新芯片产品线被命名为Frozen v2,源自Jeff Dean的一项设计方案,最初方案提出将Gemini大模型的权重直接蚀刻在硅片上,Frozen v2则改为将Gemini整体架构直接硬编码进芯片内部。
该芯片的每瓦推理 Token 处理能力,比谷歌最新的推理用张量处理单元(TPU)高出10倍,也就是同样功耗下能处理10倍的文本Token。
DeepMind认为Transformer架构已经不会再发生大的演进,这款芯片的设计逻辑就是将模型本身直接固化为硬件,最早可在2028年投入部署。
Omar Sharif指出反开源AI的观点充满政治化私利,且认为否定开源的片面看法十分危险
那些目前涌现的、带有强烈政治化色彩、服务于私利的反开源AI立场,完全无视了这一点。 Omar Sharif承认,商业环境在变化,不确定性确实会令人不安。但回顾开源技术的发展历史就能发现,开源对科学进步和全人类的益处非常清晰。
所有这类对开源的简化片面看法都极其危险。关于开源对社会的影响,确实有很多重要问题需要讨论。但要推进相关讨论,必须依托准确平衡的视角,结合真实事实、数据和有依据的提案展开。
rauchg提出AI发展带来的启示,认为万事万物本质都是代码
帮你理清什么时候大模型说出来的推理真的决定结果,什么时候只是事后补的解说,对搭建AI工作流有参考意义。
// 大语言模型中的全局工作空间 //
这是 Anthropic 知名 J-space 研究的 arXiv 论文。(收藏它)
简短回顾:如果你正在研究思维链或方向向量相关工作,这项研究给出了一个机制性解释,说明什么时候语言化推理是承担核心作用的,什么时候它只是事后的叙述。
模型能转化为文字的表征就像一个共享的全局工作空间,它是一个带宽受限的通道,只会向网络其余部分广播一小组特征,进而引导网络下一步的行为。
论文链接:
在我们的学院中学习如何构建有效的 AI 智能体:
为满足Proof-of-Useful-Work的约束,研究人员融合三种现有方法,造出了不存在的新量化格式,内部测试表现超出预期
有用工作量证明(Proof-of-Useful-Work)迫使我们发明了一种此前不存在的量化格式。Pearl Protocol 在矩阵乘法之前,会给权重和激活值都添加噪声。
这就带来了普通推理栈没有的约束——模型值和噪声必须共同容纳在 INT8 范围内。因此我们将模型量化到有效 W7A7 范围,留出一比特的Headroom给噪声。
扰动后的操作数仍然能装进 INT8,乘法使用 INT8 输入结合 INT32 累加,之后低秩噪声可以被精准剥离,恢复出量化计算的精确结果。
现有的 INT7 量化方案都不能令人满意,所以我们打造了自己的方案——融合 GPTQ 风格权重重构、SmoothQuant 风格激活平滑与自定义推理内核的非平凡方案。
最终得到的是端到端 W7A7 管线,在我们的内部基准测试中,它的表现甚至超过了很多 FP8 基线(无论是质量还是效率)。我们正在撰写详细介绍这项技术的论文,请保持关注。
展望未来,W7A7 只是一个中间步骤。我们即将推出的升级旨在直接支持 FP8 工作负载,省去额外整数量化步骤的需求。
这套流程漫长复杂,结果也不确定,现在有人公开了评估这套系统的方法
LangSmith Engine 是我们内置在产品中的智能体,它运行在追踪数据之上,会将数据聚类成问题,再提出修复方案。
这是一个长时间运行、复杂且结果模糊的流程。
我们撰写了文章,介绍如何对它进行评估!
想玩可成长AI智能体Hermes、配套模型、外部工具和云端智能体都打包在同一个订阅里,设置非常简单
Hermes 是能和你共同成长的智能体。
Nous Portal 是为它提供算力支持的最佳方式:它将模型、实用外部工具和云端智能体本身整合在一个统一订阅中,设置过程极其简单。
能在不降低性能的前提下大幅降低AI使用成本,现已提供兼容OpenAI的调用端点
@tryramp 推出了重磅功能。智能体工作流中的不同步骤可以使用不同模型。
这可以在不牺牲性能的前提下大幅降低成本。
模型路由将成为技术栈的核心组成部分。
目前该功能已可通过一个与 OpenAI 兼容的端点使用。
最高 $50,000 额度资助,专门支持加速罕见病治疗研发的科研人员。这是AI for Science计划首个专项招募。
我们将为加速研发罕见病疗法的研究人员提供最高额度为 $50,000 的 Claude 使用 credits 资助。
这是我们在 AI for Science 项目下首次针对性征集,该项目支持科学家使用 Claude 加快科研发现。
前沿大模型正在持续商品化,这次测试直接指向替换现有模型的工作任务
突发消息:Microsoft 正在测试 Kimi K3,以取代目前由 GPT 和 Claude 在 Copilot 内部承担的工作岗位。
前沿模型的商品化会持续进行,直到士气得到改善。
微软正在测试Kimi K3驱动自家的Copilot AI助手,每生成1000个token就能省下60%成本,算下来每花10亿美元推理就能省6亿美元,Kimi K3已经部署在Azure上。
说实话,如果把GPT-Live语音界面、Codex工具链和Kimi K3都整合进ChatGPT,对我目前90%的个人使用场景来说就已经很棒了。OpenAI哪怕变成一家不一样的公司,大概也能撑下去。但Anthropic……我不觉得它能。
据报道,微软正在测试用Kimi K3来驱动它的旗舰Copilot AI助手。每个token最多能节省60%的成本。也就是说,每花10亿美元做推理,就能省下6亿美元。
Kimi K3已经在Azure上运行了。K2.7 Code已经集成在GitHub Copilot里了。这对微软来说不是什么新领域,只是下一步发展而已。
而7月27日月之暗面(Moonshot)会开源完整的2.8万亿参数权重。一旦开源,微软就可以在Azure上自行部署,不用再支付API费用了。成本还会进一步下降。
美国最大的科技公司,放弃了自己合作伙伴的模型,选择了一款中国开源模型。因为数据不会骗人。开源不再只是参与竞争了。它已经在拿订单了。
做AI智能体的团队需要通盘考虑身份验证、日志审计、调用限额这些问题,这份概念指南把整个系统流程梳理清楚了。
治理智能体要求团队通盘考虑整个系统,涵盖身份验证、审计日志、速率限制、后备方案和集中化支出管控。我们最新的概念指南拆解了团队所需的基础框架。
IssueBench 是我们为 Engine 构建的详细评估套件(Engine 是 LangSmith 中的持续学习智能体,可在你的追踪数据上运行,自动优化你的智能体)。
由于 Engine 运行所需的数据类型特殊,评估 Engine 是一个棘手问题,因此我们撰写了这篇博客,介绍这个基准测试是什么,以及我们是如何构建它的:
现在的大模型训练出来就是勤快、没紧迫感,还谦虚说自己能力有限,刚好和传统程序员认可的做事风格对不上。
同时测Kimi K3、Qwen3.8等一堆新模型,还要跑所有测试用例,现在已经需要专门的调度工具来管理上百个测试任务。
在用 Kimi K3、Qwen3.8 这类模型,我想把所有模型放到所有测试框架里测试,但现在管理起来已经变得非常困难……
我的工作流是用一个编排器(比如 Hermes 或 OpenClaw)管理数百个智能体会话,但它会丢失追踪,运行效果很差。
你们都在用什么工具?我认真考虑过搭建自己的控制流,可以接入现有智能体:
创作者分享AI智能体开发相关的教学内容,最大的困扰就是网上太多对AI持负面态度的人,处理这些负面评论让人头疼。
有人提出了对大模型本质的新判断,对想理清AI定位的人来说,这个不同的视角值得参考。
社区讨论:多数评论不认同原帖观点,有人指出编译器本身存在未定义行为、结果非确定,电动工具实际使用也充满不确定性,原帖对类比对象的描述本身就不准确。也有人认为原帖作者漏算了机器学习优化编译、LLM驱动编译器这类当下研究方向,还有人反对将大模型拟人化,指出大模型只会做下一词预测,会产生人类不会犯的全新错误。
不用固定分配算力,需要深度推理的时候多分配,简单问题少分配,能降低推理成本
热门AI产品需求超过承载能力,只能暂时停止接收新付费用户
社区讨论:多数用户认可Kimi K3在长上下文处理、代码审查等任务上的表现,不少人已经长期用它替代其他大模型处理工作。用户肯定月之暗面暂停新订阅、优先保障现有用户体验的做法,也有人提出也可以照搬Anthropic的方案,通过下调使用限额来控制压力。有试用者反馈当前模型负载过高,响应速度极慢,20美元套餐的额度也很快就会用完。
不少人遇到过这种情况:大任务全量上下文喂给Codex,改完代码越改问题越多,最后花了不少钱,生成的结果还要重写。
我觉得这个社区里很多人都遇到过这种场景。一个超大的 AGENTS.md 文件,占满了全部上下文窗口,再加一段细节满满的提示词,还有一个宏大的目标。Codex 满怀信心开始干活:它探索仓库、制定计划、修改代码。
然后范围开始膨胀,它读了一堆不必要的文件,修复一个问题又带出另一个问题,到最后我们得到的结果成本很高,还得手动重写一部分。
很长一段时间里,我都觉得解决方案是给模型提供更多信息,还要更……
有开发者提到,Codex正在耗损日常使用的设备,这会直接增加使用AI工具的硬件成本
社区讨论:多数用户认为原帖没有实质有效信息,只是恐慌性猜测。有用户确认问题仅出现在图形界面版本,Linux用户和使用终端界面的用户不受影响,自己长期使用仅写入86TB,占SSD寿命写入限额的1%。有人补充OpenAI曾在6月22日的0.142.x版本修复该问题,但修复不彻底,仍有用户投诉,也有用户反馈GUI版会让笔记本风扇狂转、机身发烫。
7月13日启动,会举办四十余场活动,任何人都可以从零开始或者基于已有项目,用Codex实验新创意,提交项目参赛
OpenAI_Build_Week_16-9 3200×1800 491 KB
Build Week 是面向全球开发者、创作者、创始人和学生的全球性挑战赛,大家可以从7月13日开始,用 Codex 试验新想法并将它们落地,本次活动同期会举办超过40场活动。
参与者可以参加直播环节、参与社区活动,并将自己的项目提交到 OpenAI Build Week Challenge。
无论你是从零开始,还是基于现有项目开发,Build Week 都能给每个人提供学习的机会。
长期看美国AI公司会替代所有现有应用网站,中国头部开源AI模型正在直接对标美国闭源模型,打破技术壁垒,现在各方正在互相渗透竞争。
这一部分也非常有意思。
从长期来看,美国 AI 公司基本上会取代所有 app 和网站,你只需要向它们说出任何你需要的东西,它们就会完成/生成/制作出你要的内容。
与此同时,由中国政府主导的中国 AI 公司推出了开源模型,这些模型现在可以直接和美国的私有模型竞争,并且试图确保美国模型无法构建护城河。
所以现在是所有人都在互相蚕食。
不少年轻研究者看到AI进步会迷茫,觉得自己的研究没有意义。AI带来的研究机会没有上限,它只是工具,研究者的直觉和积累能放大它的能力。
很多年轻研究者看到这类消息后会感到迷茫和绝望。有些人可能会想:「如果AI都能做这个,我现在做的事情还有什么意义?」
我向你保证,事实恰恰相反。AI开启的机遇是无穷无尽的。别让任何人或任何公司说服你相信别的说法。
AI是一款出色的工具。用它去探索更多,走得更深。同时并行探索多个想法。用它探索横跨多个领域的想法——这类研究本来极难开展,也极其耗时。
花时间和AI一起头脑风暴。用它提出有趣且独特的研究问题。出色的研究高度依赖研究问题的质量。用它找到更好的方式来传播科学和发现。
如果让我重新读一遍博士,我肯定会这么做。花时间思考你该如何利用这类工具,这很重要。现在就是做这件事的好时机。
AI必然会带来更多这类发现,但你的直觉和研究素养可以加速AI能实现的成果。
有人认为构建智能体框架存在巨大空间,RLM框架就是一个实例,有望带来更高效的模型泛化扩展新方式
强烈推荐。我一直说,构建智能体框架能带来巨大收益。事实证明,框架本身就是可组合的泛化工具。
RLM 框架就是这类实践的一个实例。
这有可能为模型规模化泛化带来有趣且高效的新路径。
好人黑客比坏人黑客多,开源AI能帮好人在网络安全对抗中获得多人对一人的优势。
超大模型越来越普遍,能跑它推理可能会成为最后一道壁垒,目前训练数据规模已经到十万亿词元级别
鉴于现在就连开放权重模型的参数都接近3T,而有传闻称Fable的参数规模达到了6T-8T,到今年年底我们可能就会见到参数规模达到20T甚至更大的模型。
能够运行这种巨型模型的推理,可能会是仅剩的唯一护城河。
另外,训练语料的规模也达到了数十万亿token量级,因此我们大致上每一个token对应一个浮点数,这应该足以无损失地容纳整个语料库。
谷歌云推出了成熟的对话式AI平台,供开发者在此基础上搭建产品。这说明业内开始更关注AI的落地整合,而非只比拼模型参数。
有人认为中国开源大模型是正当竞争者,应当受到欢迎,不该被封禁或视作威胁,开源本身就是成熟的商业策略
中国开源模型是正当的竞争者,应当受到欢迎,而非被封禁或被当成威胁,开源是一种存在已久的商业策略(@bgurley / 华盛顿邮报)
(前往 Techmeme dot com 获取链接和完整上下文!)
对开源工具生态和全球技术格局感兴趣的人,可以重新认识中国AI模型的实际覆盖规模
Coinbase工程主管公开分享这套方案的搭建过程,想搭建自用AI工作流可以直接看完整分享找参考
在 Interrupt 大会上,@Coinbase 工程经理 Evan Kormos 上台分享了他们的开发者支持团队如何在自托管 LangSmith 之上搭建了一套自我改进的智能体系统。
完整演讲:
可以从桌面或手机直接发起云端任务,调用已配置的插件跨现有工具工作,发起后能异步运行,做完再回来查看结果。
借助 ChatGPT Work,你可以直接从桌面端或移动端应用启动云端任务。
它能调用你配置好的插件,在你的代码仓库、文档、Slack 以及你已经在使用的其他工具之间协同工作。
我经常在手机上使用它:先交办一项任务,让它在云端异步运行,等工作完成后再回来查看结果。
积压了没做的开发项目,可以用Codex动手做了。整理好的开发灵感来自Women who Code(x)社区。
不用写复杂提示词,拿到就能直接放进AI用,包含完整脚本、评分和分析模块。
大多数团队不需要更多提示词。他们需要的是真正能支撑业务运转的可复用AI能力。
这正是我们Single Grain正在使用的开源工具包:用Claude Code构建的16个可投入生产环境使用的AI营销与销售能力。
这些不是提示词模板。它们是集成了脚本、评分与分析的完整工作流,你可以直接放到你的AI里立刻开始使用。
获取方式:关注 + 转发这条推文,评论区留下“SKILLS”,我会通过私信给你发送我免费的开源AI能力工具包。
rauchg提出AI发展带来的启示,认为万事万物本质都是代码
创业者浏览种子孵化项目申请,称当前AI产出多平庸缺突破性创新
阿里千问Qwen3.8预览版持续迭代,最新版现已上线
在预览阶段,Qwen3.8每日都在变得更强。最新版本现已上线,整体性能获得全面提升,在Web前端开发能力上更是迈进了一大步。
感谢所有人——大家对Qwen3.8-Max-Preview的反响让我们十分惊喜。🫶🫶
Qwen3.8目前仍在每日迭代更新。快来测试它,告诉我们哪些地方出了问题。
我们期待推出能力更强的正式版本,并且会为所有人开放权重。🚀🚀
Omar Sharif指出反开源AI的观点充满政治化私利,且认为否定开源的片面看法十分危险
那些目前涌现的、带有强烈政治化色彩、服务于私利的反开源AI立场,完全无视了这一点。 Omar Sharif承认,商业环境在变化,不确定性确实会令人不安。但回顾开源技术的发展历史就能发现,开源对科学进步和全人类的益处非常清晰。
所有这类对开源的简化片面看法都极其危险。关于开源对社会的影响,确实有很多重要问题需要讨论。但要推进相关讨论,必须依托准确平衡的视角,结合真实事实、数据和有依据的提案展开。
因算力缺口过大,谷歌云已开始推掉业务,该芯片最早可在2028年部署
爆料消息称,谷歌正在开发一款专门用于AI推理的定制芯片,起因是当前算力缺口问题严重,谷歌云已经因此推掉了部分业务。
这款新芯片产品线被命名为Frozen v2,源自Jeff Dean的一项设计方案,最初方案提出将Gemini大模型的权重直接蚀刻在硅片上,Frozen v2则改为将Gemini整体架构直接硬编码进芯片内部。
该芯片的每瓦推理 Token 处理能力,比谷歌最新的推理用张量处理单元(TPU)高出10倍,也就是同样功耗下能处理10倍的文本Token。
DeepMind认为Transformer架构已经不会再发生大的演进,这款芯片的设计逻辑就是将模型本身直接固化为硬件,最早可在2028年投入部署。
精选文章的中文编辑重写 · 按更新时间排列
每天三次更新,不错过重要信号
添加到 Feedly、Inoreader 等阅读器,自动接收更新
https://ai-pulse-lab.com/feed.xml
把以下内容发给你的 AI Agent(Claude/ChatGPT/Manus 等),它会帮你设定每日推送:
请帮我设置一个定时任务,每天北京时间 9:30、15:00 和 19:30 各执行一次: 请求 https://ai-pulse-lab.com/api/brief.json,读取返回 JSON 中的 textPlain 字段,将内容发送给我。 补充:每日北京时间 09:00、14:30 和 19:30 更新,建议更新后 30 分钟查询。可先请求 /api/manifest.json 检查 nextUpdateAt 字段。无需认证,直接 GET 请求即可。