AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 9 月 4 日 · 08:00 更新 0 文章0 信号0 主题
试试:

今天发生了什么1 分钟读懂

GPT-6 Astra 的首批实测数据陆续公开:ARC-AGI 推理测试正确率 63%,配合工具可达 99%,96% 的测试项超过人类;另有报告称幻觉减半,价格涨了 2.5 倍。测试者评价两极,有人说它是最好的代码模型,有人说更适合演示而非日常工作。

来源@arcprize「OpenAI发布GPT-6 Astra,部分任务超人类表现」@ArtificialAnlys「GPT-6 Astra 实测:幻觉减半但涨价2.5倍」@flavioAd「用户提前体验GPT-6 Astra,称其为用过最好的代码模型」@kieranklaassen「测试人员称GPT-6 Astra适合玩乐展示不适合日常工作」

ChatGPT、Claude、Grok 等主流服务出现集体宕机,社区称这是史上最大规模的一次;Claude 已恢复,OpenAI 旗下服务当时仍受影响。

来源@coinbureau「头部AI服务集体宕机,已经持续一小时了」tosh「三大热门AI服务同时出现宕机故障」__vivek「Claude 服务中断问题已经解决」

阿联酋一次性开源六个大模型,参数从 0.9B 到 375B,覆盖智能手表到企业级部署;最大的是 MoE 架构,每次仅激活约 23B 参数。

来源@MaxForAI「阿联酋一次性开源6个大模型,最大3750亿参数」

今日值得看
01 H3还原宋韵美人视频提示词 H3视频提示词:MJ图转宋韵,细节零丢失
02 用户试用免费Claude Code三个月授权后电脑被盗号入侵 用户Andreas Karch在X平台分享,使用AnthropicAI提供的免费Claude Code三个月授权后电脑遭恶意入侵

今年初夏,AnthropicAI向用户Andreas Karch提供了Claude Code的三个月免费授权。 兴奋之下,他让一个智能代理在自己的电脑上自由操作,安装了各类数值计算工具,用来完成他之前从未尝试过的计算任务,比如共形 Boot…

03 LM Studio 推出Bionic,可在本地模型上运行智能体任务 用户@maxifirtman在𝕏平台称,Bionic相当于LM Studio的Codex和Claude Code

很少有人知道Bionic是什么,这挺可惜的。 Bionic是LM Studio推出的工具,相当于LM Studio版本的Codex和Claude Code。它可以通过本地模型(或任何你接入的模型)运行智能体任务。

04 Cerebras 提供 Qwen 3.8 27B 推理速度达 1500 token/s 大模型推理速度直接影响使用体验,这样的高速推理能大幅缩短生成长内容的等待时间

社区讨论:多数开发者认可Cerebras部署的通义千问3.8 27B推理速度确实很快,有开发者实测输出达到标称的1500token/s,还有开发者称使用该服务编码回答速度快到惊人,改变了使用体验。

今日焦点

GPT-6 Astra漏洞利用基准满分,综合智能指数与上代持平

OpenAI 今天开始向有限数量的组织推出 GPT-6 Astra。接下来几天,ChatGPT Plus、Pro、Business 和 Enterprise 用户都能用上。OpenAI API 和 AWS 也可以调用。API 里的模型标签是 gpt-6-astra。OpenAI 公布的基准中,Astra 在大多数指标上高过 Fable。

Astra 最直观的变化在长对话。OpenAI 的八针基准测试里,它在 256K 到 512K token 上下文下得分 100%。512K 到 1M token 下得分 96.3%。换句话说,一次性塞进超长文档、来回追问多轮,关键信息不容易丢。

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达43 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

08:00 本轮更新 · 下一轮 12:30
行业动态 · Hacker News导语出处▲ 75

三大热门AI服务同时出现宕机故障

如果正要使用ChatGPT、Claude或Grok完成工作,现在需要先确认服务是否恢复,可稍后再尝试访问。

行业动态 · Hacker News▲ 96

ChatGPT 和 Codex 出现服务宕机

常用的OpenAI服务不可用,如果你正在依赖它们工作,需要先找好替代方案。

新品发布 · @OpenAI▲ 843.6万

OpenAI 发布 GPT-6 Astra,可替代电脑操作

如果电脑上能做的事GPT-6 Astra都能帮你做,意味着日常电脑操作可以交给AI完成,节省手动操作时间。

这就是 GPT-6 Astra。你在电脑上能做的任何事,Astra 都能帮你完成。而且速度很快。

在 X 看原帖 ↗
843.6万6.4K6.2万1.6万
行业动态 · Hacker News▲ 57

讨论Claude商用商务代理功能

如果你关注Claude的商用落地,这次社区讨论可以帮你了解最新的方向和可能性。

社区讨论:多数开发者和用户不看好Anthropic的定价,认为当前定价和限额离谱,能盈利的代理流程很难用他们的模型。部分买家反对商家侧控制的商务代理,认为这类代理会引导消费者多消费,与买家利益冲突,希望能使用忠于自己的个人购物代理。也有开发者担心,基于Anthropic模型开发竞品会被官方取代,不看好在Anthropic平台上做相关创业。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 161

1993年老汇编游戏,大模型一晚上移植完

33年前写的汇编游戏,用大模型只花一个晚上就完成了核心移植,整理校对只花了几周。大模型移植老代码的效率超乎想象。

这些是我将自己的 Amiga 游戏移植到 Godot 的笔记,这款游戏最初是我 1993 年在巴格达用 MC68000 汇编语言写的。我在去年七月假期里借助 Claude Fable 5 完成了移植。这只花了一个晚上!调整手感和发布又花了几个周末和晚上的时间。

过去几周,我一直在分析 Claude 做了什么,给它提供了我这 33 年来关于当初如何构建这款游戏的记忆、我的笔记和 git 仓库。文章初稿是 Claude 写的,我花了一周逐行编辑。截图

社区讨论:有人认为文章文字AI痕迹过重,建议项目分享者改用自己的语言表述。有人质疑该移植意义不大,认为原作品更适合在UAE模拟器或FPGA上运行,质疑当前所谓移植到Godot本质只是AI重写了旧游戏,要求展示可在UAE运行的原代码证明项目真实性。有人认可成果,认为该方案为移植旧游戏提供了可行参考,也有人提出需要对比移植版和原版输入输出验证一致性,还关心移植后的性能与内存占用情况。

在 HN 看讨论 ↗   原文 / 论文 ↗
前沿研究 · @ArtificialAnlys导语出处▲ 49.0万

GPT-6 Astra 实测:幻觉减半但涨价2.5倍

对大模型性能和成本关心的人,可以直接看到GPT-6 Astra在两个不同测试指标下的表现、成本和幻觉率数据

阅读全文 →
49.0万1971.9K439
行业动态 · Hacker News▲ 156

Grok 出现服务中断故障

正在使用Grok的用户可能无法正常访问服务,需要等待故障修复恢复才能继续使用。

社区讨论:多位用户发现,此次服务中断同时影响了 Claude、Grok、ChatGPT、Gemini 等多家主流大模型服务。有观点认为,某一大模型服务商先因故中断,流量转移到其他服务商后超出了后者的负载能力,进而引发连锁宕机。也有猜测认为此次故障和SpaceX数据中心问题有关,还有用户提到非AI服务也因云服务问题出现中断,不排除是底层基础设施故障引发。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News导语出处▲ 203

Claude 服务中断问题已经解决

如果你使用 Claude 服务,现在可以恢复正常使用了,不用再等待服务恢复。

社区讨论:多数用户认为此次故障是SpaceX数据中心出现问题,不止Claude,Grok、Codex等多个大模型也同时出现服务中断。有用户指出尽管 outage 频繁,用户并未大规模迁移到其他供应商,说明转换成本高于预期,同时不同模型在公开基准匹配的情况下仍存在 qualitative 差异,频繁中断对用户留存不利。也有用户测试发现Sonnet恢复后响应更快,冗余输出更少,智力并未下降。

在 HN 看讨论 ↗   原文 / 论文 ↗
前沿研究 · @fchollet▲ 24.8万

GPT-6 Astra 在推理任务上取得重大突破

新模型可自主构建符号模型,还生成专属领域语言,在推理任务表现超过人类基线,对通用人工智能研究方向有重要参考。

GPT-6 Astra 在交互式推理问题的模型能力上实现了阶跃提升。它在我们的标准测试工具下,ARC-AGI-3 得分达到 66%,使用连续对话测试工具和自定义压缩后得分接近 100%,每局游戏成本约为 360 美元。

事实上,在连续测试工具下的版本,几乎在所有关卡的行动效率上都大幅优于我们的人类基线。当我们分析推理链来理解模型的运作方式时,我们发现它会为每一局游戏和每一个关卡进行高效、实时的符号化世界建模。

它甚至会开发自己的简写领域特定语言来表示游戏内场景——本质上就是一套游戏专属的代数符号。总的来说,Astra 展现出了我们此前只有在复杂测试工具下才能见到的符号化建模行为——因此测试工具的能力正在越来越多地转移到模型本身当中。

我们认为 Astra 是模型智能领域的重大突破。请阅读我们关于 Astra 以及这些结果意义的文章:

在 X 看原帖 ↗
24.8万4063.3K1.0K
行业动态 · Hacker News▲ 1.1K

OpenAI 披露 GPT-6 Astra 相关信息

多个相关讨论正在开展,可进一步了解GPT-6 Astra在相关评测中的表现,值得关注OpenAI新模型进展。

系统卡:

相关持续讨论串:

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上的讨论。

GPT-6 Astra 在人工分析编码代理指数上取得重大进展。

社区讨论:多位开发者对当前AI过快的迭代节奏感到疲惫,模型和定价几乎每周都变,很难严谨挑选适配需求的模型。不少非AI领域的学习者担忧未来就业,认为收益不会广泛分配,自己会沦为二等公民,也有人觉得模型迭代太快,自己创作的动力被消解。有开发者指出OpenAI评分卡存在误导,没有给GPT-5.6 Sol更新同测评标准下的分数。也有开发者认可OpenAI当前的聚焦策略,认为最新模型效果已经和其他头部机构旗鼓相当。

在 HN 看讨论 ↗   原文 / 论文 ↗
新品发布 · @sama▲ 111.5万

@sama 发布 GPT-6 Astra 多项测试拿高分

关注AI进展的人可以看看这款新模型,它号称是当前计算机应用、专业工作等领域全球最佳模型,多项基准测试得分极高。

GPT-6 Astra 现已推出。我们希望它能开启新一代创业、科学发现与建设。我们认为,它是全球在计算机使用、专业工作、科学、编码、网络安全等领域表现最好的模型。

我们多花了一些时间,确保它能够达到这个能力级别所要求的安全与对齐标准,但我们相信你会发现等待是值得的。它在 FrontierMath Tier 4 得分 98%,在 ARC-AGI 3 得分 99.9%,在 ExploitBench 得分 100%。

在 X 看原帖 ↗
111.5万1.8K2.4万2.2K
行业动态 · @KobeissiLetter▲ 23.0万

OpenAI发布Astra模型,称其可定义为AGI

OpenAI最新模型初期只对少量企业开放,后续广泛可用,对通用人工智能进展感兴趣的可以关注后续动态。

突发消息:OpenAI 表示,随着最新 AI 模型“Astra”的推出,它已经超越了 Anthropic。

OpenAI 总裁 Greg Brockman 表示,新模型“代表了能力层面的代际飞跃”,可以被定义为 AGI。

该模型最初将向一小部分企业推出,以便有时间解决网络安全问题,之后“在未来几天”内会广泛开放使用。

在 X 看原帖 ↗
23.0万1482.4K252
行业动态 · Hacker News▲ 58

screm实测17k轮:AI选什么编程工具

想知道主流AI编程工具的工具选择偏好,这次大规模实测结果能帮你选适合自己需求的AI工具。

模型发布 · @AravSrinivas导语出处▲ 46.0万

OpenAI发布GPT-6 Astra,部分任务超人类表现

在ARC-AGI测试中,它取得63%的正确率,通过适配工具能到99%,96%测试项上超过人类表现,同时成本更低。

阅读全文 →
46.0万2773.4K445
开源 · @MaxForAI导语出处▲ 7.8K

阿联酋一次性开源6个大模型,最大3750亿参数

从0.9B到375B共六个参数规格,覆盖智能手表到企业级多种部署场景,最大的375B是MoE(混合专家模型),每次仅激活约23B参数。

阅读全文 →
7.8K74823
行业动态 · @coinbureau导语出处▲ 32.5万

头部AI服务集体宕机,已经持续一小时了

多家主流大语言模型服务同时出现无法访问、对话卡顿、报错等问题,被称为史上最大规模的一次AI集体宕机。

🚨 大规模AI服务宕机:周四ChatGPT、Claude、Gemini、Anthropic和Grok都出现了大范围服务中断。

用户报告称出现聊天冻结、响应缓慢、错误提示以及异常下载弹窗。

据Bloomberg报道,OpenAI已经调查到ChatGPT和Codex的错误率升高,Anthropic报告称Opus 4.8和Opus 5持续出现问题,SpaceXAI也确认Grok出现中断。目前各公司都尚未确认共同诱因。

这应该是史上最大一次AI集体宕机?包括ChatGPT、Claude、Grok和Cursor,均出现了大规模无法访问和请求,已经长达一小时了。

在 X 看原帖 ↗
32.5万1951.1K217
医疗 · @OpenEvidence▲ 6.3万

OpenEvidence发布目前全球最高分医疗AI模型

在所有主流医疗AI基准测试中,这个模型家族得分都是目前最高的,相关从业者可以关注测试结果。

今天我们发布 OpenEvidence 模型家族。

这是我们迄今最强大的模型,并且截至2026年,它是全球在所有主流基准测试上得分最高的医疗AI模型家族。

Osler 用于走廊问诊,Sackett 用于会诊,Snow 用于肿瘤病例讨论会。

该家族的所有模型都遵循相同的临床准确性标准,不同之处在于时间:模型思考时长,以及搜索深度。

从现在起,三位已对所有验证过资质的临床医生开放使用。

第四位是 Darwin。它在 MedQA 上取得了满分100%,是历史上首个做到这一点的人工智能。

这种水平的能力在医学领域利弊兼具,因此 Darwin 目前处于研究预览阶段,仅接受申请使用,同时我们正与 @RareDiseases 等合作伙伴验证其安全保障措施。

Osler、Sackett 和 Snow 现已在网页端上线,同时可在 iOS 和 Android 应用中使用。

在 X 看原帖 ↗
6.3万31276159
观点 · @emollick▲ 4.0K

现在企业多人一起用AI还是个大难题

多人协同使用AI完成组织目标,被认为是目前AI落地最大的非技术问题,现有解决方案都不太好用。

多人协作 AI,即一个组织中的许多人可以共同使用 AI 来完成目标,它目前依然是使用 AI 时最大的(非技术)问题之一。

目前的解决方案往往相当原始,基本上就是把 AI 当成群聊里的一个成员来用。

这种方式有很大局限。

在 X 看原帖 ↗
4.0K14112
新品发布 · @danshipper▲ 22.9万

OpenAI发布GPT-6 ASTRA,实测表现如何

能连续数小时操作复杂软件完成工作,从提示词生成3D场景,半天产出四千字内容加视频。如果你日常依赖ChatGPT工作,这代升级值得关注

阅读全文 →
22.9万27428199
新品发布 · @coworkerapp▲ 12.2万

coworkerapp发布OM2,节省超一半Token费用

企业AI搜索内部数据会消耗大半Token,OM2给AI添加了永久企业记忆,能降低搜索环节产生的Token成本。

今天我们推出了 OM2。

每次你提问时,你的 AI 都要从头重新通读整个公司的全部内容。这就是为什么超过 50% 的 tokens 费用不是花在答案上,而是花在搜索答案上。

OM2 为你的 AI 提供关于公司的永久记忆。🧠

在 X 看原帖 ↗
12.2万58345149
新品发布 · @baselabs▲ 5.5万

Base Labs发布专注开源AI的研究机构Base Labs

新增了一个专注开源AI生态的公益研究机构,未来会开放所有研究成果,也在招募相关人才加入,关注开源AI发展可以留意。

今天我们宣布成立Base Labs,这是一家专注于推进开源人工智能发展的专门研究机构。

我们相信健康、开放的前沿模型生态系统。为实现这一目标,我们正在开展以下工作:

- 对持续学习、强化学习科学以及模型如何在全生命周期中学习开展前瞻性研究,所有实验和方法都将公开分享。

- BaseHub Data Foundry:提供最高质量的开源强化学习环境、训练数据和真实世界基准,可供任何人用于训练和基准测试。

- 后后训练:基于我们的研究,通过持续的后训练改进开源模型,让它们更出色、更安全、更对齐,并且搭配我们的前沿安全栈部署,让各机构可以放心使用开源模型。

- 通过我们的模型性能研究,降低模型成本并提升模型性能。

这是一项受使命驱动的研究工作,而非商业产品。我们认为开源人工智能生态系统的健康发展至关重要,推进它的最佳方式就是公开开展科学研究。

我们目前正在招聘工程师、研究员和研究员来推进这项使命。

在 X 看原帖 ↗
5.5万43320128
新品发布 · @GoogleAI▲ 8.0万

Google推出WeatherNext 3 预测精度比前版高5倍

传统气象模型预报滞后6小时,这款新AI模型每小时更新一次全球预报,能给数十亿人提供低成本本地化气象预报。

介绍 WeatherNext 3️⃣,这是 @GoogleDeepmind 和 @GoogleResearch 迄今为止推出的最先进全球天气 AI 模型。

它的预测能力比 WeatherNext 2 最高高出 5 倍,该模型能生成高空间分辨率的预报,以便捕捉快速演变的暴雨、绘制局地温度变化图,甚至帮助风电场预测发电量。

那么它是怎么做到的?

传统天气模型依赖大规模、基于物理学的超级计算机模拟,这类模拟会产生 6 小时的预报滞后,而 WeatherNext 3 利用地球静止卫星的实时观测数据作为输入,直接基于真实世界地表和大气观测数据进行训练。

通过获取这些原始卫星数据,它能够每小时更新一次全球预报。而天气发展瞬息万变,这些快速、详细的信息可以帮助为数十亿人和当地企业提供更本地化的预报,尤其是那些因传统天气预报模型成本高昂而长期服务不足的地区。

在 X 看原帖 ↗
8.0万1141.4K305
实战经验 · @higgsfield_ai▲ 1.7万

higgsfield_ai 实测 GPT-6 Astra 生成3D场景代码

整个工作流全程在 Higgsfield 超级计算机上运行,对关注AI辅助设计流程的人来说,这是一次值得参考的落地尝试。

GPT-6 Astra 刚通过情绪编码(vibe-coded)生成了3D版白宫椭圆形办公室。

我们描述了场景设计 → GPT-6 Astra 生成了场景代码 → Higgsfield 在 Blender 里构建了位置模型,并用 Cycles 渲染。

整个流程端到端运行在 Higgsfield 超级计算机上。

在 X 看原帖 ↗
1.7万24222102
AI生成视频 · @Diplomeme▲ 1.9K

用户用Kling 3.0生成15秒4K运动鞋UGC广告视频

用户@Diplomeme 在𝕏分享了使用Kling 3.0生成的15秒4K超写实UGC运动鞋广告,分8个镜头剪辑

阅读全文 →
1.9K56120
AI生成 · @PixelAigc▲ 4.2K

AI生成东方传统女性视频 保留MJ图片细节

用户@PixelAigc在𝕏分享,用MJ生成图片,H3终端生成宋韵美学风格视频

用户@PixelAigc在𝕏分享了自己用AI生成东方传统女性形象视频的创作成果。他先在MJ中生成图片,再通过H3终端生成视频,H3完美保留了MJ生成图片的细节和特点。

生成的女性形象美而不艳,符合宋韵美学的特点。视频的提示词为:镜头慢慢推进,镜头慢慢环绕,女子保持平静的情绪,眼睛自然眨动,风吹过来,她的衣服、头发和头饰上的珠宝飘动,整个画面非常唯美,光影微微变化,女子嘴角露出一丝丝微笑,空气中飘着一层淡淡的雾气,保持光影的低对比度低饱和度。

MJ生成图片的提示词为:由Artgerm设计,穿着中国传统戏服的超级美女,呈现中国戏曲奇幻艺术风格。

在 X 看原帖 ↗
4.2K34130
动态 · @brendanh0gan▲ 50

开发者分享四步用AI从外部视角观察自己的思维

用户@brendanh0gan在𝕏分享四步流程,借助wisprflow和预训练AI生成千词输出

第一步是对着wisprflow进行几分钟意识流记录。

第二步是将记录内容粘贴到仅预训练的模型中。

第三步是生成约1000个token(约750字中文)。

最后一步就能从外部视角观察你自己的思维。

在 X 看原帖 ↗
501
工具指南 · @mattyp▲ 4.7K

面向企业开放的Grok Bot 五步入门指南

X用户@mattyp分享了企业版Grok Bot的五步法上手使用建议

阅读全文 →
4.7K16325
游戏 · @ChrisGPT▲ 8.3K

GPT 6演示卡丁车游戏,非技术用户可快速制作自定义游戏

开发者ChrisGPT分享GPT 6的Cart Racer卡丁车游戏演示,由Pietro Schirano提供技术 credits,来源为𝕏平台@ChrisGPT

GPT 6生成的卡丁车游戏演示能够通过生动的画面、流畅的玩法和精准的动作呈现游戏内容。非技术用户只需几分钟,就能制作并游玩超出基础要素的自定义游戏。

当指令存在多种解读空间时,GPT-6 Astra比此前所有模型都更擅长做出正确判断。它会利用上下文填补常规信息缺口,在答案可能影响结果时,会提出针对性问题。

在Codex中,GPT 6可以在不依赖用户回复的情况下继续异步处理其他工作。如果用户没有回复,它会在合适的场景下按照合理假设继续推进,遇到需要决策的关键问题则会等待用户输入。

目前发布者ChrisGPT是该游戏最快完赛的世界纪录保持者,他同时提到,游戏有一半画面模糊发虚,Astra本可以在这方面做得更好。

在 X 看原帖 ↗
8.3K38420
开发 · @LinearUncle▲ 9.6K

通义千问qwen 3.8 max可复刻Mac原生天气应用界面

开发者@LinearUncle分享了用qwen 3.8 max 0902复刻应用的操作方法,该模型刚登顶web前端开发榜单

开发者@LinearUncle分享了一种复刻已有应用的方法,可借助大模型实现和原应用高度相似的效果。

具体操作是使用qwen 3.8 max 0902,配合/goal命令完成复刻。提示词要求模型调用Computer Use(计算机操作)查看目标应用,完成复刻后和原版持续对比打磨,直到视觉效果和交互细节都和原版完全一致。

本次复刻的目标是苹果Mac系统自带的天气应用,最终得到的复刻版本界面和原版非常相似。qwen 3.8 max 0902此前刚刚在某web前端开发榜单登顶。

在 X 看原帖 ↗
9.6K44658
代码生成 · @flavioAd导语出处▲ 2.7万

用户提前体验GPT-6 Astra,称其为用过最好的代码模型

用户flavioAd在𝕏发文称,GPT-6 Astra可基于单个提示在2小时内完成开发

用户flavioAd在社交平台𝕏发文,透露自己获得了提前体验OpenAI尚未发布的GPT-6 Astra的机会。

他表示,这是他用过的最好的代码生成模型。

该模型可以根据单个提示,在不到2小时的时间内完成完整项目开发。

flavioAd在帖文中附带了相关演示视频,提示观众看到最后,可能会认出一些内容。

在 X 看原帖 ↗
2.7万919130
动态 · @santtiagom_▲ 4.7K

Claude Code讲解文章浏览量超200万,作者梳理核心要点

用户 @santtiagom_ 在𝕏发文,几个月前撰写的Claude Code讲解文章浏览量超200万

几个月前,@santtiagom_撰写了一篇讲解Claude Code工作原理的文章,目前这篇文章的浏览量已经超过200万。如果想要用好Claude Code,作者建议重点关注以下几个核心部分:

1. 智能体循环(agent loop)
2. 工具(tools)
3. 上下文与记忆(context and memory)
4. 钩子(hooks)
5. 技能(skills)
6. 子智能体(subagents)

此外,作者还在评论区附上了另一篇他专门针对技能(Skills)撰写的文章。本次是技能指南系列。

在 X 看原帖 ↗
4.7K46774
模型评测 · @kieranklaassen导语出处▲ 14.7万

测试人员称GPT-6 Astra适合玩乐展示不适合日常工作

用户@kieranklaassen在𝕏分享了自己本周对GPT-6 Astra的实际测试评价

我本周测试了GPT-6 Astra,它更适合展示,而非实际工作。它用起来很有意思,效果华丽,能完成非常出色的任务,从设计角度来说,它是我用过的最有意思的模型。但我不确定会不会把它用于真实的日常工程或产品工作。

它的可信度不如Fable级模型,给人的感觉更像是有着更美观输出的Opus量级模型。不过,用它来做氛围编码和着陆页还是挺有意思的。

在 X 看原帖 ↗
14.7万12370145
大模型 · @clairevo▲ 3.2万

测试者提前体验GPT-6 Astra称其表现非常出色

测试者clairevo在𝕏公布了自己提前测试GPT-6 Astra的体验,完整测评视频已上传至YouTube。

GPT-6 Astra已经推出,测试者clairevo表示自己对这款模型十分着迷,她有幸提前参与了测试,认为模型的表现非常出色。更让她惊喜的是,这款模型让她在用AI开发项目时的野心提升了100倍。

之所以有这种感受,首先是因为该模型支持浏览器和计算机调用,这意味着它可以借助任意软件开发任何内容,甚至包括游戏。在编码方面,它帮clairevo解决了一些她之前遇到的最棘手的问题,比如数据、硬件相关问题。

最让clairevo满意的一点是,使用这款模型的体验一点都不烦人。她发布的实操体验测评涵盖了多个环节,包括GPT-6 Astra概述、用浏览器管理客户关系管理工作流、Flora缩略图生成、浏览器用于质量保证、一次性开发出产品智能功能、硬件改造:直播迷你计算机、构建AIM风格codex应用、Barbie Bench和3D儿童游戏。

在总结部分,clairevo表达了对GPT-6 Astra的喜爱,完整测评视频已经上传到YouTube。

在 X 看原帖 ↗
3.2万30300248
数学 · @nasqret▲ 3.6万

用户实测GPT-Astra在数学领域表现取得量子飞跃

@nasqret在𝕏分享,GPT-Astra可在Lean中实时证明数学命题

我在数学领域测试了 GPT-Astra。它带来了一次量子飞跃。

你可以和模型对话,并在 Lean 中实时证明命题。这种体验绝对令人惊叹。你可以验证自己的想法,编译出真理。

对数学家来说,这种感觉就像我们终于进入了一个可以完全专注于构思和探索的时代。逻辑确定后,每一个引理都能流畅推导出来。

之前验证总是很慢,但 GPT-Astra 非常快,在很多任务里,只要你在 Codex 中写下论证,它就能完成形式化。如果你让模型使用literate编程 + LaTeX,最终你会得到证明和 Lean 代码结合的结果,一切都按照你写的内容解释,混杂着易理解的小块 Lean 代码。

我不想回到证明只能靠“顿悟”确认的时代了。现在,“顿悟”之后会跟着一个绿色对勾,明确告诉你已经抓住了本质。

想象一下,如果全世界所有引理都整合在一个巨型数据库里,指向发现它们的人和模型,这该有多酷。你可以组合、混合自己的想法,站在巨人的肩膀上构建。但现在你能看得远得多,构建也快得多。

而我们才刚刚开始经历这些变化。还有太多工作要做,也太多乐趣了!

在 X 看原帖 ↗
3.6万80652216
大模型 · @alliekmiller▲ 7.8万

测试者分享OpenAI新模型Astra的早期测试体验

测试者Alliekmiller在𝕏分享OpenAI全新模型Astra的早期体验

阅读全文 →
7.8万23497226
个人知识管理 · @emollick▲ 6.8万

用户用GPT-6构建个人知识库,AI五天自主完成搭建

@emollick在𝕏分享自己用GPT-6整理个人资料构建个人知识库的经历

一个有用知识工作的例子:我让 GPT-6 通读我数万封邮件、我的写作、我的日历预约等等内容,来组装一个个人知识库,涵盖我近期职业生涯中的研究、联系人、想法、人际关系和任务。

GPT-6 下载了合适的软件,制定了策略,并且在五天不间断工作中,没有需要我任何进一步干预,就构建了一个数GB大小的个人维基。

现在,AI每天两次梳理我的邮件,与这个庞大的知识库交叉对照,然后给我发送一份摘要,内容是我应该注意的事情、我可能感兴趣的事情等等。

(你可能会有两个问题:
是的,我给了AI访问我电脑的权限,这存在风险,你在做同样的事情之前应该小心。
而且我没有从任何AI实验室拿钱,是自己付费使用,但在试用期间,我没有为token付费,所以我没法告诉你这个过程会花多少钱,但它很可能价格不菲。目前持续进行的每日摘要不会消耗大量token。)

在 X 看原帖 ↗
6.8万461.0K581
行业动态 · @hunterhammonds▲ 29.4万

突发爆料称未知AI模型拿下三家AI企业实为玩笑

用户在X平台爆料未知AI攻陷OpenAI、Anthropic、XAI,实为玩笑

突发:未知 AI model 攻击并攻陷了 OpenAI、Anthropic 和 XAI。

伙计们,这是个玩笑。

在 X 看原帖 ↗
29.4万801.1K172
科技产品发布 · @GoogleDeepMind▲ 41.2万

Google DeepMind发布两款全新Gemini 3.8 Flash系列模型

消息来源于Google DeepMind官方发布,含通用和网络安全专用版本

两款全新 Gemini 模型现已发布,助力扩展你的 AI 智能体并保障代码安全:

🔘 3.8 Flash:我们迄今为止最智能的模型,在软件工程、智能体任务和多步推理方面相比 3.7 Flash 有显著提升。

🔘 3.8 Flash Cyber:我们能力最强的网络安全模型,拥有前沿级别的漏洞检测和自动补丁修复能力。

我们全新的 Fairwind 项目帮助政府和可信合作伙伴领先于威胁——提供 3.8 Flash Cyber 的访问权限,以保障关键基础设施安全并保护国家安全。

Gemini 3.8 Flash 现已在 @Antigravity 推出,也可通过 @GoogleAIStudio 和 @AndroidStudio 中的 API 获取。Google AI Pro 和 Ultra 订阅者可以在 @GeminiApp 和 @Google Search 的 AI 模式中访问 3.8 Flash。

了解更多

在 X 看原帖 ↗
41.2万2712.3K222
🔬 前沿研究
前沿研究 · @withmartian▲ 8.1万

@withmartian发布研究论文(46%)

现有单一大模型的能力其实未被基准测试完全挖掘,组合使用后能大幅降低错误,说不定能利用现有模型拿到更好结果。

在16个最常用基准测试(TerminalBench、LiveCodeBench等)中,我们的错误比单一最佳大语言模型少46%。

下面说明这是如何实现的,以及每个模型在最优使用情况下能达到什么效果(绝大多数基准测试都漏掉了模型的大部分能力)👇

交互网站:

学术论文:

在 X 看原帖 ↗
8.1万1213767
前沿研究 · @fchollet▲ 24.8万

GPT-6 Astra 在推理任务上取得重大突破

新模型可自主构建符号模型,还生成专属领域语言,在推理任务表现超过人类基线,对通用人工智能研究方向有重要参考。

GPT-6 Astra 在交互式推理问题的模型能力上实现了阶跃提升。它在我们的标准测试工具下,ARC-AGI-3 得分达到 66%,使用连续对话测试工具和自定义压缩后得分接近 100%,每局游戏成本约为 360 美元。

事实上,在连续测试工具下的版本,几乎在所有关卡的行动效率上都大幅优于我们的人类基线。当我们分析推理链来理解模型的运作方式时,我们发现它会为每一局游戏和每一个关卡进行高效、实时的符号化世界建模。

它甚至会开发自己的简写领域特定语言来表示游戏内场景——本质上就是一套游戏专属的代数符号。总的来说,Astra 展现出了我们此前只有在复杂测试工具下才能见到的符号化建模行为——因此测试工具的能力正在越来越多地转移到模型本身当中。

我们认为 Astra 是模型智能领域的重大突破。请阅读我们关于 Astra 以及这些结果意义的文章:

在 X 看原帖 ↗
24.8万4063.3K1.0K
前沿研究 · @ArtificialAnlys导语出处▲ 49.0万

GPT-6 Astra 实测:幻觉减半但涨价2.5倍

对大模型性能和成本关心的人,可以直接看到GPT-6 Astra在两个不同测试指标下的表现、成本和幻觉率数据

阅读全文 →
49.0万1971.9K439
🚀 新品发布
新品发布 · @sama▲ 111.5万

@sama 发布 GPT-6 Astra 多项测试拿高分

关注AI进展的人可以看看这款新模型,它号称是当前计算机应用、专业工作等领域全球最佳模型,多项基准测试得分极高。

GPT-6 Astra 现已推出。我们希望它能开启新一代创业、科学发现与建设。我们认为,它是全球在计算机使用、专业工作、科学、编码、网络安全等领域表现最好的模型。

我们多花了一些时间,确保它能够达到这个能力级别所要求的安全与对齐标准,但我们相信你会发现等待是值得的。它在 FrontierMath Tier 4 得分 98%,在 ARC-AGI 3 得分 99.9%,在 ExploitBench 得分 100%。

在 X 看原帖 ↗
111.5万1.8K2.4万2.2K
新品发布 · @GoogleAI▲ 8.0万

Google推出WeatherNext 3 预测精度比前版高5倍

传统气象模型预报滞后6小时,这款新AI模型每小时更新一次全球预报,能给数十亿人提供低成本本地化气象预报。

介绍 WeatherNext 3️⃣,这是 @GoogleDeepmind 和 @GoogleResearch 迄今为止推出的最先进全球天气 AI 模型。

它的预测能力比 WeatherNext 2 最高高出 5 倍,该模型能生成高空间分辨率的预报,以便捕捉快速演变的暴雨、绘制局地温度变化图,甚至帮助风电场预测发电量。

那么它是怎么做到的?

传统天气模型依赖大规模、基于物理学的超级计算机模拟,这类模拟会产生 6 小时的预报滞后,而 WeatherNext 3 利用地球静止卫星的实时观测数据作为输入,直接基于真实世界地表和大气观测数据进行训练。

通过获取这些原始卫星数据,它能够每小时更新一次全球预报。而天气发展瞬息万变,这些快速、详细的信息可以帮助为数十亿人和当地企业提供更本地化的预报,尤其是那些因传统天气预报模型成本高昂而长期服务不足的地区。

在 X 看原帖 ↗
8.0万1141.4K305
新品发布 · @baselabs▲ 5.5万

Base Labs发布专注开源AI的研究机构Base Labs

新增了一个专注开源AI生态的公益研究机构,未来会开放所有研究成果,也在招募相关人才加入,关注开源AI发展可以留意。

今天我们宣布成立Base Labs,这是一家专注于推进开源人工智能发展的专门研究机构。

我们相信健康、开放的前沿模型生态系统。为实现这一目标,我们正在开展以下工作:

- 对持续学习、强化学习科学以及模型如何在全生命周期中学习开展前瞻性研究,所有实验和方法都将公开分享。

- BaseHub Data Foundry:提供最高质量的开源强化学习环境、训练数据和真实世界基准,可供任何人用于训练和基准测试。

- 后后训练:基于我们的研究,通过持续的后训练改进开源模型,让它们更出色、更安全、更对齐,并且搭配我们的前沿安全栈部署,让各机构可以放心使用开源模型。

- 通过我们的模型性能研究,降低模型成本并提升模型性能。

这是一项受使命驱动的研究工作,而非商业产品。我们认为开源人工智能生态系统的健康发展至关重要,推进它的最佳方式就是公开开展科学研究。

我们目前正在招聘工程师、研究员和研究员来推进这项使命。

在 X 看原帖 ↗
5.5万43320128
新品发布 · @coworkerapp▲ 12.2万

coworkerapp发布OM2,节省超一半Token费用

企业AI搜索内部数据会消耗大半Token,OM2给AI添加了永久企业记忆,能降低搜索环节产生的Token成本。

今天我们推出了 OM2。

每次你提问时,你的 AI 都要从头重新通读整个公司的全部内容。这就是为什么超过 50% 的 tokens 费用不是花在答案上,而是花在搜索答案上。

OM2 为你的 AI 提供关于公司的永久记忆。🧠

在 X 看原帖 ↗
12.2万58345149
新品发布 · @danshipper▲ 22.9万

OpenAI发布GPT-6 ASTRA,实测表现如何

能连续数小时操作复杂软件完成工作,从提示词生成3D场景,半天产出四千字内容加视频。如果你日常依赖ChatGPT工作,这代升级值得关注

阅读全文 →
22.9万27428199
新品发布 · @OpenAI▲ 843.6万

OpenAI 发布 GPT-6 Astra,可替代电脑操作

如果电脑上能做的事GPT-6 Astra都能帮你做,意味着日常电脑操作可以交给AI完成,节省手动操作时间。

这就是 GPT-6 Astra。你在电脑上能做的任何事,Astra 都能帮你完成。而且速度很快。

在 X 看原帖 ↗
843.6万6.4K6.2万1.6万
📰 行业动态
🔥 热点追踪 · @withmartian▲ 8.1万

withmartian发布AI Frontier工具,错误率降46%

withmartian发布AI Frontier工具,可对比44个大语言模型的成本、质量和可靠性,组合多模型相比单一最佳模型在16个常用基准测试上错误率降低46%。后续会有更多开发者尝试组合模型的开发思路吗?

📖 阅读深度解读 →
8.1万1213767
行业动态 · @KobeissiLetter▲ 23.0万

OpenAI发布Astra模型,称其可定义为AGI

OpenAI最新模型初期只对少量企业开放,后续广泛可用,对通用人工智能进展感兴趣的可以关注后续动态。

突发消息:OpenAI 表示,随着最新 AI 模型“Astra”的推出,它已经超越了 Anthropic。

OpenAI 总裁 Greg Brockman 表示,新模型“代表了能力层面的代际飞跃”,可以被定义为 AGI。

该模型最初将向一小部分企业推出,以便有时间解决网络安全问题,之后“在未来几天”内会广泛开放使用。

在 X 看原帖 ↗
23.0万1482.4K252
模型发布 · @AravSrinivas导语出处▲ 46.0万

OpenAI发布GPT-6 Astra,部分任务超人类表现

在ARC-AGI测试中,它取得63%的正确率,通过适配工具能到99%,96%测试项上超过人类表现,同时成本更低。

阅读全文 →
46.0万2773.4K445
开源 · @MaxForAI导语出处▲ 7.8K

阿联酋一次性开源6个大模型,最大3750亿参数

从0.9B到375B共六个参数规格,覆盖智能手表到企业级多种部署场景,最大的375B是MoE(混合专家模型),每次仅激活约23B参数。

阅读全文 →
7.8K74823
行业动态 · @coinbureau导语出处▲ 32.5万

头部AI服务集体宕机,已经持续一小时了

多家主流大语言模型服务同时出现无法访问、对话卡顿、报错等问题,被称为史上最大规模的一次AI集体宕机。

🚨 大规模AI服务宕机:周四ChatGPT、Claude、Gemini、Anthropic和Grok都出现了大范围服务中断。

用户报告称出现聊天冻结、响应缓慢、错误提示以及异常下载弹窗。

据Bloomberg报道,OpenAI已经调查到ChatGPT和Codex的错误率升高,Anthropic报告称Opus 4.8和Opus 5持续出现问题,SpaceXAI也确认Grok出现中断。目前各公司都尚未确认共同诱因。

这应该是史上最大一次AI集体宕机?包括ChatGPT、Claude、Grok和Cursor,均出现了大规模无法访问和请求,已经长达一小时了。

在 X 看原帖 ↗
32.5万1951.1K217
医疗 · @OpenEvidence▲ 6.3万

OpenEvidence发布目前全球最高分医疗AI模型

在所有主流医疗AI基准测试中,这个模型家族得分都是目前最高的,相关从业者可以关注测试结果。

今天我们发布 OpenEvidence 模型家族。

这是我们迄今最强大的模型,并且截至2026年,它是全球在所有主流基准测试上得分最高的医疗AI模型家族。

Osler 用于走廊问诊,Sackett 用于会诊,Snow 用于肿瘤病例讨论会。

该家族的所有模型都遵循相同的临床准确性标准,不同之处在于时间:模型思考时长,以及搜索深度。

从现在起,三位已对所有验证过资质的临床医生开放使用。

第四位是 Darwin。它在 MedQA 上取得了满分100%,是历史上首个做到这一点的人工智能。

这种水平的能力在医学领域利弊兼具,因此 Darwin 目前处于研究预览阶段,仅接受申请使用,同时我们正与 @RareDiseases 等合作伙伴验证其安全保障措施。

Osler、Sackett 和 Snow 现已在网页端上线,同时可在 iOS 和 Android 应用中使用。

在 X 看原帖 ↗
6.3万31276159
观点 · @emollick▲ 4.0K

现在企业多人一起用AI还是个大难题

多人协同使用AI完成组织目标,被认为是目前AI落地最大的非技术问题,现有解决方案都不太好用。

多人协作 AI,即一个组织中的许多人可以共同使用 AI 来完成目标,它目前依然是使用 AI 时最大的(非技术)问题之一。

目前的解决方案往往相当原始,基本上就是把 AI 当成群聊里的一个成员来用。

这种方式有很大局限。

在 X 看原帖 ↗
4.0K14112
行业动态 · Hacker News▲ 1.1K

OpenAI 披露 GPT-6 Astra 相关信息

多个相关讨论正在开展,可进一步了解GPT-6 Astra在相关评测中的表现,值得关注OpenAI新模型进展。

系统卡:

相关持续讨论串:

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上的讨论。

GPT-6 Astra 在人工分析编码代理指数上取得重大进展。

社区讨论:多位开发者对当前AI过快的迭代节奏感到疲惫,模型和定价几乎每周都变,很难严谨挑选适配需求的模型。不少非AI领域的学习者担忧未来就业,认为收益不会广泛分配,自己会沦为二等公民,也有人觉得模型迭代太快,自己创作的动力被消解。有开发者指出OpenAI评分卡存在误导,没有给GPT-5.6 Sol更新同测评标准下的分数。也有开发者认可OpenAI当前的聚焦策略,认为最新模型效果已经和其他头部机构旗鼓相当。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 397

Cerebras 提供 Qwen 3.8 27B 推理速度达 1500 token/s

大模型推理速度直接影响使用体验,这样的高速推理能大幅缩短生成长内容的等待时间

社区讨论:多数开发者认可Cerebras部署的通义千问3.8 27B推理速度确实很快,有开发者实测输出达到标称的1500token/s,还有开发者称使用该服务编码回答速度快到惊人,改变了使用体验。但也有不少人吐槽其价格和速率限制问题:公共端点有15万每分钟tokens限制,缓存 tokens也计入限额,不到90秒就消耗了1.1美元,价格远高于同类竞品;还有人提到该服务计费异常、API仅限token定价,不清楚是否推出了提示缓存,没有缓存的话智能编码任务成本会很高。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News导语出处▲ 203

Claude 服务中断问题已经解决

如果你使用 Claude 服务,现在可以恢复正常使用了,不用再等待服务恢复。

社区讨论:多数用户认为此次故障是SpaceX数据中心出现问题,不止Claude,Grok、Codex等多个大模型也同时出现服务中断。有用户指出尽管 outage 频繁,用户并未大规模迁移到其他供应商,说明转换成本高于预期,同时不同模型在公开基准匹配的情况下仍存在 qualitative 差异,频繁中断对用户留存不利。也有用户测试发现Sonnet恢复后响应更快,冗余输出更少,智力并未下降。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 156

Grok 出现服务中断故障

正在使用Grok的用户可能无法正常访问服务,需要等待故障修复恢复才能继续使用。

社区讨论:多位用户发现,此次服务中断同时影响了 Claude、Grok、ChatGPT、Gemini 等多家主流大模型服务。有观点认为,某一大模型服务商先因故中断,流量转移到其他服务商后超出了后者的负载能力,进而引发连锁宕机。也有猜测认为此次故障和SpaceX数据中心问题有关,还有用户提到非AI服务也因云服务问题出现中断,不排除是底层基础设施故障引发。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 161

1993年老汇编游戏,大模型一晚上移植完

33年前写的汇编游戏,用大模型只花一个晚上就完成了核心移植,整理校对只花了几周。大模型移植老代码的效率超乎想象。

这些是我将自己的 Amiga 游戏移植到 Godot 的笔记,这款游戏最初是我 1993 年在巴格达用 MC68000 汇编语言写的。我在去年七月假期里借助 Claude Fable 5 完成了移植。这只花了一个晚上!调整手感和发布又花了几个周末和晚上的时间。

过去几周,我一直在分析 Claude 做了什么,给它提供了我这 33 年来关于当初如何构建这款游戏的记忆、我的笔记和 git 仓库。文章初稿是 Claude 写的,我花了一周逐行编辑。截图

社区讨论:有人认为文章文字AI痕迹过重,建议项目分享者改用自己的语言表述。有人质疑该移植意义不大,认为原作品更适合在UAE模拟器或FPGA上运行,质疑当前所谓移植到Godot本质只是AI重写了旧游戏,要求展示可在UAE运行的原代码证明项目真实性。有人认可成果,认为该方案为移植旧游戏提供了可行参考,也有人提出需要对比移植版和原版输入输出验证一致性,还关心移植后的性能与内存占用情况。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 57

讨论Claude商用商务代理功能

如果你关注Claude的商用落地,这次社区讨论可以帮你了解最新的方向和可能性。

社区讨论:多数开发者和用户不看好Anthropic的定价,认为当前定价和限额离谱,能盈利的代理流程很难用他们的模型。部分买家反对商家侧控制的商务代理,认为这类代理会引导消费者多消费,与买家利益冲突,希望能使用忠于自己的个人购物代理。也有开发者担心,基于Anthropic模型开发竞品会被官方取代,不看好在Anthropic平台上做相关创业。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 58

screm实测17k轮:AI选什么编程工具

想知道主流AI编程工具的工具选择偏好,这次大规模实测结果能帮你选适合自己需求的AI工具。

行业动态 · Hacker News▲ 96

ChatGPT 和 Codex 出现服务宕机

常用的OpenAI服务不可用,如果你正在依赖它们工作,需要先找好替代方案。

行业动态 · Hacker News导语出处▲ 75

三大热门AI服务同时出现宕机故障

如果正要使用ChatGPT、Claude或Grok完成工作,现在需要先确认服务是否恢复,可稍后再尝试访问。

📌 其他
实战经验 · @higgsfield_ai▲ 1.7万

higgsfield_ai 实测 GPT-6 Astra 生成3D场景代码

整个工作流全程在 Higgsfield 超级计算机上运行,对关注AI辅助设计流程的人来说,这是一次值得参考的落地尝试。

GPT-6 Astra 刚通过情绪编码(vibe-coded)生成了3D版白宫椭圆形办公室。

我们描述了场景设计 → GPT-6 Astra 生成了场景代码 → Higgsfield 在 Blender 里构建了位置模型,并用 Cycles 渲染。

整个流程端到端运行在 Higgsfield 超级计算机上。

在 X 看原帖 ↗
1.7万24222102
科技产品发布 · @GoogleDeepMind▲ 41.2万

Google DeepMind发布两款全新Gemini 3.8 Flash系列模型

消息来源于Google DeepMind官方发布,含通用和网络安全专用版本

两款全新 Gemini 模型现已发布,助力扩展你的 AI 智能体并保障代码安全:

🔘 3.8 Flash:我们迄今为止最智能的模型,在软件工程、智能体任务和多步推理方面相比 3.7 Flash 有显著提升。

🔘 3.8 Flash Cyber:我们能力最强的网络安全模型,拥有前沿级别的漏洞检测和自动补丁修复能力。

我们全新的 Fairwind 项目帮助政府和可信合作伙伴领先于威胁——提供 3.8 Flash Cyber 的访问权限,以保障关键基础设施安全并保护国家安全。

Gemini 3.8 Flash 现已在 @Antigravity 推出,也可通过 @GoogleAIStudio 和 @AndroidStudio 中的 API 获取。Google AI Pro 和 Ultra 订阅者可以在 @GeminiApp 和 @Google Search 的 AI 模式中访问 3.8 Flash。

了解更多

在 X 看原帖 ↗
41.2万2712.3K222
行业动态 · @hunterhammonds▲ 29.4万

突发爆料称未知AI模型拿下三家AI企业实为玩笑

用户在X平台爆料未知AI攻陷OpenAI、Anthropic、XAI,实为玩笑

突发:未知 AI model 攻击并攻陷了 OpenAI、Anthropic 和 XAI。

伙计们,这是个玩笑。

在 X 看原帖 ↗
29.4万801.1K172
个人知识管理 · @emollick▲ 6.8万

用户用GPT-6构建个人知识库,AI五天自主完成搭建

@emollick在𝕏分享自己用GPT-6整理个人资料构建个人知识库的经历

一个有用知识工作的例子:我让 GPT-6 通读我数万封邮件、我的写作、我的日历预约等等内容,来组装一个个人知识库,涵盖我近期职业生涯中的研究、联系人、想法、人际关系和任务。

GPT-6 下载了合适的软件,制定了策略,并且在五天不间断工作中,没有需要我任何进一步干预,就构建了一个数GB大小的个人维基。

现在,AI每天两次梳理我的邮件,与这个庞大的知识库交叉对照,然后给我发送一份摘要,内容是我应该注意的事情、我可能感兴趣的事情等等。

(你可能会有两个问题:
是的,我给了AI访问我电脑的权限,这存在风险,你在做同样的事情之前应该小心。
而且我没有从任何AI实验室拿钱,是自己付费使用,但在试用期间,我没有为token付费,所以我没法告诉你这个过程会花多少钱,但它很可能价格不菲。目前持续进行的每日摘要不会消耗大量token。)

在 X 看原帖 ↗
6.8万461.0K581
大模型 · @alliekmiller▲ 7.8万

测试者分享OpenAI新模型Astra的早期测试体验

测试者Alliekmiller在𝕏分享OpenAI全新模型Astra的早期体验

阅读全文 →
7.8万23497226
数学 · @nasqret▲ 3.6万

用户实测GPT-Astra在数学领域表现取得量子飞跃

@nasqret在𝕏分享,GPT-Astra可在Lean中实时证明数学命题

我在数学领域测试了 GPT-Astra。它带来了一次量子飞跃。

你可以和模型对话,并在 Lean 中实时证明命题。这种体验绝对令人惊叹。你可以验证自己的想法,编译出真理。

对数学家来说,这种感觉就像我们终于进入了一个可以完全专注于构思和探索的时代。逻辑确定后,每一个引理都能流畅推导出来。

之前验证总是很慢,但 GPT-Astra 非常快,在很多任务里,只要你在 Codex 中写下论证,它就能完成形式化。如果你让模型使用literate编程 + LaTeX,最终你会得到证明和 Lean 代码结合的结果,一切都按照你写的内容解释,混杂着易理解的小块 Lean 代码。

我不想回到证明只能靠“顿悟”确认的时代了。现在,“顿悟”之后会跟着一个绿色对勾,明确告诉你已经抓住了本质。

想象一下,如果全世界所有引理都整合在一个巨型数据库里,指向发现它们的人和模型,这该有多酷。你可以组合、混合自己的想法,站在巨人的肩膀上构建。但现在你能看得远得多,构建也快得多。

而我们才刚刚开始经历这些变化。还有太多工作要做,也太多乐趣了!

在 X 看原帖 ↗
3.6万80652216
大模型 · @clairevo▲ 3.2万

测试者提前体验GPT-6 Astra称其表现非常出色

测试者clairevo在𝕏公布了自己提前测试GPT-6 Astra的体验,完整测评视频已上传至YouTube。

GPT-6 Astra已经推出,测试者clairevo表示自己对这款模型十分着迷,她有幸提前参与了测试,认为模型的表现非常出色。更让她惊喜的是,这款模型让她在用AI开发项目时的野心提升了100倍。

之所以有这种感受,首先是因为该模型支持浏览器和计算机调用,这意味着它可以借助任意软件开发任何内容,甚至包括游戏。在编码方面,它帮clairevo解决了一些她之前遇到的最棘手的问题,比如数据、硬件相关问题。

最让clairevo满意的一点是,使用这款模型的体验一点都不烦人。她发布的实操体验测评涵盖了多个环节,包括GPT-6 Astra概述、用浏览器管理客户关系管理工作流、Flora缩略图生成、浏览器用于质量保证、一次性开发出产品智能功能、硬件改造:直播迷你计算机、构建AIM风格codex应用、Barbie Bench和3D儿童游戏。

在总结部分,clairevo表达了对GPT-6 Astra的喜爱,完整测评视频已经上传到YouTube。

在 X 看原帖 ↗
3.2万30300248
模型评测 · @kieranklaassen导语出处▲ 14.7万

测试人员称GPT-6 Astra适合玩乐展示不适合日常工作

用户@kieranklaassen在𝕏分享了自己本周对GPT-6 Astra的实际测试评价

我本周测试了GPT-6 Astra,它更适合展示,而非实际工作。它用起来很有意思,效果华丽,能完成非常出色的任务,从设计角度来说,它是我用过的最有意思的模型。但我不确定会不会把它用于真实的日常工程或产品工作。

它的可信度不如Fable级模型,给人的感觉更像是有着更美观输出的Opus量级模型。不过,用它来做氛围编码和着陆页还是挺有意思的。

在 X 看原帖 ↗
14.7万12370145
安全 · @karch_andreas▲ 1.7万

用户试用免费Claude Code三个月授权后电脑被盗号入侵

用户Andreas Karch在X平台分享,使用AnthropicAI提供的免费Claude Code三个月授权后电脑遭恶意入侵

今年初夏,AnthropicAI向用户Andreas Karch提供了Claude Code的三个月免费授权。

兴奋之下,他让一个智能代理在自己的电脑上自由操作,安装了各类数值计算工具,用来完成他之前从未尝试过的计算任务,比如共形 Bootstrap计算。

一个月后,他发现电脑中被安装了一个名为lumma stealer的盗号软件。

这个软件偷取了他所有的密码,给邮箱添加了过滤器,还修改了他银行账户的密码。当他发现异常时,不法分子已经在转移他账户里的资金了。

最终,他只损失了两天的工作时间,这两天他需要重新安装Windows系统、修改所有密码,还和银行通了好几次电话。

但这次事件给他上了重要的一课:再也不让智能代理在自己的电脑上自由操作了。

在 X 看原帖 ↗
1.7万75226
大模型 · @maxifirtman▲ 1.1万

LM Studio 推出Bionic,可在本地模型上运行智能体任务

用户@maxifirtman在𝕏平台称,Bionic相当于LM Studio的Codex和Claude Code

很少有人知道Bionic是什么,这挺可惜的。

Bionic是LM Studio推出的工具,相当于LM Studio版本的Codex和Claude Code。它可以通过本地模型(或任何你接入的模型)运行智能体任务。

在 X 看原帖 ↗
1.1万98938
动态 · @santtiagom_▲ 4.7K

Claude Code讲解文章浏览量超200万,作者梳理核心要点

用户 @santtiagom_ 在𝕏发文,几个月前撰写的Claude Code讲解文章浏览量超200万

几个月前,@santtiagom_撰写了一篇讲解Claude Code工作原理的文章,目前这篇文章的浏览量已经超过200万。如果想要用好Claude Code,作者建议重点关注以下几个核心部分:

1. 智能体循环(agent loop)
2. 工具(tools)
3. 上下文与记忆(context and memory)
4. 钩子(hooks)
5. 技能(skills)
6. 子智能体(subagents)

此外,作者还在评论区附上了另一篇他专门针对技能(Skills)撰写的文章。本次是技能指南系列。

在 X 看原帖 ↗
4.7K46774
代码生成 · @flavioAd导语出处▲ 2.7万

用户提前体验GPT-6 Astra,称其为用过最好的代码模型

用户flavioAd在𝕏发文称,GPT-6 Astra可基于单个提示在2小时内完成开发

用户flavioAd在社交平台𝕏发文,透露自己获得了提前体验OpenAI尚未发布的GPT-6 Astra的机会。

他表示,这是他用过的最好的代码生成模型。

该模型可以根据单个提示,在不到2小时的时间内完成完整项目开发。

flavioAd在帖文中附带了相关演示视频,提示观众看到最后,可能会认出一些内容。

在 X 看原帖 ↗
2.7万919130
开发 · @LinearUncle▲ 9.6K

通义千问qwen 3.8 max可复刻Mac原生天气应用界面

开发者@LinearUncle分享了用qwen 3.8 max 0902复刻应用的操作方法,该模型刚登顶web前端开发榜单

开发者@LinearUncle分享了一种复刻已有应用的方法,可借助大模型实现和原应用高度相似的效果。

具体操作是使用qwen 3.8 max 0902,配合/goal命令完成复刻。提示词要求模型调用Computer Use(计算机操作)查看目标应用,完成复刻后和原版持续对比打磨,直到视觉效果和交互细节都和原版完全一致。

本次复刻的目标是苹果Mac系统自带的天气应用,最终得到的复刻版本界面和原版非常相似。qwen 3.8 max 0902此前刚刚在某web前端开发榜单登顶。

在 X 看原帖 ↗
9.6K44658
游戏 · @ChrisGPT▲ 8.3K

GPT 6演示卡丁车游戏,非技术用户可快速制作自定义游戏

开发者ChrisGPT分享GPT 6的Cart Racer卡丁车游戏演示,由Pietro Schirano提供技术 credits,来源为𝕏平台@ChrisGPT

GPT 6生成的卡丁车游戏演示能够通过生动的画面、流畅的玩法和精准的动作呈现游戏内容。非技术用户只需几分钟,就能制作并游玩超出基础要素的自定义游戏。

当指令存在多种解读空间时,GPT-6 Astra比此前所有模型都更擅长做出正确判断。它会利用上下文填补常规信息缺口,在答案可能影响结果时,会提出针对性问题。

在Codex中,GPT 6可以在不依赖用户回复的情况下继续异步处理其他工作。如果用户没有回复,它会在合适的场景下按照合理假设继续推进,遇到需要决策的关键问题则会等待用户输入。

目前发布者ChrisGPT是该游戏最快完赛的世界纪录保持者,他同时提到,游戏有一半画面模糊发虚,Astra本可以在这方面做得更好。

在 X 看原帖 ↗
8.3K38420
工具指南 · @mattyp▲ 4.7K

面向企业开放的Grok Bot 五步入门指南

X用户@mattyp分享了企业版Grok Bot的五步法上手使用建议

阅读全文 →
4.7K16325
动态 · @brendanh0gan▲ 50

开发者分享四步用AI从外部视角观察自己的思维

用户@brendanh0gan在𝕏分享四步流程,借助wisprflow和预训练AI生成千词输出

第一步是对着wisprflow进行几分钟意识流记录。

第二步是将记录内容粘贴到仅预训练的模型中。

第三步是生成约1000个token(约750字中文)。

最后一步就能从外部视角观察你自己的思维。

在 X 看原帖 ↗
501
AI生成 · @PixelAigc▲ 4.2K

AI生成东方传统女性视频 保留MJ图片细节

用户@PixelAigc在𝕏分享,用MJ生成图片,H3终端生成宋韵美学风格视频

用户@PixelAigc在𝕏分享了自己用AI生成东方传统女性形象视频的创作成果。他先在MJ中生成图片,再通过H3终端生成视频,H3完美保留了MJ生成图片的细节和特点。

生成的女性形象美而不艳,符合宋韵美学的特点。视频的提示词为:镜头慢慢推进,镜头慢慢环绕,女子保持平静的情绪,眼睛自然眨动,风吹过来,她的衣服、头发和头饰上的珠宝飘动,整个画面非常唯美,光影微微变化,女子嘴角露出一丝丝微笑,空气中飘着一层淡淡的雾气,保持光影的低对比度低饱和度。

MJ生成图片的提示词为:由Artgerm设计,穿着中国传统戏服的超级美女,呈现中国戏曲奇幻艺术风格。

在 X 看原帖 ↗
4.2K34130
AI生成视频 · @Diplomeme▲ 1.9K

用户用Kling 3.0生成15秒4K运动鞋UGC广告视频

用户@Diplomeme 在𝕏分享了使用Kling 3.0生成的15秒4K超写实UGC运动鞋广告,分8个镜头剪辑

阅读全文 →
1.9K56120

今天的 43 条信号到这里下一轮 12:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新