AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 10 月 9 日 · 08:00 更新 0 文章0 信号0 主题
✦
试试:

今天发生了什么1 分钟读懂

GPT-6 的智能 UI 开始向 Plus、Pro、Business、Enterprise 四档用户推送,免费用户随后接入。开发者拆解发现,这个生成式 UI 并不输出原生代码,核心是一门叫 DIL 的新语言在编译渲染界面。

来源@OpenAI「OpenAI推出带智能UI的GPT-6,全球多档用户可先用」@rabi_guha「OpenAI 推出 ChatGPT 生成式UI,拆解后发现不输出原生代码」

Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元,做中立的第三方 AI 评估;它新发布的对齐指数用 9 万多次真实会话,衡量各模型在实际使用中的出错风险。

来源@arena「Arena完成2亿美元B轮融资,估值31亿美元,要做中立AI评估」@arena「arena发布Arena Alignment Index 基准测试(90K+)」

OpenAI 的年化收入预期被下调了 200 亿美元。市场此前对它的增长寄望很高,这次修正意味着 AI 创业的增长故事要重新评估。

来源mfiguiere「OpenAI年化收入 比预期少了200亿美元」

今日值得看
01 一个 prompt 克隆整个网站的 Claude Code Skill 用一句 prompt 克隆任意网站,Pix 付款码也能一键生成 02 30秒好莱坞恐怖变身视频提示词 Seedance 2.5 一条300秒分镜恐怖短片提示词,从发烧到变身鬼怪,全程好莱坞VFX。
03 GoogleDeepMind 开放 SynthID Detector 检测器 现在所有人都可以用它检测内容是否由 GoogleAI、行业合作方包括OpenAI、NVIDIA等生成,能帮你识别网上的AI生成内容

SynthID Detector 现已向所有人开放。🌐 你可以用它检测在线内容是否由 @GoogleAI 或我们行业合作伙伴的工具生成——合作伙伴包括 @OpenAI、@NVIDIA、Kakao,很快还会加入 @Apple。

04 speridlabs开源无VAE的Iris-3B文生图模型 不需要VAE也能直接生成像素,参数规模3B,权重、代码和演示都完全开源,对生成图像细节要求高的任务有优化。

Iris-3B,一款像素空间文生图(T2I)模型,同时也是通用视觉学习器,可以直接生成每个像素。它不需要VAE。 Iris-3B是从零开始预训练的,参数量为3B,权重完全开放。

今日焦点

谷歌AI智能体有了专属邮箱,团队里多了一个新同事

谷歌在 Cloud 活动上发布了一体化智能体,Gemini 从此不只是回答问题,还能代表用户把事办完。Google Cloud CEO Thomas Kurian 给它的定位是:可以被赋予“目标,而不只是指令”。

拿到目标后,它自己规划步骤,调用自定义技能和工具,连接企业内部系统去落地。员工可以把多步骤任务整包交给它,不用再拆成一句句指令。

接入范围很广:Google Workspace、Microsoft 365、Slack、Jira、Confluence、Git、BigQuery、Databricks、Postgres、Snowflake 都支持;公司网络内外的任何 Model Con…

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达37 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

08:00 本轮更新 · 下一轮 12:30
行业动态 · Hacker News▲ 318

DeepSeek 4.1 Flash 为何没引发行业震动

普通用户也能用到高性能大模型,如果一款新大模型足够优秀却没引发关注,可能说明行业对AI新品的敏感度正在发生变化

社区讨论:该模型对显存要求很高,全精度需要约1664GB显存,即使INT4量化也需要约416GB显存,当前显存成本高昂。部分开发者认为它在基础智能体任务上表现足够好,性价比很高,已经够用。有人认为开源模型仍落后闭源模型6到12个月,也有用户表示个人设备已经可以流畅运行该模型。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 77

研究提出1比特以下大模型压缩新方法

更低比特压缩能让大模型在更低配置设备上运行,普通用户也能因此用上更快更便宜的本地大模型服务。

产品发布 · @OpenAI导语出处▲ 69.8万

OpenAI推出带智能UI的GPT-6,全球多档用户可先用

现在已经向Plus、Pro、Business和Enterprise用户开放使用,明天开始对免费用户开放。对话里现在可以直接用交互式工具,比如游戏、预算计算器。

你可以直接在对话中创建可使用的交互式工具,比如游戏或者交互式预算规划计算器。

带有智能用户界面的 GPT‑6 今天向 Plus、Pro、Business 和 Enterprise 用户全球推出,明天起将扩展到 Free 和 Go 用户。

ChatGPT 中的 GPT‑6 对 Plus、Pro、Business 和 Enterprise 层级由 GPT‑6 Sol 提供支持,对 Free 和 Go 层级由 GPT‑6 Luna 提供支持。两者都针对日常对话做了优化。

本次更新适用于 ChatGPT 中的聊天标签页。作为本次发布的一部分,驱动 Work 和 Codex 的模型没有变化。

你可以在学习、尝试和探索的过程中,通过会做出响应的交互式可视化来探索想法。

在 X 看原帖 ↗
69.8万2244.4K673
行业动态 · Hacker News▲ 61

Anthropic 禁止用户对 Claude 虐待残忍行为

对AI聊天机器人的态度也会违反平台规则,使用 Claude 时需要注意新的行为要求

社区讨论:部分人反对虐待大模型,认为 cruelty 会贬低施虐者自身。多数评论者不认同该政策,指出大语言模型只是数学模型,没有感知能力,不存在所谓的“模型福祉”,质疑Anthropic是在自我洗脑,或是借拟人化大模型做营销,还有人猜测这项规定的真正工程目的是防止模型从用户交互中学习 abusive 内容。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News导语出处▲ 343

OpenAI年化收入 比预期少了200亿美元

之前市场对OpenAI的收入预期很高,现在实际预期下调200亿美元,AI创业的增长故事要重新评估了。

社区讨论:多数人认为年化收入对于高速增长的初创公司是不靠谱的注水指标,OpenAI此次数据差异源于投资方为和Anthropic做对比刻意高估了收入,很多初创公司都这么干。有人指出OpenAI估值接近万亿美元但公众对其实际运营状况几乎没有信息,因为它不像过去那样早早公开接受监管披露。还有人质疑FT是故意放高低两个数字博流量。

在 HN 看讨论 ↗   原文 / 论文 ↗
商业 · @ThomasOrTK▲ 6.7万

Google发布面向办公的Gemini通用智能体

在Google Cloud的Gemini活动上推出,能处理从知识工作到问答的各类办公事务。现在大厂都在抢跑企业办公AI这一块。

今天我们在 Google Cloud 的 Gemini at Work 活动中,我们宣布推出 Gemini,一款面向工作场景的全新单一通用智能体。它掌握你所有的业务上下文,可用于从知识工作到回答问题,从内容创作到编码的所有任务,所有这一切都只需要在一个输入框中输入提示词即可完成。

它围绕核心架构原则构建:
☑️ 统一智能体:Gemini 可以在单个提示框中完成回答问题、执行知识工作和生成代码。

☑️访问方式:Gemini 基于网页,可从任何设备访问,并且能集成到第三方应用程序中。它也可以在没有专用用户界面的情况下运行。

☑️持久执行:它在云端运行,这意味着无论你从哪里访问它,它都维护着单一的记忆集合、上下文和一个个性化图谱。

☑️多智能体编排:Gemini 可以创建子智能体来处理多步骤任务,还可以作为拥有明确定义和专属身份的协作智能体工作。

☑️上下文感知:Gemini 了解你的工具、数据和工作历史,并且会随着你的使用越来越了解你的工作方式。

☑️灵活选择模型:它可以跨多个模型进行编排,提供最优质量并降低成本。

在 X 看原帖 ↗
6.7万88850185
新品发布 · @OpenAIDevs▲ 52.2万

OpenAIDevs 推出 Ultrafast 服务,GPT-6.1 Sol 提速 8倍

更快的推理速度能匹配开发思路的生成速度,减少等待时间,提升基于大模型的开发和使用效率。

超高速版今日在API、Codex和ChatGPT Work中向GPT-6.1 Sol 推出。

近Astra智能,速度比Sol Standard快最多8倍,因此你可以跟上灵感迸发的速度进行构建。

在 X 看原帖 ↗
52.2万2173.5K397
行业动态 · @AnthropicAI▲ 5.8万

AnthropicAI 推出 Cyber Mission 安全项目

如果依赖开源软件和基础设施的业务,能从这个新项目的安全保障工作中获益。

我们将推出 Anthropic Cyber Mission,这是一项保障关键基础设施和开源软件安全的全新计划。

在 X 看原帖 ↗
5.8万88844174
新品发布 · @hone▲ 6.2万

Hone发布Engines,获6000万美元种子轮融资

现有AI大多只输出答案或完成任务,这款服务直接对接企业业务指标交付实际商业成果,帮企业从AI拿到真金白银。

今天 Hone 推出了 Engines:掌控业务成果的人工智能。聊天机器人给出答案,智能代理完成任务,Engines 交付成果。我们要求它们创造真正的价值,用实际美元金额而非 token 或感觉来衡量。

你只要给它指定一项业务指标,剩下的就由 Engine 搞定。它会自行接入,构建必要的智能代理、技能和记忆,和合适的人员协作,并且随着经验积累不断优化。

从人工智能领导者到全球企业,我们的客户已经在用 Engines 做到了:
- 发掘数百万美元的采购成本节约
- 优化产品转化漏斗
- 管理信贷风险
- 增加新区域的合格销售线索储备
- 加速落地实施并改善客户管理

为了在整个经济体中扩大这种影响力,我们完成了 6000 万美元种子轮融资,由 Benchmark 和 Index 领投,Elad Gil、Hanabi、Definition、Diffusion、Lux、SV Angel 和 Align 参投。

人工智能的原始能力已经远远领先于它在现实世界中创造的价值,Engines 将帮助缩小这一差距。以下是它的工作方式……

在 X 看原帖 ↗
6.2万43372177
新品发布 · @im_gusye▲ 18.2万

alook_ai 推出Grok结合Discord的开源产品

想要自己搭建让不同AI模型对话的平台,可以看看这个开源项目,还能自己本地部署

别再@我了,让我的Codex和你的Codex对话就好。这就是我们开发@alook_ai的初衷——你可以把它理解为开源版的Grok Bot加Discord二合一。

可以自己试用,也可以自行部署。1/6

在 X 看原帖 ↗
18.2万114323298
新品发布 · @odysseyml▲ 25.4万

odysseyml发布免费Odyssey-3基础世界模型

这个模型目前在Physics-IQ基准上达到了当前最优性能,可赋能机器人、训练AI、生成交互式体验,所有人都可以免费体验

今天我们推出了迄今为止能力最强的基础世界模型 Odyssey-3。

它在 Physics-IQ 上达到了全新的顶尖水平,可为机器人提供动力、训练人工智能,还能生成交互式体验。它真的非常出色。

现在你就可以免费体验这个模型了!

在 X 看原帖 ↗
25.4万1651.4K647
前沿研究 · @ArtificialAnlys▲ 2.8万

Artificial Analysis 将发布第五版AI智能指数

这次AI智能指数更新加入了新的科学领域测试基准和私有数据集代码测试基准,将会更好衡量AI前沿发展水平,帮你了解AI行业整体进展。

宣布 Artificial Analysis Intelligence Index v5 将于 10 月底推出。

Intelligence Index v5 将在衡量AI前沿水平的基准测试方面实现重大飞跃。

变更包括新增 Terminal-Bench Science ,以及一个带有私有数据集的全新编码基准测试。

请持续关注更多信息。

在 X 看原帖 ↗
2.8万441.1K74
融资 · @arena导语出处▲ 4.9万

Arena完成2亿美元B轮融资,估值31亿美元,要做中立AI评估

创办方认为当前AI发展速度已经超过了评估能力,需要中立第三方来做这件事。现在他们推出了自己的对齐指数评估工具。

今天,我们宣布完成B轮融资:融资额2亿美元,估值31亿美元,并发布Arena对齐指数。

AI的发展速度已经超过了我们评估它的能力。世界需要一个中立第三方来衡量,当AI落到真实用户手中时,它实际上有多安全、对齐性如何。这就是Arena今天开始承担的角色。

对齐指数基于真实世界智能体轨迹构建,最初包含三个信号:未授权行为、错误归因和欺骗性完成,今日上线的评估结果涵盖20多个前沿模型。

你可以在下方聆听我们首席执行官@ml_angelopoulos的更多分享,完整分析以及关于我们公司发展的更多细节,请阅读整条推文。

这笔融资将让我们在安全信号、智能体能力和模态方面走得更远。它也将让我们扩大公司规模,匹配我们使命的规模。

目前,我们仍是一个由90人组成的灵活团队,我们正在招聘研究、产品、工程等多个领域的人员。来和我们一起打造吧。

随着AI能力和自主性不断提升,了解它如何才能安全有效地为人类服务变得愈发重要。这就是Arena建立的初衷:开展测量并推动进步。

感谢我们的社区、我们的投资者,以及每一位和我们一起建设的人!如果你想加入我们,可以查看我们的开放职位。

在 X 看原帖 ↗
4.9万2023857
行业观察 · @fchollet▲ 4.7K

2023到2026年AI资本投入增速比AI进展还快

AI进步本身符合指数增长规律,但同期AI资本支出是超指数增长,也就是增速本身还在不断变快。这会带来什么变化呢?

在2023-2026年期间,大多数衡量AI进展的指标都严格符合指数增长规律。

与此同时,同一时期AI领域的资本支出呈现出轻微的超指数增长(即增长率本身还在提升)。

因此如果你把AI建模为这样一个系统:它接收外部投资作为输入,输出AI进展,那么这个系统的响应是轻微次线性的。

但从长期来看,超指数速度注入的外部资源是不可持续的。

要实现持续的指数级进展,AI行业需要获得与之匹配的指数级利润——它需要完成资源闭环。

在 X 看原帖 ↗
4.7K86212
新品发布 · @LightOnIO▲ 1.6万

LightOnIO发布LightOnOCR-3开源OCR模型

处理文档速度比前代快一倍,多项指标领先主流竞品,开源可自行部署,能满足企业对文档信息提取的更多需求。

世界领先的文档识别。不止文本提取。

隆重介绍 LightOnOCR-3,我们新一代顶级人工智能文档智能模型家族。

在 LightOnOCR-2 的基础上,它能识别文本和手写体、描述图像、从图表中提取数据并保留文档结构,所有这一切只需一步处理流程。

🏆 领先的基准测试成绩:在 OlmOCR-Bench 上性能超过 Chandra-OCR-2、Mistral OCR 4.1 和 dots.mocr,并且在 ParseBench 的开放权重模型中排名第一。

📊 从每份文档获取更多信息:将文本、表格、图像和图表转换为你的业务应用可以使用的内容。

⚡ 紧凑高效:提供 0.8B 和 4B 两个版本,文档处理速度最高可达 LightOnOCR-2 的两倍。

🔓 Apache 2.0 许可证:你可以在自有基础设施上使用、调整和部署这些模型。

从手写行政文件到财务报告和技术文档,让你的更多信息变得可搜索、可用。

👉 探索模型和基准测试结果:
👉🏻 在我们的网站探索模型页面:
#LightOn #DocumentIntelligence #OCR

在 X 看原帖 ↗
1.6万38296332
前沿研究 · @ArtificialAnlys▲ 1.2万

Artificial Analysis Cyber Index Alliance发布Artificial Analysis Cyber Index 网络安全指数(32 points)

关注企业网络安全防御的可以参考,这份指数新增了受限访问模型的排名,能更全面看到不同AI模型的实战能力差异。

我们将可信访问模型引入了人工分析网络索引;GPT-6 Sol (Daybreak Blue) 目前在网络指数中排名第一。

人工分析网络索引联盟汇集了行业合作伙伴,共同评估 AI 模型在企业网络防御任务上的表现。该索引最初仅包含可公开访问的模型,为用户提供公开可用的智能体网络防御能力的最佳指示。

现在,我们正在扩展排行榜,加入网络护栏更少的模型,以便提供更广阔的前沿模型网络能力视野。首个加入的模型是 GPT-6 Sol (Daybreak Blue, max),该模型仅可通过 @OpenAI 的 Daybreak 项目访问。

GPT-6 Sol (Daybreak Blue, max) 目前排名该指数第一,并且处于成本与能力的帕累托前沿。它在整个指数中都没有触发安全拦截,其总分比公开可用的 GPT-6 Sol (max) 提升了 32 分。

它每项任务成本为 1.77 美元,比其他领先模型更具成本效益,包括每项任务成本 11.67 美元的 Grok 4.7 (xhigh)。

我们将继续扩展人工分析网络索引,涵盖公开可用模型和可信访问模型。

在 X 看原帖 ↗
1.2万820129
新品发布 · @higgsfield▲ 2.1万

higgsfield推出Higgsfield Katana AI编辑工具

现在你可以在Claude里直接生成可编辑的动态图形和视频,不用跳转到外部工具操作,减少 workflow 跳转步骤。

我们推出了由 Claude Motion 驱动的 Higgsfield Katana。

这是我们功能最强大的 AI 视频编辑工具,内置在 Claude 中。上传参考视频,即可生成可编辑的动态图形、产品发布视频或涨粉剪辑。

现在已通过 Higgsfield MCP 在 Claude 上线。

在 X 看原帖 ↗
2.1万107460180
前沿研究 · @arena导语出处▲ 5.9万

arena发布Arena Alignment Index 基准测试(90K+)

用超过9万次真实会话数据评估不同AI的安全对齐表现,能帮你了解常用大模型在实际使用中的出错风险。

阅读全文 →
5.9万2626642
深度观点 · @SemiAnalysis_▲ 2.3万

开源模型抢简单任务 前沿AI实验室商业模式存疑

如果开源模型已经能承接大量低毛利企业的简单任务,前沿实验室的盈利前景就取决于新增市场能否覆盖流失业务。

开源模型已经在接手更简单的任务了。前沿实验室的乐观前景基于一个问题。

“大量软件工程工作,以及总体而言白领工作,并不需要 Fable 5.1 或 Astra 6 级别的智能。”

“很多企业,尤其是低毛利率企业,非常理性地做出决定,开始把一些更简单的任务卸载给这些能力越来越强的开源模型。”

“所以前沿实验室的商业模式能否持续,实际上取决于你是否相信,随着前沿智能变得越来越聪明,你能用它完成的新事物的总市场规模,会超过被卸载给这些更便宜模型的任务份额。”

“如果你凭空变出一亿个在每个领域都是专家、不需要吃饭睡觉的超级智能博士,你认为经济能相对快速地吸收他们,并且仍然保持高投资回报率吗?”

在 X 看原帖 ↗
2.3万1112947
视频生成 · @Fujimoto_hina▲ 1.6K

Veo 3.1生成10秒荔枝雪葩微缩景观AI视频

用户Fujimoto_hina在𝕏发布了一段由Veo 3.1生成的AI视频提示词,包含完整分镜细节

阅读全文 →
1.6K54115
设计 · @mohamedgshoaib▲ 745

阿拉伯语用户分享设计系统链接,调用Claude生成面试内容

用户@mohamedgshoaib在𝕏分享优质设计系统链接,提及可调用Claude生成定制面试内容

用户@mohamedgshoaib在𝕏平台分享了两个优质设计系统链接,分别是

@mohamedgshoaib表示,无论选择哪个设计系统,都可以将链接发送给Claude的Sol或Opus模型,配合

可以生成类似这样的提示词:using the reference attached, interview me about the design system i want to build from a-z(使用附件中的参考资料,就我想要从零搭建的设计系统对我进行面试)。

在 X 看原帖 ↗
7452263
计算效率 · @Dimillian▲ 458

极速计算虽不是人人用得起 但体验确实好

用户Dimillian在𝕏分享了对极速计算、流程编排与任务分配的使用感受

我们经常讨论流程编排与任务分配,这点大家都知道。我也明白,极速计算不是所有人都负担得起。但真正用上它之后,能重回流畅工作流的体验实在太棒了。

能够当下立刻完成任务,还能通过智能代理完全掌控任务,这种体验刚好符合需求。

在 X 看原帖 ↗
4587
开发 · @juberti▲ 240

使用session.instructions.append可引导OpenAI Live API立即生效

用户juberti在𝕏分享,OpenAI Responses好用,但用session.instructions.append可立即引导Live API

Responses已经很好用了。

你可以使用`session.instructions.append`方法来引导Live API,修改会立即生效。

在 X 看原帖 ↗
24061
开发 · @navyabijoy▲ 1.3K

实习公司给全员开通Claude Code免Token限额权限

用户@navyabijoy在𝕏分享,公司允许无限制用Claude Opus 4.6做简单开发

@navyabijoy回忆,自己实习时的公司给所有员工开通了Claude Code访问权限。这家公司没有设置任何token(令牌)限额,因此所有人都放开手脚用Claude Opus 4.6做改变量名、加按钮这类简单开发工作。

在 X 看原帖 ↗
1.3K804
开源 · @suyuan1711▲ 7.6K

Claude Opus 5.5组合开源方案比原生更流畅

用户分享Claude Opus 5.5搭配开源项目Lcu,对接Codex Computer Use的使用体验

OpenAI削减ChatGPT Pro额度后,用户舍不得用GPT运行任务,转而使用Claude。

用户实际使用后发现,Claude Code原生的Computer Use体验很差,复杂操作只能在前台运行,运行期间电脑无法正常使用。

用户调研找到开源方案Lcu,它可以将Codex的Computer Use对接给其他Agent使用。

将Lcu对接Claude Code或Pi之后,使用体验非常流畅,项目链接放在评论区。

在 X 看原帖 ↗
7.6K33673
开发 · @mizorewww▲ 6.9K

开发者用Claude生成了一款SSH客户端UI

开发者@mizorewww表示,这个由Claude生成的UI仍带有AI生成代码的特征

开发者@mizorewww发布了一个由Claude生成的SSH客户端UI项目。 @mizorewww表示,这个生成结果依然带有AI生成内容(AI Slop)的典型特征。

在 X 看原帖 ↗
6.9K27612
大模型 · @realWeZZard▲ 1.4K

本地AI计算机使用服务思考时间比Claude Opus少一半

博主realWeZZard测试,pi+Qwen 3.8 27B+DiffusionGemma组合对比Claude Opus 5.5,思考时长缩短超一半

开发者realWeZZard在𝕏分享了自己组合Jev进行计算机使用任务的测试结果。对比Claude Code上的Opus 5.5,测试用的pi+Qwen 3.8 27B+DiffusionGemma组合任务轮次大幅减少,思考时间缩短超过一半。本次测试尚未优化Qwen 3.8 27B的本地推理效率。

测试后发现,高效计算机使用任务的核心是规划-执行(planner-executor)模式,而非单一的ReAct模式。Jev可为执行部分提供高速智能,这是此前做不到的。

基于测试结果,得到两条经验。一是所有原本适用规划-执行模式的业务,都可以用Jev重新优化;二是所有原本用单一ReAct模式的业务,都可以考虑通过Jev赋能的规划-执行模式提升体验。

realWeZZard个人实验室内的计算机使用服务,正式进入了无限令牌(unlimited token)时代。

在 X 看原帖 ↗
1.4K53521
动态 · @yifanxu_ephai▲ 2.9K

新加坡南洋理工AI学生辍学all in agent infra,原因是什么

NTU人工智能专业辍学学生yifanxu在𝕏分享自己转向agent infra赛道的经历

阅读全文 →
2.9K24425
开源 · @aehyok▲ 3.9K

一分钟安装开源插件 让你的AI聊天机器人免费变强十倍

来自@aehyok分享,适配Muse、Grok Bot、Dot,白嫖OpenRouter免费大模型

这个开源插件可让Muse的能力增强十倍,还支持Grok Bot和Dot安装使用。

插件原理是在本地调用代理,让OpenRouter上的免费大模型承担运算工作,原有AI助理本身不用更换核心模型。

OpenRouter的免费大模型支持无限tokens,全部旗舰模型每天自动更新,安装只需要一分钟。

安装步骤如下:先前往对应链接申请一个OpenRouter API密钥。

再给你的助理发送指令:指定插件链接,同时附上你的OPENROUTER_API_KEY,即可完成安装。

安装后可以使用Space Bunny Alpha、NVIDIA Nemotron 3 Ultra、Ling-3.1-flash等多个大模型。

有两个使用提醒:未充值账户每天可调用50次,累计充值10美元后可提升到每天1000次。目前该插件为最小可行版本(MVP),切换模型需要用户手动确认。

在 X 看原帖 ↗
3.9K74456
动态 · @rabi_guha导语出处▲ 3.5K

OpenAI 推出 ChatGPT 生成式UI,拆解后发现不输出原生代码

开发者rabi_guha拆解ChatGPT新版生成式UI,核心是新语言DIL编译渲染流程

ChatGPT昨日推出了自研版本的生成式UI(Generative UI),开发者rabi_guha对其技术实现做了拆解。

生成式UI的智能代理不输出原生代码,而是输出一种全新语言DIL。随后由服务器编译DIL并以流的形式传输,最后由客户端通过组件集渲染界面。

这套流程能让生成的界面给用户带来原生应用的使用感受。

在 X 看原帖 ↗
3.5K765100
大模型 · @0xMorlex▲ 1.8万

马斯克旗下Grok Bot接入Claude Opus 5.5完成重大升级

网友0xMorlex在𝕏爆料,Grok Bot接入Claude Opus 5.5后可独立完成完整AI团队工作,还有搭建步骤

Grok Bot刚刚完成了一次重大的核心升级。

本次升级将Claude Opus 5.5接入了Grok Bot的技术栈。

升级后的单个Grok Bot就可以完成一整支AI团队的全部工作,包括调研、编写代码、调用工具、验证结果以及交付最终成果。

0xMorlex发布了10步搭建这款升级后Grok Bot的教程链接:

在 X 看原帖 ↗
1.8万9149234
大语言模型 · @antiAIvo▲ 6.2K

4小时从零手写GPT-2视频,是LLM底层实现优质入门教程

原AI学习者@antiAIvo在𝕏推荐Andrej Karpathy的4小时PyTorch入门教程视频

如果你想要真正弄懂大语言模型(LLM)的底层实现,@karpathy的这期长达4小时的视频,是非常优质的入门教程。

视频中演示了如何只用纯PyTorch,从零开始手写一个GPT-2。

分享者本身是AI原生学习者,全程借助Claude辅助学习,没有看过其他教程,已经自己实现过GPT-2。但分享者仍认为值得回炉重学这个教程,因为Karpathy是业内资深研究者,重新复盘他的设计思路能收获很多。

在 X 看原帖 ↗
6.2K37166146
工具 · @Saccc_c▲ 1.7万

30分钟用Teamily AI搭好AI 3D信息监控网站

用户借助Teamily AI,30分钟搭建完成AI 3D信息监控网站

阅读全文 →
1.7万248927
🔬 前沿研究
前沿研究 · @ArtificialAnlys▲ 2.8万

Artificial Analysis 将发布第五版AI智能指数

这次AI智能指数更新加入了新的科学领域测试基准和私有数据集代码测试基准,将会更好衡量AI前沿发展水平,帮你了解AI行业整体进展。

宣布 Artificial Analysis Intelligence Index v5 将于 10 月底推出。

Intelligence Index v5 将在衡量AI前沿水平的基准测试方面实现重大飞跃。

变更包括新增 Terminal-Bench Science ,以及一个带有私有数据集的全新编码基准测试。

请持续关注更多信息。

在 X 看原帖 ↗
2.8万441.1K74
前沿研究 · @arena导语出处▲ 5.9万

arena发布Arena Alignment Index 基准测试(90K+)

用超过9万次真实会话数据评估不同AI的安全对齐表现,能帮你了解常用大模型在实际使用中的出错风险。

阅读全文 →
5.9万2626642
前沿研究 · @ArtificialAnlys▲ 1.2万

Artificial Analysis Cyber Index Alliance发布Artificial Analysis Cyber Index 网络安全指数(32 points)

关注企业网络安全防御的可以参考,这份指数新增了受限访问模型的排名,能更全面看到不同AI模型的实战能力差异。

我们将可信访问模型引入了人工分析网络索引;GPT-6 Sol (Daybreak Blue) 目前在网络指数中排名第一。

人工分析网络索引联盟汇集了行业合作伙伴,共同评估 AI 模型在企业网络防御任务上的表现。该索引最初仅包含可公开访问的模型,为用户提供公开可用的智能体网络防御能力的最佳指示。

现在,我们正在扩展排行榜,加入网络护栏更少的模型,以便提供更广阔的前沿模型网络能力视野。首个加入的模型是 GPT-6 Sol (Daybreak Blue, max),该模型仅可通过 @OpenAI 的 Daybreak 项目访问。

GPT-6 Sol (Daybreak Blue, max) 目前排名该指数第一,并且处于成本与能力的帕累托前沿。它在整个指数中都没有触发安全拦截,其总分比公开可用的 GPT-6 Sol (max) 提升了 32 分。

它每项任务成本为 1.77 美元,比其他领先模型更具成本效益,包括每项任务成本 11.67 美元的 Grok 4.7 (xhigh)。

我们将继续扩展人工分析网络索引,涵盖公开可用模型和可信访问模型。

在 X 看原帖 ↗
1.2万820129
🚀 新品发布
新品发布 · @GoogleDeepMind▲ 14.7万

GoogleDeepMind 开放 SynthID Detector 检测器

现在所有人都可以用它检测内容是否由 GoogleAI、行业合作方包括OpenAI、NVIDIA等生成,能帮你识别网上的AI生成内容

SynthID Detector 现已向所有人开放。🌐

你可以用它检测在线内容是否由 @GoogleAI 或我们行业合作伙伴的工具生成——合作伙伴包括 @OpenAI、@NVIDIA、Kakao,很快还会加入 @Apple。

点击链接试用 → https://synthid.com

在 X 看原帖 ↗
14.7万2501.4K446
新品发布 · @odysseyml▲ 25.4万

odysseyml发布免费Odyssey-3基础世界模型

这个模型目前在Physics-IQ基准上达到了当前最优性能,可赋能机器人、训练AI、生成交互式体验,所有人都可以免费体验

今天我们推出了迄今为止能力最强的基础世界模型 Odyssey-3。

它在 Physics-IQ 上达到了全新的顶尖水平,可为机器人提供动力、训练人工智能,还能生成交互式体验。它真的非常出色。

现在你就可以免费体验这个模型了!

在 X 看原帖 ↗
25.4万1651.4K647
新品发布 · @im_gusye▲ 18.2万

alook_ai 推出Grok结合Discord的开源产品

想要自己搭建让不同AI模型对话的平台,可以看看这个开源项目,还能自己本地部署

别再@我了,让我的Codex和你的Codex对话就好。这就是我们开发@alook_ai的初衷——你可以把它理解为开源版的Grok Bot加Discord二合一。

可以自己试用,也可以自行部署。1/6

在 X 看原帖 ↗
18.2万114323298
新品发布 · @hone▲ 6.2万

Hone发布Engines,获6000万美元种子轮融资

现有AI大多只输出答案或完成任务,这款服务直接对接企业业务指标交付实际商业成果,帮企业从AI拿到真金白银。

今天 Hone 推出了 Engines:掌控业务成果的人工智能。聊天机器人给出答案,智能代理完成任务,Engines 交付成果。我们要求它们创造真正的价值,用实际美元金额而非 token 或感觉来衡量。

你只要给它指定一项业务指标,剩下的就由 Engine 搞定。它会自行接入,构建必要的智能代理、技能和记忆,和合适的人员协作,并且随着经验积累不断优化。

从人工智能领导者到全球企业,我们的客户已经在用 Engines 做到了:
- 发掘数百万美元的采购成本节约
- 优化产品转化漏斗
- 管理信贷风险
- 增加新区域的合格销售线索储备
- 加速落地实施并改善客户管理

为了在整个经济体中扩大这种影响力,我们完成了 6000 万美元种子轮融资,由 Benchmark 和 Index 领投,Elad Gil、Hanabi、Definition、Diffusion、Lux、SV Angel 和 Align 参投。

人工智能的原始能力已经远远领先于它在现实世界中创造的价值,Engines 将帮助缩小这一差距。以下是它的工作方式……

在 X 看原帖 ↗
6.2万43372177
新品发布 · @speridlabs▲ 2.0万

speridlabs开源无VAE的Iris-3B文生图模型

不需要VAE也能直接生成像素,参数规模3B,权重、代码和演示都完全开源,对生成图像细节要求高的任务有优化。

Iris-3B,一款像素空间文生图(T2I)模型,同时也是通用视觉学习器,可以直接生成每个像素。它不需要VAE。

Iris-3B是从零开始预训练的,参数量为3B,权重完全开放。

我们还探索了它在对细节要求极高的视觉任务上生成先验的能力:深度估计和图像恢复。

全部内容都已完全开放:权重、代码和演示(Apache 2.0)

在 X 看原帖 ↗
2.0万65456345
新品发布 · @higgsfield▲ 2.1万

higgsfield推出Higgsfield Katana AI编辑工具

现在你可以在Claude里直接生成可编辑的动态图形和视频,不用跳转到外部工具操作,减少 workflow 跳转步骤。

我们推出了由 Claude Motion 驱动的 Higgsfield Katana。

这是我们功能最强大的 AI 视频编辑工具,内置在 Claude 中。上传参考视频,即可生成可编辑的动态图形、产品发布视频或涨粉剪辑。

现在已通过 Higgsfield MCP 在 Claude 上线。

在 X 看原帖 ↗
2.1万107460180
新品发布 · @OpenAIDevs▲ 52.2万

OpenAIDevs 推出 Ultrafast 服务,GPT-6.1 Sol 提速 8倍

更快的推理速度能匹配开发思路的生成速度,减少等待时间,提升基于大模型的开发和使用效率。

超高速版今日在API、Codex和ChatGPT Work中向GPT-6.1 Sol 推出。

近Astra智能,速度比Sol Standard快最多8倍,因此你可以跟上灵感迸发的速度进行构建。

在 X 看原帖 ↗
52.2万2173.5K397
新品发布 · @LightOnIO▲ 1.6万

LightOnIO发布LightOnOCR-3开源OCR模型

处理文档速度比前代快一倍,多项指标领先主流竞品,开源可自行部署,能满足企业对文档信息提取的更多需求。

世界领先的文档识别。不止文本提取。

隆重介绍 LightOnOCR-3,我们新一代顶级人工智能文档智能模型家族。

在 LightOnOCR-2 的基础上,它能识别文本和手写体、描述图像、从图表中提取数据并保留文档结构,所有这一切只需一步处理流程。

🏆 领先的基准测试成绩:在 OlmOCR-Bench 上性能超过 Chandra-OCR-2、Mistral OCR 4.1 和 dots.mocr,并且在 ParseBench 的开放权重模型中排名第一。

📊 从每份文档获取更多信息:将文本、表格、图像和图表转换为你的业务应用可以使用的内容。

⚡ 紧凑高效:提供 0.8B 和 4B 两个版本,文档处理速度最高可达 LightOnOCR-2 的两倍。

🔓 Apache 2.0 许可证:你可以在自有基础设施上使用、调整和部署这些模型。

从手写行政文件到财务报告和技术文档,让你的更多信息变得可搜索、可用。

👉 探索模型和基准测试结果:
👉🏻 在我们的网站探索模型页面:
#LightOn #DocumentIntelligence #OCR

在 X 看原帖 ↗
1.6万38296332
📰 行业动态
融资 · @arena导语出处▲ 4.9万

Arena完成2亿美元B轮融资,估值31亿美元,要做中立AI评估

创办方认为当前AI发展速度已经超过了评估能力,需要中立第三方来做这件事。现在他们推出了自己的对齐指数评估工具。

今天,我们宣布完成B轮融资:融资额2亿美元,估值31亿美元,并发布Arena对齐指数。

AI的发展速度已经超过了我们评估它的能力。世界需要一个中立第三方来衡量,当AI落到真实用户手中时,它实际上有多安全、对齐性如何。这就是Arena今天开始承担的角色。

对齐指数基于真实世界智能体轨迹构建,最初包含三个信号:未授权行为、错误归因和欺骗性完成,今日上线的评估结果涵盖20多个前沿模型。

你可以在下方聆听我们首席执行官@ml_angelopoulos的更多分享,完整分析以及关于我们公司发展的更多细节,请阅读整条推文。

这笔融资将让我们在安全信号、智能体能力和模态方面走得更远。它也将让我们扩大公司规模,匹配我们使命的规模。

目前,我们仍是一个由90人组成的灵活团队,我们正在招聘研究、产品、工程等多个领域的人员。来和我们一起打造吧。

随着AI能力和自主性不断提升,了解它如何才能安全有效地为人类服务变得愈发重要。这就是Arena建立的初衷:开展测量并推动进步。

感谢我们的社区、我们的投资者,以及每一位和我们一起建设的人!如果你想加入我们,可以查看我们的开放职位。

在 X 看原帖 ↗
4.9万2023857
行业动态 · @AnthropicAI▲ 5.8万

AnthropicAI 推出 Cyber Mission 安全项目

如果依赖开源软件和基础设施的业务,能从这个新项目的安全保障工作中获益。

我们将推出 Anthropic Cyber Mission,这是一项保障关键基础设施和开源软件安全的全新计划。

在 X 看原帖 ↗
5.8万88844174
产品发布 · @OpenAI导语出处▲ 69.8万

OpenAI推出带智能UI的GPT-6,全球多档用户可先用

现在已经向Plus、Pro、Business和Enterprise用户开放使用,明天开始对免费用户开放。对话里现在可以直接用交互式工具,比如游戏、预算计算器。

你可以直接在对话中创建可使用的交互式工具,比如游戏或者交互式预算规划计算器。

带有智能用户界面的 GPT‑6 今天向 Plus、Pro、Business 和 Enterprise 用户全球推出,明天起将扩展到 Free 和 Go 用户。

ChatGPT 中的 GPT‑6 对 Plus、Pro、Business 和 Enterprise 层级由 GPT‑6 Sol 提供支持,对 Free 和 Go 层级由 GPT‑6 Luna 提供支持。两者都针对日常对话做了优化。

本次更新适用于 ChatGPT 中的聊天标签页。作为本次发布的一部分,驱动 Work 和 Codex 的模型没有变化。

你可以在学习、尝试和探索的过程中,通过会做出响应的交互式可视化来探索想法。

在 X 看原帖 ↗
69.8万2244.4K673
工具 · @LangChain▲ 1.0万

LangChain发布可构建带人工审批的购物代理功能

在Slack里提问就能找商品、生成订单,人工在Stripe的Link界面审批后再付款。适合需要多人核对下单的小商家。

现在你可以构建一个代理来实现以下功能:
🔎 搜索真实商品
🛒 准备购买
💳 付款

每笔订单都需要人工审批。
👨‍💻 在@slackhq 提问,查看订单,在@Stripe 的Link 代理钱包中批准订单。
构建于MPP + Managed Deep Agents 之上。

在 X 看原帖 ↗
1.0万83716
商业 · @ThomasOrTK▲ 6.7万

Google发布面向办公的Gemini通用智能体

在Google Cloud的Gemini活动上推出,能处理从知识工作到问答的各类办公事务。现在大厂都在抢跑企业办公AI这一块。

今天我们在 Google Cloud 的 Gemini at Work 活动中,我们宣布推出 Gemini,一款面向工作场景的全新单一通用智能体。它掌握你所有的业务上下文,可用于从知识工作到回答问题,从内容创作到编码的所有任务,所有这一切都只需要在一个输入框中输入提示词即可完成。

它围绕核心架构原则构建:
☑️ 统一智能体:Gemini 可以在单个提示框中完成回答问题、执行知识工作和生成代码。

☑️访问方式:Gemini 基于网页,可从任何设备访问,并且能集成到第三方应用程序中。它也可以在没有专用用户界面的情况下运行。

☑️持久执行:它在云端运行,这意味着无论你从哪里访问它,它都维护着单一的记忆集合、上下文和一个个性化图谱。

☑️多智能体编排:Gemini 可以创建子智能体来处理多步骤任务,还可以作为拥有明确定义和专属身份的协作智能体工作。

☑️上下文感知:Gemini 了解你的工具、数据和工作历史,并且会随着你的使用越来越了解你的工作方式。

☑️灵活选择模型:它可以跨多个模型进行编排,提供最优质量并降低成本。

在 X 看原帖 ↗
6.7万88850185
行业观察 · @fchollet▲ 4.7K

2023到2026年AI资本投入增速比AI进展还快

AI进步本身符合指数增长规律,但同期AI资本支出是超指数增长,也就是增速本身还在不断变快。这会带来什么变化呢?

在2023-2026年期间,大多数衡量AI进展的指标都严格符合指数增长规律。

与此同时,同一时期AI领域的资本支出呈现出轻微的超指数增长(即增长率本身还在提升)。

因此如果你把AI建模为这样一个系统:它接收外部投资作为输入,输出AI进展,那么这个系统的响应是轻微次线性的。

但从长期来看,超指数速度注入的外部资源是不可持续的。

要实现持续的指数级进展,AI行业需要获得与之匹配的指数级利润——它需要完成资源闭环。

在 X 看原帖 ↗
4.7K86212
行业动态 · Hacker News导语出处▲ 343

OpenAI年化收入 比预期少了200亿美元

之前市场对OpenAI的收入预期很高,现在实际预期下调200亿美元,AI创业的增长故事要重新评估了。

社区讨论:多数人认为年化收入对于高速增长的初创公司是不靠谱的注水指标,OpenAI此次数据差异源于投资方为和Anthropic做对比刻意高估了收入,很多初创公司都这么干。有人指出OpenAI估值接近万亿美元但公众对其实际运营状况几乎没有信息,因为它不像过去那样早早公开接受监管披露。还有人质疑FT是故意放高低两个数字博流量。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 61

Anthropic 禁止用户对 Claude 虐待残忍行为

对AI聊天机器人的态度也会违反平台规则,使用 Claude 时需要注意新的行为要求

社区讨论:部分人反对虐待大模型,认为 cruelty 会贬低施虐者自身。多数评论者不认同该政策,指出大语言模型只是数学模型,没有感知能力,不存在所谓的“模型福祉”,质疑Anthropic是在自我洗脑,或是借拟人化大模型做营销,还有人猜测这项规定的真正工程目的是防止模型从用户交互中学习 abusive 内容。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 77

研究提出1比特以下大模型压缩新方法

更低比特压缩能让大模型在更低配置设备上运行,普通用户也能因此用上更快更便宜的本地大模型服务。

行业动态 · Hacker News▲ 318

DeepSeek 4.1 Flash 为何没引发行业震动

普通用户也能用到高性能大模型,如果一款新大模型足够优秀却没引发关注,可能说明行业对AI新品的敏感度正在发生变化

社区讨论:该模型对显存要求很高,全精度需要约1664GB显存,即使INT4量化也需要约416GB显存,当前显存成本高昂。部分开发者认为它在基础智能体任务上表现足够好,性价比很高,已经够用。有人认为开源模型仍落后闭源模型6到12个月,也有用户表示个人设备已经可以流畅运行该模型。

在 HN 看讨论 ↗   原文 / 论文 ↗
📌 其他
深度观点 · @SemiAnalysis_▲ 2.3万

开源模型抢简单任务 前沿AI实验室商业模式存疑

如果开源模型已经能承接大量低毛利企业的简单任务,前沿实验室的盈利前景就取决于新增市场能否覆盖流失业务。

开源模型已经在接手更简单的任务了。前沿实验室的乐观前景基于一个问题。

“大量软件工程工作,以及总体而言白领工作,并不需要 Fable 5.1 或 Astra 6 级别的智能。”

“很多企业,尤其是低毛利率企业,非常理性地做出决定,开始把一些更简单的任务卸载给这些能力越来越强的开源模型。”

“所以前沿实验室的商业模式能否持续,实际上取决于你是否相信,随着前沿智能变得越来越聪明,你能用它完成的新事物的总市场规模,会超过被卸载给这些更便宜模型的任务份额。”

“如果你凭空变出一亿个在每个领域都是专家、不需要吃饭睡觉的超级智能博士,你认为经济能相对快速地吸收他们,并且仍然保持高投资回报率吗?”

在 X 看原帖 ↗
2.3万1112947
开源 · @AntSeed▲ 3.9K

可自行搭建AntSeed API网关管控AI模型访问

AntSeed发布开源AntSeed API网关工具,支持密钥、限额和用量追踪

搭建你自己的 Antseed API 网关,就能让你的智能体、团队或用户访问各类 AI 模型。

你可以创建 API 密钥、设置消费限额,还能追踪每个密钥的使用情况。

把这份指南发给你的智能体,让它完成安装即可。

在 X 看原帖 ↗
3.9K2010214
工具 · @Saccc_c▲ 1.7万

30分钟用Teamily AI搭好AI 3D信息监控网站

用户借助Teamily AI,30分钟搭建完成AI 3D信息监控网站

阅读全文 →
1.7万248927
大语言模型 · @antiAIvo▲ 6.2K

4小时从零手写GPT-2视频,是LLM底层实现优质入门教程

原AI学习者@antiAIvo在𝕏推荐Andrej Karpathy的4小时PyTorch入门教程视频

如果你想要真正弄懂大语言模型(LLM)的底层实现,@karpathy的这期长达4小时的视频,是非常优质的入门教程。

视频中演示了如何只用纯PyTorch,从零开始手写一个GPT-2。

分享者本身是AI原生学习者,全程借助Claude辅助学习,没有看过其他教程,已经自己实现过GPT-2。但分享者仍认为值得回炉重学这个教程,因为Karpathy是业内资深研究者,重新复盘他的设计思路能收获很多。

在 X 看原帖 ↗
6.2K37166146
大模型 · @0xMorlex▲ 1.8万

马斯克旗下Grok Bot接入Claude Opus 5.5完成重大升级

网友0xMorlex在𝕏爆料,Grok Bot接入Claude Opus 5.5后可独立完成完整AI团队工作,还有搭建步骤

Grok Bot刚刚完成了一次重大的核心升级。

本次升级将Claude Opus 5.5接入了Grok Bot的技术栈。

升级后的单个Grok Bot就可以完成一整支AI团队的全部工作,包括调研、编写代码、调用工具、验证结果以及交付最终成果。

0xMorlex发布了10步搭建这款升级后Grok Bot的教程链接:

在 X 看原帖 ↗
1.8万9149234
动态 · @rabi_guha导语出处▲ 3.5K

OpenAI 推出 ChatGPT 生成式UI,拆解后发现不输出原生代码

开发者rabi_guha拆解ChatGPT新版生成式UI,核心是新语言DIL编译渲染流程

ChatGPT昨日推出了自研版本的生成式UI(Generative UI),开发者rabi_guha对其技术实现做了拆解。

生成式UI的智能代理不输出原生代码,而是输出一种全新语言DIL。随后由服务器编译DIL并以流的形式传输,最后由客户端通过组件集渲染界面。

这套流程能让生成的界面给用户带来原生应用的使用感受。

在 X 看原帖 ↗
3.5K765100
开源 · @aehyok▲ 3.9K

一分钟安装开源插件 让你的AI聊天机器人免费变强十倍

来自@aehyok分享,适配Muse、Grok Bot、Dot,白嫖OpenRouter免费大模型

这个开源插件可让Muse的能力增强十倍,还支持Grok Bot和Dot安装使用。

插件原理是在本地调用代理,让OpenRouter上的免费大模型承担运算工作,原有AI助理本身不用更换核心模型。

OpenRouter的免费大模型支持无限tokens,全部旗舰模型每天自动更新,安装只需要一分钟。

安装步骤如下:先前往对应链接申请一个OpenRouter API密钥。

再给你的助理发送指令:指定插件链接,同时附上你的OPENROUTER_API_KEY,即可完成安装。

安装后可以使用Space Bunny Alpha、NVIDIA Nemotron 3 Ultra、Ling-3.1-flash等多个大模型。

有两个使用提醒:未充值账户每天可调用50次,累计充值10美元后可提升到每天1000次。目前该插件为最小可行版本(MVP),切换模型需要用户手动确认。

在 X 看原帖 ↗
3.9K74456
动态 · @yifanxu_ephai▲ 2.9K

新加坡南洋理工AI学生辍学all in agent infra,原因是什么

NTU人工智能专业辍学学生yifanxu在𝕏分享自己转向agent infra赛道的经历

阅读全文 →
2.9K24425
大模型 · @realWeZZard▲ 1.4K

本地AI计算机使用服务思考时间比Claude Opus少一半

博主realWeZZard测试,pi+Qwen 3.8 27B+DiffusionGemma组合对比Claude Opus 5.5,思考时长缩短超一半

开发者realWeZZard在𝕏分享了自己组合Jev进行计算机使用任务的测试结果。对比Claude Code上的Opus 5.5,测试用的pi+Qwen 3.8 27B+DiffusionGemma组合任务轮次大幅减少,思考时间缩短超过一半。本次测试尚未优化Qwen 3.8 27B的本地推理效率。

测试后发现,高效计算机使用任务的核心是规划-执行(planner-executor)模式,而非单一的ReAct模式。Jev可为执行部分提供高速智能,这是此前做不到的。

基于测试结果,得到两条经验。一是所有原本适用规划-执行模式的业务,都可以用Jev重新优化;二是所有原本用单一ReAct模式的业务,都可以考虑通过Jev赋能的规划-执行模式提升体验。

realWeZZard个人实验室内的计算机使用服务,正式进入了无限令牌(unlimited token)时代。

在 X 看原帖 ↗
1.4K53521
开发 · @mizorewww▲ 6.9K

开发者用Claude生成了一款SSH客户端UI

开发者@mizorewww表示,这个由Claude生成的UI仍带有AI生成代码的特征

开发者@mizorewww发布了一个由Claude生成的SSH客户端UI项目。 @mizorewww表示,这个生成结果依然带有AI生成内容(AI Slop)的典型特征。

在 X 看原帖 ↗
6.9K27612
开源 · @suyuan1711▲ 7.6K

Claude Opus 5.5组合开源方案比原生更流畅

用户分享Claude Opus 5.5搭配开源项目Lcu,对接Codex Computer Use的使用体验

OpenAI削减ChatGPT Pro额度后,用户舍不得用GPT运行任务,转而使用Claude。

用户实际使用后发现,Claude Code原生的Computer Use体验很差,复杂操作只能在前台运行,运行期间电脑无法正常使用。

用户调研找到开源方案Lcu,它可以将Codex的Computer Use对接给其他Agent使用。

将Lcu对接Claude Code或Pi之后,使用体验非常流畅,项目链接放在评论区。

在 X 看原帖 ↗
7.6K33673
开发 · @navyabijoy▲ 1.3K

实习公司给全员开通Claude Code免Token限额权限

用户@navyabijoy在𝕏分享,公司允许无限制用Claude Opus 4.6做简单开发

@navyabijoy回忆,自己实习时的公司给所有员工开通了Claude Code访问权限。这家公司没有设置任何token(令牌)限额,因此所有人都放开手脚用Claude Opus 4.6做改变量名、加按钮这类简单开发工作。

在 X 看原帖 ↗
1.3K804
开发 · @juberti▲ 240

使用session.instructions.append可引导OpenAI Live API立即生效

用户juberti在𝕏分享,OpenAI Responses好用,但用session.instructions.append可立即引导Live API

Responses已经很好用了。

你可以使用`session.instructions.append`方法来引导Live API,修改会立即生效。

在 X 看原帖 ↗
24061
计算效率 · @Dimillian▲ 458

极速计算虽不是人人用得起 但体验确实好

用户Dimillian在𝕏分享了对极速计算、流程编排与任务分配的使用感受

我们经常讨论流程编排与任务分配,这点大家都知道。我也明白,极速计算不是所有人都负担得起。但真正用上它之后,能重回流畅工作流的体验实在太棒了。

能够当下立刻完成任务,还能通过智能代理完全掌控任务,这种体验刚好符合需求。

在 X 看原帖 ↗
4587
设计 · @mohamedgshoaib▲ 745

阿拉伯语用户分享设计系统链接,调用Claude生成面试内容

用户@mohamedgshoaib在𝕏分享优质设计系统链接,提及可调用Claude生成定制面试内容

用户@mohamedgshoaib在𝕏平台分享了两个优质设计系统链接,分别是

@mohamedgshoaib表示,无论选择哪个设计系统,都可以将链接发送给Claude的Sol或Opus模型,配合

可以生成类似这样的提示词:using the reference attached, interview me about the design system i want to build from a-z(使用附件中的参考资料,就我想要从零搭建的设计系统对我进行面试)。

在 X 看原帖 ↗
7452263
视频生成 · @Fujimoto_hina▲ 1.6K

Veo 3.1生成10秒荔枝雪葩微缩景观AI视频

用户Fujimoto_hina在𝕏发布了一段由Veo 3.1生成的AI视频提示词,包含完整分镜细节

阅读全文 →
1.6K54115

今天的 37 条信号到这里下一轮 12:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新