Cloud 会话会在全新虚拟机上为每个任务运行 Claude Code,因此你可以同时启动多个任务,并且即使你合上电脑,这些任务也会继续运行。
我们编写了一份使用指南,包含适配它们的七种工作流,另外还介绍了如何在第一次尝试时就连上 GitHub。
Mistral Large 4 的评价出现反转。一位测试者推翻了自己此前的负面结论,说原测试没开启推理功能,重测后模型表现明显更好。这为还在观望的用户修正了一条参考线。
来源@superalesha「测试者推翻此前对Mistral大模型的负面评价」
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,参数规模小,官方称其端侧效率超过参数量两倍于它的大模型,可配合 Gemma 4 做离线隐私优先的检索增强。想在本地跑 AI 应用的人多了一个官方选件。
来源@Google「谷歌发布EmbeddingGemma 2,端侧效率超两倍大模型」
Anthropic 把最高能力的 Claude Mythos 开放给通过验证的安全研究员,用于安全研究,普通渠道暂不开放。安全从业者不需要等公开版本,就能先调用这档模型做攻防研究。
来源@AnthropicAI「Anthropic给安全专家开放了最强Claude Mythos模型」
新的AI纹理模型刚刚开源 🎉 UltraTex可以为3D模型生成精确纹理(甚至能生成干净、可识别的文字),并且可以本地免费运行。 它使用FLUX.2 Klein base 9B + UltraTex LoRA来生成2K分辨率纹理。
掌握属于你自己的智能栈吧,朋友们!先从利用智能体轨迹中丰富的知识开始。 然后训练小型的专用模型来解决生产问题。 @OvermindLab 是开源项目,能让这件事落地。
Mistral 发布了 Large 4 预览版。参数规模 1 万亿,激活参数 490 亿。训练在自有集群上进行。集群由 3800 块 NVIDIA Grace Blackwell GPU 组成。预览版已开放 API,公司承诺月底放出开源权重。
推理级别只有两个选项:'none“ 不思考直接答,”high“ 先想清楚再动手。画鹈鹕能看出差别。”high' 模式画得更好,输出 token 也更少:2717 个对 3275 个。深度思考并不等于写更多。
Artificial Analysis 给 Large 4 打了 38 分。
𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)
OpenAI在数学推理领域的探索又有了新进展,普通用户可以期待未来AI在复杂计算推理方向能力提升
这个观点打破了大家对AI产品用户定位的常规认知,帮你换个角度看AI工具的设计逻辑
开发者可以把多个编码任务同时放在不同虚拟机运行,不用盯着电脑等任务完成再开新活。
Cloud 会话会在全新虚拟机上为每个任务运行 Claude Code,因此你可以同时启动多个任务,并且即使你合上电脑,这些任务也会继续运行。
我们编写了一份使用指南,包含适配它们的七种工作流,另外还介绍了如何在第一次尝试时就连上 GitHub。
想要搭建本地多模态嵌入功能,现在又多了一个可直接使用的轻量开源选项,无需依赖闭源服务。
企业可以把各种重复工作直接分配给这个AI同事完成,想给公司落地AI的团队不用从零搭建了。
机器人做复杂任务出错时,人类可以远程接手调整,给实体机器人落地AI提供了新路径。
我们推出了Cortex Harness,这是一个在真人形机器人上运行AI模型并提供远程人类指导的平台。
你可以提示机器人行动,用语言引导它。当需要时,可以让人类远程接管,保证任务继续推进。
你可以选择 GPT-6 Astra(超快版)、Claude、Gemini、开放权重模型和VLA。下面介绍它的工作原理 🧵
如果你做的工作不允许内容泄露、出问题或落入他人之手,可以选择这项由你掌控的安全AI服务。
Frontier/1 已推出。这是由你掌控的安全 AI。
通常情况下,使用 AI 的代价是泄露机密:你最重要的工作内容会传输到你未选择的地点,通过你无法检查的模型,在你没有选择的法律管辖下运行。
我们提供开放权重模型,或你自己的模型,运行在专属 NVIDIA 硬件上,托管在你选择的国家。每个模型在运行前都会经过扫描、签名和验证。每个请求在进入时都会被检查,每个回答在输出时也会被检查。
如果你从事的工作不允许泄露、失败或落入坏人之手,这就是我们为你打造的产品。
全方面超越旧版,生成图像更自然,支持基于蒙版的编辑,可以立即在线体验效果。
推出 @NanoBanana 2.1 🍌
我们最新的图像生成模型,在各方面都优于我们之前的模型:
- 更出色的视觉设计
- 基于蒙版的编辑功能
- 主体一致性更好
- 图像观感更自然
现在就可以试用它
如果LLM真能稳定产出全新研究创意,未来科研工作流会产生重要变化,这项新方法给出了量化评估的路径。
大语言模型能否产生新颖的研究想法?我们提出了“定价引导”(Priced Guidance)方法,通过压缩来对这一问题进行量化!
我们给出了大语言模型预测未来论文想法X的概率P的下界。与不断采样想法直到匹配X不同,我们的方法里大语言模型通过玩“20个问题”游戏来复原X,并根据惊奇程度给每个提示定价。
想要让企业AI真正落地,必须打通现有业务系统数据。这个基础设施能解决集成层面的长期痛点,降低企业AI项目失败风险。
它能实现长周期视觉规划,语义抽象会自然在各层级生成,给AI规划任务提供了新的稳定训练方案。
我们介绍 H-JEPA:首个用于长周期视觉规划的端到端学习分层世界模型!
它构建于 SIGReg/LeWM 之上,提供了一套稳定的训练方案,语义抽象会在各个层级自然涌现……
论文+代码:🧵
搭配Gemma 4可实现离线隐私优先的RAG,参数规模小,适合端侧本地部署,追求离线AI隐私的开发者可以试用
现在介绍 EmbeddingGemma 2,这是一个全新的开源多模态模型,为端侧效率树立了新标杆。
它是我们首个原生多模态开源嵌入模型,可在轻量模块化的 740M 参数架构下处理文本、代码、图像、视频和音频任务。
搭配 Gemma 4 使用时,它非常适合离线、隐私优先的检索增强生成(RAG)。
它的表现超过了部分规模是它两倍以上的专用模型。
权重现已在 Hugging Face 开放下载。
安全从业者通过验证就能直接使用最高能力的模型做研究,不用等普通渠道开放权限。
我们正在扩展网络安全验证项目,为安全专业人员提供更广泛的权限来访问我们能力最强的模型。
通过该项目,经过验证的安全专业人员可以访问 Claude Mythos 5.1、Opus 5.5 和 Sonnet 5.5,并使用专为防御性工作设计的安全保障措施。
我们还开放了新层级,允许开展获得授权的攻击性工作,比如渗透测试和红队演练。
想要评测前沿AI在复杂任务上的能力,就需要足够难的测试场景。这个针对游戏的新基准可以帮研究人员持续追踪AI能力提升。
介绍 GameGym:面向 AI 智能体的终极游戏基准测试 🎮
今天我们发布了部分内部评估环境,用于追踪前沿模型在电子游戏上的性能表现。它测量两项核心关键指标:完成率和速度。
和速通类似,虽然完成率最终可能会达到饱和,但速度被设计为一个长期有效的指标,可持续用来衡量改进。
游戏是 AI 最难掌握的挑战之一:3D、实时、长周期、非确定性,并且环境极度多样化。我们相信这是为“终局阶段”打造的完美基准测试。
X用户@0xblacklight提出代码变更后精准测试的三点需求,寻找通用解决方案开发者
X用户@0xblacklight提出了一套代码变更后精准测试的需求,询问目前是否有开发者在打造适配通用场景的解决方案。
这套需求共有三点。第一点是对变更的代码部分确定性运行测试,推测可以通过抽象语法树(AST)实现。
第二点是使用jev选择测试套件或类似功能。第三点是允许在测试文件中声明通配路径,当路径对应的文件发生变更时,自动触发对应测试运行。
𝕏用户superalesha修正此前测试结果:原测试未开启推理功能,重测后模型表现更好
OKX NOW开场演讲披露OKX将拓展支付、投资等业务,AI已深度融入内部工作流
用户@Misstang1102在𝕏分享了观看OKX NOW开场演讲后的感受。此前多数人对OKX的第一印象是加密货币交易所,本次演讲透露出OKX的业务布局早已不止交易领域。
演讲提到OKX未来将围绕四个方向发展,分别是让用户持有自有资金、便捷支付、投资多类型资产,以及通过智能工具实现财富增长。
跨境支付目前流程繁琐、耗时久成本高,演讲提到加密技术大规模应用后,7×24小时全球结算有望变得更普及自然。
AI方面,OKX工程团队目前约95%的代码合并请求已通过AI工作流完成,上月OKX在大模型相关投入达到1000万美元。除交易外,AI还可应用在客服、反欺诈、风控与合规等领域,提升用户体验与平台效率。
OKX目前不再只强调加密原生,而是尝试融合加密技术、传统金融与AI。当前加密行业与传统金融的边界正在逐渐模糊,未来用户更关注产品能否满足资金管理、支付、投资需求,而非其来源。
这场演讲传递出OKX正在重新定位自身,从交易所出发逐步转向全球金融科技平台,其业务布局范围远大于单纯的交易所。
开发者MoureDev在X平台分享自己使用OpenClaw的体验,同时向网友询问多款AI工具的使用情况
MoureDev表示,自己对OpenClaw非常满意,因此至今还没有尝试测试其他新的AI工具。
这些还未测试的工具包括Grok Bot、OpenAI Dots、Meta Muse。
MoureDev向网友提问:你正在使用其中任何一款工具吗?使用体验如何?平时都用在哪些场景?
@pratikg在𝕏介绍Yukon的运作流程,已解决密码学、数学等领域难题,正拓展生命化学方向
不少人询问Yukon的多人自动研究机制,@pratikg为此制作了完整步骤的可视化说明。
首先,由人类发起挑战,发布一道难度较高的问题,同时给出明确评分标准和自动验证程序。
人类解题者和AI模型可以同时尝试解决问题,Claude、GPT、Gemini、DeepSeek、Qwen、Kimi、GLM等任意模型、任意框架都可参与。
每一次尝试的结果都需要经过自动验证程序检验。
当某个结果超过当前最优水平,它就会成为新的基准,也就是下一轮需要超越的记录。
所有人都可以基于这个新的最优结果继续拓展,不需要从零开始,之后重复这个循环。
所有结果和提交内容都是开源的,任何人都可以追溯每条记录的生成过程。
@pratikg认为,这就是通用人工智能及后通用人工智能时代前沿科研的开展方式。
目前该平台已经解决了密码学、数学、科学以及开放权重模型领域的多个难题,接下来将继续在这些方向推进,同时开始探索生物学、化学和材料科学领域。相关已解决和正在解决的问题可查看对应链接。
由用户@gippp69在𝕏分享,可自动切换Sonnet与Opus
一位 Anthropic 工程师给 Claude Code 制定的规则,本质上把 Sonnet 5.5 和 Opus 5.5 变成了一个自路由智能体栈。这玩意儿牛逼坏了——把提示词扔进 Claude Code,它自己就能处理那些烦人的事:任务简单的时候用 Sonnet,检查不通过的时候升级任务,只把真正相关的上下文交给 Opus。
更少操心,更少无效上下文,更少没必要的昂贵调用。↓
测试Claude Sonnet 5.5显示速度快2.8倍,成本降27%
本文来自@RohOnChain在𝕏的分享,包含从开户到实盘的完整步骤
它能实现长周期视觉规划,语义抽象会自然在各层级生成,给AI规划任务提供了新的稳定训练方案。
我们介绍 H-JEPA:首个用于长周期视觉规划的端到端学习分层世界模型!
它构建于 SIGReg/LeWM 之上,提供了一套稳定的训练方案,语义抽象会在各个层级自然涌现……
论文+代码:🧵
如果LLM真能稳定产出全新研究创意,未来科研工作流会产生重要变化,这项新方法给出了量化评估的路径。
大语言模型能否产生新颖的研究想法?我们提出了“定价引导”(Priced Guidance)方法,通过压缩来对这一问题进行量化!
我们给出了大语言模型预测未来论文想法X的概率P的下界。与不断采样想法直到匹配X不同,我们的方法里大语言模型通过玩“20个问题”游戏来复原X,并根据惊奇程度给每个提示定价。
想要评测前沿AI在复杂任务上的能力,就需要足够难的测试场景。这个针对游戏的新基准可以帮研究人员持续追踪AI能力提升。
介绍 GameGym:面向 AI 智能体的终极游戏基准测试 🎮
今天我们发布了部分内部评估环境,用于追踪前沿模型在电子游戏上的性能表现。它测量两项核心关键指标:完成率和速度。
和速通类似,虽然完成率最终可能会达到饱和,但速度被设计为一个长期有效的指标,可持续用来衡量改进。
游戏是 AI 最难掌握的挑战之一:3D、实时、长周期、非确定性,并且环境极度多样化。我们相信这是为“终局阶段”打造的完美基准测试。
想要让企业AI真正落地,必须打通现有业务系统数据。这个基础设施能解决集成层面的长期痛点,降低企业AI项目失败风险。
搭配Gemma 4可实现离线隐私优先的RAG,参数规模小,适合端侧本地部署,追求离线AI隐私的开发者可以试用
现在介绍 EmbeddingGemma 2,这是一个全新的开源多模态模型,为端侧效率树立了新标杆。
它是我们首个原生多模态开源嵌入模型,可在轻量模块化的 740M 参数架构下处理文本、代码、图像、视频和音频任务。
搭配 Gemma 4 使用时,它非常适合离线、隐私优先的检索增强生成(RAG)。
它的表现超过了部分规模是它两倍以上的专用模型。
权重现已在 Hugging Face 开放下载。
全方面超越旧版,生成图像更自然,支持基于蒙版的编辑,可以立即在线体验效果。
推出 @NanoBanana 2.1 🍌
我们最新的图像生成模型,在各方面都优于我们之前的模型:
- 更出色的视觉设计
- 基于蒙版的编辑功能
- 主体一致性更好
- 图像观感更自然
现在就可以试用它
如果你做的工作不允许内容泄露、出问题或落入他人之手,可以选择这项由你掌控的安全AI服务。
Frontier/1 已推出。这是由你掌控的安全 AI。
通常情况下,使用 AI 的代价是泄露机密:你最重要的工作内容会传输到你未选择的地点,通过你无法检查的模型,在你没有选择的法律管辖下运行。
我们提供开放权重模型,或你自己的模型,运行在专属 NVIDIA 硬件上,托管在你选择的国家。每个模型在运行前都会经过扫描、签名和验证。每个请求在进入时都会被检查,每个回答在输出时也会被检查。
如果你从事的工作不允许泄露、失败或落入坏人之手,这就是我们为你打造的产品。
企业可以把各种重复工作直接分配给这个AI同事完成,想给公司落地AI的团队不用从零搭建了。
安全从业者通过验证就能直接使用最高能力的模型做研究,不用等普通渠道开放权限。
我们正在扩展网络安全验证项目,为安全专业人员提供更广泛的权限来访问我们能力最强的模型。
通过该项目,经过验证的安全专业人员可以访问 Claude Mythos 5.1、Opus 5.5 和 Sonnet 5.5,并使用专为防御性工作设计的安全保障措施。
我们还开放了新层级,允许开展获得授权的攻击性工作,比如渗透测试和红队演练。
独立3D创作者不用买云端服务,就能生成带清晰文字的纹理,降低了3D内容创作的门槛。
新的AI纹理模型刚刚开源 🎉
UltraTex可以为3D模型生成精确纹理(甚至能生成干净、可识别的文字),并且可以本地免费运行。
它使用FLUX.2 Klein base 9B + UltraTex LoRA来生成2K分辨率纹理。权重已经发布。
你可以在下方找到UltraTex的ComfyUI仓库 👇
原渲染作者:visualbruno
开发者可以把多个编码任务同时放在不同虚拟机运行,不用盯着电脑等任务完成再开新活。
Cloud 会话会在全新虚拟机上为每个任务运行 Claude Code,因此你可以同时启动多个任务,并且即使你合上电脑,这些任务也会继续运行。
我们编写了一份使用指南,包含适配它们的七种工作流,另外还介绍了如何在第一次尝试时就连上 GitHub。
机器人做复杂任务出错时,人类可以远程接手调整,给实体机器人落地AI提供了新路径。
我们推出了Cortex Harness,这是一个在真人形机器人上运行AI模型并提供远程人类指导的平台。
你可以提示机器人行动,用语言引导它。当需要时,可以让人类远程接管,保证任务继续推进。
你可以选择 GPT-6 Astra(超快版)、Claude、Gemini、开放权重模型和VLA。下面介绍它的工作原理 🧵
想要搭建本地多模态嵌入功能,现在又多了一个可直接使用的轻量开源选项,无需依赖闭源服务。
这个观点打破了大家对AI产品用户定位的常规认知,帮你换个角度看AI工具的设计逻辑
OpenAI在数学推理领域的探索又有了新进展,普通用户可以期待未来AI在复杂计算推理方向能力提升
Codex和Work用户每天可获得一项更新优化,没有更新的日子则会重置内容,关注活动可以第一时间获取新功能调整信息。
看来OpenAI团队觉得DevDay的一连串公告还不够。从今天开始,大部分Codex或Work用户每天都会获得一项明确的功能改进。如果哪天没有新改进,所有人反而会获得一次完整重置。有什么不可以呢?
我们每天都会更新这个话题。点击任意公告就能直接跳转到相关帖子。
第1天:GPT-6-Astra和GPT-6.1-Sol性能升级
第2天:Auto-Review现已免费
在接下来的28天里
可以从智能体运行轨迹提取数据,训练专属小模型解决生产问题,适合搭建个人可控AI技术栈。
掌握属于你自己的智能栈吧,朋友们!先从利用智能体轨迹中丰富的知识开始。
然后训练小型的专用模型来解决生产问题。
@OvermindLab 是开源项目,能让这件事落地。它会从你的智能体轨迹构建数据集,用你当前的模型对这些数据集进行评估,然后训练出一个你拥有的更小的专用模型。
本文来自@RohOnChain在𝕏的分享,包含从开户到实盘的完整步骤
开发者ShenSeanChen发布讲解视频,所有组件均为开源项目
测试Claude Sonnet 5.5显示速度快2.8倍,成本降27%
由用户@gippp69在𝕏分享,可自动切换Sonnet与Opus
一位 Anthropic 工程师给 Claude Code 制定的规则,本质上把 Sonnet 5.5 和 Opus 5.5 变成了一个自路由智能体栈。这玩意儿牛逼坏了——把提示词扔进 Claude Code,它自己就能处理那些烦人的事:任务简单的时候用 Sonnet,检查不通过的时候升级任务,只把真正相关的上下文交给 Opus。
更少操心,更少无效上下文,更少没必要的昂贵调用。↓
@pratikg在𝕏介绍Yukon的运作流程,已解决密码学、数学等领域难题,正拓展生命化学方向
不少人询问Yukon的多人自动研究机制,@pratikg为此制作了完整步骤的可视化说明。
首先,由人类发起挑战,发布一道难度较高的问题,同时给出明确评分标准和自动验证程序。
人类解题者和AI模型可以同时尝试解决问题,Claude、GPT、Gemini、DeepSeek、Qwen、Kimi、GLM等任意模型、任意框架都可参与。
每一次尝试的结果都需要经过自动验证程序检验。
当某个结果超过当前最优水平,它就会成为新的基准,也就是下一轮需要超越的记录。
所有人都可以基于这个新的最优结果继续拓展,不需要从零开始,之后重复这个循环。
所有结果和提交内容都是开源的,任何人都可以追溯每条记录的生成过程。
@pratikg认为,这就是通用人工智能及后通用人工智能时代前沿科研的开展方式。
目前该平台已经解决了密码学、数学、科学以及开放权重模型领域的多个难题,接下来将继续在这些方向推进,同时开始探索生物学、化学和材料科学领域。相关已解决和正在解决的问题可查看对应链接。
开发者MoureDev在X平台分享自己使用OpenClaw的体验,同时向网友询问多款AI工具的使用情况
MoureDev表示,自己对OpenClaw非常满意,因此至今还没有尝试测试其他新的AI工具。
这些还未测试的工具包括Grok Bot、OpenAI Dots、Meta Muse。
MoureDev向网友提问:你正在使用其中任何一款工具吗?使用体验如何?平时都用在哪些场景?
OKX NOW开场演讲披露OKX将拓展支付、投资等业务,AI已深度融入内部工作流
用户@Misstang1102在𝕏分享了观看OKX NOW开场演讲后的感受。此前多数人对OKX的第一印象是加密货币交易所,本次演讲透露出OKX的业务布局早已不止交易领域。
演讲提到OKX未来将围绕四个方向发展,分别是让用户持有自有资金、便捷支付、投资多类型资产,以及通过智能工具实现财富增长。
跨境支付目前流程繁琐、耗时久成本高,演讲提到加密技术大规模应用后,7×24小时全球结算有望变得更普及自然。
AI方面,OKX工程团队目前约95%的代码合并请求已通过AI工作流完成,上月OKX在大模型相关投入达到1000万美元。除交易外,AI还可应用在客服、反欺诈、风控与合规等领域,提升用户体验与平台效率。
OKX目前不再只强调加密原生,而是尝试融合加密技术、传统金融与AI。当前加密行业与传统金融的边界正在逐渐模糊,未来用户更关注产品能否满足资金管理、支付、投资需求,而非其来源。
这场演讲传递出OKX正在重新定位自身,从交易所出发逐步转向全球金融科技平台,其业务布局范围远大于单纯的交易所。
𝕏用户superalesha修正此前测试结果:原测试未开启推理功能,重测后模型表现更好
X用户@0xblacklight提出代码变更后精准测试的三点需求,寻找通用解决方案开发者
X用户@0xblacklight提出了一套代码变更后精准测试的需求,询问目前是否有开发者在打造适配通用场景的解决方案。
这套需求共有三点。第一点是对变更的代码部分确定性运行测试,推测可以通过抽象语法树(AST)实现。
第二点是使用jev选择测试套件或类似功能。第三点是允许在测试文件中声明通配路径,当路径对应的文件发生变更时,自动触发对应测试运行。
今天的 26 条信号到这里下一轮 12:30 更新
https://ai-pulse-lab.com/feed.xml
每天 08:00 · 12:30 · 18:30 · 23:50 更新
在阅读器里订阅
添加到 Feedly、Inoreader 等阅读器
https://ai-pulse-lab.com/feed.xml
让你的 Agent 自动获取每轮简报
适用于 Claude、ChatGPT、Manus 等
请帮我设置一个定时任务,每天北京时间 08:30、13:00、19:00、00:20 各执行一次: 请求 https://ai-pulse-lab.com/api/brief.json,读取返回 JSON 中的 textPlain 字段,将内容发送给我。 补充:每日北京时间 08:00、12:30、18:30、23:50 更新,建议更新后 30 分钟查询。可先请求 /api/manifest.json 检查 nextUpdateAt 字段。无需认证,直接 GET 请求即可。