AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 10 月 7 日 · 08:00 更新 0 文章0 信号0 主题
✦
试试:

今天发生了什么1 分钟读懂

Mistral Large 4 的评价出现反转。一位测试者推翻了自己此前的负面结论,说原测试没开启推理功能,重测后模型表现明显更好。这为还在观望的用户修正了一条参考线。

来源@superalesha「测试者推翻此前对Mistral大模型的负面评价」

Google 发布开源多模态嵌入模型 EmbeddingGemma 2,参数规模小,官方称其端侧效率超过参数量两倍于它的大模型,可配合 Gemma 4 做离线隐私优先的检索增强。想在本地跑 AI 应用的人多了一个官方选件。

来源@Google「谷歌发布EmbeddingGemma 2,端侧效率超两倍大模型」

Anthropic 把最高能力的 Claude Mythos 开放给通过验证的安全研究员,用于安全研究,普通渠道暂不开放。安全从业者不需要等公开版本,就能先调用这档模型做攻防研究。

来源@AnthropicAI「Anthropic给安全专家开放了最强Claude Mythos模型」

今日值得看
01 tui-design:让AI画终端界面的Skill tui-design:AI从写代码跨界到终端UI设计,草稿、模拟、审计全包 02 Kling 3.0 拍泪珠落下的视频提示词 中文提示词直接驱动 Kling 3.0,15秒1080p 还带泪珠特写。
03 开源UltraTex能本地免费给3D模型生成精准纹理 独立3D创作者不用买云端服务,就能生成带清晰文字的纹理,降低了3D内容创作的门槛。

新的AI纹理模型刚刚开源 🎉 UltraTex可以为3D模型生成精确纹理(甚至能生成干净、可识别的文字),并且可以本地免费运行。 它使用FLUX.2 Klein base 9B + UltraTex LoRA来生成2K分辨率纹理。

04 OvermindLab开源自定义训练小模型工具 可以从智能体运行轨迹提取数据,训练专属小模型解决生产问题,适合搭建个人可控AI技术栈。

掌握属于你自己的智能栈吧,朋友们!先从利用智能体轨迹中丰富的知识开始。 然后训练小型的专用模型来解决生产问题。 @OvermindLab 是开源项目,能让这件事落地。

今日焦点

Mistral Large 4预览版:深度思考画鹈鹕更好,token反而更少

Mistral 发布了 Large 4 预览版。参数规模 1 万亿,激活参数 490 亿。训练在自有集群上进行。集群由 3800 块 NVIDIA Grace Blackwell GPU 组成。预览版已开放 API,公司承诺月底放出开源权重。

推理级别只有两个选项:'none“ 不思考直接答,”high“ 先想清楚再动手。画鹈鹕能看出差别。”high' 模式画得更好,输出 token 也更少:2717 个对 3275 个。深度思考并不等于写更多。

Artificial Analysis 给 Large 4 打了 38 分。

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达26 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

08:00 本轮更新 · 下一轮 12:30
行业动态 · Hacker News▲ 38

OpenAI发布数学手稿与支撑证明工件

OpenAI在数学推理领域的探索又有了新进展,普通用户可以期待未来AI在复杂计算推理方向能力提升

行业动态 · Hacker News▲ 59

开发者讨论Claude Code功能,提出新观点

这个观点打破了大家对AI产品用户定位的常规认知,帮你换个角度看AI工具的设计逻辑

开发工具 · @ClaudeDevs▲ 2.6万

Claude Code能关着笔记本同时跑多个开发任务

开发者可以把多个编码任务同时放在不同虚拟机运行,不用盯着电脑等任务完成再开新活。

Cloud 会话会在全新虚拟机上为每个任务运行 Claude Code,因此你可以同时启动多个任务,并且即使你合上电脑,这些任务也会继续运行。

我们编写了一份使用指南,包含适配它们的七种工作流,另外还介绍了如何在第一次尝试时就连上 GitHub。

在 X 看原帖 ↗
2.6万17397188
行业动态 · Hacker News▲ 180

开发者开源轻量开源 EmbeddingGemma 2 多模态模型

想要搭建本地多模态嵌入功能,现在又多了一个可直接使用的轻量开源选项,无需依赖闭源服务。

企业协作 · @danshipper▲ 2.4万

Every Agent把AI同事直接放进了Slack工作区

企业可以把各种重复工作直接分配给这个AI同事完成,想给公司落地AI的团队不用从零搭建了。

阅读全文 →
2.4万7157112
机器人 · @cortexairobot▲ 1.7万

Cortex Harness能靠语言提示远程操控实体机器人

机器人做复杂任务出错时,人类可以远程接手调整,给实体机器人落地AI提供了新路径。

我们推出了Cortex Harness,这是一个在真人形机器人上运行AI模型并提供远程人类指导的平台。

你可以提示机器人行动,用语言引导它。当需要时,可以让人类远程接管,保证任务继续推进。

你可以选择 GPT-6 Astra(超快版)、Claude、Gemini、开放权重模型和VLA。下面介绍它的工作原理 🧵

在 X 看原帖 ↗
1.7万116329
新品发布 · @frontier1_ai▲ 6.9万

Frontier/1 AI发布可控安全AI服务

如果你做的工作不允许内容泄露、出问题或落入他人之手,可以选择这项由你掌控的安全AI服务。

Frontier/1 已推出。这是由你掌控的安全 AI。

通常情况下,使用 AI 的代价是泄露机密:你最重要的工作内容会传输到你未选择的地点,通过你无法检查的模型,在你没有选择的法律管辖下运行。

我们提供开放权重模型,或你自己的模型,运行在专属 NVIDIA 硬件上,托管在你选择的国家。每个模型在运行前都会经过扫描、签名和验证。每个请求在进入时都会被检查,每个回答在输出时也会被检查。

如果你从事的工作不允许泄露、失败或落入坏人之手,这就是我们为你打造的产品。

在 X 看原帖 ↗
6.9万5220638
新品发布 · @GoogleAIStudio▲ 22.5万

GoogleAIStudio发布新版NanoBanana 2.1模型

全方面超越旧版,生成图像更自然,支持基于蒙版的编辑,可以立即在线体验效果。

推出 @NanoBanana 2.1 🍌

我们最新的图像生成模型,在各方面都优于我们之前的模型:
- 更出色的视觉设计
- 基于蒙版的编辑功能
- 主体一致性更好
- 图像观感更自然

现在就可以试用它

在 X 看原帖 ↗
22.5万3054.4K802
前沿研究 · @wen_kaiyue▲ 10.0K

研究者用20问测LLM生成新研究创意能力

如果LLM真能稳定产出全新研究创意,未来科研工作流会产生重要变化,这项新方法给出了量化评估的路径。

大语言模型能否产生新颖的研究想法?我们提出了“定价引导”(Priced Guidance)方法,通过压缩来对这一问题进行量化!

我们给出了大语言模型预测未来论文想法X的概率P的下界。与不断采样想法直到匹配X不同,我们的方法里大语言模型通过玩“20个问题”游戏来复原X,并根据惊奇程度给每个提示定价。

在 X 看原帖 ↗
10.0K40173115
新品发布 · @ayanb▲ 35.2万

Ampersand推出企业智能体集成基础设施

想要让企业AI真正落地,必须打通现有业务系统数据。这个基础设施能解决集成层面的长期痛点,降低企业AI项目失败风险。

阅读全文 →
35.2万1.5K362256
前沿研究 · @randall_balestr▲ 1.7万

首个端到端分层世界模型H-JEPA发布

它能实现长周期视觉规划,语义抽象会自然在各层级生成,给AI规划任务提供了新的稳定训练方案。

我们介绍 H-JEPA:首个用于长周期视觉规划的端到端学习分层世界模型!

它构建于 SIGReg/LeWM 之上,提供了一套稳定的训练方案,语义抽象会在各个层级自然涌现……

论文+代码:🧵

在 X 看原帖 ↗
1.7万41319230
新品发布 · @Google导语出处▲ 86.0万

谷歌发布EmbeddingGemma 2,端侧效率超两倍大模型

搭配Gemma 4可实现离线隐私优先的RAG,参数规模小,适合端侧本地部署,追求离线AI隐私的开发者可以试用

现在介绍 EmbeddingGemma 2,这是一个全新的开源多模态模型,为端侧效率树立了新标杆。

它是我们首个原生多模态开源嵌入模型,可在轻量模块化的 740M 参数架构下处理文本、代码、图像、视频和音频任务。

搭配 Gemma 4 使用时,它非常适合离线、隐私优先的检索增强生成(RAG)。

它的表现超过了部分规模是它两倍以上的专用模型。

权重现已在 Hugging Face 开放下载。

在 X 看原帖 ↗
86.0万1.1K1.3万5.7K
安全 · @AnthropicAI导语出处▲ 1.1万

Anthropic给安全专家开放了最强Claude Mythos模型

安全从业者通过验证就能直接使用最高能力的模型做研究,不用等普通渠道开放权限。

我们正在扩展网络安全验证项目,为安全专业人员提供更广泛的权限来访问我们能力最强的模型。

通过该项目,经过验证的安全专业人员可以访问 Claude Mythos 5.1、Opus 5.5 和 Sonnet 5.5,并使用专为防御性工作设计的安全保障措施。

我们还开放了新层级,允许开展获得授权的攻击性工作,比如渗透测试和红队演练。

在 X 看原帖 ↗
1.1万1210625
前沿研究 · @jjschnyder▲ 4.2K

GameGym 发布 成为AI智能体游戏基准

想要评测前沿AI在复杂任务上的能力,就需要足够难的测试场景。这个针对游戏的新基准可以帮研究人员持续追踪AI能力提升。

介绍 GameGym:面向 AI 智能体的终极游戏基准测试 🎮

今天我们发布了部分内部评估环境,用于追踪前沿模型在电子游戏上的性能表现。它测量两项核心关键指标:完成率和速度。

和速通类似,虽然完成率最终可能会达到饱和,但速度被设计为一个长期有效的指标,可持续用来衡量改进。

游戏是 AI 最难掌握的挑战之一:3D、实时、长周期、非确定性,并且环境极度多样化。我们相信这是为“终局阶段”打造的完美基准测试。

在 X 看原帖 ↗
4.2K1710051
AI开发 · @0xblacklight▲ 9

开发者提三点测试优化需求,询问谁在开发通用方案

X用户@0xblacklight提出代码变更后精准测试的三点需求,寻找通用解决方案开发者

X用户@0xblacklight提出了一套代码变更后精准测试的需求,询问目前是否有开发者在打造适配通用场景的解决方案。

这套需求共有三点。第一点是对变更的代码部分确定性运行测试,推测可以通过抽象语法树(AST)实现。

第二点是使用jev选择测试套件或类似功能。第三点是允许在测试文件中声明通配路径,当路径对应的文件发生变更时,自动触发对应测试运行。

在 X 看原帖 ↗
9
大模型 · @superalesha导语出处▲ 128

测试者推翻此前对Mistral大模型的负面评价

𝕏用户superalesha修正此前测试结果:原测试未开启推理功能,重测后模型表现更好

加密货币 · @Misstang1102▲ 457

OKX不再局限于交易所,正转型全球金融科技平台

OKX NOW开场演讲披露OKX将拓展支付、投资等业务,AI已深度融入内部工作流

用户@Misstang1102在𝕏分享了观看OKX NOW开场演讲后的感受。此前多数人对OKX的第一印象是加密货币交易所,本次演讲透露出OKX的业务布局早已不止交易领域。

演讲提到OKX未来将围绕四个方向发展,分别是让用户持有自有资金、便捷支付、投资多类型资产,以及通过智能工具实现财富增长。

跨境支付目前流程繁琐、耗时久成本高,演讲提到加密技术大规模应用后,7×24小时全球结算有望变得更普及自然。

AI方面,OKX工程团队目前约95%的代码合并请求已通过AI工作流完成,上月OKX在大模型相关投入达到1000万美元。除交易外,AI还可应用在客服、反欺诈、风控与合规等领域,提升用户体验与平台效率。

OKX目前不再只强调加密原生,而是尝试融合加密技术、传统金融与AI。当前加密行业与传统金融的边界正在逐渐模糊,未来用户更关注产品能否满足资金管理、支付、投资需求,而非其来源。

这场演讲传递出OKX正在重新定位自身,从交易所出发逐步转向全球金融科技平台,其业务布局范围远大于单纯的交易所。

在 X 看原帖 ↗
457135
开发者 · @MoureDev▲ 7.8K

西班牙开发者MoureDev称沉迷OpenClaw未测试其他AI工具

开发者MoureDev在X平台分享自己使用OpenClaw的体验,同时向网友询问多款AI工具的使用情况

MoureDev表示,自己对OpenClaw非常满意,因此至今还没有尝试测试其他新的AI工具。

这些还未测试的工具包括Grok Bot、OpenAI Dots、Meta Muse。

MoureDev向网友提问:你正在使用其中任何一款工具吗?使用体验如何?平时都用在哪些场景?

在 X 看原帖 ↗
7.8K45324
科研 · @pratikg▲ 1.9K

Yukon多人自动研究如何运作 可人机协作推进科研

@pratikg在𝕏介绍Yukon的运作流程,已解决密码学、数学等领域难题,正拓展生命化学方向

不少人询问Yukon的多人自动研究机制,@pratikg为此制作了完整步骤的可视化说明。

首先,由人类发起挑战,发布一道难度较高的问题,同时给出明确评分标准和自动验证程序。

人类解题者和AI模型可以同时尝试解决问题,Claude、GPT、Gemini、DeepSeek、Qwen、Kimi、GLM等任意模型、任意框架都可参与。

每一次尝试的结果都需要经过自动验证程序检验。

当某个结果超过当前最优水平,它就会成为新的基准,也就是下一轮需要超越的记录。

所有人都可以基于这个新的最优结果继续拓展,不需要从零开始,之后重复这个循环。

所有结果和提交内容都是开源的,任何人都可以追溯每条记录的生成过程。

@pratikg认为,这就是通用人工智能及后通用人工智能时代前沿科研的开展方式。

目前该平台已经解决了密码学、数学、科学以及开放权重模型领域的多个难题,接下来将继续在这些方向推进,同时开始探索生物学、化学和材料科学领域。相关已解决和正在解决的问题可查看对应链接。

在 X 看原帖 ↗
1.9K55319
开发工具 · @gippp69▲ 4.6K

Anthropic工程师把Claude 5.5改成自路由智能体栈

由用户@gippp69在𝕏分享,可自动切换Sonnet与Opus

一位 Anthropic 工程师给 Claude Code 制定的规则,本质上把 Sonnet 5.5 和 Opus 5.5 变成了一个自路由智能体栈。这玩意儿牛逼坏了——把提示词扔进 Claude Code,它自己就能处理那些烦人的事:任务简单的时候用 Sonnet,检查不通过的时候升级任务,只把真正相关的上下文交给 Opus。

更少操心,更少无效上下文,更少没必要的昂贵调用。↓

在 X 看原帖 ↗
4.6K710599
大模型 · @NFT_Chen▲ 8.2K

让大模型写Markdown CLI渲染,比手写HTML省6.1倍Token

测试Claude Sonnet 5.5显示速度快2.8倍,成本降27%

阅读全文 →
8.2K1476124
AI交易 · @RohOnChain▲ 1.4万

手把手教你用Opus 5.5搭建全天候盈利交易策略框架

本文来自@RohOnChain在𝕏的分享,包含从开户到实盘的完整步骤

阅读全文 →
1.4万1069166
🔬 前沿研究
前沿研究 · @randall_balestr▲ 1.7万

首个端到端分层世界模型H-JEPA发布

它能实现长周期视觉规划,语义抽象会自然在各层级生成,给AI规划任务提供了新的稳定训练方案。

我们介绍 H-JEPA:首个用于长周期视觉规划的端到端学习分层世界模型!

它构建于 SIGReg/LeWM 之上,提供了一套稳定的训练方案,语义抽象会在各个层级自然涌现……

论文+代码:🧵

在 X 看原帖 ↗
1.7万41319230
前沿研究 · @wen_kaiyue▲ 10.0K

研究者用20问测LLM生成新研究创意能力

如果LLM真能稳定产出全新研究创意,未来科研工作流会产生重要变化,这项新方法给出了量化评估的路径。

大语言模型能否产生新颖的研究想法?我们提出了“定价引导”(Priced Guidance)方法,通过压缩来对这一问题进行量化!

我们给出了大语言模型预测未来论文想法X的概率P的下界。与不断采样想法直到匹配X不同,我们的方法里大语言模型通过玩“20个问题”游戏来复原X,并根据惊奇程度给每个提示定价。

在 X 看原帖 ↗
10.0K40173115
前沿研究 · @jjschnyder▲ 4.2K

GameGym 发布 成为AI智能体游戏基准

想要评测前沿AI在复杂任务上的能力,就需要足够难的测试场景。这个针对游戏的新基准可以帮研究人员持续追踪AI能力提升。

介绍 GameGym:面向 AI 智能体的终极游戏基准测试 🎮

今天我们发布了部分内部评估环境,用于追踪前沿模型在电子游戏上的性能表现。它测量两项核心关键指标:完成率和速度。

和速通类似,虽然完成率最终可能会达到饱和,但速度被设计为一个长期有效的指标,可持续用来衡量改进。

游戏是 AI 最难掌握的挑战之一:3D、实时、长周期、非确定性,并且环境极度多样化。我们相信这是为“终局阶段”打造的完美基准测试。

在 X 看原帖 ↗
4.2K1710051
🚀 新品发布
新品发布 · @ayanb▲ 35.2万

Ampersand推出企业智能体集成基础设施

想要让企业AI真正落地,必须打通现有业务系统数据。这个基础设施能解决集成层面的长期痛点,降低企业AI项目失败风险。

阅读全文 →
35.2万1.5K362256
新品发布 · @Google导语出处▲ 86.0万

谷歌发布EmbeddingGemma 2,端侧效率超两倍大模型

搭配Gemma 4可实现离线隐私优先的RAG,参数规模小,适合端侧本地部署,追求离线AI隐私的开发者可以试用

现在介绍 EmbeddingGemma 2,这是一个全新的开源多模态模型,为端侧效率树立了新标杆。

它是我们首个原生多模态开源嵌入模型,可在轻量模块化的 740M 参数架构下处理文本、代码、图像、视频和音频任务。

搭配 Gemma 4 使用时,它非常适合离线、隐私优先的检索增强生成(RAG)。

它的表现超过了部分规模是它两倍以上的专用模型。

权重现已在 Hugging Face 开放下载。

在 X 看原帖 ↗
86.0万1.1K1.3万5.7K
新品发布 · @GoogleAIStudio▲ 22.5万

GoogleAIStudio发布新版NanoBanana 2.1模型

全方面超越旧版,生成图像更自然,支持基于蒙版的编辑,可以立即在线体验效果。

推出 @NanoBanana 2.1 🍌

我们最新的图像生成模型,在各方面都优于我们之前的模型:
- 更出色的视觉设计
- 基于蒙版的编辑功能
- 主体一致性更好
- 图像观感更自然

现在就可以试用它

在 X 看原帖 ↗
22.5万3054.4K802
新品发布 · @frontier1_ai▲ 6.9万

Frontier/1 AI发布可控安全AI服务

如果你做的工作不允许内容泄露、出问题或落入他人之手,可以选择这项由你掌控的安全AI服务。

Frontier/1 已推出。这是由你掌控的安全 AI。

通常情况下,使用 AI 的代价是泄露机密:你最重要的工作内容会传输到你未选择的地点,通过你无法检查的模型,在你没有选择的法律管辖下运行。

我们提供开放权重模型,或你自己的模型,运行在专属 NVIDIA 硬件上,托管在你选择的国家。每个模型在运行前都会经过扫描、签名和验证。每个请求在进入时都会被检查,每个回答在输出时也会被检查。

如果你从事的工作不允许泄露、失败或落入坏人之手,这就是我们为你打造的产品。

在 X 看原帖 ↗
6.9万5220638
📰 行业动态
企业协作 · @danshipper▲ 2.4万

Every Agent把AI同事直接放进了Slack工作区

企业可以把各种重复工作直接分配给这个AI同事完成,想给公司落地AI的团队不用从零搭建了。

阅读全文 →
2.4万7157112
安全 · @AnthropicAI导语出处▲ 1.1万

Anthropic给安全专家开放了最强Claude Mythos模型

安全从业者通过验证就能直接使用最高能力的模型做研究,不用等普通渠道开放权限。

我们正在扩展网络安全验证项目,为安全专业人员提供更广泛的权限来访问我们能力最强的模型。

通过该项目,经过验证的安全专业人员可以访问 Claude Mythos 5.1、Opus 5.5 和 Sonnet 5.5,并使用专为防御性工作设计的安全保障措施。

我们还开放了新层级,允许开展获得授权的攻击性工作,比如渗透测试和红队演练。

在 X 看原帖 ↗
1.1万1210625
开源 · @philippsieben▲ 7.6K

开源UltraTex能本地免费给3D模型生成精准纹理

独立3D创作者不用买云端服务,就能生成带清晰文字的纹理,降低了3D内容创作的门槛。

新的AI纹理模型刚刚开源 🎉

UltraTex可以为3D模型生成精确纹理(甚至能生成干净、可识别的文字),并且可以本地免费运行。

它使用FLUX.2 Klein base 9B + UltraTex LoRA来生成2K分辨率纹理。权重已经发布。

你可以在下方找到UltraTex的ComfyUI仓库 👇

原渲染作者:visualbruno

在 X 看原帖 ↗
7.6K22213277
开发工具 · @ClaudeDevs▲ 2.6万

Claude Code能关着笔记本同时跑多个开发任务

开发者可以把多个编码任务同时放在不同虚拟机运行,不用盯着电脑等任务完成再开新活。

Cloud 会话会在全新虚拟机上为每个任务运行 Claude Code,因此你可以同时启动多个任务,并且即使你合上电脑,这些任务也会继续运行。

我们编写了一份使用指南,包含适配它们的七种工作流,另外还介绍了如何在第一次尝试时就连上 GitHub。

在 X 看原帖 ↗
2.6万17397188
机器人 · @cortexairobot▲ 1.7万

Cortex Harness能靠语言提示远程操控实体机器人

机器人做复杂任务出错时,人类可以远程接手调整,给实体机器人落地AI提供了新路径。

我们推出了Cortex Harness,这是一个在真人形机器人上运行AI模型并提供远程人类指导的平台。

你可以提示机器人行动,用语言引导它。当需要时,可以让人类远程接管,保证任务继续推进。

你可以选择 GPT-6 Astra(超快版)、Claude、Gemini、开放权重模型和VLA。下面介绍它的工作原理 🧵

在 X 看原帖 ↗
1.7万116329
行业动态 · Hacker News▲ 180

开发者开源轻量开源 EmbeddingGemma 2 多模态模型

想要搭建本地多模态嵌入功能,现在又多了一个可直接使用的轻量开源选项,无需依赖闭源服务。

行业动态 · Hacker News▲ 59

开发者讨论Claude Code功能,提出新观点

这个观点打破了大家对AI产品用户定位的常规认知,帮你换个角度看AI工具的设计逻辑

行业动态 · Hacker News▲ 38

OpenAI发布数学手稿与支撑证明工件

OpenAI在数学推理领域的探索又有了新进展,普通用户可以期待未来AI在复杂计算推理方向能力提升

行业动态 · OpenAI 开发者社区▲ 77

OpenAI发布28天体验优化活动(28)

Codex和Work用户每天可获得一项更新优化,没有更新的日子则会重置内容,关注活动可以第一时间获取新功能调整信息。

看来OpenAI团队觉得DevDay的一连串公告还不够。从今天开始,大部分Codex或Work用户每天都会获得一项明确的功能改进。如果哪天没有新改进,所有人反而会获得一次完整重置。有什么不可以呢?

我们每天都会更新这个话题。点击任意公告就能直接跳转到相关帖子。

第1天:GPT-6-Astra和GPT-6.1-Sol性能升级
第2天:Auto-Review现已免费

在接下来的28天里

在社区看讨论 ↗
📌 其他
工具产品 · @omarsar0▲ 3.0K

OvermindLab开源自定义训练小模型工具

可以从智能体运行轨迹提取数据,训练专属小模型解决生产问题,适合搭建个人可控AI技术栈。

掌握属于你自己的智能栈吧,朋友们!先从利用智能体轨迹中丰富的知识开始。

然后训练小型的专用模型来解决生产问题。

@OvermindLab 是开源项目,能让这件事落地。它会从你的智能体轨迹构建数据集,用你当前的模型对这些数据集进行评估,然后训练出一个你拥有的更小的专用模型。

在 X 看原帖 ↗
3.0K32018
AI交易 · @RohOnChain▲ 1.4万

手把手教你用Opus 5.5搭建全天候盈利交易策略框架

本文来自@RohOnChain在𝕏的分享,包含从开户到实盘的完整步骤

阅读全文 →
1.4万1069166
开源 · @ShenSeanChen▲ 3.4K

开发者开源了AI智能体可观测性与评估演示项目

开发者ShenSeanChen发布讲解视频,所有组件均为开源项目

阅读全文 →
3.4K493114
大模型 · @NFT_Chen▲ 8.2K

让大模型写Markdown CLI渲染,比手写HTML省6.1倍Token

测试Claude Sonnet 5.5显示速度快2.8倍,成本降27%

阅读全文 →
8.2K1476124
开发工具 · @gippp69▲ 4.6K

Anthropic工程师把Claude 5.5改成自路由智能体栈

由用户@gippp69在𝕏分享,可自动切换Sonnet与Opus

一位 Anthropic 工程师给 Claude Code 制定的规则,本质上把 Sonnet 5.5 和 Opus 5.5 变成了一个自路由智能体栈。这玩意儿牛逼坏了——把提示词扔进 Claude Code,它自己就能处理那些烦人的事:任务简单的时候用 Sonnet,检查不通过的时候升级任务,只把真正相关的上下文交给 Opus。

更少操心,更少无效上下文,更少没必要的昂贵调用。↓

在 X 看原帖 ↗
4.6K710599
科研 · @pratikg▲ 1.9K

Yukon多人自动研究如何运作 可人机协作推进科研

@pratikg在𝕏介绍Yukon的运作流程,已解决密码学、数学等领域难题,正拓展生命化学方向

不少人询问Yukon的多人自动研究机制,@pratikg为此制作了完整步骤的可视化说明。

首先,由人类发起挑战,发布一道难度较高的问题,同时给出明确评分标准和自动验证程序。

人类解题者和AI模型可以同时尝试解决问题,Claude、GPT、Gemini、DeepSeek、Qwen、Kimi、GLM等任意模型、任意框架都可参与。

每一次尝试的结果都需要经过自动验证程序检验。

当某个结果超过当前最优水平,它就会成为新的基准,也就是下一轮需要超越的记录。

所有人都可以基于这个新的最优结果继续拓展,不需要从零开始,之后重复这个循环。

所有结果和提交内容都是开源的,任何人都可以追溯每条记录的生成过程。

@pratikg认为,这就是通用人工智能及后通用人工智能时代前沿科研的开展方式。

目前该平台已经解决了密码学、数学、科学以及开放权重模型领域的多个难题,接下来将继续在这些方向推进,同时开始探索生物学、化学和材料科学领域。相关已解决和正在解决的问题可查看对应链接。

在 X 看原帖 ↗
1.9K55319
开发者 · @MoureDev▲ 7.8K

西班牙开发者MoureDev称沉迷OpenClaw未测试其他AI工具

开发者MoureDev在X平台分享自己使用OpenClaw的体验,同时向网友询问多款AI工具的使用情况

MoureDev表示,自己对OpenClaw非常满意,因此至今还没有尝试测试其他新的AI工具。

这些还未测试的工具包括Grok Bot、OpenAI Dots、Meta Muse。

MoureDev向网友提问:你正在使用其中任何一款工具吗?使用体验如何?平时都用在哪些场景?

在 X 看原帖 ↗
7.8K45324
加密货币 · @Misstang1102▲ 457

OKX不再局限于交易所,正转型全球金融科技平台

OKX NOW开场演讲披露OKX将拓展支付、投资等业务,AI已深度融入内部工作流

用户@Misstang1102在𝕏分享了观看OKX NOW开场演讲后的感受。此前多数人对OKX的第一印象是加密货币交易所,本次演讲透露出OKX的业务布局早已不止交易领域。

演讲提到OKX未来将围绕四个方向发展,分别是让用户持有自有资金、便捷支付、投资多类型资产,以及通过智能工具实现财富增长。

跨境支付目前流程繁琐、耗时久成本高,演讲提到加密技术大规模应用后,7×24小时全球结算有望变得更普及自然。

AI方面,OKX工程团队目前约95%的代码合并请求已通过AI工作流完成,上月OKX在大模型相关投入达到1000万美元。除交易外,AI还可应用在客服、反欺诈、风控与合规等领域,提升用户体验与平台效率。

OKX目前不再只强调加密原生,而是尝试融合加密技术、传统金融与AI。当前加密行业与传统金融的边界正在逐渐模糊,未来用户更关注产品能否满足资金管理、支付、投资需求,而非其来源。

这场演讲传递出OKX正在重新定位自身,从交易所出发逐步转向全球金融科技平台,其业务布局范围远大于单纯的交易所。

在 X 看原帖 ↗
457135
大模型 · @superalesha导语出处▲ 128

测试者推翻此前对Mistral大模型的负面评价

𝕏用户superalesha修正此前测试结果:原测试未开启推理功能,重测后模型表现更好

AI开发 · @0xblacklight▲ 9

开发者提三点测试优化需求,询问谁在开发通用方案

X用户@0xblacklight提出代码变更后精准测试的三点需求,寻找通用解决方案开发者

X用户@0xblacklight提出了一套代码变更后精准测试的需求,询问目前是否有开发者在打造适配通用场景的解决方案。

这套需求共有三点。第一点是对变更的代码部分确定性运行测试,推测可以通过抽象语法树(AST)实现。

第二点是使用jev选择测试套件或类似功能。第三点是允许在测试文件中声明通配路径,当路径对应的文件发生变更时,自动触发对应测试运行。

在 X 看原帖 ↗
9

今天的 26 条信号到这里下一轮 12:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新