AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 9 月 19 日 · 08:00 更新 0 文章0 信号0 主题
试试:

今天发生了什么1 分钟读懂

Anthropic 和埃森哲宣布,未来五年共同投入 10 亿美元搭建前沿 AI 的评估能力。计划不排他,Anthropic 还会引入更多评估机构。它已经承诺让外部人员评估自家模型,这笔钱花在评估能力本身。

来源@AnthropicAI「Anthropic和埃森哲投10亿美元做前沿AI评估」@wallstengine「两家巨头五年投十亿美金做AI安全评估」

Meta 把 SAM 3.1 上线到自家的 Meta Model API,一次调用同时拿到检测、精准分割和轨迹追踪。这次是官方实现,做了推理效率优化,还支持用名词短语指定要检测的对象,做图像视频识别的开发者不用自己拼三套流程。

来源@MetaforDevs「Meta 上线 SAM 3.1 模型到 Meta Model API」@nikhilaravi「Meta发布Meta模型API上的SAM 3.1」

MiniMax 开源的编程 agent MiniMax Code 拿出了横向成绩:同一套 30 道测试题,通过率 76.7%,用时四分半,两项都高于 Codex 和 Claude Code。开源意味着这份成绩可以自己跑一遍验证。

来源@NFT_Chen「MiniMax Code开源后通过率超过Codex和Claude Code」

今日值得看
01 一键出完整章节的开源小说 Skill bookflow-skill 单篇生成,不用调提示词直接出稿 02 30秒武侠电影级视频提示词 30秒武侠对决,剑气怎么飞都定死了
03 基于Qwen2.5的Kev-0.5B开源 可在MacBook Pro运行 想要在个人电脑训练运行小型决策模型,现在有了一个兼容TypeSafe API的开源选项,权重和模型卡已上传GitHub。

Kev-0.5B:一个基于 Qwen2.5-0.5B 的小型开源类 Jev 决策模型,拥有兼容 TypeSafe 的 API,你可以在 MacBook Pro 上训练和运行它。 模型卡片和权重已在 GitHub 上开放。

04 @madiator 开源 Bespoke Nimble 模型性能提至 90% 普通笔记本也能免费体验,模型准确率从基础版的 66%提升到 90%,可以关注这个开源方向的后续进展

介绍 Bespoke Nimble:一款针对 open Jev 的开放数据、开放模型、开放方案。代码和信息:模型:数据: * 一种叫做对比数据整理的新型数据整理方案。 * 通过轻微修改事实来生成负样本数据。

今日焦点

Anthropic警告AI或将灭绝人类,却建湿实验室做实验

Anthropic证实已拥有一间湿实验室,能用自研AI模型运行真实的物理实验。对一家以聊天机器人出名的大模型公司来说,这一步走出了代码范畴。就在上周,CEO Dario Amodei还放言:AI可能在5到10年内治愈大多数主要疾病。

Anthropic生命科学负责人Eric Kauderer-Abrams说得很直接。生物学的最终测试,仍然且将在一段时间内是真实实验室工作。新实验室的运转方式与大多数生物科技实验室类似。Anthropic自己在里面做研究,同时与外部伙伴合作。今年4月,它还收购了隐形AI生物技术公司Coefficient Bio。

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达38 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

08:00 本轮更新 · 下一轮 12:30
行业动态 · Hacker News▲ 41

讨论语言不可读性对大语言模型安全的影响

大语言模型安全不止防prompt注入,这个新角度的讨论值得关注,帮助你提前了解潜在安全风险。

行业动态 · Hacker News▲ 56

rochansinha发布《Cache-to-Cache:大语言模型之间的直接语义通信》论文(2025)

现有大模型通常只能通过人类可读文本交互,这项新研究提出大模型之间直接通信的新思路,未来可能提升多模型协作效率。

开源 · @NFT_Chen导语出处▲ 3.0万

MiniMax Code开源后通过率超过Codex和Claude Code

同30道测试题,MiniMax Code通过率76.7%,用时四分半,比另外两个模型更快通过率更高

🚨重磅:MiniMax Code已正式开源,以76.7% 直接碾过 Codex 和 Claude Code!

同一模型、同一批 30 题,换一层 harness,榜就翻了:

🔹通过率:MiniMax Code 76.7%(23/30)> Codex 66.7% > Claude Code 63.3%
🔹速度:4分33秒 vs Codex 6分43秒 vs Claude Code 9分38秒
🔹成本:$1.83 / 次 vs Codex $3.47 vs Claude Code $18.34

🔹协议:CLI v0.4.12,MIT 全开;桌面端暂未开源
🔹用法:账号可登,也能 BYOK,工具调用和权限能直接审

结论不是模型赢了,是外壳赢了!

curl -fsSL | bash

GitHub:

#MiniMaxCode #OpenSource #Codex #ClaudeCode #AICoding #FrontierHarness

在 X 看原帖 ↗
3.0万14166100
开源 · @picocreator▲ 2.2万

picocreator发布开源Jev-ify HF模型库

原Jev不开源,缺少视觉能力。这个开源库可以把任何HF模型转换成Jev格式

我喜欢 Jev,但也对它感到不满——它不开源?它缺少视觉能力?我们把这些问题全都解决了:我们推出了一个全开源库,可以给任意 HF 模型添加 Jev 能力,并提供 API 端点。

现已上线 GitHub,并且在 @FeatherlessAI 正式投入生产使用。

在 X 看原帖 ↗
2.2万30326480
行业动态 · @unusual_whales▲ 6.6万

Amazon称AI模型需经严格测试才能发布

行业巨头对AI发布风险的态度,会影响未来普通用户能用到的AI产品安全标准

亚马逊(股票代码$AMZN)表示,人工智能模型只有经过严格测试后才能发布。

在 X 看原帖 ↗
6.6万41444
新品发布 · @o_kwasniewski▲ 1.5万

@o_kwasniewski发布e2e + jev 开源测试框架

对需要做自动化测试的开发者来说,又多了一个同时支持网页和移动端的开源选择。

来自 @typesafeai 的 e2e + jev ⚡

我正在构建一个开源框架,用于通过智能体运行端到端测试。

支持网页、移动端(以及更多平台!)即将推出:

在 X 看原帖 ↗
1.5万18323281
行业动态 · @aievalforum▲ 5.0万

百名顶尖AI专家提出AI外部评估要求

对前沿AI发展的监管讨论正在推进,这些要求明确了独立评估者应获得的权限和保护,影响公众对AI开发的信任。

阅读全文 →
5.0万4714438
新品发布 · @quxiaoyin▲ 18.5万

Agentsky发布全球首个智能体市场

不用安装就能在浏览器或手机上使用40多个AI智能体,额度用完可无缝切换,还能直接对比成本和效果,可领$20额度体验。

我们刚刚推出了 Agentsky @agentsky_dev,这是全球首个智能体市场!

OpenRouter 是面向模型的,AgentSky 是面向智能体的。你可以在浏览器(甚至手机)上,或是通过一个 API 使用 40 多种智能体——包括 Claude Code、Codex、OpenCode、Hermes、Pi。全都不需要安装或配置任何东西。

碰到 Codex Astra 达到周限额了?你可以在浏览器中直接切换到另一个智能体,比如 OpenCode + DeepSeek V4.1,而且不会丢失任何上下文。

你可以直接在浏览器中对比任意智能体+模型组合,我就是这么发现:在同一个仪表盘任务中,Astra 花费 5.3 美元,而 deepseek v4.1 只花费 0.12 美元。(事实上我更喜欢 DeepSeek)

来试用吧:

如果你无需安装就能轻松试用任意智能体,你接下来想试哪款?输入智能体名称,我就会送你 20 美元额度(你可以用于任意模型)。

在 X 看原帖 ↗
18.5万114288127
新品发布 · @MetaforDevs导语出处▲ 8.4万

Meta 上线 SAM 3.1 模型到 Meta Model API

开发图像视频识别相关应用,现在可以一次API调用同时获得检测、精准分割和轨迹追踪,降低开发门槛。

Meta 的 Segment Anything Model (SAM) 3.1 现已在 Meta Model API 上线,开发者可以通过单次推理调用获得一个快速轻量的模型,用于检测、分割和跟踪,该推理专为 SAM 3.1 的架构调优。

你可以用一个短语在图像和视频中查找物体。一次 API 调用即可返回检测结果、像素级精确分割掩码以及保持一致性的视频轨迹。

了解更多并开始构建:

在 X 看原帖 ↗
8.4万95729427
行业动态 · @AnthropicAI导语出处▲ 22.8万

Anthropic和埃森哲投10亿美元做前沿AI评估

Anthropic此前承诺引入外部评估人员,这次投资将在未来五年搭建评估能力,前沿AI的安全可控有了新进展。

我们正与埃森哲合作开展前沿AI的独立评估——这是我们最近承诺的在Anthric内置评估机制工作的一部分。

我们和埃森哲都预计,未来五年将在该领域至少投入10亿美元,建设相关能力。

在 X 看原帖 ↗
22.8万1341.4K272
深度观点 · @NEARProtocol▲ 7.2万

NEARProtocol 讨论用户所有型私有AI

关注数据隐私的人可以看看,这种方案能让运营方也看不到AI运行内容,已有多个不同领域的机构采用。

探秘 NEAR AI,它也被称为用户所有的 AI。

保密推理由 Venice、Brave(跨境支付平台)、一个国家政府及更多主体所利用。AI 运行在运营商无法看到的地方。

NEAR 如何帮助企业和用户拥有自己的智能 🧵

在 X 看原帖 ↗
7.2万372682
开发 · @rileybrown▲ 3.2万

开发者周末项目实现不同AI代理平台无缝切换

开发者在𝕏发布个人周末项目,支持Codex、Claude Code等多平台切换

我需要智能代理可移植性……我的周末项目是集中管理我所有的技能、插件和密钥,这样就能在不同智能代理平台之间无缝切换。(包括 Codex、GrokBot、Claude Code、Muse 等等)。

这个周末我会测试所有支持这项功能的平台,从中选出我业务要用的那一个。下周我会出一个相关视频。

在 X 看原帖 ↗
3.2万4317164
行业动态 · @aiwithsally▲ 1.1万

Anthropic称Claude承担近三成自身研发工作

Claude现在参与了90%的研发任务,其中26%由它独立完成。AI辅助研发的进度比预想中更快

这一周,我观察到AI安全领域的讨论已经变得严肃得多。

Anthropic 现在表示,Claude 已经承担了它自身 26% 的研发工作,并且在大约 90% 的研发任务中与人类协作。与此同时,OpenAI 也披露了更多模型出现意外行为的案例。

真正吸引我注意力的是这件事的发展方向。我们已经不再只是要求AI使用工具了。我们越来越多地要求AI帮助构建下一代AI。

我仍然非常看好这件事。但我认为下一个重大问题不再简单是“这些模型能变得多聪明?”而是:我们放心把AI开发循环中多大比例的工作交给AI自己来做?

这个问题现在看来是科技领域最重要的问题之一。

在 X 看原帖 ↗
1.1万301212
商业 · @wallstengine导语出处▲ 1.5万

两家巨头五年投十亿美金做AI安全评估

投资计划不排他,Anthropic后续还会找更多评估机构。现在对大模型安全的讨论越来越严肃了

Anthropic 和埃森哲计划在五年内各自至少投入 10 亿美元,用于前沿 AI 模型的独立评估。这项协议是非排他性的。

Anthropic 表示将在未来几周公布更多评估机构,而埃森哲也会和其他 AI 开发者合作。

值得注意的是:埃森哲的 AI 部门 Faculty 将把评估人员安插在 Anthropic 内部,获得和员工相当的访问权限。

这些评估人员会对模型进行红队测试、开展对齐评估并测试安全防护措施。Anthropic 将直接支付埃森哲的工作费用。

在 X 看原帖 ↗
1.5万14727
发布 · @nikhilaravi导语出处▲ 1.4万

Meta发布Meta模型API上的SAM 3.1

这次是官方实现,做了推理效率优化,还支持用名词短语提示检测对象

📢 SAM 3.1 现已在@Meta Model API上线——这是我们为模型打造的、具备高效推理能力的官方实现。

借助名词短语提示,你可以检测、分割和跟踪图像与视频中的对象,并且能轻松通过相同的API接口、计费和鉴权方式,与其他Muse模型结合使用。

价格为每1000张图像 2.50 美元,每1000帧 0.20 美元。开源权重仍保留在Hugging Face!

在 X 看原帖 ↗
1.4万2017281
研究 · @nc_frey▲ 9.2K

Anthropic优化三十余个开源模型,速度提四倍

针对结构预测和分子设计任务优化,还做了低内存适配,相关研究速度更快了

阅读全文 →
9.2K2111246
新品发布 · @higgsfield_ai▲ 2.5K

higgsfield_ai, typesafeai发布生成式AI模型自动路由功能

现在生成不同内容不用手动选模型,功能会自动根据提示词匹配最合适的图文视频生成模型,降低手动试错成本。

Jev + Higgsfield = 搞定生成式AI模型的自动路由。

在这个演示里,@typesafeai 的 Jev 会评估提示词,并在 Higgsfield 上为视频和图像生成挑选最合适的模型。

在 X 看原帖 ↗
2.5K2177
前沿研究 · @omarsar0▲ 3.9K

EvoSkill v2 实现智能体无需重训自我改进

这项研究发现智能体可通过记录经验技能自我优化,复杂表格任务通过率从约2.5%提升至17.5%,展示了智能体自主进化的新方向。

智能体无需重新训练就能自我提升。EvoSkill v2 通过持久化智能体技能实现了这一点。

教练智能体会读取失败的运行记录,然后编写技能文件。工作智能体下次遇到类似任务时就会加载这个技能。整个过程不会改动权重。

所有改进都来自一个记录经验教训的简单文件,哪怕是错误的经验也会被保存下来。

在修复电子表格任务问题时,教练发现评分器信任缓存值,于是编写了一个技能,指示工作智能体跳过重新计算。

Sentient 团队的修复方案是拆分角色:编写技能的智能体不能接触测试,每轮结束后都由人类检查结果。

部署这个方案后,难度最高的电子表格任务通过率从120次里通过3次提升到了通过21次。

在 X 看原帖 ↗
3.9K43320
深度观点 · @mardehaym▲ 5.1K

以创业速度交付企业级AI的五步实践方法

如果你想在企业项目里快速交付可用AI,可以看看这个经过实战验证的方法,帮你避开冗长流程,快速落地可用成果。

阅读全文 →
5.1K195746
深度观点 · @antiAIvo▲ 3.4K

AI黑盒真的无法打开吗?

看完14期GPT2从零手写教程后,分享对大模型可解释性的思考:AI不是天生不可解释,机制可解释性就是专门破解这个问题的方向。

从零手写大模型(GPT2)系列完结 学完这14期后,难免有些思考🤔 模型内部那些 768 维的向量 那些经过12层 Attention 和 FFN 变换之后的数字 它们到底代表着什么?我们知道怎么算出它们 但不知道它们“意味着”什么 都说AI 是黑盒,那么这个黑盒 是不是真的无法打开?首先,不可解释≠无法解释 一段没有注释的汇编代码 你不熟悉它,相当于“黑盒” 但如果你愿意花时间 逐条指令反推它在做什么 是完全可以搞清楚 这段代码到底实现了什么逻辑的 这叫做“可解释性” 神经网络内部的向量也是一样 它们不是天生不可知 而是需要专门的技术手段去翻译 这个专门的研究方向叫 “机制可解释性” 目标就是把模型内部到底在做什么样的计算 逆向工程出来 机制可解释性在做什么?

下一篇再详细说明

在 X 看原帖 ↗
3.4K105140
商业 · @joshkim

SpaceXAI团队分享Grok Bot在营销全流程中的应用案例

joshkim在𝕏发文公开SpaceXAI团队使用Grok Bot搭建完整营销活动的过程及完整演示链接

joshkim发文分享SpaceXAI团队如何将Grok Bot应用于营销工作。

Grok Bot可以从开始到结束完整搭建一套营销活动,涵盖的工作包括:新品审核、落地页上线、付费营销活动搭建与分析,以及全流程自动化。

本次分享附带完整演示视频,同时Grok Bot Galaxy三天活动的完整录像也已公开。

第一天活动内容涵盖Grok Bot基础介绍、工程场景应用、产品经理场景应用和创始人场景应用。

第二天活动内容涵盖销售工程场景应用、GTM(go-to-market)场景应用和SDR(销售开发代表)场景应用。

第三天活动内容涵盖营销运营场景应用、售后场景应用和营销场景应用。

在 X 看原帖 ↗
大模型 · @noctus91▲ 8

用户实测Bonsai 2 27B可在苹果M3 Pro本地稳定运行

X用户@noctus91实测PrismML的Bonsai 2 27B大模型,在苹果M3 Pro芯片上本地运行表现优异

PrismML开发的Bonsai 2 27B,是少数能在苹果M3 Pro芯片上本地稳定运行的大模型。

实测显示,它的代码生成和智能体性能表现良好,可处理长任务、工具调用、文件操作、代码执行,以及视觉多模态任务,使用体验并不像精简后的本地模型。

主要缺点是运行速度较慢,实测 tokens 生成速度约为每秒8.5到11个。但作为一个270亿参数、以1-bit量化本地运行的模型,能在设备端实现这样的能力已经相当出色。

在 X 看原帖 ↗
81
开发工具 · @mohewedy▲ 8.9K

开发者实测Claude Code 不适合复杂项目更适合氛围编码

开发者@mohewedy在𝕏分享自己使用Claude Code和OpenCode的不同体验对比

阅读全文 →
8.9K211769
大模型 · @libukai▲ 3.7K

用户实测Jev模型:分类场景速度、质量、价格优势明显

libukai在𝕏分享,使用Jev模型对比Gemini Flash Lite测试人民日报新闻分类的结果

阅读全文 →
3.7K63933
技术分享 · @santtiagom_▲ 4.5K

博主@santtiagom_今年已发布五篇技术文章,第六篇正在创作中

发布在X平台的内容包含Harness Engineering、Claude Code相关等五篇技术文章链接

博主@santtiagom_在X平台分享了自己今年截至目前撰写完成的五篇技术文章链接。

五篇文章分别是:《Harness Engineering:从零开始讲解》,链接: Code的实际工作原理是什么?》,链接: Code中的SKILLS:入门完整指南》,链接:

目前第六篇文章正在撰写中,请感兴趣的读者期待后续更新。

此外,博主提到X平台存在一个bug,会随机引用分享列表中的一篇文章。

在 X 看原帖 ↗
4.5K6100106
AI开发工具 · @sawyerhood▲ 4.1K

开发者借助工具实现AI提示框自动填充,不用手动填参数了

开发者sawyerhood在X平台分享,借助typesafeai的jev工具实现提示框自动填充,大改写用Fable加Claude Code

开发者sawyerhood在X平台分享,借助typesafeai开发的jev工具,他不再需要手动填写提示框里的所有内容。

工具会自动帮他选择代理、模型、设备和文件夹。

进行大篇幅改写时,该工作流使用Fable和Claude Code完成。
iOS应用的修改会在他其中一台Mac上运行。

在 X 看原帖 ↗
4.1K38852
动态 · @gippp69▲ 2.0K

GPT-6 ASTRA暴露智能体一个难以忽视的错误

爆料者@gippp69在𝕏平台分享观点,称GPT-6 ASTRA拥有超100万token上下文窗口

超100万token的上下文窗口听起来规模很大,但仅靠长上下文无法让智能体变得可靠。真正重要的是规划、行动、检查和记忆如何分层处理。规划→工具调用→验证→记忆→输出的五阶段流程,可以防止错误决策暗中进入实际应用,同时将有效结果存储起来供后续运行使用。

长期运行的任务会因此呈现完全不同的状态。相比用一个巨型prompt承载所有内容,分层架构中每一层只处理明确任务,也能清晰定位故障点。更优质的智能体已经越来越不像更聪明的聊天机器人,反而更像是围绕大模型搭建的小型操作系统。

在 X 看原帖 ↗
2.0K17244
开发 · @kloss_xyz▲ 6.8K

使用Codex、Claude Code或Grok开发时必须用的提示词

X用户@kloss_xyz分享一款针对AI代码开发助手的提示词,称不用就会出问题

如果你正在用Codex、Claude Code或Grok开发,却还没用过这个提示词:“从用户体验(UX)、开发者体验(DX)和智能体体验(AX)出发,我们的方案可以在哪些地方改进?”

你正在把事情搞砸。

在 X 看原帖 ↗
6.8K4101158
API设计 · @systemdesignone▲ 4.1K

一份API设计完整路线图,覆盖从基础到落地的全部要点

来自@systemdesignone的API设计终极路线图,整理了从基础到实战10个模块的核心设计要点

阅读全文 →
4.1K1774116
商业 · @gkpacker▲ 6.6K

TypeSafe推出按需付费决策模型Jev,单价极低延迟低

gkpacker在𝕏分享了Jev模型的特性、Visor应用案例以及可拓展的领域示例

阅读全文 →
6.6K6134116
工具 · @oikon48▲ 1.1万

Claude Code新增可配置AGENTS.md文件支持,版本2.1.277可用

来自X平台@oikon48的消息,Claude Code可通过项目设置页配置四种AGENTS.md读取模式

Claude Code从版本2.1.277开始,支持对AGENTS.md文件的读取配置。

配置入口为/config页面下的Project instructions设置项,共有4种模式可以选择。

四种可选模式分别是:1. claude-md、2. claude-md-or-agents-md、3. claude-md-and-agents-md、4. managed-only。

默认选中的是第二种模式claude-md-or-agents-md。在该模式下,如果没有CLAUDE.md文件,Claude Code会自动读取AGENTS.md文件。

在 X 看原帖 ↗
1.1万157957
工具 · @0xCodila▲ 2.3K

Jev被称为AI行业的“互联网时刻”新工具

开发者0xCodila在𝕏发布,这款工具可毫秒级告知智能体与大语言模型下一步动作,成本近乎为零

Jev是人工智能行业的“互联网时刻”。它能在数毫秒内告诉你的智能体和大语言模型(LLMs)下一步该做什么,而且成本几乎为零。

如果配置正确,你就能得到面向2028年的人工智能工程师开发栈。本文作者展示了具体的使用方法,详见链接

在 X 看原帖 ↗
2.3K95976
开发工具 · @kunchenguid▲ 9.4K

适配Claude和pi的compact-adviser插件已发布

开发者@kunchenguid 发布了一款可自动判断会话压缩时机的插件

阅读全文 →
9.4K15235224
行业舆情 · @0xcherry▲ 1.5万

用户讨论GLM默认无差别上传代码库引发舆情争议

@0xcherry在𝕏发文分析GLM传数据事件的原因和问题

阅读全文 →
1.5万19521
🚀 新品发布
新品发布 · @quxiaoyin▲ 18.5万

Agentsky发布全球首个智能体市场

不用安装就能在浏览器或手机上使用40多个AI智能体,额度用完可无缝切换,还能直接对比成本和效果,可领$20额度体验。

我们刚刚推出了 Agentsky @agentsky_dev,这是全球首个智能体市场!

OpenRouter 是面向模型的,AgentSky 是面向智能体的。你可以在浏览器(甚至手机)上,或是通过一个 API 使用 40 多种智能体——包括 Claude Code、Codex、OpenCode、Hermes、Pi。全都不需要安装或配置任何东西。

碰到 Codex Astra 达到周限额了?你可以在浏览器中直接切换到另一个智能体,比如 OpenCode + DeepSeek V4.1,而且不会丢失任何上下文。

你可以直接在浏览器中对比任意智能体+模型组合,我就是这么发现:在同一个仪表盘任务中,Astra 花费 5.3 美元,而 deepseek v4.1 只花费 0.12 美元。(事实上我更喜欢 DeepSeek)

来试用吧:

如果你无需安装就能轻松试用任意智能体,你接下来想试哪款?输入智能体名称,我就会送你 20 美元额度(你可以用于任意模型)。

在 X 看原帖 ↗
18.5万114288127
新品发布 · @MetaforDevs导语出处▲ 8.4万

Meta 上线 SAM 3.1 模型到 Meta Model API

开发图像视频识别相关应用,现在可以一次API调用同时获得检测、精准分割和轨迹追踪,降低开发门槛。

Meta 的 Segment Anything Model (SAM) 3.1 现已在 Meta Model API 上线,开发者可以通过单次推理调用获得一个快速轻量的模型,用于检测、分割和跟踪,该推理专为 SAM 3.1 的架构调优。

你可以用一个短语在图像和视频中查找物体。一次 API 调用即可返回检测结果、像素级精确分割掩码以及保持一致性的视频轨迹。

了解更多并开始构建:

在 X 看原帖 ↗
8.4万95729427
新品发布 · @jaredpalmer▲ 3.4万

基于Qwen2.5的Kev-0.5B开源 可在MacBook Pro运行

想要在个人电脑训练运行小型决策模型,现在有了一个兼容TypeSafe API的开源选项,权重和模型卡已上传GitHub。

Kev-0.5B:一个基于 Qwen2.5-0.5B 的小型开源类 Jev 决策模型,拥有兼容 TypeSafe 的 API,你可以在 MacBook Pro 上训练和运行它。

模型卡片和权重已在 GitHub 上开放。

在 X 看原帖 ↗
3.4万46689596
新品发布 · @o_kwasniewski▲ 1.5万

@o_kwasniewski发布e2e + jev 开源测试框架

对需要做自动化测试的开发者来说,又多了一个同时支持网页和移动端的开源选择。

来自 @typesafeai 的 e2e + jev ⚡

我正在构建一个开源框架,用于通过智能体运行端到端测试。

支持网页、移动端(以及更多平台!)即将推出:

在 X 看原帖 ↗
1.5万18323281
新品发布 · @madiator▲ 1.4万

@madiator 开源 Bespoke Nimble 模型性能提至 90%

普通笔记本也能免费体验,模型准确率从基础版的 66%提升到 90%,可以关注这个开源方向的后续进展

阅读全文 →
1.4万25248197
新品发布 · @higgsfield_ai▲ 2.5K

higgsfield_ai, typesafeai发布生成式AI模型自动路由功能

现在生成不同内容不用手动选模型,功能会自动根据提示词匹配最合适的图文视频生成模型,降低手动试错成本。

Jev + Higgsfield = 搞定生成式AI模型的自动路由。

在这个演示里,@typesafeai 的 Jev 会评估提示词,并在 Higgsfield 上为视频和图像生成挑选最合适的模型。

在 X 看原帖 ↗
2.5K2177
📰 行业动态
行业动态 · @AnthropicAI导语出处▲ 22.8万

Anthropic和埃森哲投10亿美元做前沿AI评估

Anthropic此前承诺引入外部评估人员,这次投资将在未来五年搭建评估能力,前沿AI的安全可控有了新进展。

我们正与埃森哲合作开展前沿AI的独立评估——这是我们最近承诺的在Anthric内置评估机制工作的一部分。

我们和埃森哲都预计,未来五年将在该领域至少投入10亿美元,建设相关能力。

在 X 看原帖 ↗
22.8万1341.4K272
行业动态 · @aievalforum▲ 5.0万

百名顶尖AI专家提出AI外部评估要求

对前沿AI发展的监管讨论正在推进,这些要求明确了独立评估者应获得的权限和保护,影响公众对AI开发的信任。

阅读全文 →
5.0万4714438
行业动态 · @unusual_whales▲ 6.6万

Amazon称AI模型需经严格测试才能发布

行业巨头对AI发布风险的态度,会影响未来普通用户能用到的AI产品安全标准

亚马逊(股票代码$AMZN)表示,人工智能模型只有经过严格测试后才能发布。

在 X 看原帖 ↗
6.6万41444
行业动态 · Hacker News▲ 1.2万

Claude Code 新增对 AGENTS.md 的读取支持

使用 Claude Code 做开发任务时,现在可以直接读取 AGENTS.md 配置,无需额外创建 Claude.md 文件,简化开发配置流程。

社区讨论:不少人认可这次更新符合标准,不需要再用仅一行内容指向AGENTS.md的Claude.md文件,也不用手动保留指向AGENTS.md的软链接。有人提出不满,称Claude Code依然检测不到。agencies/skills目录下的技能,这次更新只是做到了最基础的要求。

还有人质疑这些markdown文件只是给prompt加文本,反而会干扰上下文。

在 HN 看讨论 ↗
1.2万816825
行业动态 · @aiwithsally▲ 1.1万

Anthropic称Claude承担近三成自身研发工作

Claude现在参与了90%的研发任务,其中26%由它独立完成。AI辅助研发的进度比预想中更快

这一周,我观察到AI安全领域的讨论已经变得严肃得多。

Anthropic 现在表示,Claude 已经承担了它自身 26% 的研发工作,并且在大约 90% 的研发任务中与人类协作。与此同时,OpenAI 也披露了更多模型出现意外行为的案例。

真正吸引我注意力的是这件事的发展方向。我们已经不再只是要求AI使用工具了。我们越来越多地要求AI帮助构建下一代AI。

我仍然非常看好这件事。但我认为下一个重大问题不再简单是“这些模型能变得多聪明?”而是:我们放心把AI开发循环中多大比例的工作交给AI自己来做?

这个问题现在看来是科技领域最重要的问题之一。

在 X 看原帖 ↗
1.1万301212
商业 · @wallstengine导语出处▲ 1.5万

两家巨头五年投十亿美金做AI安全评估

投资计划不排他,Anthropic后续还会找更多评估机构。现在对大模型安全的讨论越来越严肃了

Anthropic 和埃森哲计划在五年内各自至少投入 10 亿美元,用于前沿 AI 模型的独立评估。这项协议是非排他性的。

Anthropic 表示将在未来几周公布更多评估机构,而埃森哲也会和其他 AI 开发者合作。

值得注意的是:埃森哲的 AI 部门 Faculty 将把评估人员安插在 Anthropic 内部,获得和员工相当的访问权限。

这些评估人员会对模型进行红队测试、开展对齐评估并测试安全防护措施。Anthropic 将直接支付埃森哲的工作费用。

在 X 看原帖 ↗
1.5万14727
开源 · @NFT_Chen导语出处▲ 3.0万

MiniMax Code开源后通过率超过Codex和Claude Code

同30道测试题,MiniMax Code通过率76.7%,用时四分半,比另外两个模型更快通过率更高

🚨重磅:MiniMax Code已正式开源,以76.7% 直接碾过 Codex 和 Claude Code!

同一模型、同一批 30 题,换一层 harness,榜就翻了:

🔹通过率:MiniMax Code 76.7%(23/30)> Codex 66.7% > Claude Code 63.3%
🔹速度:4分33秒 vs Codex 6分43秒 vs Claude Code 9分38秒
🔹成本:$1.83 / 次 vs Codex $3.47 vs Claude Code $18.34

🔹协议:CLI v0.4.12,MIT 全开;桌面端暂未开源
🔹用法:账号可登,也能 BYOK,工具调用和权限能直接审

结论不是模型赢了,是外壳赢了!

curl -fsSL | bash

GitHub:

#MiniMaxCode #OpenSource #Codex #ClaudeCode #AICoding #FrontierHarness

在 X 看原帖 ↗
3.0万14166100
发布 · @nikhilaravi导语出处▲ 1.4万

Meta发布Meta模型API上的SAM 3.1

这次是官方实现,做了推理效率优化,还支持用名词短语提示检测对象

📢 SAM 3.1 现已在@Meta Model API上线——这是我们为模型打造的、具备高效推理能力的官方实现。

借助名词短语提示,你可以检测、分割和跟踪图像与视频中的对象,并且能轻松通过相同的API接口、计费和鉴权方式,与其他Muse模型结合使用。

价格为每1000张图像 2.50 美元,每1000帧 0.20 美元。开源权重仍保留在Hugging Face!

在 X 看原帖 ↗
1.4万2017281
研究 · @nc_frey▲ 9.2K

Anthropic优化三十余个开源模型,速度提四倍

针对结构预测和分子设计任务优化,还做了低内存适配,相关研究速度更快了

阅读全文 →
9.2K2111246
开源 · @picocreator▲ 2.2万

picocreator发布开源Jev-ify HF模型库

原Jev不开源,缺少视觉能力。这个开源库可以把任何HF模型转换成Jev格式

我喜欢 Jev,但也对它感到不满——它不开源?它缺少视觉能力?我们把这些问题全都解决了:我们推出了一个全开源库,可以给任意 HF 模型添加 Jev 能力,并提供 API 端点。

现已上线 GitHub,并且在 @FeatherlessAI 正式投入生产使用。

在 X 看原帖 ↗
2.2万30326480
行业动态 · Hacker News▲ 56

rochansinha发布《Cache-to-Cache:大语言模型之间的直接语义通信》论文(2025)

现有大模型通常只能通过人类可读文本交互,这项新研究提出大模型之间直接通信的新思路,未来可能提升多模型协作效率。

行业动态 · Hacker News▲ 41

讨论语言不可读性对大语言模型安全的影响

大语言模型安全不止防prompt注入,这个新角度的讨论值得关注,帮助你提前了解潜在安全风险。

💡 深度观点
深度观点 · @NEARProtocol▲ 7.2万

NEARProtocol 讨论用户所有型私有AI

关注数据隐私的人可以看看,这种方案能让运营方也看不到AI运行内容,已有多个不同领域的机构采用。

探秘 NEAR AI,它也被称为用户所有的 AI。

保密推理由 Venice、Brave(跨境支付平台)、一个国家政府及更多主体所利用。AI 运行在运营商无法看到的地方。

NEAR 如何帮助企业和用户拥有自己的智能 🧵

在 X 看原帖 ↗
7.2万372682
深度观点 · @antiAIvo▲ 3.4K

AI黑盒真的无法打开吗?

看完14期GPT2从零手写教程后,分享对大模型可解释性的思考:AI不是天生不可解释,机制可解释性就是专门破解这个问题的方向。

从零手写大模型(GPT2)系列完结 学完这14期后,难免有些思考🤔 模型内部那些 768 维的向量 那些经过12层 Attention 和 FFN 变换之后的数字 它们到底代表着什么?我们知道怎么算出它们 但不知道它们“意味着”什么 都说AI 是黑盒,那么这个黑盒 是不是真的无法打开?首先,不可解释≠无法解释 一段没有注释的汇编代码 你不熟悉它,相当于“黑盒” 但如果你愿意花时间 逐条指令反推它在做什么 是完全可以搞清楚 这段代码到底实现了什么逻辑的 这叫做“可解释性” 神经网络内部的向量也是一样 它们不是天生不可知 而是需要专门的技术手段去翻译 这个专门的研究方向叫 “机制可解释性” 目标就是把模型内部到底在做什么样的计算 逆向工程出来 机制可解释性在做什么?

下一篇再详细说明

在 X 看原帖 ↗
3.4K105140
深度观点 · @mardehaym▲ 5.1K

以创业速度交付企业级AI的五步实践方法

如果你想在企业项目里快速交付可用AI,可以看看这个经过实战验证的方法,帮你避开冗长流程,快速落地可用成果。

阅读全文 →
5.1K195746
📌 其他
前沿研究 · @omarsar0▲ 3.9K

EvoSkill v2 实现智能体无需重训自我改进

这项研究发现智能体可通过记录经验技能自我优化,复杂表格任务通过率从约2.5%提升至17.5%,展示了智能体自主进化的新方向。

智能体无需重新训练就能自我提升。EvoSkill v2 通过持久化智能体技能实现了这一点。

教练智能体会读取失败的运行记录,然后编写技能文件。工作智能体下次遇到类似任务时就会加载这个技能。整个过程不会改动权重。

所有改进都来自一个记录经验教训的简单文件,哪怕是错误的经验也会被保存下来。

在修复电子表格任务问题时,教练发现评分器信任缓存值,于是编写了一个技能,指示工作智能体跳过重新计算。

Sentient 团队的修复方案是拆分角色:编写技能的智能体不能接触测试,每轮结束后都由人类检查结果。

部署这个方案后,难度最高的电子表格任务通过率从120次里通过3次提升到了通过21次。

在 X 看原帖 ↗
3.9K43320
开源 · @Sumanth_077▲ 8.7K

这个分步仓库教你用PyTorch从零训练自己的LLM

@Sumanth_077在𝕏分享了一个支持13M到2B+参数训练的开源仓库

阅读全文 →
8.7K46303343
开发 · @rileybrown▲ 3.2万

开发者周末项目实现不同AI代理平台无缝切换

开发者在𝕏发布个人周末项目,支持Codex、Claude Code等多平台切换

我需要智能代理可移植性……我的周末项目是集中管理我所有的技能、插件和密钥,这样就能在不同智能代理平台之间无缝切换。(包括 Codex、GrokBot、Claude Code、Muse 等等)。

这个周末我会测试所有支持这项功能的平台,从中选出我业务要用的那一个。下周我会出一个相关视频。

在 X 看原帖 ↗
3.2万4317164
行业舆情 · @0xcherry▲ 1.5万

用户讨论GLM默认无差别上传代码库引发舆情争议

@0xcherry在𝕏发文分析GLM传数据事件的原因和问题

阅读全文 →
1.5万19521
开发工具 · @kunchenguid▲ 9.4K

适配Claude和pi的compact-adviser插件已发布

开发者@kunchenguid 发布了一款可自动判断会话压缩时机的插件

阅读全文 →
9.4K15235224
工具 · @0xCodila▲ 2.3K

Jev被称为AI行业的“互联网时刻”新工具

开发者0xCodila在𝕏发布,这款工具可毫秒级告知智能体与大语言模型下一步动作,成本近乎为零

Jev是人工智能行业的“互联网时刻”。它能在数毫秒内告诉你的智能体和大语言模型(LLMs)下一步该做什么,而且成本几乎为零。

如果配置正确,你就能得到面向2028年的人工智能工程师开发栈。本文作者展示了具体的使用方法,详见链接

在 X 看原帖 ↗
2.3K95976
工具 · @oikon48▲ 1.1万

Claude Code新增可配置AGENTS.md文件支持,版本2.1.277可用

来自X平台@oikon48的消息,Claude Code可通过项目设置页配置四种AGENTS.md读取模式

Claude Code从版本2.1.277开始,支持对AGENTS.md文件的读取配置。

配置入口为/config页面下的Project instructions设置项,共有4种模式可以选择。

四种可选模式分别是:1. claude-md、2. claude-md-or-agents-md、3. claude-md-and-agents-md、4. managed-only。

默认选中的是第二种模式claude-md-or-agents-md。在该模式下,如果没有CLAUDE.md文件,Claude Code会自动读取AGENTS.md文件。

在 X 看原帖 ↗
1.1万157957
商业 · @gkpacker▲ 6.6K

TypeSafe推出按需付费决策模型Jev,单价极低延迟低

gkpacker在𝕏分享了Jev模型的特性、Visor应用案例以及可拓展的领域示例

阅读全文 →
6.6K6134116
API设计 · @systemdesignone▲ 4.1K

一份API设计完整路线图,覆盖从基础到落地的全部要点

来自@systemdesignone的API设计终极路线图,整理了从基础到实战10个模块的核心设计要点

阅读全文 →
4.1K1774116
开发 · @kloss_xyz▲ 6.8K

使用Codex、Claude Code或Grok开发时必须用的提示词

X用户@kloss_xyz分享一款针对AI代码开发助手的提示词,称不用就会出问题

如果你正在用Codex、Claude Code或Grok开发,却还没用过这个提示词:“从用户体验(UX)、开发者体验(DX)和智能体体验(AX)出发,我们的方案可以在哪些地方改进?”

你正在把事情搞砸。

在 X 看原帖 ↗
6.8K4101158
动态 · @gippp69▲ 2.0K

GPT-6 ASTRA暴露智能体一个难以忽视的错误

爆料者@gippp69在𝕏平台分享观点,称GPT-6 ASTRA拥有超100万token上下文窗口

超100万token的上下文窗口听起来规模很大,但仅靠长上下文无法让智能体变得可靠。真正重要的是规划、行动、检查和记忆如何分层处理。规划→工具调用→验证→记忆→输出的五阶段流程,可以防止错误决策暗中进入实际应用,同时将有效结果存储起来供后续运行使用。

长期运行的任务会因此呈现完全不同的状态。相比用一个巨型prompt承载所有内容,分层架构中每一层只处理明确任务,也能清晰定位故障点。更优质的智能体已经越来越不像更聪明的聊天机器人,反而更像是围绕大模型搭建的小型操作系统。

在 X 看原帖 ↗
2.0K17244
AI开发工具 · @sawyerhood▲ 4.1K

开发者借助工具实现AI提示框自动填充,不用手动填参数了

开发者sawyerhood在X平台分享,借助typesafeai的jev工具实现提示框自动填充,大改写用Fable加Claude Code

开发者sawyerhood在X平台分享,借助typesafeai开发的jev工具,他不再需要手动填写提示框里的所有内容。

工具会自动帮他选择代理、模型、设备和文件夹。

进行大篇幅改写时,该工作流使用Fable和Claude Code完成。
iOS应用的修改会在他其中一台Mac上运行。

在 X 看原帖 ↗
4.1K38852
技术分享 · @santtiagom_▲ 4.5K

博主@santtiagom_今年已发布五篇技术文章,第六篇正在创作中

发布在X平台的内容包含Harness Engineering、Claude Code相关等五篇技术文章链接

博主@santtiagom_在X平台分享了自己今年截至目前撰写完成的五篇技术文章链接。

五篇文章分别是:《Harness Engineering:从零开始讲解》,链接: Code的实际工作原理是什么?》,链接: Code中的SKILLS:入门完整指南》,链接:

目前第六篇文章正在撰写中,请感兴趣的读者期待后续更新。

此外,博主提到X平台存在一个bug,会随机引用分享列表中的一篇文章。

在 X 看原帖 ↗
4.5K6100106
大模型 · @libukai▲ 3.7K

用户实测Jev模型:分类场景速度、质量、价格优势明显

libukai在𝕏分享,使用Jev模型对比Gemini Flash Lite测试人民日报新闻分类的结果

阅读全文 →
3.7K63933
开发工具 · @mohewedy▲ 8.9K

开发者实测Claude Code 不适合复杂项目更适合氛围编码

开发者@mohewedy在𝕏分享自己使用Claude Code和OpenCode的不同体验对比

阅读全文 →
8.9K211769
大模型 · @noctus91▲ 8

用户实测Bonsai 2 27B可在苹果M3 Pro本地稳定运行

X用户@noctus91实测PrismML的Bonsai 2 27B大模型,在苹果M3 Pro芯片上本地运行表现优异

PrismML开发的Bonsai 2 27B,是少数能在苹果M3 Pro芯片上本地稳定运行的大模型。

实测显示,它的代码生成和智能体性能表现良好,可处理长任务、工具调用、文件操作、代码执行,以及视觉多模态任务,使用体验并不像精简后的本地模型。

主要缺点是运行速度较慢,实测 tokens 生成速度约为每秒8.5到11个。但作为一个270亿参数、以1-bit量化本地运行的模型,能在设备端实现这样的能力已经相当出色。

在 X 看原帖 ↗
81
商业 · @joshkim

SpaceXAI团队分享Grok Bot在营销全流程中的应用案例

joshkim在𝕏发文公开SpaceXAI团队使用Grok Bot搭建完整营销活动的过程及完整演示链接

joshkim发文分享SpaceXAI团队如何将Grok Bot应用于营销工作。

Grok Bot可以从开始到结束完整搭建一套营销活动,涵盖的工作包括:新品审核、落地页上线、付费营销活动搭建与分析,以及全流程自动化。

本次分享附带完整演示视频,同时Grok Bot Galaxy三天活动的完整录像也已公开。

第一天活动内容涵盖Grok Bot基础介绍、工程场景应用、产品经理场景应用和创始人场景应用。

第二天活动内容涵盖销售工程场景应用、GTM(go-to-market)场景应用和SDR(销售开发代表)场景应用。

第三天活动内容涵盖营销运营场景应用、售后场景应用和营销场景应用。

在 X 看原帖 ↗

今天的 38 条信号到这里下一轮 12:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新