社区讨论: 多名用户好奇,为何Jev发布短短几周就涌现出大量替代决策模型,这类模型是否容易复刻。有用户认为,无法传入先验也不能微调的Jev类模型实际用处有限,输出几乎没有意义。用户对比定价发现,Clef每百万token输入价格是Jev的近六倍,推荐有能力的用户自行部署。
还有用户澄清,Clef仅开放权重且基于Qwen,并非完全开源。
Tavus 发布视频模型 Griffin,称其首个通过图灵视频测试:在实时视频通话中,接近一半真人对话者把它错认成了真人,而此前同类系统的通过率不到 3%。
来源@tavus「tavus发布Griffin,首个通过图灵视频测试」
多款决策模型扎堆发布:Cloudflare 开源 clef 与 clef-flash 权重,Perplexity 上线 Decisions API,Fastino 发布 GLiDE。
来源@george_onx「Fastino发布GLiDE决策模型,排名超过Jev」@ritakozlov「ritakozlov / Cloudflare开源clef和clef-flash决策模型」@perplexitydevs「ritakozlov / Cloudflare开源clef和clef-flash决策模型」
一篇新论文研究了网络爬取到的 AI 生成文本对预训练的影响,发现这类文本会让模型质量变差。
来源@max_spero_「max_spero_ / jennajrussell发布关于AI文本影响LLM预训练缩放规律的论文」
介绍 e2e:适用于任意应用的智能代理测试框架 ~/ npx e2e init → 完全开源 混合确定性与智能代理 API 支持网页、移动端及更多平台 可使用你自己的智能代理和基础设施 可在本地或 CI 中运行
我们重构了 JetBrains IDEs,将其打造成终极智能代理工作台。 Air 是 IDE 内部的开放智能代理 hub: - 可运行任意智能代理(Claude、Codex 等等) - 借助 IDE 智能能力,代理运行效率更高 - 捆绑了免…
Qwen3.8-27B 有个怪问题:思考档位顺序是乱的。低档比中档花更多推理,通过率反而更低——68.5% 对 70.7%。只数通过的尝试,低档仍比中档多花约 1.3 倍推理。基础模型只在最高档满足“更高级别花更多、解决更多”这一顺序。
微调版 Pi(Qwen3.8-27B-pi)把这个顺序掰了回来。做法分两段:先 SFT,再 RL(GRPO)。SFT 用筛选过的成功会话做 LoRA 微调,覆盖所有线性层。适配器参数不到模型参数的 1%。它让输出 token 省约 21%、每任务轮次少 13%,通过率还略高。但成本顺序依然违反——low 还是比 medium 贵三分之一。
𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 2 条)
对关注智能体AI发展的人来说,这是行业里最早专门讨论智能体身份管理的公开研究,值得参考相关方向。
想要尝试强化学习微调模型的人,可以直接用这个开源平台,不用从头搭建环境。
社区讨论: 多名用户好奇,为何Jev发布短短几周就涌现出大量替代决策模型,这类模型是否容易复刻。有用户认为,无法传入先验也不能微调的Jev类模型实际用处有限,输出几乎没有意义。用户对比定价发现,Clef每百万token输入价格是Jev的近六倍,推荐有能力的用户自行部署。
还有用户澄清,Clef仅开放权重且基于Qwen,并非完全开源。
Halluminate正在构建强化学习环境和基准测试,帮助AI模型完成编程之外的知识工作,首先从金融领域切入,团队还不到10人。
Halluminate 正在构建强化学习环境和基准测试,帮助AI模型完成编码以外的知识工作,从金融领域起步。
这家公司团队人数不到10人,已经与美国前五闭源AI实验室中的四家展开合作,最近刚刚完成3000万美元A轮融资。
在本次炉边对话中,联合创始人 @Jerr_Wu 和 @wgm752 与 YC 的 @xuster 对谈,分享了测试浏览器代理如何让他们搭建出现在模型用来练习金融建模这类任务的环境。
他们解释了为什么更好的验证(而不只是更多训练任务)对让模型变聪明至关重要,以及这项工作最终如何能催生AI代理团队在其中协作学习的模拟公司。
时间线:
00:00 — Halluminate 从评估转向训练环境
03:48 — 教AI完成金融工作
07:13 — 为什么验证比数量更重要
10:13 — 从金融到模拟公司
13:30 — AI安全与团队建设
监管已经开始直面AI产品的潜在风险,未来AI行业发展和使用成本都可能因此改变
社区讨论:多数人认为此次调查最终不会有结果,大选中期选举结束六个月后要么不了了之要么对企业有利,因为美国现任政府不认为AI是问题,企业只要雇佣合适说客就能搞定白宫、换掉反对的监管官员。有人提出应当因头部AI企业低价倾销、挤压就业展开调查,也有人认为FTC本身对大企业做相关调查是正常情况。
只给不确定的复杂问题开启推理,兼顾速度和能力上限。未来能处理更复杂的系统决策任务,值得关注
现在为大家介绍 GLiDE,首个会思考的决策模型。它在 Decision Index 上排名第一,比 Jev 高出 6.9 分。
GLiDE 采用自适应思考方式。它的工作原理大致是:它先计算出快速概率分布,如果领先的答案不确定,就会启动推理过程。然后将推理结果整合到最终概率中。
这意味着该模型只会对需要推理的复杂决策使用推理能力,从而既能保持模型速度,又能扩展它可处理的任务种类。最终结果是,GLiDE 在知识与推理任务上比 Jev 高出 11.5 分,在 Decision Index 的全部五个评估领域全面领先。
推理能力让 GLiDE 可以完成传统决策模型难以处理的高度复杂任务,包括:从上百种工具和可能性路径中做出选择;执行、沙箱隔离、上报或拦截敏感操作;检查包含算术、代码、日期或多个事实的输出。
GLiDE 现已通过 Fastino API 开放使用。使用优惠码 USE_GLIDE 即可获得免费额度。
GLiDE API:
AI生成内容越来越逼真,难辨真假。可靠的溯源方案能帮区分人造、AI生成还是自然内容,可避免虚假信息干扰。
当 AI 生成内容变得越来越逼真,我们该如何验证内容到底来自人类、机器还是自然?
我们在播客中探讨了来源的关键作用——以及隐形水印如何同时保护数字媒体和生物设计。
↓时间码:
00:00 简介
00:34 什么是水印?
04:35 SynthID
15:16 图像与视频
19:28 SynthID Bio
28:00 未来的韧性
做有声内容时遇到AI读错专有名词,无需换工具重新生成,可直接在原有语音工具流程中修正错读,节省返工时间。
你的AI语音听起来像人声,但为什么它连产品名都读不对?
AI语音读“Porsche Taycan”时会读成TAY-can,但保时捷官方读法是TIE-kahn。它是根据拼写猜的,没人纠正这个错误,因为没人会去听第1200行文本。
今天我们推出了Onepin:文本转语音之后的生产步骤。它会在交付前用你已经在使用的语音检查每一句配音。
Onepin可以:
➤ 根据含400万个词的发音词典检查人名和产品名发音
➤ 在语音读出前解析价格和日期
➤ 给每一句音频就自然度、清晰度和单词准确度打分
➤ 用相同语音修正单个错词,无需重新渲染整段录音
它可以配合你在ElevenLabs、OpenAI、Google等30多个平台的语音订阅服务使用。
不需要输入音标拼写,不需要重新生成,不需要更换供应商。
免费开始使用,无需信用卡。
在下方串推中收听修改前后的对比效果 ⬇️
想学习难知识点却找不到规划,AI可以生成个性化系统课程,还能交互式带练,已有十万多用户体验。
介绍@hyperknow_ai:一种全新的学习方式。
这个AI教授能把任何学习目标转化为一对一、交互式的系统化课程。当其他所有AI都在忙着取代你的思考时,我们筹集了100万美元,来找回你自己理解事物时那种纯粹的兴奋感。
你给Hyperknow一个主题、一本教材,或是任何你之前一直难以理解的内容,它就能把你的好奇心转化为个性化课程,包含结构化单元、课程、练习甚至实践项目,然后在交互式白板上一步步带你学习,感觉就像有私人教授在你身边一样。
已有超过10万名学习者通过Hyperknow探索了新领域。现在轮到你了。
无需修改现有框架和训练代码,就能在常用框架中用强化学习训练任意模型,效果提升明显,对训练AI模型有参考价值。
1/ 我们很高兴发布《多agent环境强化学习终极指南》。
同一个模型在每个agent环境里的表现都不一样。因此我们构建了一种开源方法,可以在人们实际使用的环境(比如 Claude Code、Codex 和 OpenCode)中,不用修改一行环境代码和训练代码,就能在任意任务集上用强化学习训练任意模型。
在四个环境中训练后,LFM2.5-2.6B 的正确率从 42% 提升到了 54%,工具调用减少了 31%。🧵
新决策模型在质量和延迟上都超过现有基准,可托管使用也可下载权重,关注低延迟AI推理的开发者可以试试。
我们推出 clef:这是由 Cloudflare workers ai 团队训练的首批模型。
今天,我们发布了两个快速且准确的决策模型,它们在质量和延迟方面都优于基准测试。
你可以在 workers ai 上调用托管后的模型,也可以从 @huggingface 获取权重,因为我们也将它开源了。
接近半数真人对话者会把它错认成真人,此前同类系统通过率不到3%,想要和真人级别的AI视频互动可以期待。
首个通过图灵测试的模型——Griffin登场。
与Griffin实时对话的人群中,有48%认为它是真实人类。此前的系统通过率都低于3%。
它在NVIDIA全双工AI视频基准测试中排名第一。
这是首个“人类交互模型(HIM)”。
X平台用户@leaf_sanren分享了一套可以稳定产出Muse AI人像视频的超长提示词
博主@leaf_sanren在X平台分享了一段由Muse直接生成的AI视频,并提出疑问:这款生成结果能否超越现有的Seedance 2.5或Wan 3.0?
博主给出了这套用于生成视频的完整提示词,要求生成一段15秒、9:16竖屏、超高清4K、30fps的电影级真实质感时尚人像短片,还详细设定了人物、妆容、场景、光线、运镜等细节。
人物设定要求是20-25岁左右的年轻亚洲女性,整体气质像车模或时尚活动现场被摄影师近距离怼脸抓拍,明确要求保留毛孔、轻微痘印、细纹等真实皮肤细节,排除网红感、过度磨皮等不真实效果。
光线要求符合现实拍摄逻辑,主光从人物正前偏侧上方打来,全程允许出现2到3次自然的短暂闪光灯,不能整段频闪。运镜采用超近距离人像运镜,按时间分段给出了具体的镜头移动要求。
最终要求整体风格呈现真实高级的时尚人像质感,不能出现五官变形、镜头乱晃等问题。这套提示词已经可以稳定产出对应视频,相关链接已公开。
近期多家机构接连发布决策模型,Cloudflare也开源了两款自家训练的clef和clef-flash模型,可在Cloudflare Workers AI上使用。你最近有没有接触过决策类AI模型?
我们推出了 Perplexity Decisions API。它由 pplx-decider-v1-27b 驱动,这是我们训练的多模态决策模型,用于输出固定答案集上的概率分布而非文本。其价格为每百万输入 tokens 0.04 美元,在各基准测试上得分达到 85.71%。
“今天,我们发布了两个由 Cloudflare 训练的决策模型 Clef 和 Clef-flash。”从未见过一个观点传播得如此之快。
现在是决策模型之秋 🍂,今天,我们开源了 clef 和 clef-flash,这是我们第一个自主训练的模型,两者现在都可以在 @cloudflare workers ai 上使用!演示/排行榜:博客:
新研究测量了网络爬取的AI生成文本对大模型预训练缩放规律的影响,发现这类文本会让训练出来的模型质量变差。
Extract v2.5推出了多个不同档位的智能体,专门针对文档提取的价值准确率和接地(关联原文)做了调优,成本也更低。
今天我们推出了 Extract v2.5 —— 一系列专门为文档提取调整的前沿智能体。
这些智能体(高性价比、智能体型、增强智能体型)针对取值准确性和内容溯源做了优化。我们的提取智能体性能超过了 Opus 5.5 和 GPT-6 Sol,同时价格低 30% 到 4 倍。
我们对复杂提取做了大幅改进:
- 长列表(智能体层级准确率从 86.1% 提升到 95.5%)
- 跨页记录(从 85.5% 提升到 96.5%)
- 扫描表单(从 90.9% 提升到 95.7%)
我们还推出了以下功能:
✅ 高级引用:我们会为推导字段的所有支持值定位 bounding box,哪怕没有完全匹配也没关系。
✅ 结构推理:我们会根据文档的类型、布局和信息定制文档提取算法。
我们的提取智能体在 ExtractBench 上,跨多个价格档位,都实现了价格性能的 SOTA。对于任意复杂度的文档,我们都是最好的文档提取工具。
所有这些功能都已经在 LlamaParse 上线,快去体验吧!
更低成本的开源权重模型达到前沿水平的React开发性能,React开发者可以多一个低成本的开发工具选项。
我们推出了 Apex:一款面向移动和 Web、专注于 React 的智能编码模型。
我们构建 Apex 源于一个简单的想法:一个开放权重模型能否以更低成本实现前沿级性能?
答案是可以。
Apex 在 React Native 和 Next.js 上达到了当前最优水平。
立即体验:
想知道通用人工智能开发的最新进展,这是朝着超级智能迈出的关键一步,值得关注这个方向的新尝试
今天我们推出PROWL-2,在此模型中,智能体及其世界模型通过递归学习实现改进。
智能体暴露想象中的错误,修复这些错误就能让学习更进一步。
我们认为,这种开放式学习是迈向超级智能的关键一步。
支持图片像素嵌入搜索、PDF文字识别,可搭配任意大语言模型使用,最大能处理10 MiB文件,给日常搜图搜文档多了一个新选择。
AI Search 现已全面开放。
它直接嵌入图像像素以进行视觉搜索,可对扫描版 PDF 运行光学字符识别,支持上传最大 10 MiB 的文件,并且适配任何聊天模型。
下文介绍了新增功能和定价方式。
#BirthdayWeek
想参与开发新AI时代代码管理平台,可参与本次竞赛,已开放测试版可供体验
Cloudflare 正在举办一场竞赛,看谁能为智能体时代打造下一代 Git 平台。
Artifacts 现已开启公开测试,支持 Workers 绑定、数据管辖控制,以及针对代码库变更的事件订阅。
#BirthdayWeek
让大模型自主编辑管理运行中的上下文,能在减少计算量的同时提升任务准确率,对需要大上下文处理的任务有明显性能优化。
想了解当前大模型技术迭代核心方向的话,可以看看这个观点,它指出了新旧模型在推理范式上的关键区别和性能差异。
基础大语言模型(2024年及更早版本)和现代大推理模型(LRM)之间的关键区别,并不在于符号化工具使用。
区别在于,它们从转导范式(直接根据查询推断答案)转向了归纳范式(推断出能生成查询答案的程序/指令)。
现在的模型被训练为归纳式,它们会在测试时进行归纳,也就是在测试时预测自然语言程序/推理链。
这解锁了全新的能力——尤其是流体智力。
到目前为止,基础大语言模型的流体智力几乎为0。而现代大推理模型已经拥有相当高水平的流体智力。
大语言模型在ARC 1(2019年推出的一项基准测试)上的表现,到今天仍然只有大约10%-15%。将模型参数量缩放100000倍,也只是让准确率从0%提升到了10%。
而参数量相同甚至更小的现代大推理模型,已经在2025年拉满了ARC 1的成绩。
想靠大模型帮忙做科研,可以看看这个观点,了解目前大模型在科研领域的适配问题,以及新的解决思路。
在物理学中,当两个系统各自都能正常工作,但匹配度很差时,就会出现“阻抗失配”。
在这篇《科学》博客客座文章中,哈佛大学物理学家马修·施瓦茨提出,AI和科学领域目前也发生了类似的情况。
大语言模型可以胜任很多工作,但目前按照和人类合作者共事的方式来使用它们,并不是激发它们科学能力的最佳方式。
为了解决这种失配,施瓦茨创建了一个用于定量科学精确计算的工具包。
由于类似的计算通常出现在差异极大的科学领域,Claude 找到了它与生态学、种群遗传学以及其他十几个领域之间的关联,施瓦茨则与领域专家合作,引导它去探索有趣的问题。
用户@FynCas在𝕏平台发布了使用Seedance 2.5生成AI视频的完整结构化提示词
用户@Naiknelofar788在𝕏分享了Seedance 2.5的详细生成提示词
用户@hxhxhx0916 在𝕏分享《现代战争:斩首》AI生成视频提示词,限定积分一次生成
本次共发布两款模型,可在Hugging Face获取权重,支持部署在边缘GPU
HaileyAILabs在X平台测评Muse,其内置Spark的视频生成能力超出预期,适合普通用户做AI漫剧
因「个人智能体(Agent)」走红的Muse,本次被当作基础模型测评其内置Spark的视频生成能力。
测评结果超出预期,尤其在AI漫剧生成场景,它基本可以一键生成长视频,剧情、分镜和画面衔接都比较完整,微调后就具备商用潜力。
Muse被吐槽最多的帧率问题确实存在,整体表现一般,但对于治愈系动画、手绘短片、AI漫剧这类内容来说,帧率问题影响不大,不影响正常出片。
它最大的优势是成本低。测评者连续制作多个视频后,免费额度只用了不到一半,而且免费额度每周重置;之前通过邀请获得的10亿Token甚至还未使用。
此前不管是Seedance还是其他视频生成平台,Token成本都比较高,新手制作长视频还容易出现制作周期长、生成不稳定、内容崩溃等问题。
测评者认为,对于普通用户玩AI漫剧、制作短视频内容来说,Muse确实是不错的Seedance平替。
测评者发布相关内容后,评论区出现不少人身攻击,起因只是测评者说了一句「再见Seedance」。测评者表示,观点不同可以拿作品、效果、成本理性讨论,希望这只是部分用户情绪上头,而非公关大战。
Anthropic工程师Lance Martin分享了Claude Opus 5.5的优化技巧
Anthropic工程师Lance Martin披露了一个Claude Opus 5.5的实用使用技巧,可以将生产力提升300%。
操作步骤非常简单,只需要打开Claude Code,输入指令/claude-api prompt-audit即可。
这个指令会完成三项工作:首先检查你的技能配置、CLAUDE.md文件和提示词,然后移除所有拖慢模型运行速度的内容,最后按照官方Opus 5.5指南重写提示词。
很多用户的提示词都是为旧版本模型编写的,这个优化只需要3分钟就能完成,建议收藏这个技巧。
用户@0xwhrrari分享了Claude Opus 5.5在动态设计上的用法,发布于𝕏
Claude Opus 5.5在动态设计领域表现十分出色。
只需把指定提示词发送给Claude Code,就能将一个粗略的创意想法转化为完整的工作室工作流。这个完整工作流涵盖:创意→分镜→视觉系统→动画→音效→最终渲染。
复制并发送指定提示词后,就可以在下方文章中阅读完整的动态设计指南。
用户@mikepat711在𝕏分享了自己的AI使用配置,以Grok Bot为核心统一界面兼顾便利性和灵活性
用户Corey Ganim在𝕏分享了对Muse、Dot、GrokBot、Instinct四款个人AI助手的使用体验
用户@ScarletKc分享了Claude Code的/insights命令的使用体验
@icreatelife在𝕏发布经验分享,涵盖提示词生成、模型选择等实用建议
这是一组AI视频制作技巧:
1. 使用Claude生成提示词,Opus 5.5的效果很不错。目前多数专业创作者已经不再手动编写提示词。
2. 生成视频之前先制作角色表,为每个素材创建对应资料,这能帮你保证生成内容的一致性。另外要在生成视频前准备并优化好所有素材。
3. 每个AI大模型都有自己的优缺点,要根据模型特性选择使用。比如Seedream 5.0 Pro在皮肤纹理生成上表现很好,生成视频一般选Seedance 2.5,如果只有2.0版本也可以使用。
4. 测试提示词、优化调整的阶段可以先生成480分辨率的视频,不用一开始就生成1080分辨率,这样可以节省你的使用额度。
5. 很多时候批量生成比重新改写提示词效率更高,这往往是更优的选择。
6. 如果会使用Blender,可以用它来处理场景镜头运动、保证内容一致性;如果不会用Blender,可以让Claude帮你处理相关工作。
网友@sudoingX在𝕏分享测试结果,总速度超76token每秒,每个智能体占用64k上下文
16GB显存的NVIDIA RTX 5060 Ti显卡可以同时运行4个自主编码智能体,总生成速度超过每秒76个token,单个智能体速度在每秒17到21个token之间。
测试用的是4个Hermes智能体,可以同时并行构建4款游戏,每个智能体支持64k上下文窗口。开启多令牌预测(mtp)时单流速度可达每秒67个token。
测试过程中占用了16GB显存里的15.6GB,显卡整功耗130瓦。所用模型为Bonsai 2 27B三元量化版本,占用空间5.95GB,通过llama.cpp服务器部署,4个插槽各接收一个纯文本提示。
整个过程实际耗时42分钟,视频加速到3分钟展示四个智能体同时思考编码的过程。
该模型已经打包发布,只要拥有RTX 3060及以上的30、40、50系列NVIDIA显卡都可以运行,用户可以前往链接拉取模型部署使用。
本文带你上手适合国内用户的AI Agent产品WorkBuddy
@antiAIvo计划推出8期从0手写AI Agent的技术教程系列
准备做一个新的技术教程系列:《从 0 手写一个 AI Agent》 整个系列分为 8 期: 第 1 期:写出你的第一个 Agent 跑通最小 Agent,理解模型、工具和执行循环 第 2 期:让 Agent 调用工具 学会 Tool Calling:定义工具、传参、执行、返回结果 第 3 期:亲手实现 Agent Loop 让 Agent 根据结果继续行动,加上退出条件和最大步数 第 4 期:让 Agent 保存任务进度 管理对话历史、工具结果和任务状态,支持保存与恢复 第 5 期:让 Agent 更可靠 处理报错、超时、重复调用,加入重试、成本限制和人工确认 第 6 期:接入检索与记忆 让 Agent 查资料库,理解 RAG、会话状态和长期记忆 第 7 期:验证 Agent 到底有没有变好 记录执行轨迹,建立测试任务,从正确率、耗时、成本评估 第 8 期:从单 Agent 走向复杂系统 理解何时用工作流、框架或多 Agent,并实现一个协作版本 目标: 看完能自己写出一个 Agent,也能解释它为什么这样工作
这个更切合实际场景 难度也更低,做起来应该更有兴趣
来自X平台用户@EXM7777的分享,Opus 5.5和GPT-6.1 Sol获S级评级
当前AI模型分级列表:
S级:Opus 5.5 和 GPT-6.1 Sol: insane聪明,速度快,效率高……这是我用过体验最好的AI,真的挑不出毛病。
F级:其他所有模型。
不开玩笑说,你真的不需要其他AI了。目前来看,200美元套餐的使用额度几乎是无限的,如果你同时订阅 Claude 和 ChatGPT,你就能得到:
- 最佳写作模型:Opus
- 最佳设计模型:Opus
- 最佳编码模型:Opus
- 最佳浏览器和电脑使用模型与工具链:Sol
- 最佳图像生成模型:Images-2.5
已有15000名创始人加入我的系统,每周只发一封邮件(免费)。
想了解当前大模型技术迭代核心方向的话,可以看看这个观点,它指出了新旧模型在推理范式上的关键区别和性能差异。
基础大语言模型(2024年及更早版本)和现代大推理模型(LRM)之间的关键区别,并不在于符号化工具使用。
区别在于,它们从转导范式(直接根据查询推断答案)转向了归纳范式(推断出能生成查询答案的程序/指令)。
现在的模型被训练为归纳式,它们会在测试时进行归纳,也就是在测试时预测自然语言程序/推理链。
这解锁了全新的能力——尤其是流体智力。
到目前为止,基础大语言模型的流体智力几乎为0。而现代大推理模型已经拥有相当高水平的流体智力。
大语言模型在ARC 1(2019年推出的一项基准测试)上的表现,到今天仍然只有大约10%-15%。将模型参数量缩放100000倍,也只是让准确率从0%提升到了10%。
而参数量相同甚至更小的现代大推理模型,已经在2025年拉满了ARC 1的成绩。
让大模型自主编辑管理运行中的上下文,能在减少计算量的同时提升任务准确率,对需要大上下文处理的任务有明显性能优化。
AI生成内容越来越逼真,难辨真假。可靠的溯源方案能帮区分人造、AI生成还是自然内容,可避免虚假信息干扰。
当 AI 生成内容变得越来越逼真,我们该如何验证内容到底来自人类、机器还是自然?
我们在播客中探讨了来源的关键作用——以及隐形水印如何同时保护数字媒体和生物设计。
↓时间码:
00:00 简介
00:34 什么是水印?
04:35 SynthID
15:16 图像与视频
19:28 SynthID Bio
28:00 未来的韧性
接近半数真人对话者会把它错认成真人,此前同类系统通过率不到3%,想要和真人级别的AI视频互动可以期待。
首个通过图灵测试的模型——Griffin登场。
与Griffin实时对话的人群中,有48%认为它是真实人类。此前的系统通过率都低于3%。
它在NVIDIA全双工AI视频基准测试中排名第一。
这是首个“人类交互模型(HIM)”。
新决策模型在质量和延迟上都超过现有基准,可托管使用也可下载权重,关注低延迟AI推理的开发者可以试试。
我们推出 clef:这是由 Cloudflare workers ai 团队训练的首批模型。
今天,我们发布了两个快速且准确的决策模型,它们在质量和延迟方面都优于基准测试。
你可以在 workers ai 上调用托管后的模型,也可以从 @huggingface 获取权重,因为我们也将它开源了。
开发各类应用都需要测试,这款全开源测试框架支持自定义代理和基础设施,可本地也可在持续集成中运行,能降低应用开发测试成本
介绍 e2e:适用于任意应用的智能代理测试框架
~/ npx e2e init →
完全开源
混合确定性与智能代理 API
支持网页、移动端及更多平台
可使用你自己的智能代理和基础设施
可在本地或 CI 中运行
无需修改现有框架和训练代码,就能在常用框架中用强化学习训练任意模型,效果提升明显,对训练AI模型有参考价值。
1/ 我们很高兴发布《多agent环境强化学习终极指南》。
同一个模型在每个agent环境里的表现都不一样。因此我们构建了一种开源方法,可以在人们实际使用的环境(比如 Claude Code、Codex 和 OpenCode)中,不用修改一行环境代码和训练代码,就能在任意任务集上用强化学习训练任意模型。
在四个环境中训练后,LFM2.5-2.6B 的正确率从 42% 提升到了 54%,工具调用减少了 31%。🧵
做有声内容时遇到AI读错专有名词,无需换工具重新生成,可直接在原有语音工具流程中修正错读,节省返工时间。
你的AI语音听起来像人声,但为什么它连产品名都读不对?
AI语音读“Porsche Taycan”时会读成TAY-can,但保时捷官方读法是TIE-kahn。它是根据拼写猜的,没人纠正这个错误,因为没人会去听第1200行文本。
今天我们推出了Onepin:文本转语音之后的生产步骤。它会在交付前用你已经在使用的语音检查每一句配音。
Onepin可以:
➤ 根据含400万个词的发音词典检查人名和产品名发音
➤ 在语音读出前解析价格和日期
➤ 给每一句音频就自然度、清晰度和单词准确度打分
➤ 用相同语音修正单个错词,无需重新渲染整段录音
它可以配合你在ElevenLabs、OpenAI、Google等30多个平台的语音订阅服务使用。
不需要输入音标拼写,不需要重新生成,不需要更换供应商。
免费开始使用,无需信用卡。
在下方串推中收听修改前后的对比效果 ⬇️
想参与开发新AI时代代码管理平台,可参与本次竞赛,已开放测试版可供体验
Cloudflare 正在举办一场竞赛,看谁能为智能体时代打造下一代 Git 平台。
Artifacts 现已开启公开测试,支持 Workers 绑定、数据管辖控制,以及针对代码库变更的事件订阅。
#BirthdayWeek
支持图片像素嵌入搜索、PDF文字识别,可搭配任意大语言模型使用,最大能处理10 MiB文件,给日常搜图搜文档多了一个新选择。
AI Search 现已全面开放。
它直接嵌入图像像素以进行视觉搜索,可对扫描版 PDF 运行光学字符识别,支持上传最大 10 MiB 的文件,并且适配任何聊天模型。
下文介绍了新增功能和定价方式。
#BirthdayWeek
想知道通用人工智能开发的最新进展,这是朝着超级智能迈出的关键一步,值得关注这个方向的新尝试
今天我们推出PROWL-2,在此模型中,智能体及其世界模型通过递归学习实现改进。
智能体暴露想象中的错误,修复这些错误就能让学习更进一步。
我们认为,这种开放式学习是迈向超级智能的关键一步。
只给不确定的复杂问题开启推理,兼顾速度和能力上限。未来能处理更复杂的系统决策任务,值得关注
现在为大家介绍 GLiDE,首个会思考的决策模型。它在 Decision Index 上排名第一,比 Jev 高出 6.9 分。
GLiDE 采用自适应思考方式。它的工作原理大致是:它先计算出快速概率分布,如果领先的答案不确定,就会启动推理过程。然后将推理结果整合到最终概率中。
这意味着该模型只会对需要推理的复杂决策使用推理能力,从而既能保持模型速度,又能扩展它可处理的任务种类。最终结果是,GLiDE 在知识与推理任务上比 Jev 高出 11.5 分,在 Decision Index 的全部五个评估领域全面领先。
推理能力让 GLiDE 可以完成传统决策模型难以处理的高度复杂任务,包括:从上百种工具和可能性路径中做出选择;执行、沙箱隔离、上报或拦截敏感操作;检查包含算术、代码、日期或多个事实的输出。
GLiDE 现已通过 Fastino API 开放使用。使用优惠码 USE_GLIDE 即可获得免费额度。
GLiDE API:
更低成本的开源权重模型达到前沿水平的React开发性能,React开发者可以多一个低成本的开发工具选项。
我们推出了 Apex:一款面向移动和 Web、专注于 React 的智能编码模型。
我们构建 Apex 源于一个简单的想法:一个开放权重模型能否以更低成本实现前沿级性能?
答案是可以。
Apex 在 React Native 和 Next.js 上达到了当前最优水平。
立即体验:
想学习难知识点却找不到规划,AI可以生成个性化系统课程,还能交互式带练,已有十万多用户体验。
介绍@hyperknow_ai:一种全新的学习方式。
这个AI教授能把任何学习目标转化为一对一、交互式的系统化课程。当其他所有AI都在忙着取代你的思考时,我们筹集了100万美元,来找回你自己理解事物时那种纯粹的兴奋感。
你给Hyperknow一个主题、一本教材,或是任何你之前一直难以理解的内容,它就能把你的好奇心转化为个性化课程,包含结构化单元、课程、练习甚至实践项目,然后在交互式白板上一步步带你学习,感觉就像有私人教授在你身边一样。
已有超过10万名学习者通过Hyperknow探索了新领域。现在轮到你了。
近期多家机构接连发布决策模型,Cloudflare也开源了两款自家训练的clef和clef-flash模型,可在Cloudflare Workers AI上使用。你最近有没有接触过决策类AI模型?
我们推出了 Perplexity Decisions API。它由 pplx-decider-v1-27b 驱动,这是我们训练的多模态决策模型,用于输出固定答案集上的概率分布而非文本。其价格为每百万输入 tokens 0.04 美元,在各基准测试上得分达到 85.71%。
“今天,我们发布了两个由 Cloudflare 训练的决策模型 Clef 和 Clef-flash。”从未见过一个观点传播得如此之快。
现在是决策模型之秋 🍂,今天,我们开源了 clef 和 clef-flash,这是我们第一个自主训练的模型,两者现在都可以在 @cloudflare workers ai 上使用!演示/排行榜:博客:
新研究测量了网络爬取的AI生成文本对大模型预训练缩放规律的影响,发现这类文本会让训练出来的模型质量变差。
Extract v2.5推出了多个不同档位的智能体,专门针对文档提取的价值准确率和接地(关联原文)做了调优,成本也更低。
今天我们推出了 Extract v2.5 —— 一系列专门为文档提取调整的前沿智能体。
这些智能体(高性价比、智能体型、增强智能体型)针对取值准确性和内容溯源做了优化。我们的提取智能体性能超过了 Opus 5.5 和 GPT-6 Sol,同时价格低 30% 到 4 倍。
我们对复杂提取做了大幅改进:
- 长列表(智能体层级准确率从 86.1% 提升到 95.5%)
- 跨页记录(从 85.5% 提升到 96.5%)
- 扫描表单(从 90.9% 提升到 95.7%)
我们还推出了以下功能:
✅ 高级引用:我们会为推导字段的所有支持值定位 bounding box,哪怕没有完全匹配也没关系。
✅ 结构推理:我们会根据文档的类型、布局和信息定制文档提取算法。
我们的提取智能体在 ExtractBench 上,跨多个价格档位,都实现了价格性能的 SOTA。对于任意复杂度的文档,我们都是最好的文档提取工具。
所有这些功能都已经在 LlamaParse 上线,快去体验吧!
Halluminate正在构建强化学习环境和基准测试,帮助AI模型完成编程之外的知识工作,首先从金融领域切入,团队还不到10人。
Halluminate 正在构建强化学习环境和基准测试,帮助AI模型完成编码以外的知识工作,从金融领域起步。
这家公司团队人数不到10人,已经与美国前五闭源AI实验室中的四家展开合作,最近刚刚完成3000万美元A轮融资。
在本次炉边对话中,联合创始人 @Jerr_Wu 和 @wgm752 与 YC 的 @xuster 对谈,分享了测试浏览器代理如何让他们搭建出现在模型用来练习金融建模这类任务的环境。
他们解释了为什么更好的验证(而不只是更多训练任务)对让模型变聪明至关重要,以及这项工作最终如何能催生AI代理团队在其中协作学习的模拟公司。
时间线:
00:00 — Halluminate 从评估转向训练环境
03:48 — 教AI完成金融工作
07:13 — 为什么验证比数量更重要
10:13 — 从金融到模拟公司
13:30 — AI安全与团队建设
IDE里集成了开放智能体中心,可以运行多种第三方AI智能体,还优化了运行效率,常用Claude、Codex写代码的开发者可以试试。
我们重构了 JetBrains IDEs,将其打造成终极智能代理工作台。
Air 是 IDE 内部的开放智能代理 hub:
- 可运行任意智能代理(Claude、Codex 等等)
- 借助 IDE 智能能力,代理运行效率更高
- 捆绑了免费的 Junie Lite 代理
- 通过 Air Teams 支持云端运行 ⬇️
监管已经开始直面AI产品的潜在风险,未来AI行业发展和使用成本都可能因此改变
社区讨论:多数人认为此次调查最终不会有结果,大选中期选举结束六个月后要么不了了之要么对企业有利,因为美国现任政府不认为AI是问题,企业只要雇佣合适说客就能搞定白宫、换掉反对的监管官员。有人提出应当因头部AI企业低价倾销、挤压就业展开调查,也有人认为FTC本身对大企业做相关调查是正常情况。
想要尝试强化学习微调模型的人,可以直接用这个开源平台,不用从头搭建环境。
社区讨论: 多名用户好奇,为何Jev发布短短几周就涌现出大量替代决策模型,这类模型是否容易复刻。有用户认为,无法传入先验也不能微调的Jev类模型实际用处有限,输出几乎没有意义。用户对比定价发现,Clef每百万token输入价格是Jev的近六倍,推荐有能力的用户自行部署。
还有用户澄清,Clef仅开放权重且基于Qwen,并非完全开源。
对关注智能体AI发展的人来说,这是行业里最早专门讨论智能体身份管理的公开研究,值得参考相关方向。
想靠大模型帮忙做科研,可以看看这个观点,了解目前大模型在科研领域的适配问题,以及新的解决思路。
在物理学中,当两个系统各自都能正常工作,但匹配度很差时,就会出现“阻抗失配”。
在这篇《科学》博客客座文章中,哈佛大学物理学家马修·施瓦茨提出,AI和科学领域目前也发生了类似的情况。
大语言模型可以胜任很多工作,但目前按照和人类合作者共事的方式来使用它们,并不是激发它们科学能力的最佳方式。
为了解决这种失配,施瓦茨创建了一个用于定量科学精确计算的工具包。
由于类似的计算通常出现在差异极大的科学领域,Claude 找到了它与生态学、种群遗传学以及其他十几个领域之间的关联,施瓦茨则与领域专家合作,引导它去探索有趣的问题。
来自X平台用户@EXM7777的分享,Opus 5.5和GPT-6.1 Sol获S级评级
当前AI模型分级列表:
S级:Opus 5.5 和 GPT-6.1 Sol: insane聪明,速度快,效率高……这是我用过体验最好的AI,真的挑不出毛病。
F级:其他所有模型。
不开玩笑说,你真的不需要其他AI了。目前来看,200美元套餐的使用额度几乎是无限的,如果你同时订阅 Claude 和 ChatGPT,你就能得到:
- 最佳写作模型:Opus
- 最佳设计模型:Opus
- 最佳编码模型:Opus
- 最佳浏览器和电脑使用模型与工具链:Sol
- 最佳图像生成模型:Images-2.5
已有15000名创始人加入我的系统,每周只发一封邮件(免费)。
@antiAIvo计划推出8期从0手写AI Agent的技术教程系列
准备做一个新的技术教程系列:《从 0 手写一个 AI Agent》 整个系列分为 8 期: 第 1 期:写出你的第一个 Agent 跑通最小 Agent,理解模型、工具和执行循环 第 2 期:让 Agent 调用工具 学会 Tool Calling:定义工具、传参、执行、返回结果 第 3 期:亲手实现 Agent Loop 让 Agent 根据结果继续行动,加上退出条件和最大步数 第 4 期:让 Agent 保存任务进度 管理对话历史、工具结果和任务状态,支持保存与恢复 第 5 期:让 Agent 更可靠 处理报错、超时、重复调用,加入重试、成本限制和人工确认 第 6 期:接入检索与记忆 让 Agent 查资料库,理解 RAG、会话状态和长期记忆 第 7 期:验证 Agent 到底有没有变好 记录执行轨迹,建立测试任务,从正确率、耗时、成本评估 第 8 期:从单 Agent 走向复杂系统 理解何时用工作流、框架或多 Agent,并实现一个协作版本 目标: 看完能自己写出一个 Agent,也能解释它为什么这样工作
这个更切合实际场景 难度也更低,做起来应该更有兴趣
本文带你上手适合国内用户的AI Agent产品WorkBuddy
网友@sudoingX在𝕏分享测试结果,总速度超76token每秒,每个智能体占用64k上下文
16GB显存的NVIDIA RTX 5060 Ti显卡可以同时运行4个自主编码智能体,总生成速度超过每秒76个token,单个智能体速度在每秒17到21个token之间。
测试用的是4个Hermes智能体,可以同时并行构建4款游戏,每个智能体支持64k上下文窗口。开启多令牌预测(mtp)时单流速度可达每秒67个token。
测试过程中占用了16GB显存里的15.6GB,显卡整功耗130瓦。所用模型为Bonsai 2 27B三元量化版本,占用空间5.95GB,通过llama.cpp服务器部署,4个插槽各接收一个纯文本提示。
整个过程实际耗时42分钟,视频加速到3分钟展示四个智能体同时思考编码的过程。
该模型已经打包发布,只要拥有RTX 3060及以上的30、40、50系列NVIDIA显卡都可以运行,用户可以前往链接拉取模型部署使用。
@icreatelife在𝕏发布经验分享,涵盖提示词生成、模型选择等实用建议
这是一组AI视频制作技巧:
1. 使用Claude生成提示词,Opus 5.5的效果很不错。目前多数专业创作者已经不再手动编写提示词。
2. 生成视频之前先制作角色表,为每个素材创建对应资料,这能帮你保证生成内容的一致性。另外要在生成视频前准备并优化好所有素材。
3. 每个AI大模型都有自己的优缺点,要根据模型特性选择使用。比如Seedream 5.0 Pro在皮肤纹理生成上表现很好,生成视频一般选Seedance 2.5,如果只有2.0版本也可以使用。
4. 测试提示词、优化调整的阶段可以先生成480分辨率的视频,不用一开始就生成1080分辨率,这样可以节省你的使用额度。
5. 很多时候批量生成比重新改写提示词效率更高,这往往是更优的选择。
6. 如果会使用Blender,可以用它来处理场景镜头运动、保证内容一致性;如果不会用Blender,可以让Claude帮你处理相关工作。
用户@ScarletKc分享了Claude Code的/insights命令的使用体验
用户Corey Ganim在𝕏分享了对Muse、Dot、GrokBot、Instinct四款个人AI助手的使用体验
用户@mikepat711在𝕏分享了自己的AI使用配置,以Grok Bot为核心统一界面兼顾便利性和灵活性
用户@0xwhrrari分享了Claude Opus 5.5在动态设计上的用法,发布于𝕏
Claude Opus 5.5在动态设计领域表现十分出色。
只需把指定提示词发送给Claude Code,就能将一个粗略的创意想法转化为完整的工作室工作流。这个完整工作流涵盖:创意→分镜→视觉系统→动画→音效→最终渲染。
复制并发送指定提示词后,就可以在下方文章中阅读完整的动态设计指南。
Anthropic工程师Lance Martin分享了Claude Opus 5.5的优化技巧
Anthropic工程师Lance Martin披露了一个Claude Opus 5.5的实用使用技巧,可以将生产力提升300%。
操作步骤非常简单,只需要打开Claude Code,输入指令/claude-api prompt-audit即可。
这个指令会完成三项工作:首先检查你的技能配置、CLAUDE.md文件和提示词,然后移除所有拖慢模型运行速度的内容,最后按照官方Opus 5.5指南重写提示词。
很多用户的提示词都是为旧版本模型编写的,这个优化只需要3分钟就能完成,建议收藏这个技巧。
HaileyAILabs在X平台测评Muse,其内置Spark的视频生成能力超出预期,适合普通用户做AI漫剧
因「个人智能体(Agent)」走红的Muse,本次被当作基础模型测评其内置Spark的视频生成能力。
测评结果超出预期,尤其在AI漫剧生成场景,它基本可以一键生成长视频,剧情、分镜和画面衔接都比较完整,微调后就具备商用潜力。
Muse被吐槽最多的帧率问题确实存在,整体表现一般,但对于治愈系动画、手绘短片、AI漫剧这类内容来说,帧率问题影响不大,不影响正常出片。
它最大的优势是成本低。测评者连续制作多个视频后,免费额度只用了不到一半,而且免费额度每周重置;之前通过邀请获得的10亿Token甚至还未使用。
此前不管是Seedance还是其他视频生成平台,Token成本都比较高,新手制作长视频还容易出现制作周期长、生成不稳定、内容崩溃等问题。
测评者认为,对于普通用户玩AI漫剧、制作短视频内容来说,Muse确实是不错的Seedance平替。
测评者发布相关内容后,评论区出现不少人身攻击,起因只是测评者说了一句「再见Seedance」。测评者表示,观点不同可以拿作品、效果、成本理性讨论,希望这只是部分用户情绪上头,而非公关大战。
本次共发布两款模型,可在Hugging Face获取权重,支持部署在边缘GPU
X平台用户@leaf_sanren分享了一套可以稳定产出Muse AI人像视频的超长提示词
博主@leaf_sanren在X平台分享了一段由Muse直接生成的AI视频,并提出疑问:这款生成结果能否超越现有的Seedance 2.5或Wan 3.0?
博主给出了这套用于生成视频的完整提示词,要求生成一段15秒、9:16竖屏、超高清4K、30fps的电影级真实质感时尚人像短片,还详细设定了人物、妆容、场景、光线、运镜等细节。
人物设定要求是20-25岁左右的年轻亚洲女性,整体气质像车模或时尚活动现场被摄影师近距离怼脸抓拍,明确要求保留毛孔、轻微痘印、细纹等真实皮肤细节,排除网红感、过度磨皮等不真实效果。
光线要求符合现实拍摄逻辑,主光从人物正前偏侧上方打来,全程允许出现2到3次自然的短暂闪光灯,不能整段频闪。运镜采用超近距离人像运镜,按时间分段给出了具体的镜头移动要求。
最终要求整体风格呈现真实高级的时尚人像质感,不能出现五官变形、镜头乱晃等问题。这套提示词已经可以稳定产出对应视频,相关链接已公开。
用户@hxhxhx0916 在𝕏分享《现代战争:斩首》AI生成视频提示词,限定积分一次生成
用户@Naiknelofar788在𝕏分享了Seedance 2.5的详细生成提示词
用户@FynCas在𝕏平台发布了使用Seedance 2.5生成AI视频的完整结构化提示词
今天的 39 条信号到这里下一轮 12:30 更新
https://ai-pulse-lab.com/feed.xml
每天 08:00 · 12:30 · 18:30 · 23:50 更新
在阅读器里订阅
添加到 Feedly、Inoreader 等阅读器
https://ai-pulse-lab.com/feed.xml
让你的 Agent 自动获取每轮简报
适用于 Claude、ChatGPT、Manus 等
请帮我设置一个定时任务,每天北京时间 08:30、13:00、19:00、00:20 各执行一次: 请求 https://ai-pulse-lab.com/api/brief.json,读取返回 JSON 中的 textPlain 字段,将内容发送给我。 补充:每日北京时间 08:00、12:30、18:30、23:50 更新,建议更新后 30 分钟查询。可先请求 /api/manifest.json 检查 nextUpdateAt 字段。无需认证,直接 GET 请求即可。