AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 8 月 21 日 · 08:00 更新 0 文章0 信号0 主题
试试:

今天发生了什么1 分钟读懂

Harvey 发布自研法律模型 Tenet,底座是 Kimi K3。法律基准通过率最高提升 82%,推理成本降超四分之三,另有三个细分领域子模型。应用层 AI 公司开始自己训练垂直模型,不再只租头部通用模型。

Grok 4.6 与 Claude Opus 5 并列智能体基准第一,工具调用和规划能力进入同一梯队。AT&T 则把 40% 的 AI 查询迁到开源模型,称性能几乎无损、成本明显下降。

今日值得看
01 Seedance 2.5 铅笔点万物变2D动画视频提示词 Seedance 2.5 铅笔一点,实拍秒变 2D 手绘动画,运动轨迹分毫未差
02 Anthropic推出免费公开AI学习入门课程体系 Claude开发团队推出免费全品类AI学习资源对公众开放

要学习人工智能,很难找到比这更好的入门包了。开发 Claude 的团队推出了一门规模庞大的课程,内容从 AI 基础开始,一路延伸到 Claude Code、API、MCP、agent 和技能,现在完全免费、对所有人开放。

03 商汤开源SenseNova U1.5 Lite 仅8B参数 普通个人开发者也能运行这个原生多模态模型,做视觉生成和图像编辑,不用依赖大参数量的闭源商用模型

SenseNova U1.5 Lite — 更锐利、更可控、更具成本效益。 这是一个开源、轻量的原生统一多模态模型,适用于视觉理解、生成与编辑。

04 nutlope发布/variate 开源UI迭代设计工具 它可以在Claude Code、Codex和OpenCode里直接用,一行命令就能安装,做界面设计的时候可以一次性出多个变体参考。

宣布推出 /variate。这是一项开源设计技能,可以通过生成多个设计变体来迭代 UI。 它支持在 Claude Code、Codex 和 OpenCode 中使用。 安装命令:npx skills add nutlope/variate

今日焦点

开源工具包让AMD显卡跑AI提速59%,AI服务更便宜、响应更快

dstack开源了一个工具包。它让Qwen3.8-27B在单块MI300X上跑得更快。速度从311 tokens/s拉到495 tokens/s,提升59%。这个成绩在完整100万token上下文下测出。首token时间低于1.5秒,同时服务四个并发用户。不是短文本场景刷出来的数字,长对话、长文档都能保持。

提速来自两处。一处是源代码级补丁,打在SGLang的AITER注意力后端上。另一处是一连串优化会话。改完的结果打包成一个可移植的预设。任何AMD云、Kubernetes集群或裸机集群,都能直接部署。

评论区有人指出,AMD自己的Hyperloom项目正在做类似的事。

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达36 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

08:00 本轮更新 · 下一轮 12:30
行业动态 · Hacker News▲ 163

Bluestein发布Vomit工具 清理Claude 5输出

使用Claude 5生成内容时,如果常遇到多余无效 tokens,可以试试这个工具,用额外大模型专门清理输出杂质

社区讨论:多数开发者都称Claude 5尤其是Opus 5存在输出冗余啰嗦、违反格式要求的问题,已经困扰他们数周,部分团队甚至考虑将预算转移到Codex或开源模型上。有人质疑,如果全程需要用其他模型清理输出,为什么不直接改用其他厂商的模型。也有人认为对输出措辞的抱怨太过度,大模型只是工具不完美很正常,还有人指出只有Opus 5问题严重,Fable 5表现要好得多。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 78

作者实测27美元智能手表跑Claude

只要能连接云端API,最便宜的可穿戴设备也能运行大模型,日常轻量AI使用的门槛可能比想象低得多。

社区讨论:有用户质疑作者标题和全文标注为Claude,实际多数工作用的是Kimi、DeepSeek等其他模型,表述容易误导读者,也有人调侃Claude已经变成智能体领域的舒洁,成了这类产品的通用代称。不少开发者讨论低价位开放固件的可穿戴硬件,有人推荐同价位的Waveshare ESP32-S3 AMOLED手表,有人希望未来能出现百元级开源的佳明同款运动手表。

在 HN 看讨论 ↗   原文 / 论文 ↗
动态 · @OpenAIDevs▲ 8.1万

OpenAI发布GPT-Image-2 API透明背景预览功能

生成的图片可以直接放到任意背景上用,做产品图、平面设计或者网站原型都能用得上。

透明背景功能现已在 API 的 GPT-Image-2 中开放预览。

你可以生成可复用的资产,将它们放置在任何背景上——用于产品图片、平面设计、网站原型和营销活动。

在 X 看原帖 ↗
8.1万1081.8K536
开发工具 · @coledermo▲ 3.1万

OpenRouter发布统一API预付费计费服务

开发AI代理和产品的团队不用再分别给每个API充钱对账,一个余额就能覆盖所有需要的API开销。

现在推出:全场景 OpenRouter。一个预付费余额,覆盖你的代理和产品所需的所有 API。

这是每支 AI 团队从第一天就需要的计费与计量层。一个全场景 OpenRouter。

每一次模型调用、搜索、抓取或数据请求——一个密钥,一个余额,按你设定的价格实时计费。差价收益全归你。失败调用不收费。支持下钻到单个用户的完整账目。

覆盖 286+ 提供商,2404+ 端点。现在它已经为我们的消费产品 Locus Founder 提供支撑。

不用再同时管理多个提供商账户、处理月末发票,或是从零搭建自己的使用计费系统。

构建代理产品的团队终于可以像处理其他支出项一样管理 API 开销:定价、设限额,最终计费转嫁给你的用户。

评论「LOCUS」获取优先提前体验资格。预约通话请访问:

在 X 看原帖 ↗
3.1万9199177
行业动态 · @wallstengine▲ 2.5万

AT&T 把四成AI查询迁移到开源模型

大公司开始用开源模型分流付费大模型请求,帮企业降本同时几乎不损失性能,给想用AI又控制成本的企业探出了可行路径。

AT&T 将更多 AI 工作负载转移至开源模型。

AT&T 表示,目前开源模型处理了 40% 的员工 AI 查询,预计这一比例将上升至 60%-70%,同时该公司计划将对 OpenAI 和 Anthropic 模型的支出大致维持在现有水平。

该公司称,通过 LiteLLM 进行模型路由,AI 编码成本降低了 56%,仅出现了 2% 的性能质量下降。

AT&T 的内部 AI 平台目前每天处理约 450 亿 token,除了将前沿模型用于更复杂的任务外,还使用了包括 Nvidia Nemotron、Meta Llama 和 Google Gemma 在内的模型。

在 X 看原帖 ↗
2.5万2214429
新品发布 · @dhruvamin▲ 4.2万

Anything发布Skydive,让AI队友随处可用

支持全渠道接入且适配各类大模型,首日开放全权限访问,需要多AI协作的日常工作可以尝试新方案。

如果AI队友(Grok Bot、Hermes等)无处不在会怎么样?

我们推出Anything出品的Skydive。

- 全渠道覆盖(Slack、email、iMessage、CLI)
- 云原生(始终在线,你睡觉时也能工作)
- 模型中立(支持Fable、GPT、Deepseek等更多模型)

从第一天起,所有人就能获得完整访问权限。

让我们出发吧。🪂

在 X 看原帖 ↗
4.2万7621896
新品发布 · @OpenAIDevs▲ 15.0万

ExaAILabs发布新插件可访问千亿级网页

ChatGPT和Codex现在能通过这个插件,调取超过千亿个网页、论文和文档内容,拓展了搜索引用信息的范围

借助全新的 @ExaAILabs 插件,你可以让 ChatGPT Work 和 Codex 访问超过 1000 亿个网站、论文、文档及更多内容。

在 X 看原帖 ↗
15.0万901.7K1.1K
前沿研究 · @XFreeze▲ 91.1万

Grok 4.6 与Claude Opus 5并列agent榜第一

这项排名衡量AI使用工具、自主规划解决复杂问题的智能体能力,得分最高意味着智能体能力已经达到第一梯队,会直接影响实际任务的完成效果

Grok 4.6 刚刚在 Artificial Analysis Agentic Index 中并列第一

Grok 4.6 (high) — 59
Claude Opus 5 (max) — 59

表现优于 Claude Fable 5 和 GPT-5.6 Sol

我们正在进入智能体时代,而这正是非常重要的一类基准测试:工具调用、规划、自主性和复杂问题解决。

Grok 4.6 现在已经高居榜首。

这点之所以更为重要,是因为 Grok 为 Grok Build 和 Grok Bot 提供动力,在这些场景中,模型必须不止于回答问题,而是实际采取行动、使用工具并完成真实工作。

Grok 的智能体能力正在变得异常强大。

在 X 看原帖 ↗
91.1万3230742
新品发布 · @harvey▲ 12.5万

Harvey发布Tenet法律模型 成本降超四分之三

相比基础模型,该模型在法律基准测试上通过率最高提升82%,性能达到行业前沿,还配套了三个细分领域的专用子模型。法律行业AI工具成本进一步降低。

阅读全文 →
12.5万60713470
前沿研究 · @teslaownersSV▲ 22.9万

Grok 4.6登顶智能体测试并列第一

该基准测试衡量AI智能体的工具调用、规划等实用能力,得分与当前头部模型Claude Opus 5持平,xAI智能体布局迎来关键进展

突发消息:Grok 4.6 刚刚在 Artificial Analysis Agentic Index 中并列排名第一。⚡🤖

Grok 4.6 (High) — 59
Claude Opus 5 (Max) — 59

Grok 4.6 现在位居该基准测试榜首,领先于其他领先模型。

Agentic Index 聚焦对现实世界 AI 智能体至关重要的能力:工具使用、规划、自主运行,以及复杂问题解决。

这一结果意义尤其重大,因为 Grok 正在拓展 Grok Build 和 Grok Bot 业务,在这些场景中 AI 需要做的不只是回答问题——它还需要使用工具、完成任务。

来源:Artificial Analysis

在 X 看原帖 ↗
22.9万11277424
🔥 热点追踪 · @harvey▲ 51.0万

Harvey发布Tenet法律模型,性能较基模大幅提升

Harvey以Kimi K3 base为基础,结合公开法律数据、合成数据与模拟长周期法律工作的专家数据完成后训练。该模型在部分法律基准测试中通过率提升最高达82%,目前已取得前沿测试成绩,后续性能泛化情况有待观察。

📖 阅读深度解读 →
51.0万78946630
🔥 热点追踪 · @harvey▲ 12.5万

Harvey发布Tenet法律模型,基于Kimi K3底座

该模型用公开法律数据、合成数据和人工专家数据完成后训练,相比原底座模型,在LAB测试全通过率提升82%,在LAB合同测试提升22%。业界认为这是应用层AI自研模型的新尝试。

📖 阅读深度解读 →
12.5万60713470
大模型 · @BrendanFoody▲ 2.1万

法律AI公司Harvey推出自研Tenet系列模型

该模型在法律基准测试中拿到了当前最优成绩,还能用子模型适配法律领域的特定需求,之后会拓展到更多定制模型方向。

阅读全文 →
2.1万2718275
研究 · @GoodfireAI▲ 1.4万

GoodfireAI拿出百万美元资助AI可解释性研究

资助形式是免费提供Silico服务使用额度,面向做AI可解释性和对齐研究的学术机构与非盈利研究者。

我们将为专注于 AI 可解释性与对齐研究的学术及非营利研究者提供总价值 100 万美元的免费 Silico 使用额度资助。

我们认为推进对齐方向的可解释性研究是极端紧迫的,我们希望帮助更多研究者推动这项工作向前发展。🧵

在 X 看原帖 ↗
1.4万27193115
开源 · @rionaifantasy▲ 6.3K

微信聊天总结情报工具本周即将开源

它能自动总结单日聊天和群聊信息,生成带交互的日报,还能识别商单信息,给重点联系人的消息出回复建议。

阅读全文 →
6.3K75381
深度观点 · @nikos1▲ 4.6K

Glen 推企业智能体上下文层,效率提21%

团队智能体每次任务产生的推理过程大多直接丢弃,这个产品能统一留存所有历史信息,帮新任务更快产出更高质量结果,目前开放抢先体验申请。

Glen 正在为智能体构建组织学习与上下文层。你的团队运行的每一次智能体会话,都会产生值得留存的推理内容,但几乎所有内容都会在上下文窗口关闭的瞬间被丢弃。

Glen 就是统一你公司运行的所有智能体与模型的层级。它会从 Claude Code、Codex 和 Cursor 拉取智能体会话数据,同时整合 Slack 消息、GitHub PR、工单、文档和通话内容。

当新的智能体接手一项任务时,Glen 会找到相关的过往上下文,将其注入智能体的上下文窗口来引导工作,最终产出的知识工作质量远高于以往,速度更快、成本也更低。准确来说,所需上下文减少 29%,速度提升 21%。

而且 Glen 能做的还有更多……
> 查询任意一行代码对应的原始智能体
> 搜索你组织运行过的每一次会话
> 动态技能蒸馏
> 多玩家智能体
> 可在 Claude Code、Codex 和 Cursor 之间中途交接任务的统一转录文本
> 内嵌在 Slack 中的公司大脑

Glen 目前处于抢先体验阶段,在下方报名加入等候名单即可。

在 X 看原帖 ↗
4.6K206815
前沿研究 · @AIatMeta▲ 7.7K

Meta AI 发布 WildArtifactBench 多模态测试框架

这套框架不靠刻板标准答案打分,更贴合真实复杂任务,可以帮开发者更准确测出多模态AIagent的实际能力

今天我们还预览了 WildArtifactBench,这是一个内部评估框架,用于评估智能体在复杂真实任务上的表现,覆盖多种不同的交付成果格式。

它不采用严格的真值评分标准,而是使用来自人类和智能体偏好裁判的胜率与 Elo 评分,扩展了实际多模态工作流的任务覆盖范围。

我们将发布 WildArtifactBench 中的 10 个任务,以此推进我们衡量多模态智能体实际实用价值的能力:

在 X 看原帖 ↗
7.7K88924
前沿研究 · @marfinxx▲ 1.8万

Google DeepMind 新研究提升多智能体任务完成率

这套框架用可验证契约替代原有的提示交接,在15步仓库重构任务中,将任务完成率从42.6%提升到88.4%,能帮你更可靠地落地复杂多AI协作流程

阅读全文 →
1.8万21200331
实战经验 · @AndyMarlowg▲ 2.2万

实测Unstract解决AI文档工作流痛点

做文档AI、RAG pipeline或自动化工作流的开发者,可以参考这个解决LLM数据输入问题的方案

大多数 AI 文档工作流甚至在 LLM 投入运行之前就失败了。我一直在测试 Unstract,这是一个开源平台,可以将 PDF、扫描文档、表单和手写文本转换为干净、结构化的 JSON,无需模板或模型训练。

你可以将结果部署为 REST API 或 ETL 流水线。最值得注意的是,LLMWhisperer 会先处理分析和数据提取,保留视觉布局、表格、复选框和手写内容,这样 LLM 收到的就是干净且结构化的信息。

如果你正在开发文档相关 AI 解决方案、RAG 流水线或自动化工作流,这个工具绝对值得探索。在这里试用 LLMWhisperer OCR:代码仓库:#AI #OpenSource #LLM #DocumentAI #RAG #Automation #Development

在 X 看原帖 ↗
2.2万198380
实战经验 · @AndroidDev▲ 1.1万

AndroidDev发布Jetpacker系列第三部分教程(3)

想同时用端侧AI的速度和云端AI的能力,这篇教程提供可落地的开发步骤

💡 借助 Firebase AI Logic 结合端侧 AI 的速度与云的算力 → 我们 Jetpacker 系列的第三部分展示了如何做到以下内容:用 Google Search、Maps 和 URL 数据为聊天bot提供 grounding,用 Hybrid Inference API 实现智能回退,以及构建自定义路由的实时聊天翻译。

在 X 看原帖 ↗
1.1万66422
深度观点 · @emollick▲ 1.7万

emollick吐槽AI多模式功能太混乱

现在大模型分多种模式、多端形态,连经常用AI的人都分不清不同入口,记不清哪项功能对应哪端,体验越来越混乱了

现在 AI 模式(ChatGPT Work/Codex/Chat、Claude Cowork/Code/Chat)和形态(电脑端应用、网页应用)越来越多,有一件事让我很困惑:我已经记不清每种产品都有哪些功能了。🤷‍♂️

在不同产品里,插件、技能、记忆、权限、文件这些功能究竟各是什么情况?

在 X 看原帖 ↗
1.7万1030034
大模型 · @danieltvela

开发者danieltvela评测通义千问Qwen3.8-27B编程能力

称该模型可覆盖绝大多数编程主题,体验让其联想到2025年12月的Opus 4.5

用户danieltvela在𝕏平台分享了对大模型Qwen3.8-27B的评测结果。他表示,Qwen3.8-27B完全可以应用在几乎所有编程相关任务中。

这次使用体验让他联想到了2025年12月使用Opus 4.5时的感受。

在 X 看原帖 ↗
交易 · @YuChen▲ 4.9K

用户体验Questflow新版:和常规AI交易工具定位不同

多数AI交易产品仅提供信号或自动下单,它加入了交易前的AI判断流程

AI智能体 · @sydneyrunkle▲ 1.8K

开发者用浏览器智能体冲Map Tap任务满分 几分钟就达成

开发者Sydney Runkle发文询问图像处理模型和地理上下文建议,刚抛出问题几分钟就拿到满分

开发者sydneyrunkle在X平台发文,称自己正在用浏览器智能体对Map Tap任务做爬山搜索优化。

他向网友询问两个问题:一是适合简单图像处理的最优模型是什么,二是需要提供哪些地理上下文信息。

sydneyrunkle表示,能在本周末前拿到任务满分会很不错,但他不确定智能体能有多快完成这项任务,还附上了任务进度链接。

几分钟后,他更新了进展:刚把这个问题丢给编码智能体,没一会儿就已经拿到了满分。

他提到,自己还可以继续对任务轨迹做爬山搜索优化,同时附上了更新后的进度链接。

在 X 看原帖 ↗
1.8K181
生成式视频 · @MrLarus▲ 3.3K

Seedance 2.5可生成同台词不同情绪AI表演

用户分享了精准控制AI演员微表情和情绪的提示词撰写方法

用户测试Seedance 2.5生成AI表演时发现,同一or台词可以实现7种细腻不同的情绪控制,包括心动、欣喜、温柔、笃定、不舍、苦涩、执念。

控制AI演员微表情的核心,是在提示词中加入独立情境,把眼神、呼吸、动作、停顿和台词后的反应完整写清楚。只要把AI演员的内心状态描述清楚,就能得到符合要求的表演效果。完整提示词方法发布在原动态的评论区。

具体操作时,先用参考图锁定人物脸型、发型、服装、场景、光线和机位,后续只调整表演内容,不改动角色本身。把每一种情绪都当作一场独立的小戏设计,不要只笼统告诉AI人物的情绪,要写清楚情绪产生的原因。

撰写提示词可以按照固定顺序:情境触发→第一反应→眼神神态→呼吸/身体动作→台词→台词后的余韵。比如要表现“不舍”,不用只写“眼眶湿润”,可以完整描述事件和动作过程:对方准备离开,她下意识追出半步,抬手想挽留又停住,强撑着笑,眼眶慢慢泛湿,说出指定台词,目光继续追着对方,笑意一点点消失。重点要把真实演员会有的细节反应写清楚,核心是讲清这场戏的起因、人物反应和台词的完整逻辑。

在 X 看原帖 ↗
3.3K23628
大模型 · @LufzzLiz▲ 8.4K

用户在RTX 4090上测试通义千问3.8-27B量化版本

对比INT4 AWQ与FP8两种量化版本的推理性能,仅用简单提示就生成了闲鱼App首页代码

测试者在NVIDIA RTX 4090显卡上运行了Qwen(通义千问)3.8-27B大模型。测试者仅输入了“开发一个闲鱼app版首页”的简单提示,得到的生成效果超出预期。

测试分别运行了4位量化版本Qwen3.8-27B-AWQ-INT4,和8位量化版本Qwen3.8-27B-FP8。测试者认为4位量化版本的生成效果更好。

测试给出多项核心性能对比数据:推理解码环节,AWQ版本速度为每秒44.9个token,FP8版本为每秒19.6个token。

8路非思考并发聚合环节,AWQ版本速度为每秒302个token,FP8版本为每秒136个token。

5.5万token预填充首包响应时间(TTFT),AWQ版本用时23.2秒,FP8版本用时17.5秒。AWQ预填充速度更慢,原因是4位权重需要先反量化回BF16格式再计算。

本次测试通过Claude Code对接vllm框架完成,测试过程遇到不少问题,测试者表示后续会整理相关经验。

该测试数据验证了相关实验结论:AWQ量化效果优于FP8。

在 X 看原帖 ↗
8.4K23128
开源 · @AI_EmeraldApple▲ 2.0K

创作者用开源AI视频模型修复旧AI生成cos图

创作者将2023年SD1.5生成的原神角色cos图输入模型修复,仍存在部分缺陷

用户@AI_EmeraldApple在X平台分享了用开源AI视频模型修复旧AI生成图像的体验。

他把自己旧AI生成的原神角色cos图,还有几张仿冒图,输入到这个AI视频模型中。

这些图像生成于2023年,使用的是旧版SD1.5(Stable Diffusion 1.5)模型,AI成功修复了图像里的部分问题。

目前依然存在重影、幻觉生成及其他图像瑕疵问题,音频效果也不够好。

角色在每个连续镜头间的外观一致性表现不错,动作整体物理逻辑和其他细节看起来都比较可信。

成果仍处在“恐怖谷”区间,但生成效果正在逐步提升。

在 X 看原帖 ↗
2.0K210618
图像生成 · @beechinour▲ 4.0K

AI视频创作者分享自测试最佳图像生成工作流

创作者测试了一年内九成以上图像生成方案,分享了可重复的最优工作流程

一年前开始制作AI视频以来,创作者已经测试了99%的现有图像生成方案。他分享了一套可重复运行,并且在他测试过的方案中效果最佳的工作流。

第一步用Claude结合参考图像确定创作风格。第二步在Midjourney v8.2中生成基础图像。第三步在GPT-2中完成图像清理与放大。

创作者认为这套流程非常简单,已经足够得到目前能实现的最优图像输出。完整指南可以在他公开的链接中查看。

创作者邀请用户加入他的免费TG群组获取更多资讯。

在 X 看原帖 ↗
4.0K5969
语言学 · @voooooogel▲ 3.0K

开发者发现AI大模型 Claude 演化出专属特有用语Claudlish

研究发现Claude在自我交互中演化出了适配环境的专属用语

阅读全文 →
3.0K7598
智能体 · @fofrAI▲ 4.0K

开发者分享基于Slack/谷歌聊天的多智能体架构

开发者分享自主运行的多智能体协作配置,最大问题为上下文管理

我目前在 Slack/Google Chat 里的智能体架构:

- 一个频道容纳了由 6 个智能体组成的团队,作为基础设施团队,管理其他智能体的运行时、环境、工具、技能开发和各类服务(比如日报、Google Cloud 等等)

- 小型「沙龙」团队,为特定任务、长期实验、创意想法或是快速落地新想法而组建,它们自主工作,有自己的排期,拥有可以向基础设施团队上报问题的工具

- 沙龙会采用不同的结构、不同的智能体数量,还有不同的模型混合组合,用来观察动态变化(比如 3 个工作智能体加 1 个主持智能体,所有工作智能体优先级互相对立等等)

- 用于和人类在特定任务上快速协作的直接一对一智能体

- 一个我可以直接对话的语音智能体,它可以查看任意频道、发送消息,整体通过聊天完成管理

- 任何模型/框架都能轻松部署

这套架构基本可以自主运行,最大的问题是上下文管理。

在 X 看原帖 ↗
4.0K24730
游戏开发 · @xgwei▲ 2.3万

Meta推出XR Operator 实现AI实时真人式测试VR动作游戏

Meta打造的AI agent可实时真人方式测试真实VR动作游戏,系首次实现

阅读全文 →
2.3万78391
投资交易 · @mardehaym▲ 1.5万

资深交易团队对AI交易尽调往往并不充分

作者将揭露AI交易尽调疏漏,面向相关从业者推送

如果你正在读这篇内容,我相信算法把你推送给我是对的——因为你就是靠评估软件公司吃饭的。

经验丰富的交易团队总爱说自己做了非常全面的尽职调查。我打算告诉你,为什么在AI交易里,他们根本没做到。

如果你想要交付AI原生产品,就预约一次发掘通话:

90%的AI内容都是从未交付过生产级智能体的人写的。这份通讯出自每周都在做这件事的100多个工程团队内部。免费订阅👇

在 X 看原帖 ↗
1.5万214025
🔬 前沿研究
前沿研究 · @teslaownersSV▲ 22.9万

Grok 4.6登顶智能体测试并列第一

该基准测试衡量AI智能体的工具调用、规划等实用能力,得分与当前头部模型Claude Opus 5持平,xAI智能体布局迎来关键进展

突发消息:Grok 4.6 刚刚在 Artificial Analysis Agentic Index 中并列排名第一。⚡🤖

Grok 4.6 (High) — 59
Claude Opus 5 (Max) — 59

Grok 4.6 现在位居该基准测试榜首,领先于其他领先模型。

Agentic Index 聚焦对现实世界 AI 智能体至关重要的能力:工具使用、规划、自主运行,以及复杂问题解决。

这一结果意义尤其重大,因为 Grok 正在拓展 Grok Build 和 Grok Bot 业务,在这些场景中 AI 需要做的不只是回答问题——它还需要使用工具、完成任务。

来源:Artificial Analysis

在 X 看原帖 ↗
22.9万11277424
前沿研究 · @XFreeze▲ 91.1万

Grok 4.6 与Claude Opus 5并列agent榜第一

这项排名衡量AI使用工具、自主规划解决复杂问题的智能体能力,得分最高意味着智能体能力已经达到第一梯队,会直接影响实际任务的完成效果

Grok 4.6 刚刚在 Artificial Analysis Agentic Index 中并列第一

Grok 4.6 (high) — 59
Claude Opus 5 (max) — 59

表现优于 Claude Fable 5 和 GPT-5.6 Sol

我们正在进入智能体时代,而这正是非常重要的一类基准测试:工具调用、规划、自主性和复杂问题解决。

Grok 4.6 现在已经高居榜首。

这点之所以更为重要,是因为 Grok 为 Grok Build 和 Grok Bot 提供动力,在这些场景中,模型必须不止于回答问题,而是实际采取行动、使用工具并完成真实工作。

Grok 的智能体能力正在变得异常强大。

在 X 看原帖 ↗
91.1万3230742
前沿研究 · @marfinxx▲ 1.8万

Google DeepMind 新研究提升多智能体任务完成率

这套框架用可验证契约替代原有的提示交接,在15步仓库重构任务中,将任务完成率从42.6%提升到88.4%,能帮你更可靠地落地复杂多AI协作流程

阅读全文 →
1.8万21200331
前沿研究 · @AIatMeta▲ 7.7K

Meta AI 发布 WildArtifactBench 多模态测试框架

这套框架不靠刻板标准答案打分,更贴合真实复杂任务,可以帮开发者更准确测出多模态AIagent的实际能力

今天我们还预览了 WildArtifactBench,这是一个内部评估框架,用于评估智能体在复杂真实任务上的表现,覆盖多种不同的交付成果格式。

它不采用严格的真值评分标准,而是使用来自人类和智能体偏好裁判的胜率与 Elo 评分,扩展了实际多模态工作流的任务覆盖范围。

我们将发布 WildArtifactBench 中的 10 个任务,以此推进我们衡量多模态智能体实际实用价值的能力:

在 X 看原帖 ↗
7.7K88924
🚀 新品发布
新品发布 · @harvey▲ 12.5万

Harvey发布Tenet法律模型 成本降超四分之三

相比基础模型,该模型在法律基准测试上通过率最高提升82%,性能达到行业前沿,还配套了三个细分领域的专用子模型。法律行业AI工具成本进一步降低。

阅读全文 →
12.5万60713470
新品发布 · @OpenAIDevs▲ 15.0万

ExaAILabs发布新插件可访问千亿级网页

ChatGPT和Codex现在能通过这个插件,调取超过千亿个网页、论文和文档内容,拓展了搜索引用信息的范围

借助全新的 @ExaAILabs 插件,你可以让 ChatGPT Work 和 Codex 访问超过 1000 亿个网站、论文、文档及更多内容。

在 X 看原帖 ↗
15.0万901.7K1.1K
新品发布 · @dhruvamin▲ 4.2万

Anything发布Skydive,让AI队友随处可用

支持全渠道接入且适配各类大模型,首日开放全权限访问,需要多AI协作的日常工作可以尝试新方案。

如果AI队友(Grok Bot、Hermes等)无处不在会怎么样?

我们推出Anything出品的Skydive。

- 全渠道覆盖(Slack、email、iMessage、CLI)
- 云原生(始终在线,你睡觉时也能工作)
- 模型中立(支持Fable、GPT、Deepseek等更多模型)

从第一天起,所有人就能获得完整访问权限。

让我们出发吧。🪂

在 X 看原帖 ↗
4.2万7621896
新品发布 · @SenseTime_AI▲ 6.2万

商汤开源SenseNova U1.5 Lite 仅8B参数

普通个人开发者也能运行这个原生多模态模型,做视觉生成和图像编辑,不用依赖大参数量的闭源商用模型

SenseNova U1.5 Lite — 更锐利、更可控、更具成本效益。

这是一个开源、轻量的原生统一多模态模型,适用于视觉理解、生成与编辑。专为真实世界视觉工件工作流打造:
🔹原生4K生成,拥有更好的细节、构图与真实感
🔹能完成跨主体、计数、文本、布局与风格的复杂指令跟随
🔹增强了中英文字渲染与多文本布局能力
🔹借助视觉标记、 bounding box 与多图参考,实现精确图像编辑与控制

它仅有8B参数,在指令跟随与编辑保留能力上优于同尺寸模型,同时在文本渲染与复杂布局方面可与大型商用模型竞争。

🛠️GitHub:
🤗HF:
👾Discord:
🎨SenseNova Studio:

在 X 看原帖 ↗
6.2万88175109
📰 行业动态
🔥 热点追踪 · @harvey▲ 51.0万

Harvey发布Tenet法律模型,性能较基模大幅提升

Harvey以Kimi K3 base为基础,结合公开法律数据、合成数据与模拟长周期法律工作的专家数据完成后训练。该模型在部分法律基准测试中通过率提升最高达82%,目前已取得前沿测试成绩,后续性能泛化情况有待观察。

📖 阅读深度解读 →
51.0万78946630
🔥 热点追踪 · @harvey▲ 12.5万

Harvey发布Tenet法律模型,基于Kimi K3底座

该模型用公开法律数据、合成数据和人工专家数据完成后训练,相比原底座模型,在LAB测试全通过率提升82%,在LAB合同测试提升22%。业界认为这是应用层AI自研模型的新尝试。

📖 阅读深度解读 →
12.5万60713470
行业动态 · @wallstengine▲ 2.5万

AT&T 把四成AI查询迁移到开源模型

大公司开始用开源模型分流付费大模型请求,帮企业降本同时几乎不损失性能,给想用AI又控制成本的企业探出了可行路径。

AT&T 将更多 AI 工作负载转移至开源模型。

AT&T 表示,目前开源模型处理了 40% 的员工 AI 查询,预计这一比例将上升至 60%-70%,同时该公司计划将对 OpenAI 和 Anthropic 模型的支出大致维持在现有水平。

该公司称,通过 LiteLLM 进行模型路由,AI 编码成本降低了 56%,仅出现了 2% 的性能质量下降。

AT&T 的内部 AI 平台目前每天处理约 450 亿 token,除了将前沿模型用于更复杂的任务外,还使用了包括 Nvidia Nemotron、Meta Llama 和 Google Gemma 在内的模型。

在 X 看原帖 ↗
2.5万2214429
大模型 · @BrendanFoody▲ 2.1万

法律AI公司Harvey推出自研Tenet系列模型

该模型在法律基准测试中拿到了当前最优成绩,还能用子模型适配法律领域的特定需求,之后会拓展到更多定制模型方向。

阅读全文 →
2.1万2718275
动态 · @OpenAIDevs▲ 8.1万

OpenAI发布GPT-Image-2 API透明背景预览功能

生成的图片可以直接放到任意背景上用,做产品图、平面设计或者网站原型都能用得上。

透明背景功能现已在 API 的 GPT-Image-2 中开放预览。

你可以生成可复用的资产,将它们放置在任何背景上——用于产品图片、平面设计、网站原型和营销活动。

在 X 看原帖 ↗
8.1万1081.8K536
开发工具 · @coledermo▲ 3.1万

OpenRouter发布统一API预付费计费服务

开发AI代理和产品的团队不用再分别给每个API充钱对账,一个余额就能覆盖所有需要的API开销。

现在推出:全场景 OpenRouter。一个预付费余额,覆盖你的代理和产品所需的所有 API。

这是每支 AI 团队从第一天就需要的计费与计量层。一个全场景 OpenRouter。

每一次模型调用、搜索、抓取或数据请求——一个密钥,一个余额,按你设定的价格实时计费。差价收益全归你。失败调用不收费。支持下钻到单个用户的完整账目。

覆盖 286+ 提供商,2404+ 端点。现在它已经为我们的消费产品 Locus Founder 提供支撑。

不用再同时管理多个提供商账户、处理月末发票,或是从零搭建自己的使用计费系统。

构建代理产品的团队终于可以像处理其他支出项一样管理 API 开销:定价、设限额,最终计费转嫁给你的用户。

评论「LOCUS」获取优先提前体验资格。预约通话请访问:

在 X 看原帖 ↗
3.1万9199177
开源 · @nutlope▲ 6.6K

nutlope发布/variate 开源UI迭代设计工具

它可以在Claude Code、Codex和OpenCode里直接用,一行命令就能安装,做界面设计的时候可以一次性出多个变体参考。

宣布推出 /variate。这是一项开源设计技能,可以通过生成多个设计变体来迭代 UI。

它支持在 Claude Code、Codex 和 OpenCode 中使用。

安装命令:npx skills add nutlope/variate

在 X 看原帖 ↗
6.6K14182207
研究 · @GoodfireAI▲ 1.4万

GoodfireAI拿出百万美元资助AI可解释性研究

资助形式是免费提供Silico服务使用额度,面向做AI可解释性和对齐研究的学术机构与非盈利研究者。

我们将为专注于 AI 可解释性与对齐研究的学术及非营利研究者提供总价值 100 万美元的免费 Silico 使用额度资助。

我们认为推进对齐方向的可解释性研究是极端紧迫的,我们希望帮助更多研究者推动这项工作向前发展。🧵

在 X 看原帖 ↗
1.4万27193115
开源 · @rionaifantasy▲ 6.3K

微信聊天总结情报工具本周即将开源

它能自动总结单日聊天和群聊信息,生成带交互的日报,还能识别商单信息,给重点联系人的消息出回复建议。

阅读全文 →
6.3K75381
行业动态 · Hacker News▲ 78

作者实测27美元智能手表跑Claude

只要能连接云端API,最便宜的可穿戴设备也能运行大模型,日常轻量AI使用的门槛可能比想象低得多。

社区讨论:有用户质疑作者标题和全文标注为Claude,实际多数工作用的是Kimi、DeepSeek等其他模型,表述容易误导读者,也有人调侃Claude已经变成智能体领域的舒洁,成了这类产品的通用代称。不少开发者讨论低价位开放固件的可穿戴硬件,有人推荐同价位的Waveshare ESP32-S3 AMOLED手表,有人希望未来能出现百元级开源的佳明同款运动手表。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 163

Bluestein发布Vomit工具 清理Claude 5输出

使用Claude 5生成内容时,如果常遇到多余无效 tokens,可以试试这个工具,用额外大模型专门清理输出杂质

社区讨论:多数开发者都称Claude 5尤其是Opus 5存在输出冗余啰嗦、违反格式要求的问题,已经困扰他们数周,部分团队甚至考虑将预算转移到Codex或开源模型上。有人质疑,如果全程需要用其他模型清理输出,为什么不直接改用其他厂商的模型。也有人认为对输出措辞的抱怨太过度,大模型只是工具不完美很正常,还有人指出只有Opus 5问题严重,Fable 5表现要好得多。

在 HN 看讨论 ↗   原文 / 论文 ↗
💡 深度观点
深度观点 · @emollick▲ 1.7万

emollick吐槽AI多模式功能太混乱

现在大模型分多种模式、多端形态,连经常用AI的人都分不清不同入口,记不清哪项功能对应哪端,体验越来越混乱了

现在 AI 模式(ChatGPT Work/Codex/Chat、Claude Cowork/Code/Chat)和形态(电脑端应用、网页应用)越来越多,有一件事让我很困惑:我已经记不清每种产品都有哪些功能了。🤷‍♂️

在不同产品里,插件、技能、记忆、权限、文件这些功能究竟各是什么情况?

在 X 看原帖 ↗
1.7万1030034
深度观点 · @nikos1▲ 4.6K

Glen 推企业智能体上下文层,效率提21%

团队智能体每次任务产生的推理过程大多直接丢弃,这个产品能统一留存所有历史信息,帮新任务更快产出更高质量结果,目前开放抢先体验申请。

Glen 正在为智能体构建组织学习与上下文层。你的团队运行的每一次智能体会话,都会产生值得留存的推理内容,但几乎所有内容都会在上下文窗口关闭的瞬间被丢弃。

Glen 就是统一你公司运行的所有智能体与模型的层级。它会从 Claude Code、Codex 和 Cursor 拉取智能体会话数据,同时整合 Slack 消息、GitHub PR、工单、文档和通话内容。

当新的智能体接手一项任务时,Glen 会找到相关的过往上下文,将其注入智能体的上下文窗口来引导工作,最终产出的知识工作质量远高于以往,速度更快、成本也更低。准确来说,所需上下文减少 29%,速度提升 21%。

而且 Glen 能做的还有更多……
> 查询任意一行代码对应的原始智能体
> 搜索你组织运行过的每一次会话
> 动态技能蒸馏
> 多玩家智能体
> 可在 Claude Code、Codex 和 Cursor 之间中途交接任务的统一转录文本
> 内嵌在 Slack 中的公司大脑

Glen 目前处于抢先体验阶段,在下方报名加入等候名单即可。

在 X 看原帖 ↗
4.6K206815
⚡ 实战经验
实战经验 · @AndyMarlowg▲ 2.2万

实测Unstract解决AI文档工作流痛点

做文档AI、RAG pipeline或自动化工作流的开发者,可以参考这个解决LLM数据输入问题的方案

大多数 AI 文档工作流甚至在 LLM 投入运行之前就失败了。我一直在测试 Unstract,这是一个开源平台,可以将 PDF、扫描文档、表单和手写文本转换为干净、结构化的 JSON,无需模板或模型训练。

你可以将结果部署为 REST API 或 ETL 流水线。最值得注意的是,LLMWhisperer 会先处理分析和数据提取,保留视觉布局、表格、复选框和手写内容,这样 LLM 收到的就是干净且结构化的信息。

如果你正在开发文档相关 AI 解决方案、RAG 流水线或自动化工作流,这个工具绝对值得探索。在这里试用 LLMWhisperer OCR:代码仓库:#AI #OpenSource #LLM #DocumentAI #RAG #Automation #Development

在 X 看原帖 ↗
2.2万198380
实战经验 · @AndroidDev▲ 1.1万

AndroidDev发布Jetpacker系列第三部分教程(3)

想同时用端侧AI的速度和云端AI的能力,这篇教程提供可落地的开发步骤

💡 借助 Firebase AI Logic 结合端侧 AI 的速度与云的算力 → 我们 Jetpacker 系列的第三部分展示了如何做到以下内容:用 Google Search、Maps 和 URL 数据为聊天bot提供 grounding,用 Hybrid Inference API 实现智能回退,以及构建自定义路由的实时聊天翻译。

在 X 看原帖 ↗
1.1万66422
📌 其他
教育 · @sarpstar▲ 6.2万

Anthropic推出免费公开AI学习入门课程体系

Claude开发团队推出免费全品类AI学习资源对公众开放

要学习人工智能,很难找到比这更好的入门包了。开发 Claude 的团队推出了一门规模庞大的课程,内容从 AI 基础开始,一路延伸到 Claude Code、API、MCP、agent 和技能,现在完全免费、对所有人开放。

他们不只是提供工具,还在培养会使用这些工具的下一代。这次就好好投入学习吧。

我自己刚开始的时候,也是从 Anthropic 的课程入门的。你可以从这里访问:

在 X 看原帖 ↗
6.2万20317684
投资交易 · @mardehaym▲ 1.5万

资深交易团队对AI交易尽调往往并不充分

作者将揭露AI交易尽调疏漏,面向相关从业者推送

如果你正在读这篇内容,我相信算法把你推送给我是对的——因为你就是靠评估软件公司吃饭的。

经验丰富的交易团队总爱说自己做了非常全面的尽职调查。我打算告诉你,为什么在AI交易里,他们根本没做到。

如果你想要交付AI原生产品,就预约一次发掘通话:

90%的AI内容都是从未交付过生产级智能体的人写的。这份通讯出自每周都在做这件事的100多个工程团队内部。免费订阅👇

在 X 看原帖 ↗
1.5万214025
游戏开发 · @xgwei▲ 2.3万

Meta推出XR Operator 实现AI实时真人式测试VR动作游戏

Meta打造的AI agent可实时真人方式测试真实VR动作游戏,系首次实现

阅读全文 →
2.3万78391
开源 · @iamlukethedev▲ 1.6万

开发者为Hermes智能体推出开源3D实时指挥中心Hermes3D

开发者基于旧原型Claw3D重构,推出适配Hermes智能体的开源3D实时指挥中心

来认识 Hermes3D,这是给 Hermes Agents 打造的实时 3D 指挥中心。

你们中有些人可能还记得 Claw3D,它曾经走红,但它是围绕 OpenClaw 构建的。在我把所有工作流都迁移到 Hermes 之后,继续维护它就说不通了。

所以我为 Hermes 重新构建了整个概念。

Hermes Bot Mode 本来就已经给每个智能体分配了专属角色、模型、记忆、技能、工具和个性。而 Hermes3D 给这个团队提供了一间办公室。

你可以看到哪些智能体正在工作,看到谁被卡住了,查看它们的任务,打开看板,走过去和它们对话。

当智能体之间互相交流、委派工作或是交接任务时,你都能在这间办公室里实时看到整个过程。

你的 AI 团队不应该像是藏在终端标签页里的十个看不见的进程。它应该让你感觉是一个你真的能看见、能掌控的工作场所。

Claw3D 是原型,Hermes3D 才是真正的愿景。

当然了,它是开源的。演示在下方,仓库链接在第一条评论。

Hermes3D Repo

在 X 看原帖 ↗
1.6万19282230
智能体 · @fofrAI▲ 4.0K

开发者分享基于Slack/谷歌聊天的多智能体架构

开发者分享自主运行的多智能体协作配置,最大问题为上下文管理

我目前在 Slack/Google Chat 里的智能体架构:

- 一个频道容纳了由 6 个智能体组成的团队,作为基础设施团队,管理其他智能体的运行时、环境、工具、技能开发和各类服务(比如日报、Google Cloud 等等)

- 小型「沙龙」团队,为特定任务、长期实验、创意想法或是快速落地新想法而组建,它们自主工作,有自己的排期,拥有可以向基础设施团队上报问题的工具

- 沙龙会采用不同的结构、不同的智能体数量,还有不同的模型混合组合,用来观察动态变化(比如 3 个工作智能体加 1 个主持智能体,所有工作智能体优先级互相对立等等)

- 用于和人类在特定任务上快速协作的直接一对一智能体

- 一个我可以直接对话的语音智能体,它可以查看任意频道、发送消息,整体通过聊天完成管理

- 任何模型/框架都能轻松部署

这套架构基本可以自主运行,最大的问题是上下文管理。

在 X 看原帖 ↗
4.0K24730
语言学 · @voooooogel▲ 3.0K

开发者发现AI大模型 Claude 演化出专属特有用语Claudlish

研究发现Claude在自我交互中演化出了适配环境的专属用语

阅读全文 →
3.0K7598
图像生成 · @beechinour▲ 4.0K

AI视频创作者分享自测试最佳图像生成工作流

创作者测试了一年内九成以上图像生成方案,分享了可重复的最优工作流程

一年前开始制作AI视频以来,创作者已经测试了99%的现有图像生成方案。他分享了一套可重复运行,并且在他测试过的方案中效果最佳的工作流。

第一步用Claude结合参考图像确定创作风格。第二步在Midjourney v8.2中生成基础图像。第三步在GPT-2中完成图像清理与放大。

创作者认为这套流程非常简单,已经足够得到目前能实现的最优图像输出。完整指南可以在他公开的链接中查看。

创作者邀请用户加入他的免费TG群组获取更多资讯。

在 X 看原帖 ↗
4.0K5969
开源 · @AI_EmeraldApple▲ 2.0K

创作者用开源AI视频模型修复旧AI生成cos图

创作者将2023年SD1.5生成的原神角色cos图输入模型修复,仍存在部分缺陷

用户@AI_EmeraldApple在X平台分享了用开源AI视频模型修复旧AI生成图像的体验。

他把自己旧AI生成的原神角色cos图,还有几张仿冒图,输入到这个AI视频模型中。

这些图像生成于2023年,使用的是旧版SD1.5(Stable Diffusion 1.5)模型,AI成功修复了图像里的部分问题。

目前依然存在重影、幻觉生成及其他图像瑕疵问题,音频效果也不够好。

角色在每个连续镜头间的外观一致性表现不错,动作整体物理逻辑和其他细节看起来都比较可信。

成果仍处在“恐怖谷”区间,但生成效果正在逐步提升。

在 X 看原帖 ↗
2.0K210618
大模型 · @LufzzLiz▲ 8.4K

用户在RTX 4090上测试通义千问3.8-27B量化版本

对比INT4 AWQ与FP8两种量化版本的推理性能,仅用简单提示就生成了闲鱼App首页代码

测试者在NVIDIA RTX 4090显卡上运行了Qwen(通义千问)3.8-27B大模型。测试者仅输入了“开发一个闲鱼app版首页”的简单提示,得到的生成效果超出预期。

测试分别运行了4位量化版本Qwen3.8-27B-AWQ-INT4,和8位量化版本Qwen3.8-27B-FP8。测试者认为4位量化版本的生成效果更好。

测试给出多项核心性能对比数据:推理解码环节,AWQ版本速度为每秒44.9个token,FP8版本为每秒19.6个token。

8路非思考并发聚合环节,AWQ版本速度为每秒302个token,FP8版本为每秒136个token。

5.5万token预填充首包响应时间(TTFT),AWQ版本用时23.2秒,FP8版本用时17.5秒。AWQ预填充速度更慢,原因是4位权重需要先反量化回BF16格式再计算。

本次测试通过Claude Code对接vllm框架完成,测试过程遇到不少问题,测试者表示后续会整理相关经验。

该测试数据验证了相关实验结论:AWQ量化效果优于FP8。

在 X 看原帖 ↗
8.4K23128
生成式视频 · @MrLarus▲ 3.3K

Seedance 2.5可生成同台词不同情绪AI表演

用户分享了精准控制AI演员微表情和情绪的提示词撰写方法

用户测试Seedance 2.5生成AI表演时发现,同一or台词可以实现7种细腻不同的情绪控制,包括心动、欣喜、温柔、笃定、不舍、苦涩、执念。

控制AI演员微表情的核心,是在提示词中加入独立情境,把眼神、呼吸、动作、停顿和台词后的反应完整写清楚。只要把AI演员的内心状态描述清楚,就能得到符合要求的表演效果。完整提示词方法发布在原动态的评论区。

具体操作时,先用参考图锁定人物脸型、发型、服装、场景、光线和机位,后续只调整表演内容,不改动角色本身。把每一种情绪都当作一场独立的小戏设计,不要只笼统告诉AI人物的情绪,要写清楚情绪产生的原因。

撰写提示词可以按照固定顺序:情境触发→第一反应→眼神神态→呼吸/身体动作→台词→台词后的余韵。比如要表现“不舍”,不用只写“眼眶湿润”,可以完整描述事件和动作过程:对方准备离开,她下意识追出半步,抬手想挽留又停住,强撑着笑,眼眶慢慢泛湿,说出指定台词,目光继续追着对方,笑意一点点消失。重点要把真实演员会有的细节反应写清楚,核心是讲清这场戏的起因、人物反应和台词的完整逻辑。

在 X 看原帖 ↗
3.3K23628
AI智能体 · @sydneyrunkle▲ 1.8K

开发者用浏览器智能体冲Map Tap任务满分 几分钟就达成

开发者Sydney Runkle发文询问图像处理模型和地理上下文建议,刚抛出问题几分钟就拿到满分

开发者sydneyrunkle在X平台发文,称自己正在用浏览器智能体对Map Tap任务做爬山搜索优化。

他向网友询问两个问题:一是适合简单图像处理的最优模型是什么,二是需要提供哪些地理上下文信息。

sydneyrunkle表示,能在本周末前拿到任务满分会很不错,但他不确定智能体能有多快完成这项任务,还附上了任务进度链接。

几分钟后,他更新了进展:刚把这个问题丢给编码智能体,没一会儿就已经拿到了满分。

他提到,自己还可以继续对任务轨迹做爬山搜索优化,同时附上了更新后的进度链接。

在 X 看原帖 ↗
1.8K181
交易 · @YuChen▲ 4.9K

用户体验Questflow新版:和常规AI交易工具定位不同

多数AI交易产品仅提供信号或自动下单,它加入了交易前的AI判断流程

大模型 · @danieltvela

开发者danieltvela评测通义千问Qwen3.8-27B编程能力

称该模型可覆盖绝大多数编程主题,体验让其联想到2025年12月的Opus 4.5

用户danieltvela在𝕏平台分享了对大模型Qwen3.8-27B的评测结果。他表示,Qwen3.8-27B完全可以应用在几乎所有编程相关任务中。

这次使用体验让他联想到了2025年12月使用Opus 4.5时的感受。

在 X 看原帖 ↗

今天的 36 条信号到这里下一轮 12:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新