社区讨论:多数开发者都称Claude 5尤其是Opus 5存在输出冗余啰嗦、违反格式要求的问题,已经困扰他们数周,部分团队甚至考虑将预算转移到Codex或开源模型上。有人质疑,如果全程需要用其他模型清理输出,为什么不直接改用其他厂商的模型。也有人认为对输出措辞的抱怨太过度,大模型只是工具不完美很正常,还有人指出只有Opus 5问题严重,Fable 5表现要好得多。
今天发生了什么1 分钟读懂
Harvey 发布自研法律模型 Tenet,底座是 Kimi K3。法律基准通过率最高提升 82%,推理成本降超四分之三,另有三个细分领域子模型。应用层 AI 公司开始自己训练垂直模型,不再只租头部通用模型。
Grok 4.6 与 Claude Opus 5 并列智能体基准第一,工具调用和规划能力进入同一梯队。AT&T 则把 40% 的 AI 查询迁到开源模型,称性能几乎无损、成本明显下降。
02 Anthropic推出免费公开AI学习入门课程体系 Claude开发团队推出免费全品类AI学习资源对公众开放
要学习人工智能,很难找到比这更好的入门包了。开发 Claude 的团队推出了一门规模庞大的课程,内容从 AI 基础开始,一路延伸到 Claude Code、API、MCP、agent 和技能,现在完全免费、对所有人开放。
03 商汤开源SenseNova U1.5 Lite 仅8B参数 普通个人开发者也能运行这个原生多模态模型,做视觉生成和图像编辑,不用依赖大参数量的闭源商用模型
SenseNova U1.5 Lite — 更锐利、更可控、更具成本效益。 这是一个开源、轻量的原生统一多模态模型,适用于视觉理解、生成与编辑。
04 nutlope发布/variate 开源UI迭代设计工具 它可以在Claude Code、Codex和OpenCode里直接用,一行命令就能安装,做界面设计的时候可以一次性出多个变体参考。
宣布推出 /variate。这是一项开源设计技能,可以通过生成多个设计变体来迭代 UI。 它支持在 Claude Code、Codex 和 OpenCode 中使用。 安装命令:npx skills add nutlope/variate
今日焦点
开源工具包让AMD显卡跑AI提速59%,AI服务更便宜、响应更快
dstack开源了一个工具包。它让Qwen3.8-27B在单块MI300X上跑得更快。速度从311 tokens/s拉到495 tokens/s,提升59%。这个成绩在完整100万token上下文下测出。首token时间低于1.5秒,同时服务四个并发用户。不是短文本场景刷出来的数字,长对话、长文档都能保持。
提速来自两处。一处是源代码级补丁,打在SGLang的AITER注意力后端上。另一处是一连串优化会话。改完的结果打包成一个可移植的预设。任何AMD云、Kubernetes集群或裸机集群,都能直接部署。
评论区有人指出,AMD自己的Hyperloom项目正在做类似的事。
深度阅读
🔥 信号雷达36 条
𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)
行业动态 · Hacker News▲ 163
Bluestein发布Vomit工具 清理Claude 5输出
使用Claude 5生成内容时,如果常遇到多余无效 tokens,可以试试这个工具,用额外大模型专门清理输出杂质
Bluestein发布Vomit工具 清理Claude 5输出
使用Claude 5生成内容时,如果常遇到多余无效 tokens,可以试试这个工具,用额外大模型专门清理输出杂质
行业动态 · Hacker News▲ 78
作者实测27美元智能手表跑Claude
只要能连接云端API,最便宜的可穿戴设备也能运行大模型,日常轻量AI使用的门槛可能比想象低得多。
作者实测27美元智能手表跑Claude
只要能连接云端API,最便宜的可穿戴设备也能运行大模型,日常轻量AI使用的门槛可能比想象低得多。
社区讨论:有用户质疑作者标题和全文标注为Claude,实际多数工作用的是Kimi、DeepSeek等其他模型,表述容易误导读者,也有人调侃Claude已经变成智能体领域的舒洁,成了这类产品的通用代称。不少开发者讨论低价位开放固件的可穿戴硬件,有人推荐同价位的Waveshare ESP32-S3 AMOLED手表,有人希望未来能出现百元级开源的佳明同款运动手表。
动态 · @OpenAIDevs▲ 8.1万
OpenAI发布GPT-Image-2 API透明背景预览功能
生成的图片可以直接放到任意背景上用,做产品图、平面设计或者网站原型都能用得上。
OpenAI发布GPT-Image-2 API透明背景预览功能
生成的图片可以直接放到任意背景上用,做产品图、平面设计或者网站原型都能用得上。
透明背景功能现已在 API 的 GPT-Image-2 中开放预览。
你可以生成可复用的资产,将它们放置在任何背景上——用于产品图片、平面设计、网站原型和营销活动。
开发工具 · @coledermo▲ 3.1万
OpenRouter发布统一API预付费计费服务
开发AI代理和产品的团队不用再分别给每个API充钱对账,一个余额就能覆盖所有需要的API开销。
OpenRouter发布统一API预付费计费服务
开发AI代理和产品的团队不用再分别给每个API充钱对账,一个余额就能覆盖所有需要的API开销。
现在推出:全场景 OpenRouter。一个预付费余额,覆盖你的代理和产品所需的所有 API。
这是每支 AI 团队从第一天就需要的计费与计量层。一个全场景 OpenRouter。
每一次模型调用、搜索、抓取或数据请求——一个密钥,一个余额,按你设定的价格实时计费。差价收益全归你。失败调用不收费。支持下钻到单个用户的完整账目。
覆盖 286+ 提供商,2404+ 端点。现在它已经为我们的消费产品 Locus Founder 提供支撑。
不用再同时管理多个提供商账户、处理月末发票,或是从零搭建自己的使用计费系统。
构建代理产品的团队终于可以像处理其他支出项一样管理 API 开销:定价、设限额,最终计费转嫁给你的用户。
评论「LOCUS」获取优先提前体验资格。预约通话请访问:
行业动态 · @wallstengine▲ 2.5万
AT&T 把四成AI查询迁移到开源模型
大公司开始用开源模型分流付费大模型请求,帮企业降本同时几乎不损失性能,给想用AI又控制成本的企业探出了可行路径。
AT&T 把四成AI查询迁移到开源模型
大公司开始用开源模型分流付费大模型请求,帮企业降本同时几乎不损失性能,给想用AI又控制成本的企业探出了可行路径。
AT&T 将更多 AI 工作负载转移至开源模型。
AT&T 表示,目前开源模型处理了 40% 的员工 AI 查询,预计这一比例将上升至 60%-70%,同时该公司计划将对 OpenAI 和 Anthropic 模型的支出大致维持在现有水平。
该公司称,通过 LiteLLM 进行模型路由,AI 编码成本降低了 56%,仅出现了 2% 的性能质量下降。
AT&T 的内部 AI 平台目前每天处理约 450 亿 token,除了将前沿模型用于更复杂的任务外,还使用了包括 Nvidia Nemotron、Meta Llama 和 Google Gemma 在内的模型。
新品发布 · @dhruvamin▲ 4.2万
Anything发布Skydive,让AI队友随处可用
支持全渠道接入且适配各类大模型,首日开放全权限访问,需要多AI协作的日常工作可以尝试新方案。
Anything发布Skydive,让AI队友随处可用
支持全渠道接入且适配各类大模型,首日开放全权限访问,需要多AI协作的日常工作可以尝试新方案。
如果AI队友(Grok Bot、Hermes等)无处不在会怎么样?
我们推出Anything出品的Skydive。
- 全渠道覆盖(Slack、email、iMessage、CLI)
- 云原生(始终在线,你睡觉时也能工作)
- 模型中立(支持Fable、GPT、Deepseek等更多模型)
从第一天起,所有人就能获得完整访问权限。
让我们出发吧。🪂
新品发布 · @OpenAIDevs▲ 15.0万
ExaAILabs发布新插件可访问千亿级网页
ChatGPT和Codex现在能通过这个插件,调取超过千亿个网页、论文和文档内容,拓展了搜索引用信息的范围
ExaAILabs发布新插件可访问千亿级网页
ChatGPT和Codex现在能通过这个插件,调取超过千亿个网页、论文和文档内容,拓展了搜索引用信息的范围
前沿研究 · @XFreeze▲ 91.1万
Grok 4.6 与Claude Opus 5并列agent榜第一
这项排名衡量AI使用工具、自主规划解决复杂问题的智能体能力,得分最高意味着智能体能力已经达到第一梯队,会直接影响实际任务的完成效果
Grok 4.6 与Claude Opus 5并列agent榜第一
这项排名衡量AI使用工具、自主规划解决复杂问题的智能体能力,得分最高意味着智能体能力已经达到第一梯队,会直接影响实际任务的完成效果
Grok 4.6 刚刚在 Artificial Analysis Agentic Index 中并列第一
Grok 4.6 (high) — 59
Claude Opus 5 (max) — 59
表现优于 Claude Fable 5 和 GPT-5.6 Sol
我们正在进入智能体时代,而这正是非常重要的一类基准测试:工具调用、规划、自主性和复杂问题解决。
Grok 4.6 现在已经高居榜首。
这点之所以更为重要,是因为 Grok 为 Grok Build 和 Grok Bot 提供动力,在这些场景中,模型必须不止于回答问题,而是实际采取行动、使用工具并完成真实工作。
Grok 的智能体能力正在变得异常强大。
新品发布 · @harvey▲ 12.5万
Harvey发布Tenet法律模型 成本降超四分之三
相比基础模型,该模型在法律基准测试上通过率最高提升82%,性能达到行业前沿,还配套了三个细分领域的专用子模型。法律行业AI工具成本进一步降低。
Harvey发布Tenet法律模型 成本降超四分之三
相比基础模型,该模型在法律基准测试上通过率最高提升82%,性能达到行业前沿,还配套了三个细分领域的专用子模型。法律行业AI工具成本进一步降低。
前沿研究 · @teslaownersSV▲ 22.9万
Grok 4.6登顶智能体测试并列第一
该基准测试衡量AI智能体的工具调用、规划等实用能力,得分与当前头部模型Claude Opus 5持平,xAI智能体布局迎来关键进展
Grok 4.6登顶智能体测试并列第一
该基准测试衡量AI智能体的工具调用、规划等实用能力,得分与当前头部模型Claude Opus 5持平,xAI智能体布局迎来关键进展
突发消息:Grok 4.6 刚刚在 Artificial Analysis Agentic Index 中并列排名第一。⚡🤖
Grok 4.6 (High) — 59
Claude Opus 5 (Max) — 59
Grok 4.6 现在位居该基准测试榜首,领先于其他领先模型。
Agentic Index 聚焦对现实世界 AI 智能体至关重要的能力:工具使用、规划、自主运行,以及复杂问题解决。
这一结果意义尤其重大,因为 Grok 正在拓展 Grok Build 和 Grok Bot 业务,在这些场景中 AI 需要做的不只是回答问题——它还需要使用工具、完成任务。
来源:Artificial Analysis
🔥 热点追踪 · @harvey▲ 51.0万
Harvey发布Tenet法律模型,性能较基模大幅提升
Harvey以Kimi K3 base为基础,结合公开法律数据、合成数据与模拟长周期法律工作的专家数据完成后训练。该模型在部分法律基准测试中通过率提升最高达82%,目前已取得前沿测试成绩,后续性能泛化情况有待观察。
Harvey发布Tenet法律模型,性能较基模大幅提升
Harvey以Kimi K3 base为基础,结合公开法律数据、合成数据与模拟长周期法律工作的专家数据完成后训练。该模型在部分法律基准测试中通过率提升最高达82%,目前已取得前沿测试成绩,后续性能泛化情况有待观察。
🔥 热点追踪 · @harvey▲ 12.5万
Harvey发布Tenet法律模型,基于Kimi K3底座
该模型用公开法律数据、合成数据和人工专家数据完成后训练,相比原底座模型,在LAB测试全通过率提升82%,在LAB合同测试提升22%。业界认为这是应用层AI自研模型的新尝试。
Harvey发布Tenet法律模型,基于Kimi K3底座
该模型用公开法律数据、合成数据和人工专家数据完成后训练,相比原底座模型,在LAB测试全通过率提升82%,在LAB合同测试提升22%。业界认为这是应用层AI自研模型的新尝试。
大模型 · @BrendanFoody▲ 2.1万
法律AI公司Harvey推出自研Tenet系列模型
该模型在法律基准测试中拿到了当前最优成绩,还能用子模型适配法律领域的特定需求,之后会拓展到更多定制模型方向。
法律AI公司Harvey推出自研Tenet系列模型
该模型在法律基准测试中拿到了当前最优成绩,还能用子模型适配法律领域的特定需求,之后会拓展到更多定制模型方向。
研究 · @GoodfireAI▲ 1.4万
GoodfireAI拿出百万美元资助AI可解释性研究
资助形式是免费提供Silico服务使用额度,面向做AI可解释性和对齐研究的学术机构与非盈利研究者。
GoodfireAI拿出百万美元资助AI可解释性研究
资助形式是免费提供Silico服务使用额度,面向做AI可解释性和对齐研究的学术机构与非盈利研究者。
我们将为专注于 AI 可解释性与对齐研究的学术及非营利研究者提供总价值 100 万美元的免费 Silico 使用额度资助。
我们认为推进对齐方向的可解释性研究是极端紧迫的,我们希望帮助更多研究者推动这项工作向前发展。🧵
开源 · @rionaifantasy▲ 6.3K
微信聊天总结情报工具本周即将开源
它能自动总结单日聊天和群聊信息,生成带交互的日报,还能识别商单信息,给重点联系人的消息出回复建议。
微信聊天总结情报工具本周即将开源
它能自动总结单日聊天和群聊信息,生成带交互的日报,还能识别商单信息,给重点联系人的消息出回复建议。
深度观点 · @nikos1▲ 4.6K
Glen 推企业智能体上下文层,效率提21%
团队智能体每次任务产生的推理过程大多直接丢弃,这个产品能统一留存所有历史信息,帮新任务更快产出更高质量结果,目前开放抢先体验申请。
Glen 推企业智能体上下文层,效率提21%
团队智能体每次任务产生的推理过程大多直接丢弃,这个产品能统一留存所有历史信息,帮新任务更快产出更高质量结果,目前开放抢先体验申请。
Glen 正在为智能体构建组织学习与上下文层。你的团队运行的每一次智能体会话,都会产生值得留存的推理内容,但几乎所有内容都会在上下文窗口关闭的瞬间被丢弃。
Glen 就是统一你公司运行的所有智能体与模型的层级。它会从 Claude Code、Codex 和 Cursor 拉取智能体会话数据,同时整合 Slack 消息、GitHub PR、工单、文档和通话内容。
当新的智能体接手一项任务时,Glen 会找到相关的过往上下文,将其注入智能体的上下文窗口来引导工作,最终产出的知识工作质量远高于以往,速度更快、成本也更低。准确来说,所需上下文减少 29%,速度提升 21%。
而且 Glen 能做的还有更多……
> 查询任意一行代码对应的原始智能体
> 搜索你组织运行过的每一次会话
> 动态技能蒸馏
> 多玩家智能体
> 可在 Claude Code、Codex 和 Cursor 之间中途交接任务的统一转录文本
> 内嵌在 Slack 中的公司大脑
Glen 目前处于抢先体验阶段,在下方报名加入等候名单即可。
前沿研究 · @AIatMeta▲ 7.7K
Meta AI 发布 WildArtifactBench 多模态测试框架
这套框架不靠刻板标准答案打分,更贴合真实复杂任务,可以帮开发者更准确测出多模态AIagent的实际能力
Meta AI 发布 WildArtifactBench 多模态测试框架
这套框架不靠刻板标准答案打分,更贴合真实复杂任务,可以帮开发者更准确测出多模态AIagent的实际能力
今天我们还预览了 WildArtifactBench,这是一个内部评估框架,用于评估智能体在复杂真实任务上的表现,覆盖多种不同的交付成果格式。
它不采用严格的真值评分标准,而是使用来自人类和智能体偏好裁判的胜率与 Elo 评分,扩展了实际多模态工作流的任务覆盖范围。
我们将发布 WildArtifactBench 中的 10 个任务,以此推进我们衡量多模态智能体实际实用价值的能力:
前沿研究 · @marfinxx▲ 1.8万
Google DeepMind 新研究提升多智能体任务完成率
这套框架用可验证契约替代原有的提示交接,在15步仓库重构任务中,将任务完成率从42.6%提升到88.4%,能帮你更可靠地落地复杂多AI协作流程
Google DeepMind 新研究提升多智能体任务完成率
这套框架用可验证契约替代原有的提示交接,在15步仓库重构任务中,将任务完成率从42.6%提升到88.4%,能帮你更可靠地落地复杂多AI协作流程
实战经验 · @AndyMarlowg▲ 2.2万
实测Unstract解决AI文档工作流痛点
做文档AI、RAG pipeline或自动化工作流的开发者,可以参考这个解决LLM数据输入问题的方案
实测Unstract解决AI文档工作流痛点
做文档AI、RAG pipeline或自动化工作流的开发者,可以参考这个解决LLM数据输入问题的方案
大多数 AI 文档工作流甚至在 LLM 投入运行之前就失败了。我一直在测试 Unstract,这是一个开源平台,可以将 PDF、扫描文档、表单和手写文本转换为干净、结构化的 JSON,无需模板或模型训练。
你可以将结果部署为 REST API 或 ETL 流水线。最值得注意的是,LLMWhisperer 会先处理分析和数据提取,保留视觉布局、表格、复选框和手写内容,这样 LLM 收到的就是干净且结构化的信息。
如果你正在开发文档相关 AI 解决方案、RAG 流水线或自动化工作流,这个工具绝对值得探索。在这里试用 LLMWhisperer OCR:代码仓库:#AI #OpenSource #LLM #DocumentAI #RAG #Automation #Development
实战经验 · @AndroidDev▲ 1.1万
AndroidDev发布Jetpacker系列第三部分教程(3)
想同时用端侧AI的速度和云端AI的能力,这篇教程提供可落地的开发步骤
AndroidDev发布Jetpacker系列第三部分教程(3)
想同时用端侧AI的速度和云端AI的能力,这篇教程提供可落地的开发步骤
💡 借助 Firebase AI Logic 结合端侧 AI 的速度与云的算力 → 我们 Jetpacker 系列的第三部分展示了如何做到以下内容:用 Google Search、Maps 和 URL 数据为聊天bot提供 grounding,用 Hybrid Inference API 实现智能回退,以及构建自定义路由的实时聊天翻译。
深度观点 · @emollick▲ 1.7万
emollick吐槽AI多模式功能太混乱
现在大模型分多种模式、多端形态,连经常用AI的人都分不清不同入口,记不清哪项功能对应哪端,体验越来越混乱了
emollick吐槽AI多模式功能太混乱
现在大模型分多种模式、多端形态,连经常用AI的人都分不清不同入口,记不清哪项功能对应哪端,体验越来越混乱了
现在 AI 模式(ChatGPT Work/Codex/Chat、Claude Cowork/Code/Chat)和形态(电脑端应用、网页应用)越来越多,有一件事让我很困惑:我已经记不清每种产品都有哪些功能了。🤷♂️
在不同产品里,插件、技能、记忆、权限、文件这些功能究竟各是什么情况?
大模型 · @danieltvela
开发者danieltvela评测通义千问Qwen3.8-27B编程能力
称该模型可覆盖绝大多数编程主题,体验让其联想到2025年12月的Opus 4.5
开发者danieltvela评测通义千问Qwen3.8-27B编程能力
称该模型可覆盖绝大多数编程主题,体验让其联想到2025年12月的Opus 4.5
用户danieltvela在𝕏平台分享了对大模型Qwen3.8-27B的评测结果。他表示,Qwen3.8-27B完全可以应用在几乎所有编程相关任务中。
这次使用体验让他联想到了2025年12月使用Opus 4.5时的感受。
交易 · @YuChen▲ 4.9K
用户体验Questflow新版:和常规AI交易工具定位不同
多数AI交易产品仅提供信号或自动下单,它加入了交易前的AI判断流程
用户体验Questflow新版:和常规AI交易工具定位不同
多数AI交易产品仅提供信号或自动下单,它加入了交易前的AI判断流程
AI智能体 · @sydneyrunkle▲ 1.8K
开发者用浏览器智能体冲Map Tap任务满分 几分钟就达成
开发者Sydney Runkle发文询问图像处理模型和地理上下文建议,刚抛出问题几分钟就拿到满分
开发者用浏览器智能体冲Map Tap任务满分 几分钟就达成
开发者Sydney Runkle发文询问图像处理模型和地理上下文建议,刚抛出问题几分钟就拿到满分
开发者sydneyrunkle在X平台发文,称自己正在用浏览器智能体对Map Tap任务做爬山搜索优化。
他向网友询问两个问题:一是适合简单图像处理的最优模型是什么,二是需要提供哪些地理上下文信息。
sydneyrunkle表示,能在本周末前拿到任务满分会很不错,但他不确定智能体能有多快完成这项任务,还附上了任务进度链接。
几分钟后,他更新了进展:刚把这个问题丢给编码智能体,没一会儿就已经拿到了满分。
他提到,自己还可以继续对任务轨迹做爬山搜索优化,同时附上了更新后的进度链接。
生成式视频 · @MrLarus▲ 3.3K
Seedance 2.5可生成同台词不同情绪AI表演
用户分享了精准控制AI演员微表情和情绪的提示词撰写方法
Seedance 2.5可生成同台词不同情绪AI表演
用户分享了精准控制AI演员微表情和情绪的提示词撰写方法
用户测试Seedance 2.5生成AI表演时发现,同一or台词可以实现7种细腻不同的情绪控制,包括心动、欣喜、温柔、笃定、不舍、苦涩、执念。
控制AI演员微表情的核心,是在提示词中加入独立情境,把眼神、呼吸、动作、停顿和台词后的反应完整写清楚。只要把AI演员的内心状态描述清楚,就能得到符合要求的表演效果。完整提示词方法发布在原动态的评论区。
具体操作时,先用参考图锁定人物脸型、发型、服装、场景、光线和机位,后续只调整表演内容,不改动角色本身。把每一种情绪都当作一场独立的小戏设计,不要只笼统告诉AI人物的情绪,要写清楚情绪产生的原因。
撰写提示词可以按照固定顺序:情境触发→第一反应→眼神神态→呼吸/身体动作→台词→台词后的余韵。比如要表现“不舍”,不用只写“眼眶湿润”,可以完整描述事件和动作过程:对方准备离开,她下意识追出半步,抬手想挽留又停住,强撑着笑,眼眶慢慢泛湿,说出指定台词,目光继续追着对方,笑意一点点消失。重点要把真实演员会有的细节反应写清楚,核心是讲清这场戏的起因、人物反应和台词的完整逻辑。
大模型 · @LufzzLiz▲ 8.4K
用户在RTX 4090上测试通义千问3.8-27B量化版本
对比INT4 AWQ与FP8两种量化版本的推理性能,仅用简单提示就生成了闲鱼App首页代码
用户在RTX 4090上测试通义千问3.8-27B量化版本
对比INT4 AWQ与FP8两种量化版本的推理性能,仅用简单提示就生成了闲鱼App首页代码
测试者在NVIDIA RTX 4090显卡上运行了Qwen(通义千问)3.8-27B大模型。测试者仅输入了“开发一个闲鱼app版首页”的简单提示,得到的生成效果超出预期。
测试分别运行了4位量化版本Qwen3.8-27B-AWQ-INT4,和8位量化版本Qwen3.8-27B-FP8。测试者认为4位量化版本的生成效果更好。
测试给出多项核心性能对比数据:推理解码环节,AWQ版本速度为每秒44.9个token,FP8版本为每秒19.6个token。
8路非思考并发聚合环节,AWQ版本速度为每秒302个token,FP8版本为每秒136个token。
5.5万token预填充首包响应时间(TTFT),AWQ版本用时23.2秒,FP8版本用时17.5秒。AWQ预填充速度更慢,原因是4位权重需要先反量化回BF16格式再计算。
本次测试通过Claude Code对接vllm框架完成,测试过程遇到不少问题,测试者表示后续会整理相关经验。
该测试数据验证了相关实验结论:AWQ量化效果优于FP8。
开源 · @AI_EmeraldApple▲ 2.0K
创作者用开源AI视频模型修复旧AI生成cos图
创作者将2023年SD1.5生成的原神角色cos图输入模型修复,仍存在部分缺陷
创作者用开源AI视频模型修复旧AI生成cos图
创作者将2023年SD1.5生成的原神角色cos图输入模型修复,仍存在部分缺陷
用户@AI_EmeraldApple在X平台分享了用开源AI视频模型修复旧AI生成图像的体验。
他把自己旧AI生成的原神角色cos图,还有几张仿冒图,输入到这个AI视频模型中。
这些图像生成于2023年,使用的是旧版SD1.5(Stable Diffusion 1.5)模型,AI成功修复了图像里的部分问题。
目前依然存在重影、幻觉生成及其他图像瑕疵问题,音频效果也不够好。
角色在每个连续镜头间的外观一致性表现不错,动作整体物理逻辑和其他细节看起来都比较可信。
成果仍处在“恐怖谷”区间,但生成效果正在逐步提升。
图像生成 · @beechinour▲ 4.0K
AI视频创作者分享自测试最佳图像生成工作流
创作者测试了一年内九成以上图像生成方案,分享了可重复的最优工作流程
AI视频创作者分享自测试最佳图像生成工作流
创作者测试了一年内九成以上图像生成方案,分享了可重复的最优工作流程
一年前开始制作AI视频以来,创作者已经测试了99%的现有图像生成方案。他分享了一套可重复运行,并且在他测试过的方案中效果最佳的工作流。
第一步用Claude结合参考图像确定创作风格。第二步在Midjourney v8.2中生成基础图像。第三步在GPT-2中完成图像清理与放大。
创作者认为这套流程非常简单,已经足够得到目前能实现的最优图像输出。完整指南可以在他公开的链接中查看。
创作者邀请用户加入他的免费TG群组获取更多资讯。
语言学 · @voooooogel▲ 3.0K
开发者发现AI大模型 Claude 演化出专属特有用语Claudlish
研究发现Claude在自我交互中演化出了适配环境的专属用语
开发者发现AI大模型 Claude 演化出专属特有用语Claudlish
研究发现Claude在自我交互中演化出了适配环境的专属用语
智能体 · @fofrAI▲ 4.0K
开发者分享基于Slack/谷歌聊天的多智能体架构
开发者分享自主运行的多智能体协作配置,最大问题为上下文管理
开发者分享基于Slack/谷歌聊天的多智能体架构
开发者分享自主运行的多智能体协作配置,最大问题为上下文管理
我目前在 Slack/Google Chat 里的智能体架构:
- 一个频道容纳了由 6 个智能体组成的团队,作为基础设施团队,管理其他智能体的运行时、环境、工具、技能开发和各类服务(比如日报、Google Cloud 等等)
- 小型「沙龙」团队,为特定任务、长期实验、创意想法或是快速落地新想法而组建,它们自主工作,有自己的排期,拥有可以向基础设施团队上报问题的工具
- 沙龙会采用不同的结构、不同的智能体数量,还有不同的模型混合组合,用来观察动态变化(比如 3 个工作智能体加 1 个主持智能体,所有工作智能体优先级互相对立等等)
- 用于和人类在特定任务上快速协作的直接一对一智能体
- 一个我可以直接对话的语音智能体,它可以查看任意频道、发送消息,整体通过聊天完成管理
- 任何模型/框架都能轻松部署
这套架构基本可以自主运行,最大的问题是上下文管理。
游戏开发 · @xgwei▲ 2.3万
Meta推出XR Operator 实现AI实时真人式测试VR动作游戏
Meta打造的AI agent可实时真人方式测试真实VR动作游戏,系首次实现
Meta推出XR Operator 实现AI实时真人式测试VR动作游戏
Meta打造的AI agent可实时真人方式测试真实VR动作游戏,系首次实现
投资交易 · @mardehaym▲ 1.5万
资深交易团队对AI交易尽调往往并不充分
作者将揭露AI交易尽调疏漏,面向相关从业者推送
资深交易团队对AI交易尽调往往并不充分
作者将揭露AI交易尽调疏漏,面向相关从业者推送
如果你正在读这篇内容,我相信算法把你推送给我是对的——因为你就是靠评估软件公司吃饭的。
经验丰富的交易团队总爱说自己做了非常全面的尽职调查。我打算告诉你,为什么在AI交易里,他们根本没做到。
如果你想要交付AI原生产品,就预约一次发掘通话:
90%的AI内容都是从未交付过生产级智能体的人写的。这份通讯出自每周都在做这件事的100多个工程团队内部。免费订阅👇
前沿研究 · @teslaownersSV▲ 22.9万
Grok 4.6登顶智能体测试并列第一
该基准测试衡量AI智能体的工具调用、规划等实用能力,得分与当前头部模型Claude Opus 5持平,xAI智能体布局迎来关键进展
Grok 4.6登顶智能体测试并列第一
该基准测试衡量AI智能体的工具调用、规划等实用能力,得分与当前头部模型Claude Opus 5持平,xAI智能体布局迎来关键进展
突发消息:Grok 4.6 刚刚在 Artificial Analysis Agentic Index 中并列排名第一。⚡🤖
Grok 4.6 (High) — 59
Claude Opus 5 (Max) — 59
Grok 4.6 现在位居该基准测试榜首,领先于其他领先模型。
Agentic Index 聚焦对现实世界 AI 智能体至关重要的能力:工具使用、规划、自主运行,以及复杂问题解决。
这一结果意义尤其重大,因为 Grok 正在拓展 Grok Build 和 Grok Bot 业务,在这些场景中 AI 需要做的不只是回答问题——它还需要使用工具、完成任务。
来源:Artificial Analysis
前沿研究 · @XFreeze▲ 91.1万
Grok 4.6 与Claude Opus 5并列agent榜第一
这项排名衡量AI使用工具、自主规划解决复杂问题的智能体能力,得分最高意味着智能体能力已经达到第一梯队,会直接影响实际任务的完成效果
Grok 4.6 与Claude Opus 5并列agent榜第一
这项排名衡量AI使用工具、自主规划解决复杂问题的智能体能力,得分最高意味着智能体能力已经达到第一梯队,会直接影响实际任务的完成效果
Grok 4.6 刚刚在 Artificial Analysis Agentic Index 中并列第一
Grok 4.6 (high) — 59
Claude Opus 5 (max) — 59
表现优于 Claude Fable 5 和 GPT-5.6 Sol
我们正在进入智能体时代,而这正是非常重要的一类基准测试:工具调用、规划、自主性和复杂问题解决。
Grok 4.6 现在已经高居榜首。
这点之所以更为重要,是因为 Grok 为 Grok Build 和 Grok Bot 提供动力,在这些场景中,模型必须不止于回答问题,而是实际采取行动、使用工具并完成真实工作。
Grok 的智能体能力正在变得异常强大。
前沿研究 · @marfinxx▲ 1.8万
Google DeepMind 新研究提升多智能体任务完成率
这套框架用可验证契约替代原有的提示交接,在15步仓库重构任务中,将任务完成率从42.6%提升到88.4%,能帮你更可靠地落地复杂多AI协作流程
Google DeepMind 新研究提升多智能体任务完成率
这套框架用可验证契约替代原有的提示交接,在15步仓库重构任务中,将任务完成率从42.6%提升到88.4%,能帮你更可靠地落地复杂多AI协作流程
前沿研究 · @AIatMeta▲ 7.7K
Meta AI 发布 WildArtifactBench 多模态测试框架
这套框架不靠刻板标准答案打分,更贴合真实复杂任务,可以帮开发者更准确测出多模态AIagent的实际能力
Meta AI 发布 WildArtifactBench 多模态测试框架
这套框架不靠刻板标准答案打分,更贴合真实复杂任务,可以帮开发者更准确测出多模态AIagent的实际能力
今天我们还预览了 WildArtifactBench,这是一个内部评估框架,用于评估智能体在复杂真实任务上的表现,覆盖多种不同的交付成果格式。
它不采用严格的真值评分标准,而是使用来自人类和智能体偏好裁判的胜率与 Elo 评分,扩展了实际多模态工作流的任务覆盖范围。
我们将发布 WildArtifactBench 中的 10 个任务,以此推进我们衡量多模态智能体实际实用价值的能力:
新品发布 · @harvey▲ 12.5万
Harvey发布Tenet法律模型 成本降超四分之三
相比基础模型,该模型在法律基准测试上通过率最高提升82%,性能达到行业前沿,还配套了三个细分领域的专用子模型。法律行业AI工具成本进一步降低。
Harvey发布Tenet法律模型 成本降超四分之三
相比基础模型,该模型在法律基准测试上通过率最高提升82%,性能达到行业前沿,还配套了三个细分领域的专用子模型。法律行业AI工具成本进一步降低。
新品发布 · @OpenAIDevs▲ 15.0万
ExaAILabs发布新插件可访问千亿级网页
ChatGPT和Codex现在能通过这个插件,调取超过千亿个网页、论文和文档内容,拓展了搜索引用信息的范围
ExaAILabs发布新插件可访问千亿级网页
ChatGPT和Codex现在能通过这个插件,调取超过千亿个网页、论文和文档内容,拓展了搜索引用信息的范围
新品发布 · @dhruvamin▲ 4.2万
Anything发布Skydive,让AI队友随处可用
支持全渠道接入且适配各类大模型,首日开放全权限访问,需要多AI协作的日常工作可以尝试新方案。
Anything发布Skydive,让AI队友随处可用
支持全渠道接入且适配各类大模型,首日开放全权限访问,需要多AI协作的日常工作可以尝试新方案。
如果AI队友(Grok Bot、Hermes等)无处不在会怎么样?
我们推出Anything出品的Skydive。
- 全渠道覆盖(Slack、email、iMessage、CLI)
- 云原生(始终在线,你睡觉时也能工作)
- 模型中立(支持Fable、GPT、Deepseek等更多模型)
从第一天起,所有人就能获得完整访问权限。
让我们出发吧。🪂
新品发布 · @SenseTime_AI▲ 6.2万
商汤开源SenseNova U1.5 Lite 仅8B参数
普通个人开发者也能运行这个原生多模态模型,做视觉生成和图像编辑,不用依赖大参数量的闭源商用模型
商汤开源SenseNova U1.5 Lite 仅8B参数
普通个人开发者也能运行这个原生多模态模型,做视觉生成和图像编辑,不用依赖大参数量的闭源商用模型
SenseNova U1.5 Lite — 更锐利、更可控、更具成本效益。
这是一个开源、轻量的原生统一多模态模型,适用于视觉理解、生成与编辑。专为真实世界视觉工件工作流打造:
🔹原生4K生成,拥有更好的细节、构图与真实感
🔹能完成跨主体、计数、文本、布局与风格的复杂指令跟随
🔹增强了中英文字渲染与多文本布局能力
🔹借助视觉标记、 bounding box 与多图参考,实现精确图像编辑与控制
它仅有8B参数,在指令跟随与编辑保留能力上优于同尺寸模型,同时在文本渲染与复杂布局方面可与大型商用模型竞争。
🛠️GitHub:
🤗HF:
👾Discord:
🎨SenseNova Studio:
🔥 热点追踪 · @harvey▲ 51.0万
Harvey发布Tenet法律模型,性能较基模大幅提升
Harvey以Kimi K3 base为基础,结合公开法律数据、合成数据与模拟长周期法律工作的专家数据完成后训练。该模型在部分法律基准测试中通过率提升最高达82%,目前已取得前沿测试成绩,后续性能泛化情况有待观察。
Harvey发布Tenet法律模型,性能较基模大幅提升
Harvey以Kimi K3 base为基础,结合公开法律数据、合成数据与模拟长周期法律工作的专家数据完成后训练。该模型在部分法律基准测试中通过率提升最高达82%,目前已取得前沿测试成绩,后续性能泛化情况有待观察。
🔥 热点追踪 · @harvey▲ 12.5万
Harvey发布Tenet法律模型,基于Kimi K3底座
该模型用公开法律数据、合成数据和人工专家数据完成后训练,相比原底座模型,在LAB测试全通过率提升82%,在LAB合同测试提升22%。业界认为这是应用层AI自研模型的新尝试。
Harvey发布Tenet法律模型,基于Kimi K3底座
该模型用公开法律数据、合成数据和人工专家数据完成后训练,相比原底座模型,在LAB测试全通过率提升82%,在LAB合同测试提升22%。业界认为这是应用层AI自研模型的新尝试。
行业动态 · @wallstengine▲ 2.5万
AT&T 把四成AI查询迁移到开源模型
大公司开始用开源模型分流付费大模型请求,帮企业降本同时几乎不损失性能,给想用AI又控制成本的企业探出了可行路径。
AT&T 把四成AI查询迁移到开源模型
大公司开始用开源模型分流付费大模型请求,帮企业降本同时几乎不损失性能,给想用AI又控制成本的企业探出了可行路径。
AT&T 将更多 AI 工作负载转移至开源模型。
AT&T 表示,目前开源模型处理了 40% 的员工 AI 查询,预计这一比例将上升至 60%-70%,同时该公司计划将对 OpenAI 和 Anthropic 模型的支出大致维持在现有水平。
该公司称,通过 LiteLLM 进行模型路由,AI 编码成本降低了 56%,仅出现了 2% 的性能质量下降。
AT&T 的内部 AI 平台目前每天处理约 450 亿 token,除了将前沿模型用于更复杂的任务外,还使用了包括 Nvidia Nemotron、Meta Llama 和 Google Gemma 在内的模型。
大模型 · @BrendanFoody▲ 2.1万
法律AI公司Harvey推出自研Tenet系列模型
该模型在法律基准测试中拿到了当前最优成绩,还能用子模型适配法律领域的特定需求,之后会拓展到更多定制模型方向。
法律AI公司Harvey推出自研Tenet系列模型
该模型在法律基准测试中拿到了当前最优成绩,还能用子模型适配法律领域的特定需求,之后会拓展到更多定制模型方向。
动态 · @OpenAIDevs▲ 8.1万
OpenAI发布GPT-Image-2 API透明背景预览功能
生成的图片可以直接放到任意背景上用,做产品图、平面设计或者网站原型都能用得上。
OpenAI发布GPT-Image-2 API透明背景预览功能
生成的图片可以直接放到任意背景上用,做产品图、平面设计或者网站原型都能用得上。
透明背景功能现已在 API 的 GPT-Image-2 中开放预览。
你可以生成可复用的资产,将它们放置在任何背景上——用于产品图片、平面设计、网站原型和营销活动。
开发工具 · @coledermo▲ 3.1万
OpenRouter发布统一API预付费计费服务
开发AI代理和产品的团队不用再分别给每个API充钱对账,一个余额就能覆盖所有需要的API开销。
OpenRouter发布统一API预付费计费服务
开发AI代理和产品的团队不用再分别给每个API充钱对账,一个余额就能覆盖所有需要的API开销。
现在推出:全场景 OpenRouter。一个预付费余额,覆盖你的代理和产品所需的所有 API。
这是每支 AI 团队从第一天就需要的计费与计量层。一个全场景 OpenRouter。
每一次模型调用、搜索、抓取或数据请求——一个密钥,一个余额,按你设定的价格实时计费。差价收益全归你。失败调用不收费。支持下钻到单个用户的完整账目。
覆盖 286+ 提供商,2404+ 端点。现在它已经为我们的消费产品 Locus Founder 提供支撑。
不用再同时管理多个提供商账户、处理月末发票,或是从零搭建自己的使用计费系统。
构建代理产品的团队终于可以像处理其他支出项一样管理 API 开销:定价、设限额,最终计费转嫁给你的用户。
评论「LOCUS」获取优先提前体验资格。预约通话请访问:
开源 · @nutlope▲ 6.6K
nutlope发布/variate 开源UI迭代设计工具
它可以在Claude Code、Codex和OpenCode里直接用,一行命令就能安装,做界面设计的时候可以一次性出多个变体参考。
nutlope发布/variate 开源UI迭代设计工具
它可以在Claude Code、Codex和OpenCode里直接用,一行命令就能安装,做界面设计的时候可以一次性出多个变体参考。
宣布推出 /variate。这是一项开源设计技能,可以通过生成多个设计变体来迭代 UI。
它支持在 Claude Code、Codex 和 OpenCode 中使用。
安装命令:npx skills add nutlope/variate
研究 · @GoodfireAI▲ 1.4万
GoodfireAI拿出百万美元资助AI可解释性研究
资助形式是免费提供Silico服务使用额度,面向做AI可解释性和对齐研究的学术机构与非盈利研究者。
GoodfireAI拿出百万美元资助AI可解释性研究
资助形式是免费提供Silico服务使用额度,面向做AI可解释性和对齐研究的学术机构与非盈利研究者。
我们将为专注于 AI 可解释性与对齐研究的学术及非营利研究者提供总价值 100 万美元的免费 Silico 使用额度资助。
我们认为推进对齐方向的可解释性研究是极端紧迫的,我们希望帮助更多研究者推动这项工作向前发展。🧵
开源 · @rionaifantasy▲ 6.3K
微信聊天总结情报工具本周即将开源
它能自动总结单日聊天和群聊信息,生成带交互的日报,还能识别商单信息,给重点联系人的消息出回复建议。
微信聊天总结情报工具本周即将开源
它能自动总结单日聊天和群聊信息,生成带交互的日报,还能识别商单信息,给重点联系人的消息出回复建议。
行业动态 · Hacker News▲ 78
作者实测27美元智能手表跑Claude
只要能连接云端API,最便宜的可穿戴设备也能运行大模型,日常轻量AI使用的门槛可能比想象低得多。
作者实测27美元智能手表跑Claude
只要能连接云端API,最便宜的可穿戴设备也能运行大模型,日常轻量AI使用的门槛可能比想象低得多。
社区讨论:有用户质疑作者标题和全文标注为Claude,实际多数工作用的是Kimi、DeepSeek等其他模型,表述容易误导读者,也有人调侃Claude已经变成智能体领域的舒洁,成了这类产品的通用代称。不少开发者讨论低价位开放固件的可穿戴硬件,有人推荐同价位的Waveshare ESP32-S3 AMOLED手表,有人希望未来能出现百元级开源的佳明同款运动手表。
行业动态 · Hacker News▲ 163
Bluestein发布Vomit工具 清理Claude 5输出
使用Claude 5生成内容时,如果常遇到多余无效 tokens,可以试试这个工具,用额外大模型专门清理输出杂质
Bluestein发布Vomit工具 清理Claude 5输出
使用Claude 5生成内容时,如果常遇到多余无效 tokens,可以试试这个工具,用额外大模型专门清理输出杂质
社区讨论:多数开发者都称Claude 5尤其是Opus 5存在输出冗余啰嗦、违反格式要求的问题,已经困扰他们数周,部分团队甚至考虑将预算转移到Codex或开源模型上。有人质疑,如果全程需要用其他模型清理输出,为什么不直接改用其他厂商的模型。也有人认为对输出措辞的抱怨太过度,大模型只是工具不完美很正常,还有人指出只有Opus 5问题严重,Fable 5表现要好得多。
深度观点 · @emollick▲ 1.7万
emollick吐槽AI多模式功能太混乱
现在大模型分多种模式、多端形态,连经常用AI的人都分不清不同入口,记不清哪项功能对应哪端,体验越来越混乱了
emollick吐槽AI多模式功能太混乱
现在大模型分多种模式、多端形态,连经常用AI的人都分不清不同入口,记不清哪项功能对应哪端,体验越来越混乱了
现在 AI 模式(ChatGPT Work/Codex/Chat、Claude Cowork/Code/Chat)和形态(电脑端应用、网页应用)越来越多,有一件事让我很困惑:我已经记不清每种产品都有哪些功能了。🤷♂️
在不同产品里,插件、技能、记忆、权限、文件这些功能究竟各是什么情况?
深度观点 · @nikos1▲ 4.6K
Glen 推企业智能体上下文层,效率提21%
团队智能体每次任务产生的推理过程大多直接丢弃,这个产品能统一留存所有历史信息,帮新任务更快产出更高质量结果,目前开放抢先体验申请。
Glen 推企业智能体上下文层,效率提21%
团队智能体每次任务产生的推理过程大多直接丢弃,这个产品能统一留存所有历史信息,帮新任务更快产出更高质量结果,目前开放抢先体验申请。
Glen 正在为智能体构建组织学习与上下文层。你的团队运行的每一次智能体会话,都会产生值得留存的推理内容,但几乎所有内容都会在上下文窗口关闭的瞬间被丢弃。
Glen 就是统一你公司运行的所有智能体与模型的层级。它会从 Claude Code、Codex 和 Cursor 拉取智能体会话数据,同时整合 Slack 消息、GitHub PR、工单、文档和通话内容。
当新的智能体接手一项任务时,Glen 会找到相关的过往上下文,将其注入智能体的上下文窗口来引导工作,最终产出的知识工作质量远高于以往,速度更快、成本也更低。准确来说,所需上下文减少 29%,速度提升 21%。
而且 Glen 能做的还有更多……
> 查询任意一行代码对应的原始智能体
> 搜索你组织运行过的每一次会话
> 动态技能蒸馏
> 多玩家智能体
> 可在 Claude Code、Codex 和 Cursor 之间中途交接任务的统一转录文本
> 内嵌在 Slack 中的公司大脑
Glen 目前处于抢先体验阶段,在下方报名加入等候名单即可。
实战经验 · @AndyMarlowg▲ 2.2万
实测Unstract解决AI文档工作流痛点
做文档AI、RAG pipeline或自动化工作流的开发者,可以参考这个解决LLM数据输入问题的方案
实测Unstract解决AI文档工作流痛点
做文档AI、RAG pipeline或自动化工作流的开发者,可以参考这个解决LLM数据输入问题的方案
大多数 AI 文档工作流甚至在 LLM 投入运行之前就失败了。我一直在测试 Unstract,这是一个开源平台,可以将 PDF、扫描文档、表单和手写文本转换为干净、结构化的 JSON,无需模板或模型训练。
你可以将结果部署为 REST API 或 ETL 流水线。最值得注意的是,LLMWhisperer 会先处理分析和数据提取,保留视觉布局、表格、复选框和手写内容,这样 LLM 收到的就是干净且结构化的信息。
如果你正在开发文档相关 AI 解决方案、RAG 流水线或自动化工作流,这个工具绝对值得探索。在这里试用 LLMWhisperer OCR:代码仓库:#AI #OpenSource #LLM #DocumentAI #RAG #Automation #Development
实战经验 · @AndroidDev▲ 1.1万
AndroidDev发布Jetpacker系列第三部分教程(3)
想同时用端侧AI的速度和云端AI的能力,这篇教程提供可落地的开发步骤
AndroidDev发布Jetpacker系列第三部分教程(3)
想同时用端侧AI的速度和云端AI的能力,这篇教程提供可落地的开发步骤
💡 借助 Firebase AI Logic 结合端侧 AI 的速度与云的算力 → 我们 Jetpacker 系列的第三部分展示了如何做到以下内容:用 Google Search、Maps 和 URL 数据为聊天bot提供 grounding,用 Hybrid Inference API 实现智能回退,以及构建自定义路由的实时聊天翻译。
教育 · @sarpstar▲ 6.2万
Anthropic推出免费公开AI学习入门课程体系
Claude开发团队推出免费全品类AI学习资源对公众开放
Anthropic推出免费公开AI学习入门课程体系
Claude开发团队推出免费全品类AI学习资源对公众开放
要学习人工智能,很难找到比这更好的入门包了。开发 Claude 的团队推出了一门规模庞大的课程,内容从 AI 基础开始,一路延伸到 Claude Code、API、MCP、agent 和技能,现在完全免费、对所有人开放。
他们不只是提供工具,还在培养会使用这些工具的下一代。这次就好好投入学习吧。
我自己刚开始的时候,也是从 Anthropic 的课程入门的。你可以从这里访问:
投资交易 · @mardehaym▲ 1.5万
资深交易团队对AI交易尽调往往并不充分
作者将揭露AI交易尽调疏漏,面向相关从业者推送
资深交易团队对AI交易尽调往往并不充分
作者将揭露AI交易尽调疏漏,面向相关从业者推送
如果你正在读这篇内容,我相信算法把你推送给我是对的——因为你就是靠评估软件公司吃饭的。
经验丰富的交易团队总爱说自己做了非常全面的尽职调查。我打算告诉你,为什么在AI交易里,他们根本没做到。
如果你想要交付AI原生产品,就预约一次发掘通话:
90%的AI内容都是从未交付过生产级智能体的人写的。这份通讯出自每周都在做这件事的100多个工程团队内部。免费订阅👇
游戏开发 · @xgwei▲ 2.3万
Meta推出XR Operator 实现AI实时真人式测试VR动作游戏
Meta打造的AI agent可实时真人方式测试真实VR动作游戏,系首次实现
Meta推出XR Operator 实现AI实时真人式测试VR动作游戏
Meta打造的AI agent可实时真人方式测试真实VR动作游戏,系首次实现
开源 · @iamlukethedev▲ 1.6万
开发者为Hermes智能体推出开源3D实时指挥中心Hermes3D
开发者基于旧原型Claw3D重构,推出适配Hermes智能体的开源3D实时指挥中心
开发者为Hermes智能体推出开源3D实时指挥中心Hermes3D
开发者基于旧原型Claw3D重构,推出适配Hermes智能体的开源3D实时指挥中心
来认识 Hermes3D,这是给 Hermes Agents 打造的实时 3D 指挥中心。
你们中有些人可能还记得 Claw3D,它曾经走红,但它是围绕 OpenClaw 构建的。在我把所有工作流都迁移到 Hermes 之后,继续维护它就说不通了。
所以我为 Hermes 重新构建了整个概念。
Hermes Bot Mode 本来就已经给每个智能体分配了专属角色、模型、记忆、技能、工具和个性。而 Hermes3D 给这个团队提供了一间办公室。
你可以看到哪些智能体正在工作,看到谁被卡住了,查看它们的任务,打开看板,走过去和它们对话。
当智能体之间互相交流、委派工作或是交接任务时,你都能在这间办公室里实时看到整个过程。
你的 AI 团队不应该像是藏在终端标签页里的十个看不见的进程。它应该让你感觉是一个你真的能看见、能掌控的工作场所。
Claw3D 是原型,Hermes3D 才是真正的愿景。
当然了,它是开源的。演示在下方,仓库链接在第一条评论。
Hermes3D Repo
智能体 · @fofrAI▲ 4.0K
开发者分享基于Slack/谷歌聊天的多智能体架构
开发者分享自主运行的多智能体协作配置,最大问题为上下文管理
开发者分享基于Slack/谷歌聊天的多智能体架构
开发者分享自主运行的多智能体协作配置,最大问题为上下文管理
我目前在 Slack/Google Chat 里的智能体架构:
- 一个频道容纳了由 6 个智能体组成的团队,作为基础设施团队,管理其他智能体的运行时、环境、工具、技能开发和各类服务(比如日报、Google Cloud 等等)
- 小型「沙龙」团队,为特定任务、长期实验、创意想法或是快速落地新想法而组建,它们自主工作,有自己的排期,拥有可以向基础设施团队上报问题的工具
- 沙龙会采用不同的结构、不同的智能体数量,还有不同的模型混合组合,用来观察动态变化(比如 3 个工作智能体加 1 个主持智能体,所有工作智能体优先级互相对立等等)
- 用于和人类在特定任务上快速协作的直接一对一智能体
- 一个我可以直接对话的语音智能体,它可以查看任意频道、发送消息,整体通过聊天完成管理
- 任何模型/框架都能轻松部署
这套架构基本可以自主运行,最大的问题是上下文管理。
语言学 · @voooooogel▲ 3.0K
开发者发现AI大模型 Claude 演化出专属特有用语Claudlish
研究发现Claude在自我交互中演化出了适配环境的专属用语
开发者发现AI大模型 Claude 演化出专属特有用语Claudlish
研究发现Claude在自我交互中演化出了适配环境的专属用语
图像生成 · @beechinour▲ 4.0K
AI视频创作者分享自测试最佳图像生成工作流
创作者测试了一年内九成以上图像生成方案,分享了可重复的最优工作流程
AI视频创作者分享自测试最佳图像生成工作流
创作者测试了一年内九成以上图像生成方案,分享了可重复的最优工作流程
一年前开始制作AI视频以来,创作者已经测试了99%的现有图像生成方案。他分享了一套可重复运行,并且在他测试过的方案中效果最佳的工作流。
第一步用Claude结合参考图像确定创作风格。第二步在Midjourney v8.2中生成基础图像。第三步在GPT-2中完成图像清理与放大。
创作者认为这套流程非常简单,已经足够得到目前能实现的最优图像输出。完整指南可以在他公开的链接中查看。
创作者邀请用户加入他的免费TG群组获取更多资讯。
开源 · @AI_EmeraldApple▲ 2.0K
创作者用开源AI视频模型修复旧AI生成cos图
创作者将2023年SD1.5生成的原神角色cos图输入模型修复,仍存在部分缺陷
创作者用开源AI视频模型修复旧AI生成cos图
创作者将2023年SD1.5生成的原神角色cos图输入模型修复,仍存在部分缺陷
用户@AI_EmeraldApple在X平台分享了用开源AI视频模型修复旧AI生成图像的体验。
他把自己旧AI生成的原神角色cos图,还有几张仿冒图,输入到这个AI视频模型中。
这些图像生成于2023年,使用的是旧版SD1.5(Stable Diffusion 1.5)模型,AI成功修复了图像里的部分问题。
目前依然存在重影、幻觉生成及其他图像瑕疵问题,音频效果也不够好。
角色在每个连续镜头间的外观一致性表现不错,动作整体物理逻辑和其他细节看起来都比较可信。
成果仍处在“恐怖谷”区间,但生成效果正在逐步提升。
大模型 · @LufzzLiz▲ 8.4K
用户在RTX 4090上测试通义千问3.8-27B量化版本
对比INT4 AWQ与FP8两种量化版本的推理性能,仅用简单提示就生成了闲鱼App首页代码
用户在RTX 4090上测试通义千问3.8-27B量化版本
对比INT4 AWQ与FP8两种量化版本的推理性能,仅用简单提示就生成了闲鱼App首页代码
测试者在NVIDIA RTX 4090显卡上运行了Qwen(通义千问)3.8-27B大模型。测试者仅输入了“开发一个闲鱼app版首页”的简单提示,得到的生成效果超出预期。
测试分别运行了4位量化版本Qwen3.8-27B-AWQ-INT4,和8位量化版本Qwen3.8-27B-FP8。测试者认为4位量化版本的生成效果更好。
测试给出多项核心性能对比数据:推理解码环节,AWQ版本速度为每秒44.9个token,FP8版本为每秒19.6个token。
8路非思考并发聚合环节,AWQ版本速度为每秒302个token,FP8版本为每秒136个token。
5.5万token预填充首包响应时间(TTFT),AWQ版本用时23.2秒,FP8版本用时17.5秒。AWQ预填充速度更慢,原因是4位权重需要先反量化回BF16格式再计算。
本次测试通过Claude Code对接vllm框架完成,测试过程遇到不少问题,测试者表示后续会整理相关经验。
该测试数据验证了相关实验结论:AWQ量化效果优于FP8。
生成式视频 · @MrLarus▲ 3.3K
Seedance 2.5可生成同台词不同情绪AI表演
用户分享了精准控制AI演员微表情和情绪的提示词撰写方法
Seedance 2.5可生成同台词不同情绪AI表演
用户分享了精准控制AI演员微表情和情绪的提示词撰写方法
用户测试Seedance 2.5生成AI表演时发现,同一or台词可以实现7种细腻不同的情绪控制,包括心动、欣喜、温柔、笃定、不舍、苦涩、执念。
控制AI演员微表情的核心,是在提示词中加入独立情境,把眼神、呼吸、动作、停顿和台词后的反应完整写清楚。只要把AI演员的内心状态描述清楚,就能得到符合要求的表演效果。完整提示词方法发布在原动态的评论区。
具体操作时,先用参考图锁定人物脸型、发型、服装、场景、光线和机位,后续只调整表演内容,不改动角色本身。把每一种情绪都当作一场独立的小戏设计,不要只笼统告诉AI人物的情绪,要写清楚情绪产生的原因。
撰写提示词可以按照固定顺序:情境触发→第一反应→眼神神态→呼吸/身体动作→台词→台词后的余韵。比如要表现“不舍”,不用只写“眼眶湿润”,可以完整描述事件和动作过程:对方准备离开,她下意识追出半步,抬手想挽留又停住,强撑着笑,眼眶慢慢泛湿,说出指定台词,目光继续追着对方,笑意一点点消失。重点要把真实演员会有的细节反应写清楚,核心是讲清这场戏的起因、人物反应和台词的完整逻辑。
AI智能体 · @sydneyrunkle▲ 1.8K
开发者用浏览器智能体冲Map Tap任务满分 几分钟就达成
开发者Sydney Runkle发文询问图像处理模型和地理上下文建议,刚抛出问题几分钟就拿到满分
开发者用浏览器智能体冲Map Tap任务满分 几分钟就达成
开发者Sydney Runkle发文询问图像处理模型和地理上下文建议,刚抛出问题几分钟就拿到满分
开发者sydneyrunkle在X平台发文,称自己正在用浏览器智能体对Map Tap任务做爬山搜索优化。
他向网友询问两个问题:一是适合简单图像处理的最优模型是什么,二是需要提供哪些地理上下文信息。
sydneyrunkle表示,能在本周末前拿到任务满分会很不错,但他不确定智能体能有多快完成这项任务,还附上了任务进度链接。
几分钟后,他更新了进展:刚把这个问题丢给编码智能体,没一会儿就已经拿到了满分。
他提到,自己还可以继续对任务轨迹做爬山搜索优化,同时附上了更新后的进度链接。
交易 · @YuChen▲ 4.9K
用户体验Questflow新版:和常规AI交易工具定位不同
多数AI交易产品仅提供信号或自动下单,它加入了交易前的AI判断流程
用户体验Questflow新版:和常规AI交易工具定位不同
多数AI交易产品仅提供信号或自动下单,它加入了交易前的AI判断流程
大模型 · @danieltvela
开发者danieltvela评测通义千问Qwen3.8-27B编程能力
称该模型可覆盖绝大多数编程主题,体验让其联想到2025年12月的Opus 4.5
开发者danieltvela评测通义千问Qwen3.8-27B编程能力
称该模型可覆盖绝大多数编程主题,体验让其联想到2025年12月的Opus 4.5
用户danieltvela在𝕏平台分享了对大模型Qwen3.8-27B的评测结果。他表示,Qwen3.8-27B完全可以应用在几乎所有编程相关任务中。
这次使用体验让他联想到了2025年12月使用Opus 4.5时的感受。
今天的 36 条信号到这里下一轮 12:30 更新
📬 订阅
https://ai-pulse-lab.com/feed.xml