社区讨论:多位用户质疑测试不严谨,有用户认为整个站点内容像AI生成的低质内容,测试结果不严谨,仅靠Claude验证不算合格。有用户指出标题应该标注量化信息,目前这类可及显卡的 benchmark 都只测单请求,应该补充并发场景下的 token 生成速度测试。还有用户认为这种测试对生产有用,但作为核心性能对比会造成误导。
今天发生了什么1 分钟读懂
Cursor 在 GitHub 再度宕机的同一天,发布了自有的代码托管平台 Origin,仓库、部署都可以留在 Cursor 内完成。对依赖 AI 编码的团队来说,GitHub 一家独大的托管市场多了一个新选项。
OpenAI 被传即将发布新模型系列 Astra,主打多智能体集群,可能定名 GPT-6,官方还没证实。开源这边,Qwen3.8-27B 用单张 24GB 消费级显卡就能跑出 50 token/秒,性能直追参数大近 30 倍的闭源模型。
扎克伯格发了一篇 6500 字长文,描绘 AI 为每个人配个人代理的乌托邦,质疑声却更响亮:TechCrunch 记者直言这封信"正是人们不喜欢 AI 的原因",这场争论详见今日深读。
02 MUZIM发布本地AI文件搜索工具 最高24TB存储 核心本地索引功能永久免费,全离线就能按语义搜本地各类文件,还能统一云端存储,给大模型传授权信息省90%输入token
以原生AI方式重新设计你的文件「查找器」。来认识 MUZIM——一款本地优先的AI文件代理,能把你散落的媒体资产变成可搜索的个人数字档案馆,依靠语义,而非文件名。
03 satvikpendem 发布Llama.cpp v0.1.0版本 这是本地运行大语言模型工具的首个正式版本,关注本地部署大模型的用户可以关注后续功能更新。
这是本地运行大语言模型工具的首个正式版本,关注本地部署大模型的用户可以关注后续功能更新。
04 整理了14个免费AI学习指南,不用到处搜了 包含OpenAI官方教程、吴恩达机器学习课程等不同方向的入门资源,新手可以直接按列表选学。
人们觉得学AI很难。其实不然。我找到了14个免费指南,省得你到处搜索: 1. OpenAI Academy - ChatGPT和OpenAI的官方学院。 2. Coursera - 跟Andrew Ng学机器学习。
今日焦点
扎克伯格再画AI乌托邦,人们为何不买账?
扎克伯格本周发了一篇6500字的文章,宣称“未来属于每个人”。他描绘的图景是:AI 会给每个人配一个了解你的目标、知道你在意什么的个人代理。
不是每个人都买账。TechCrunch 的 Equity 播客专门聊了这篇宣言。同事 Russell Brandom 在专栏里写,这封信“正是人们不喜欢 AI 的原因”。Rebecca Bellan 把这种反感讲得很清楚。
回到社交媒体时代,扎克伯格当年说的是:让每个人都有和朋友交流的渠道,都能拥有社交网络。结果大家得到的是愤怒诱导和广告,不是连接。Kirsten Korosec 觉得这篇宣言太过乐观。
深度阅读
🔥 信号雷达131 条
𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)
行业动态 · Hacker News▲ 46
专家证人让ChatGPT洗清3M全部责任
AI已经进入司法作证环节,这种利用AI生成倾向性法律内容的行为,会直接影响案件审判结果
专家证人让ChatGPT洗清3M全部责任
AI已经进入司法作证环节,这种利用AI生成倾向性法律内容的行为,会直接影响案件审判结果
行业动态 · Hacker News▲ 38
单24GB GPU跑Qwen3.8 27B达50TPS
普通消费级显存就能跑出这个推理速度,意味着大模型本地部署的门槛又降了一截
单24GB GPU跑Qwen3.8 27B达50TPS
普通消费级显存就能跑出这个推理速度,意味着大模型本地部署的门槛又降了一截
新品发布 · @harshilmathur▲ 5.9万
Razorpay发布Vulcan,印度首个支付AI基础模型
统一大模型替代多个独立方案解决支付问题,已在超五万家企业测试,提升支付成功率与欺诈识别效率,按月多完成十几万笔交易。
Razorpay发布Vulcan,印度首个支付AI基础模型
统一大模型替代多个独立方案解决支付问题,已在超五万家企业测试,提升支付成功率与欺诈识别效率,按月多完成十几万笔交易。
40亿笔支付。3万亿个数据点。用全部这些数据训练出了一个模型。来认识@Razorpay Vulcan——印度首个面向支付领域的基于Transformer的AI基础模型。
它在印度开发、训练和托管,合作方为@nvidia和@awscloud。
到目前为止,每个支付问题都是分开解决的:路由、欺诈、风险、个性化等等。我们提出了一个问题:如果能用一个模型理解资金的流动呢?
就像大语言模型在文本上训练来理解语言,Vulcan在支付数据上训练来理解资金如何流动。
它已经在超过51000家企业进行Beta测试,目前已经实现:
- 支付成功率提升8-10%——这是衡量一笔支付能否正常完成的核心指标
- 检测到的国际信用卡欺诈量提升8倍
- 识别出的欺诈或争议交易提升5倍
- 通过更好的结账个性化,每月多完成10-20万笔交易
而我们才刚刚起步。最棒的一点是:Vulcan每处理一笔支付,下一笔支付就会变得更智能。
我们花了数年时间建设为印度流转资金的基础设施。现在,我们正在建设能够理解并优化资金流动的智能。🔥
AI生成视频 · @mightyking▲ 31.1万
AI生成超逼真视频 终结AI内容不真实的争论
用户用Seedance 2.5生成1080p手持夜游码头视频,细节和真实UGC内容完全一致
AI生成超逼真视频 终结AI内容不真实的争论
用户用Seedance 2.5生成1080p手持夜游码头视频,细节和真实UGC内容完全一致
行业动态 · Hacker News▲ 214
Topfi 将 GPT-5.6 Sol 价格砍半
用更低的价格就能体验 GPT-5.6 Sol,使用同款模型的成本直接降低一半
Topfi 将 GPT-5.6 Sol 价格砍半
用更低的价格就能体验 GPT-5.6 Sol,使用同款模型的成本直接降低一半
社区讨论:多数体验过模型的用户认可GPT-5.6 Sol能力强,推理消耗更少token和时间,200美元的Pro套餐性价比很高。也有用户提出它处理简单任务时表现更差,容易过度复杂化,写待办事项会生成四页长文。有人指出本次降价仅限OpenRouter平台,不适用于OpenAI官方定价,还有用户猜测降价和Stripe收购OpenRouter有关,或是为了抢占市场份额。
前沿论文 · arXiv▲ 71
世界模型评测有了可追溯的推理链
世界模型评测首次引入分层子代理,把每个评估拆成可验证的推理链,在18个模型、330个案例上与人类判断高度一致。
世界模型评测有了可追溯的推理链
世界模型评测首次引入分层子代理,把每个评估拆成可验证的推理链,在18个模型、330个案例上与人类判断高度一致。
前沿论文 · arXiv▲ 44
让AI搭3D世界,开源模型反超闭源
让AI根据一句话搭出可交互的3D世界,这事现在连最强的模型都做不好——GPT-5.5和Qwen3.8-Max成功率不到60%,瓶颈卡在精确编辑3D物体上。
让AI搭3D世界,开源模型反超闭源
让AI根据一句话搭出可交互的3D世界,这事现在连最强的模型都做不好——GPT-5.5和Qwen3.8-Max成功率不到60%,瓶颈卡在精确编辑3D物体上。
让AI根据一句话搭出可交互的3D世界,这事现在连最强的模型都做不好——GPT-5.5和Qwen3.8-Max成功率不到60%,瓶颈卡在精确编辑3D物体上。但研究者发现,用强化学习专门训练开源模型,能补上这个短板:一个80亿参数的模型就能追平闭源巨头,300亿参数的旗舰版直接登顶。这不是你明天能用的工具,但它说明一件事:在需要动手操作真实3D环境的任务上,闭源模型的先发优势正在被开源+强化学习追平。
行业动态 · Hacker News▲ 128
用户讨论Anthropic对抗开源AI一事
大厂与开源AI的关系已经走到明面对抗的地步,行业走向可能影响普通用户能用到的免费AI工具。
用户讨论Anthropic对抗开源AI一事
大厂与开源AI的关系已经走到明面对抗的地步,行业走向可能影响普通用户能用到的免费AI工具。
社区讨论:有人认为Anthronic虽然理念偏向狂热教派,但已经公开了自身核心观点,读者可自行查阅判断。有人指责Anthropic的行为是给AI套上束缚,而非提供工具,还有人认为整个大模型行业急需联邦监管,从业者的信息透明度和财务规范都符合欺诈特征,应该参照武器出口进行监管,同时指出Anthropic是行业中独特的危险存在,不确定其他巨头是否只是更擅长隐藏自身问题。部分网友顺带吐槽当前未登录状态下的X(原Twitter)体验极差,还质疑这篇反Anthropic的长文是AI生成,可读性很差。
行业动态 · Hacker News▲ 105
Cursor 推出 Origin 替代 GitHub
GitHub 一家独大的代码托管领域多了新选择,开发者未来可能多一个可选平台
Cursor 推出 Origin 替代 GitHub
GitHub 一家独大的代码托管领域多了新选择,开发者未来可能多一个可选平台
社区讨论:部分人认为GitHub近期问题频发,现在正是AI公司替代它的好时机,也好奇这次替代能否动摇GitHub的网络效应。有人指出新工具命名为Origin会让LLM产生语义混淆,也吐槽名字辨识度低,还有付费测试版网站占用100%CPU,产品只是GitHub克隆,没有在协作版本控制方向创新。有人质疑全非公开、需要账号才能浏览仓库的模式没法真的替代GitHub,还有人因公司相关负面丑闻拒绝在该平台托管代码。
人工智能 · @GavinSBaker▲ 123.8万
行业人士称Grok Bot堪称AI领域又一个Claude Code时刻
科技人士评价Grok Bot大幅提升AI使用效率,功能体验出色
行业人士称Grok Bot堪称AI领域又一个Claude Code时刻
科技人士评价Grok Bot大幅提升AI使用效率,功能体验出色
我认为@bot是AI领域又一个“Claude Code”时刻。我个人的AI使用量估计已经增长了差不多100倍。
每个来问我怎么搭建“播客摘要工具”的人,我都想说,我在Grok Bot里花了大概15秒就做好了,效果比我之前用过的都要好。
这就是@bot讲述的GrokBot起源故事。遗憾的是,它目前既没有分享功能,也没有iPad应用,但我得到消息说这两样很快都会推出:
行业动态 · Hacker News▲ 42
以色列创建虚假智库,试图误导AI聊天机器人
AI聊天机器人正在成为信息战的新目标,普通用户获取信息时更需要注意核实来源。
以色列创建虚假智库,试图误导AI聊天机器人
AI聊天机器人正在成为信息战的新目标,普通用户获取信息时更需要注意核实来源。
🔥 热点追踪 · @NousResearch▲ 120.5万
NousResearch 为 Hermes Desktop 发布 Bot Mode 功能
NousResearch 推出 Bot Mode,可创建带独立配置的专属智能体,支持跨模型使用,还可实现智能体之间互相通信。目前已有从业者开始测试相关功能,观察实际体验效果。
NousResearch 为 Hermes Desktop 发布 Bot Mode 功能
NousResearch 推出 Bot Mode,可创建带独立配置的专属智能体,支持跨模型使用,还可实现智能体之间互相通信。目前已有从业者开始测试相关功能,观察实际体验效果。
大模型 · @MaxForAI▲ 5.7K
27B小模型性能追平大自己28倍的大模型
小模型靠优化训练数据和推理方法,性能已经接近参数大一个数量级的顶级闭源模型,普通用户可以在笔记本本地运行它
27B小模型性能追平大自己28倍的大模型
小模型靠优化训练数据和推理方法,性能已经接近参数大一个数量级的顶级闭源模型,普通用户可以在笔记本本地运行它
Qwen3.8-27B的性能已经接近比它大 28 倍的 GLM5.2 了🔥 太夸张了,一个只有 27B、能在本地跑的模型,在AA的测试里直接拿到了 52 分,已经和一众顶级闭源模型挤在同一档。更离谱的是,GLM5.2 的参数规模接近它的 28 倍,但两者实际效果已经非常接近。参数量差了一个数量级,最终能力却只差这么一点。
这也是最近小模型越来越明显的趋势:更好的训练数据、后训练和推理方法,正在不断把过去靠堆参数才能得到的能力压缩进更小的模型里。以前本地模型意味着「能跑就行」。现在 27B 的本地模型,已经开始直接和超大云端模型坐一桌了。
AI生成内容 · @agi_aibusi▲ 6.5K
现在AI生成内容,哪怕改动效也一眼能看出来
AI生成视频和AI生成广告图一样,即使脚本和拍摄都没问题,只要出现特征化的角色设计和画面颗粒噪点,观众就能立刻识别出来
现在AI生成内容,哪怕改动效也一眼能看出来
AI生成视频和AI生成广告图一样,即使脚本和拍摄都没问题,只要出现特征化的角色设计和画面颗粒噪点,观众就能立刻识别出来
如今视频生成已经可以通过 Codex 实现自动控制,绕了一圈后,「图像」的差异反而变得愈发明显。
最近大家都在说「ChatGPT 的广告好违和!」对吧?其实这种现象,在 AI 生成的视频里也完全一模一样。
不管脚本写得多好,不管你对演出效果多讲究,当那一眼就能认出「哦,这是 ChatGPT 做的!」的角色设计,带着颗粒噪点的画面一出来,观众瞬间就没看下去的欲望了。
内容本身不错,却在入口就被划走,这真的太可惜了。
希望大家不要误解,这不是 ChatGPT 的问题。GPT-Image-2.0 的编辑能力非常出色,通过调整提示词也能在一定程度上做出差异化。
但 GPT 模型特有的那种画面质感,已经被大众看腻了,这是事实。
所以哪怕只是在角色设计上,用 Midjourney 或者其他模型做出差异化,光靠这一步,第一印象就会天差地别。
自动化程度越高,大家就越容易用相同的素材生成大同小异的画面,在这种环境下,能拉开差距的只有两点:
・脚本(分镜)
・角色设计
AI 视频的胜负,其实在你按下生成按钮之前,就已经基本决定了。
硬件 · @GOROman▲ 3.9K
有人做了能对着发AI指令的智能戒指
对着戒指说话,指令会经手机和云端服务器,最终传到家里电脑的Codex大模型,帮你完成操作
有人做了能对着发AI指令的智能戒指
对着戒指说话,指令会经手机和云端服务器,最终传到家里电脑的Codex大模型,帮你完成操作
做到了!!!
!我成功做出了能对着戒指说话就能给AI发指令的功能!#Vibe指輪コーディング 流程:Pebble Index 01 → iPhone App → MCP Server (Cloudflare Workers)→ 家里Mac上的Codex
开源 · @BSCNews▲ 1.3万
NEAR AI发布IronClaw 1.2,支持多用户智能体
这个开源平台新增了多用户智能体支持和开放工具连接能力,满足团队协作开发AI工具的需求
NEAR AI发布IronClaw 1.2,支持多用户智能体
这个开源平台新增了多用户智能体支持和开放工具连接能力,满足团队协作开发AI工具的需求
NEAR AI 推出了支持多用户代理与开放工具连接的 IronClaw 1.2。
@NEARProtocol AI 发布了其开源安全代理平台 @IronClawAI 的 1.2 版本,新增支持所有兼容 MCP 的工具,覆盖从 CRM 到内部 API 的各类场景。
代理现在可以在 Slack 频道和 Telegram 群组内运行,每一条消息都会在发送者自身的身份、权限与审批规则下执行。
本次更新将频道历史视为不可信内容,而非操作指令。它还会在代理读取公共频道内容时防护提示注入攻击。
IronClaw 运行在 NEAR AI Cloud 的加密飞地中,将用户密钥保存在模型之外。
视频编辑 · @Byp215Bai▲ 6.9K
Qwen-Video-Edit不用视频预训练也能剪视频
它直接用预训练图像编辑模型操作视频隐空间,就能完成视频编辑,简化了AI视频编辑的流程
Qwen-Video-Edit不用视频预训练也能剪视频
它直接用预训练图像编辑模型操作视频隐空间,就能完成视频编辑,简化了AI视频编辑的流程
Introducing Qwen-Video-Edit 📷
视频编辑比你想的更简单:一个预训练图像编辑模型就能编辑视频——直接在视频VAE潜变量上操作。不需要经过视频预训练的骨干网络。
🌐 项目页面:
AI工具 · @aiedge_▲ 1.4万
把两个AI工具叠一起,能做出最强智能体
多数人分开用Grok Bot和Hermes,作者说把它们组合堆叠,才能发挥出两者的最大能力
把两个AI工具叠一起,能做出最强智能体
多数人分开用Grok Bot和Hermes,作者说把它们组合堆叠,才能发挥出两者的最大能力
行业动态 · @Scobleizer▲ 1.5万
xpander_ai Omni获750万美元融资 能自建AI代理
能让IT部门同意使用,还支持云端运行和管理,想自己搭AI工作流的话可以多一个选择。
xpander_ai Omni获750万美元融资 能自建AI代理
能让IT部门同意使用,还支持云端运行和管理,想自己搭AI工作流的话可以多一个选择。
看好了。他们简直就拍了一条「Mac vs PC」风格的广告……只不过这次是给智能体拍的。
左边:一个小哥自己搭建智能体。智能体只存在他的笔记本电脑上。一合盖子 → 咻,永远没了。IT 部门已经哭晕了。
右边:另一个小哥只用问问 Omni,就能继续推进项目。智能体跑在云上。全有日志记录。管控呢?IT 部门居然说「同意」了。
这个反转感受完全不一样:Omni 不只是一个智能体。Omni 是能搭建其他智能体的智能体。
David 就是靠着这股劲刚融到了 $7.5M。多玩家时代已经有了第一个真正的平台。
@xpander_ai @dudutwizer
前沿研究 · @Jaeyeon_Kim_0▲ 7.7K
Jaeyeon Kim 研究团队发布LatentMDM 模型、FlexMDM 模型(6个月)
新提出的LatentMDM在相同推理预算下,性能首次超过带KV缓存的AR模型,或将改进生成式AI的推理效率。
Jaeyeon Kim 研究团队发布LatentMDM 模型、FlexMDM 模型(6个月)
新提出的LatentMDM在相同推理预算下,性能首次超过带KV缓存的AR模型,或将改进生成式AI的推理效率。
很高兴向大家分享我们过去6个月的研究成果。
我们真的能把掩码扩散称为「任意顺序」模型吗?在我们的最新工作中,我们提出:现成的掩码扩散模型具备任意顺序预测能力,但无法以「真正的任意顺序方式」推理。
我们推出了两款能做到这点的模型:LatentMDM 和 70 亿参数规模的 FlexMDM,是我们之前工作的延伸。
我们的新型隐空间掩码扩散模型 LatentMDM,在推理预算匹配的情况下,在 TinyGSM 上的表现超过了带 KV 缓存的自回归模型(AR)。据我们所知,LatentMDM 是在相同设置下做到这一点的首个模型。
这是联合研究成果,共同第一作者为 @seunggeun_kr、@tklll_tx 和 Yuyuan Chen,指导老师为 @du_yilun、@ShamKakade6 和 @sitanch。
新品发布 · @aigclink▲ 3.2K
郑耀威发布PenguinHarness,成本仅Claude Code1/70
搭AI Agent原来需要手写代码编排,现在只需要说一句话就能生成完整应用。普通开发者也能低成本快速本地化部署自进化Agent。
郑耀威发布PenguinHarness,成本仅Claude Code1/70
搭AI Agent原来需要手写代码编排,现在只需要说一句话就能生成完整应用。普通开发者也能低成本快速本地化部署自进化Agent。
深度观点 · @ZackKorman▲ 380
ZackKorman用一张图总结AI网安风险辩论
浓缩了业内针对AI网络安全风险的争议讨论
ZackKorman用一张图总结AI网安风险辩论
浓缩了业内针对AI网络安全风险的争议讨论
实战经验 · @LinusEkenstam▲ 2.0K
用Perplexity vibe coding做柠檬水摊管理系统
vibe coding已经可以从需求直接生成完整可用的工具,哪怕只是给小孩摆柠檬水摊的小需求,也能一次性配齐全功能管理工具
用Perplexity vibe coding做柠檬水摊管理系统
vibe coding已经可以从需求直接生成完整可用的工具,哪怕只是给小孩摆柠檬水摊的小需求,也能一次性配齐全功能管理工具
为了给柠檬水摊提供支持,我们用 Perplexity vibe coding 开发了一套适合孩子使用的POS系统和完整管理后台,来运营摊位 🤯
> SKU 管理
> 销售概览
> 客户 CRM
> 销售成本监控
> 天气
> 柠檬水批次管理
Lou 和柠檬水摊一样,都在用得很开心。
新品发布 · @HuggingModels▲ 7.3K
@HuggingModels发布Qwen3.8-9B多模态模型
这款9B参数的小模型同时支持推理、函数调用、图文理解,能直接部署用于实际场景,轻量化多模态方案又多了一个新选择。
@HuggingModels发布Qwen3.8-9B多模态模型
这款9B参数的小模型同时支持推理、函数调用、图文理解,能直接部署用于实际场景,轻量化多模态方案又多了一个新选择。
你是否一直想要一款能推理、调用函数,同时理解图像和文本的模型?来认识一下 Qwen3.8-9B 吧,这是一款紧凑的 9B 规格算力模型,融合了视觉与语言能力。
它为现实世界任务打造,适用场景从聊天机器人到智能代理都包含。
目前它已有 540 次下载和 102 个赞,已经引发了不少关注。
我们这就深入了解!
深度观点 · @bindureddy▲ 9.8K
bindureddy评价Qwen 3.8 27B开源表现优异
想找Luna的开源平替做小分类器和快速推理,这个小模型可以直接替换使用,不用额外调整适配。
bindureddy评价Qwen 3.8 27B开源表现优异
想找Luna的开源平替做小分类器和快速推理,这个小模型可以直接替换使用,不用额外调整适配。
新品发布 · @NVIDIARTXSpark▲ 9.6K
英伟达推本地AI工具 UnslothAI Desktop提速20%
本地运行、微调AI模型不用依赖云端服务,性能有实实在在的提升,想离线跑大模型多了一个新选择
英伟达推本地AI工具 UnslothAI Desktop提速20%
本地运行、微调AI模型不用依赖云端服务,性能有实实在在的提升,想离线跑大模型多了一个新选择
本地 AI 刚刚迎来重大升级。你现在可以通过 @UnslothAI Desktop 在本地微调并运行 AI 模型。
此外,借助我们推出的全新优化,llama.cpp 的性能最高可提升 20%(来自 @ggerganov)。
行业动态 · @OzakAGI▲ 5.7K
OzakAGI与4AI开启6天联盟系列活动
双方都认同多专业智能体协作优于单一大模型包揽所有任务,想尝新玩法的可以去参与任务拿积分
OzakAGI与4AI开启6天联盟系列活动
双方都认同多专业智能体协作优于单一大模型包揽所有任务,想尝新玩法的可以去参与任务拿积分
Alliance Series 活动继续 🚀 在我们建立合作关系的同时,我们即将与 4AI 共同开启为期 6 天的 Alliance Series 活动。
4AI 是一个运行在 BSC 上的去中心化 AI 社区,开发者和用户可以在这里构建、分享和部署自主智能体。他们平台支持多个智能体实时协作,在彼此之间共享知识,并自动把任务分配给能力最匹配的智能体 🧠
以下是这 6 天的活动安排:
- 在 Ozak AI Rewards Hub 参与联合任务。完成任务,赚取 XP,同时参与两个社区的活动
- 本周会举办 4 场 X Spaces,两队将展开真实对话,实时回答提问,并介绍双方各自正在构建的项目
- 所有内容都会在我们全渠道同步更新,无论你在哪关注我们,都不会错过任何信息
我们两队都认同:专业智能体协同工作,胜过单个模型包办一切。这会是很棒的一周 🤝
点击链接前往奖励中心参与:🚀
前沿研究 · @ai_for_success▲ 4.5K
Qwen3.8-27B 跑分52 可本地运行
五千到六千美元的本地设备就能跑,性能达到了一流水平,想本地部署大模型有了更强的开源选择
Qwen3.8-27B 跑分52 可本地运行
五千到六千美元的本地设备就能跑,性能达到了一流水平,想本地部署大模型有了更强的开源选择
Qwen3.8-27B 在 Artificial Analysis 上拿到了 52 分。
一个 27B 参数的开源模型,能轻松在 5000 到 6000 美元的本地设备上运行,说实话甚至用更便宜的配置也行,能达到这个竞争水平太疯狂了。
开源万岁。🔥
深度观点 · @zetalyrae▲ 4.5K
@zetalyrae 讨论AI对齐是思想终止套话
这会影响普通人对AI安全议题的讨论方向
@zetalyrae 讨论AI对齐是思想终止套话
这会影响普通人对AI安全议题的讨论方向
深度观点 · @Grow_withAI▲ 1.4K
Ken Huang发布《OpenClaw AI in Production》指南(6)
做生产级AI智能体不用再拼凑脆弱原型,这套经过验证的架构方案覆盖扩容、安全、故障处理全环节,可直接落地可用系统。
Ken Huang发布《OpenClaw AI in Production》指南(6)
做生产级AI智能体不用再拼凑脆弱原型,这套经过验证的架构方案覆盖扩容、安全、故障处理全环节,可直接落地可用系统。
新品发布 · @Weixin_WeChat▲ 3.3万
微信(企业微信)发布CLI与MCP升级能力(十)
各类主流自建AI Agent都能直接调用企业微信十大办公能力,所有规模企业都可接入,没有人数资质限制,降低企业AI办公改造门槛
微信(企业微信)发布CLI与MCP升级能力(十)
各类主流自建AI Agent都能直接调用企业微信十大办公能力,所有规模企业都可接入,没有人数资质限制,降低企业AI办公改造门槛
自建的AI Agent,现在也可以接入企业微信。企业微信全面升级CLI与MCP能力。WorkBuddy、Deepseek Harness、Minimax Code等主流AI Agent均可直接调用企业微信的文档、表格、邮件、会议、日程、通讯录等十大办公能力模块。
企业还可以通过企业微信开放接口,接入自主开发的 AI Agent。该能力面向所有规模的企业开放,不再受企业人数、资质等门槛限制。立即开始体验:
前沿研究 · @askalphaxiv▲ 3.3K
AutoDesign不调模型权重 反而提性能超Claude
传统提升AI Agent性能靠改模型权重,这项研究找到了另一条路径,可帮所有测试的Agent模型提升效果,性能超过了Claude Design。
AutoDesign不调模型权重 反而提性能超Claude
传统提升AI Agent性能靠改模型权重,这项研究找到了另一条路径,可帮所有测试的Agent模型提升效果,性能超过了Claude Design。
《AutoDesign:面向长周期智能体设计的元框架优化》
AutoDesign 让智能体优化模型周边的系统,而非模型权重。
它设计了一个修复当前产出物的内循环,以及一个从轨迹失败中学习并更新框架本身的外部元框架循环。
这个经过学习的框架让全部 7 个被测智能体-模型配置在 PosterBench 上提升了 5.0–19.6 分,并且 AutoDesign 比 Claude Design 高出 7.45 分。
行业动态 · @mark_k▲ 2.2万
传OpenAI本周将发布Astra AI模型系列
传闻该模型主打包群体智能体能力,数学能力较强,正式定名仍不确定,可能会叫GPT-6,关注大模型更新的可以留意本周动态。
传OpenAI本周将发布Astra AI模型系列
传闻该模型主打包群体智能体能力,数学能力较强,正式定名仍不确定,可能会叫GPT-6,关注大模型更新的可以留意本周动态。
越来越多传闻称,@OpenAI 将于本周推出他们的下一代AI模型系列“Astra”。
我们可以确定的是,Astra 将重度依赖智能体集群,并且在数学能力上表现强劲。
我们无法确定的是它的官方名称。它有可能会被命名为 GPT-6。
实战经验 · @gosrum▲ 3.8K
数月没登Discord,AI还在自己循环成长
计划把Hermes Agent训练的旧模型换成GLM-5.3,登录才发现没人看管的旧模型还每天自动跑成长周期,开发者看了感慨
数月没登Discord,AI还在自己循环成长
计划把Hermes Agent训练的旧模型换成GLM-5.3,登录才发现没人看管的旧模型还每天自动跑成长周期,开发者看了感慨
本来打算把用 Hermes Agent 训练的 AI 模型换成 GLM-5.3,于是隔了几个月去 Discord 看了一眼。
发现就算没人关注,它每天也在乖乖循环成长周期,看到这一幕我感觉有点难过🐦
实战经验 · @gp_pulipaka▲ 3.8K
NiuTrans发布《LLM基础》免费开源电子书
想系统学习大语言模型与自然语言处理,不用再付费找零散入门资料,这份免费开源资源可以直接用。
NiuTrans发布《LLM基础》免费开源电子书
想系统学习大语言模型与自然语言处理,不用再付费找零散入门资料,这份免费开源资源可以直接用。
《大语言模型基础》!—— 免费电子书 + PDF + GitHub
下载PDF:免费开放获取书籍
GitHub:NiuTrans NLPBook
完整书籍包含自然语言处理 + 神经网络 + 大语言模型
涉及主题:大语言模型 • Transformers • 生成式AI • 预训练 • 基础模型 • 提示工程 • 思维链 • 对齐 • RLHF • DPO • 推理 • 解码 • KV缓存 • 缩放 • NLP • 深度学习 • 人工智能 • 机器学习
标签:#BigData #Analytics #DataScience #AI #MachineLearning #NLProc #LLM #GenerativeAI #DeepLearning #PyTorch #Python #TensorFlow #CloudComputing #DataScientist #Linux #Mathematics #Programming #Coding #100DaysofCode
免费电子书PDF:arXiv:
GitHub:
完整NLPBook:
PDF:
深度观点 · @lidangzzz▲ 5.0万
大V观点:VLM和世界模型都是死路
提出同等参数规模下,纯文字LLM Agent能解决的问题难度远高于VLM Agent,从业者选技术方向可以参考这个判断
大V观点:VLM和世界模型都是死路
提出同等参数规模下,纯文字LLM Agent能解决的问题难度远高于VLM Agent,从业者选技术方向可以参考这个判断
我为什么反复强调VLM(multimodal,多模态)是死路一条,世界模型更是臭狗屎。
一个最简单的第一性原理,100k tokens文字的信息量,远远高于图片,更远远远远高于视频,这些量文字形式能解决一些超级复杂完备的问题,而对于VLM输入图片,信息极其稀疏,能解决的问题基本约等于狗几把。
如果人类在1T~10T的VLM Agent能解决一个难度为X的问题, 那么同等模型下,对应纯文字LLM Agent给足上下文、memory、wiki、信息,全部以pure text和structured data形式准备好,并且通过text/bash/cli/api/mcp形式获取信息,那么这个LLM Agent一定能解决难度为1000X的问题。
等到VLM强大到让一个VLM Agent解决难度为1000X的问题的时候,LLM Agent已经可以解决(1000^2) * X难度的问题了。
就这么简单一个道理,绝大多数人根本想不明白。
文生视频 · @LudovicCreator▲ 1.9K
创作者分享Seedance 2.5情绪对话文生视频第二次测试
本次测试围绕恐惧情绪生成,创作者公开了完整提示词并询问效果
创作者分享Seedance 2.5情绪对话文生视频第二次测试
本次测试围绕恐惧情绪生成,创作者公开了完整提示词并询问效果
视觉特效 · @CharaspowerAI▲ 5.4K
AI生成文字视觉特效:火涡锻造出单词IGNITE
作品由MiniMax的Hailuo H3生成,用户分享了完整的生成提示词
AI生成文字视觉特效:火涡锻造出单词IGNITE
作品由MiniMax的Hailuo H3生成,用户分享了完整的生成提示词
如果你喜欢文字视觉特效(VFX),会喜欢这个生成作品。
一个巨型火焰漩涡在屏幕上锻造出单词“IGNITE”,随后火焰在全屏炸开,整个作品由Hailuo H3生成。
完整的生成提示词为:超电影感宽镜头:广阔的余烬原野延伸至黑暗中,突然一道巨大火墙扫过地面,将数十亿发光火星抛向空中。火焰扭曲成一个数百英尺(约几十米)高的巨型旋转火涡,熔化的余烬、烟雾和流动火焰缠绕盘旋,由熊熊火焰自然锻造出单词“IGNITE”。字母亮度不断升高,随后爆发为巨大冲击波,让整个屏幕布满火焰与炽热粒子,要求达到好莱坞火焰模拟、超写实视觉特效、大片标题展示的效果。
AI视频 · @YourAlphaMom▲ 2.7万
创作者分享Seedance 2.5生成荒诞AI视频的提示词
两段15秒AI生成视频经手工拼接,呈现荒诞超现实喜剧场景,给出两段完整提示词
创作者分享Seedance 2.5生成荒诞AI视频的提示词
两段15秒AI生成视频经手工拼接,呈现荒诞超现实喜剧场景,给出两段完整提示词
工具技巧 · @vnord42xw
用户分享Vencord视频功能修复操作步骤
无需VPN即可恢复功能,官方Discord无法使用可换Canary或PTB版本
用户分享Vencord视频功能修复操作步骤
无需VPN即可恢复功能,官方Discord无法使用可换Canary或PTB版本
正在使用网页版或桌面版Vencord的用户,可以通过插件设置恢复功能。操作步骤为:在插件中开启实验功能,在实验功能里搜索video-guard,随后选择「Not Eligible」,功能即可恢复正常,操作全程不需要使用VPN。
如果在官方Discord上无法完成操作,可以尝试使用Canary版本或PTB版本。分享该方法的用户本人就是通过Discord PTB完成操作的。
相关操作演示和细节可查看原文附带的四条链接。
金融 · @6_eared▲ 289
券商给AI Agent开放独立交易账户 可自主交易多品类资产
采用划定活动边界替代逐笔人工确认,不提供信用杠杆,Agent拥有独立持续经济操作空间
券商给AI Agent开放独立交易账户 可自主交易多品类资产
采用划定活动边界替代逐笔人工确认,不提供信用杠杆,Agent拥有独立持续经济操作空间
云服务 · @kenn▲ 1.6万
开发者分享低成本Cloudflare+AI自动生成会议纪要方案
基于Cloudflare的AI工作流可自动生成分享会议纪要,越用越高效
开发者分享低成本Cloudflare+AI自动生成会议纪要方案
基于Cloudflare的AI工作流可自动生成分享会议纪要,越用越高效
无需担心成本就能使用的 Cloudflare 技术栈用来放 AI 报告真的很棒!> 会议结束后,只要对 Claude Code 说一句「用 Kanary 做文字转写,整理成会议纪要,再通过 as 分享给客户」。就这样就能把会议纪要送到对方手里了。
> 而且过去的会议纪要都存在 as 里,所以 Claude Code 可以从中提取出席者姓名和上次会议的上下文,用得越多,需要手动修改会议纪要的地方就越少。> 这种「越积累越轻松」的感觉,是过去把文件扔在 Slack 里的时候完全没有的。
自动化 · @goro2_traveler▲ 9.3K
非程序员用Claude Code实现民泊运营自动化12法
非编程人员无需手写代码,用Claude Code自动化民泊全流程运营
非程序员用Claude Code实现民泊运营自动化12法
非编程人员无需手写代码,用Claude Code自动化民泊全流程运营
智能Agent · @dotey▲ 2.9万
博主体验豆包更新后多项功能对标Codex,部分实现超越
博主体验更新后豆包,其多项功能设计对标Codex,部分已实现本土化超越
博主体验豆包更新后多项功能对标Codex,部分实现超越
博主体验更新后豆包,其多项功能设计对标Codex,部分已实现本土化超越
大语言模型 · @NFT_Chen▲ 2.1万
J-Space实测提升DeepSeek V4 Pro性能 已开源即插即用
J-Space修复DeepSeek V4 ProAgent场景短板,性能超越多款顶流模型
J-Space实测提升DeepSeek V4 Pro性能 已开源即插即用
J-Space修复DeepSeek V4 ProAgent场景短板,性能超越多款顶流模型
开发工具 · @zjp1997720▲ 3.0K
zjp1997720发布codex-image-gen 工具(零依赖)
不需要中转API,还支持并行出图,直接复用已登录的Codex CLI授权状态,只需要一个Python小脚本就能用。
zjp1997720发布codex-image-gen 工具(零依赖)
不需要中转API,还支持并行出图,直接复用已登录的Codex CLI授权状态,只需要一个Python小脚本就能用。
【一个skill让任何Agent可以调用Codex的生图能力】 WorkBuddy想用Codex的GPT image 2,根本不需要中转API!
离谱的是,还可以并行出图!
codex-image-gen 直接复用你已登录的 Codex CLI OAuth 态:自动刷新 token、带上必需请求头、解析 SSE 流、落地本地 PNG——一个零依赖 Python 脚本。
Claude Code / Codex / DeepSeek Harness,任何Agent都能用。
一键安装:npx skills add zjp1997720/zhijian-skills --skill codex-image-gen
欢迎star🌟:
开发工具 · @FishAudio▲ 6.7K
Fish Audio MCP 支持接入多款主流AI Agent
只需要一个统一接口,就能在已搭建好的Claude、Codex CLI等AI Agent里调用自己的音色生成语音。
Fish Audio MCP 支持接入多款主流AI Agent
只需要一个统一接口,就能在已搭建好的Claude、Codex CLI等AI Agent里调用自己的音色生成语音。
来认识一下 Fish Audio MCP。用你自己的声音,接入你已经在构建的任意智能体 🪄——支持 Claude、Codex CLI、Cursor 和 Windsurf。
一个端点就能适配你已经在使用的所有智能体。
✅搜索最优声音
✅生成语音
✅转录音频
✅查看用量
所有功能都能直接在你的工作流内完成。快来试用 🎣
金融 · @0xBeyondLee▲ 7.1K
扎根预测市场的AI交易工具NeoTrade上线了
这类AI交易工具并不多见,和普通AI交易工具不同,它能在用户授权范围内直接执行交易操作。
扎根预测市场的AI交易工具NeoTrade上线了
这类AI交易工具并不多见,和普通AI交易工具不同,它能在用户授权范围内直接执行交易操作。
千呼万唤始出来,NeoSoul 的 AI Agent 今天终于上线了,定名 NeoTrade 辨识度很高 AI 交易工具很多,但扎根于预测市场的 AI 交易工具真没几个,NeoTrade 的领显优势很明显,希望可以保持 对比之前测评过的交易产品 Copilot,NeoSoul 的特点很鲜明,如果说 Copilot 实在众多标的中找到最具潜力的并给出建议,那 NeoSoul 则更进一步在授权范围内执行决策 我愿意称之为可控的 AI,足够聪明,但又不会越界 生于量化,高于量化,自我迭代,无限进步
职场 · @Kay2289123▲ 1.6万
硅谷20人AI团队管理者吐槽AI带来新麻烦
AI生成了太多冗杂的项目文档,管理者读完后大脑已经装不下更多信息,问成员细节对方也答不上,得重新让AI生成答案。
硅谷20人AI团队管理者吐槽AI带来新麻烦
AI生成了太多冗杂的项目文档,管理者读完后大脑已经装不下更多信息,问成员细节对方也答不上,得重新让AI生成答案。
开发 · @hshimodaira▲ 1.2万
用AI写代码,验证答案花的token比生成多好多
开发者先用AI输出代码结果,后续验证这些结果正确性的过程,消耗的token数量是生成步骤的数倍。
用AI写代码,验证答案花的token比生成多好多
开发者先用AI输出代码结果,后续验证这些结果正确性的过程,消耗的token数量是生成步骤的数倍。
嗯,我也这么想。就我自己的情况来说,比起用 codex 或是 claude code 先得出答案的步骤,花在验证上的 token 要多上好几倍。
对此我选择离开数学界。我将从「发现答案」,转向构建能够对答案进行验证的系统。
大模型评测 · @Jeremybtc▲ 1.1万
开发者实测两款大模型生成实速3D加密货币区块图
用完全相同的提示词,让两个大模型分别生成能够展示比特币、以太坊、Solana出块速度的实时3D可视化效果。
开发者实测两款大模型生成实速3D加密货币区块图
用完全相同的提示词,让两个大模型分别生成能够展示比特币、以太坊、Solana出块速度的实时3D可视化效果。
我用完全相同的提示词测试了 GLM 5.3 和 GPT 5.6 Sol。
我要求两者生成一个实时3D可视化,展示 Bitcoin、Ethereum 和 Solana 以真实出块速度生产区块。
第一个视频是 GLM 5.3,第二个是 GPT 5.6 Sol。
这轮我让大家自己来判断。
前沿研究 · @Ryrenz▲ 2.4K
PosterCraft 专门解决AI做海报中文文字乱的问题
普通用户做海报不用再手动改歪字缺字,有显存不够的设备也能跑,开放权重和数据集支持自行部署微调
PosterCraft 专门解决AI做海报中文文字乱的问题
普通用户做海报不用再手动改歪字缺字,有显存不够的设备也能跑,开放权重和数据集支持自行部署微调
新品发布 · @shengkunye▲ 9.1K
Monid 发布 Monid Discover 可自行找工具干活
AI 代理能自己搜索超1300个工具、对比价格、调用付费完成任务,不用人提前找好工具配好流程
Monid 发布 Monid Discover 可自行找工具干活
AI 代理能自己搜索超1300个工具、对比价格、调用付费完成任务,不用人提前找好工具配好流程
你的智能体现在可以自主发现新工具了。我们推出 Monid Discover。
你的智能体可以:
> 搜索超过1,300个API与工具
> 对比供应商
> 查看定价
> 在运行时调用工具并完成支付
等你问到它用了哪些工具的时候,工作早就做完了。
实战经验 · @liyue_ai▲ 1.3万
liyue_ai分享Seedance 2.5适配的优化提示词
实测后这次生成的视频整体流畅,没出现大的物理逻辑问题。想要用Seedance 2.5生成稳定视频可以直接参考这套结构化提示词。
liyue_ai分享Seedance 2.5适配的优化提示词
实测后这次生成的视频整体流畅,没出现大的物理逻辑问题。想要用Seedance 2.5生成稳定视频可以直接参考这套结构化提示词。
新品发布 · @tom_doerr▲ 6.1K
Startup Skill发布开源创业想法验证工具包
还没写代码就能验证创业想法,直接生成全市场调研、竞品分析等报告,比付费战略咨询便宜,能兼容Claude Code使用
Startup Skill发布开源创业想法验证工具包
还没写代码就能验证创业想法,直接生成全市场调研、竞品分析等报告,比付费战略咨询便宜,能兼容Claude Code使用
Startup Skill 用一个开源工具包替代了昂贵的战略咨询顾问,它可以让你在编写代码前验证你的创业想法。
它能即时输出完整市场调研、竞品分析卡、产品定位和财务预测。
该工具支持搭配 Claude Code 使用。
深度观点 · @HackingDave▲ 3.4K
工程师父亲带娃学AI 孩子大学选了AI专业
想让孩子抓住AI行业机会的家长,可以参考这套每周几小时的家庭启蒙路径,已经培养出明确选方向的结果
工程师父亲带娃学AI 孩子大学选了AI专业
想让孩子抓住AI行业机会的家长,可以参考这套每周几小时的家庭启蒙路径,已经培养出明确选方向的结果
大约三年前,我每周花几个小时教我的孩子网络、协议、编码等基础知识。
过去一年,我每周花几个小时讲解AI,向他们展示如何用codex、claude开发自己的项目,要求他们下周汇报自己的进展。
过程很有意思,他们学到了很多,也能真切体会到自己做的所有事情的价值。
我儿子将要去大学读AI+网络安全专业,他已经做好了充分准备。
我的另一个儿子明天就要去高中职业中心上学,他选的方向是网络安全课程。我肯定会经常去那里做分享。
行业动态 · @Xudong07452910▲ 3.3K
Anthropic分享企业Agent落地实用路线
非技术员工也能自己搭建能用的生产Agent,企业落地Agent的门槛不在开发,而在配套管理基础设施。
Anthropic分享企业Agent落地实用路线
非技术员工也能自己搭建能用的生产Agent,企业落地Agent的门槛不在开发,而在配套管理基础设施。
新品发布 · @dotey▲ 3.0万
Cursor推出Origin托管平台 为AI设计底层架构
如果已经在用Cursor的云端智能体跑代码任务,整个流程不用跳出Cursor就能完成,能解决传统托管平台拖AI并行开发后腿的问题。
Cursor推出Origin托管平台 为AI设计底层架构
如果已经在用Cursor的云端智能体跑代码任务,整个流程不用跳出Cursor就能完成,能解决传统托管平台拖AI并行开发后腿的问题。
实战经验 · @Voxyz_ai▲ 1.8万
Hermes Desktop 推出 Bot Mode 多代理协作功能
多智能体竞争开始比拼协作体验,机器人交接、群组对话能不能用顺,会成为下一阶段的竞争核心
Hermes Desktop 推出 Bot Mode 多代理协作功能
多智能体竞争开始比拼协作体验,机器人交接、群组对话能不能用顺,会成为下一阶段的竞争核心
Competition has Hermes moving fast lol. 笑死,竞争让Hermes动作快了起来。
这些天我把一部分工作转移到Grok Bot里测试它。Bot-to-Bot交接和群聊已经内置在产品里了。
交接流程顺畅,群聊功能也能用。现在Hermes Desktop也推出了Bot模式。所有现有个人资料现在都会以持久化Bot的形式存在,自带专属角色、模型、记忆和技能。
Bot之间可以互相通信,同时用户依然可以控制每个Bot的模型和配置。
下一轮多Agent竞争比拼的就是协作体验:谁能先把角色、记忆、交接和群聊这几项都做顺畅了。
开源显然不会放弃这一层赛道。
深度观点 · @Vtrivedy10▲ 6.6K
专家说通用大模型99%能力用户根本不需要
做To B AI产品如果只聚焦客户需要的窄任务,效果能超过通用大模型,这给小团队做出差异化产品指明了方向。
专家说通用大模型99%能力用户根本不需要
做To B AI产品如果只聚焦客户需要的窄任务,效果能超过通用大模型,这给小团队做出差异化产品指明了方向。
掌控自有智能很重要的一环,就是把你的智能体每天产出的海量数据,转化成两类东西:
1. 人类能够理解的报告、可视化和内容——人类作为下游消费者,仍然重要。
2. 可供你优化提升的环境与任务:利用 harness-eng 并对开放模型做后训练,得到适配你具体智能体任务的模型。
模型是不规则的智能野兽,但我们可以通过整理优质数据与上下文供模型学习,将它们的原生智能引导到你的客户真正关心的具体事情上。
专业化智能显然是可行的方向——看看各个实验室发布的专业化模型(GPT-Rosalind、网络安全模型等等)就知道了。
这其实已经直白地告诉我们:完全可以通过将模型参数引导到具体细分任务上,超越前沿模型的性能。
客户根本不在乎模型能做的99%的事情,他们也不会为这些功能付钱 :) 你只需要从那堆巨大(而且还在指数增长)的数据中筛选,从中做出有用的东西。
如果你对这个方向感兴趣,可以来找我们 :)
前沿研究 · @BrianRoemmele▲ 1.5万
康奈尔技术研究人员发布WARP攻击研究论文(13)
现在主流AI深度研究工具都会大量抓取Reddit内容,仅13个恶意植入文字就能让AI把推广内容当成可信信源写入报告,开发这些工具的公司手握解决方案却毫无应对
康奈尔技术研究人员发布WARP攻击研究论文(13)
现在主流AI深度研究工具都会大量抓取Reddit内容,仅13个恶意植入文字就能让AI把推广内容当成可信信源写入报告,开发这些工具的公司手握解决方案却毫无应对
新品发布 · @MaxForAI▲ 1.9万
企业微信发布AI开放能力(6月)
国内大厂已经开始抢占AI Agent落地的核心入口——谁先对接上真实工作生活的工具数据,谁就能拿下下一阶段AI竞争的主动权。
企业微信发布AI开放能力(6月)
国内大厂已经开始抢占AI Agent落地的核心入口——谁先对接上真实工作生活的工具数据,谁就能拿下下一阶段AI竞争的主动权。
实战经验 · @ClaudeCode_UT▲ 2.4万
Claude Code 加 Skills,输出效果差距这么大
大部分人用 Claude Code 做网页都没加载 Skills。只需要加载免费的设计类 Skills,同模型就能做出质感完全不同的网页。
Claude Code 加 Skills,输出效果差距这么大
大部分人用 Claude Code 做网页都没加载 Skills。只需要加载免费的设计类 Skills,同模型就能做出质感完全不同的网页。
【话题】现在有一个观点引发讨论:绝大多数在网站制作中使用Claude Code的人,其实根本没有加载Skills就直接使用了😳
哪怕是同一个Claude Code,仅仅因为传入的Skills不同,效果前后差异能有这么大,演示就在这里👇
・不加Skills的普通Claude Code,做出来的页面美观但平庸
・加载了设计类Skills的同一个Claude Code,最终成品效果就像高端品牌网站
・这些Skills已经在GitHub上免费公开,名称整理在原文里
模型本身没有区别,改变结果的只是传给Claude Code的Skills内容。模板感会彻底消失,成品看起来就像是投入了很多成本打造的品牌官网。
深度观点 · @TheAhmadOsman▲ 1.2K
无监督AI Agent容易失控,问题不在它本身
靠AI自己记住完成任务一定会失败,这套简单确定的人工约束方案,能减少AI Agent自作主张出错的概率
无监督AI Agent容易失控,问题不在它本身
靠AI自己记住完成任务一定会失败,这套简单确定的人工约束方案,能减少AI Agent自作主张出错的概率
无人监督的智能体是愚蠢、鲁莽且会自我毁灭的。
它们会搞垮自己的技术栈。它们会互相认同,最终都认同了错误结论。它们会偏离任务目标。
解决方法不是造出更聪明的智能体。解决方法是无聊、确定性的“管教”:
- 一个 cron 监控器,任何 LLM 都没法说服它放水
- 用 Git 作为唯一的共享记忆
- 一份任务文档,写清楚什么是重要事项,什么才算任务完成
然后再据此加上防护措施:
- 在上下文溢出前轮换会话
- 将关键文件锁在智能体访问范围之外
- 在 API 前设置代理,这样你就能查看成本和运行健康状况
如果一件事要靠智能体记得去做才能完成,那它一定会失败。
新品发布 · @XFreeze▲ 5.2万
Cursor 发布 Origin 托管功能 当天GitHub宕机
GitHub本月多次出现服务故障,开发者的AI开发 workflow 随时可能中断。Cursor选择故障当天推出原生代码托管功能,直接补全了全链路开发闭环
Cursor 发布 Origin 托管功能 当天GitHub宕机
GitHub本月多次出现服务故障,开发者的AI开发 workflow 随时可能中断。Cursor选择故障当天推出原生代码托管功能,直接补全了全链路开发闭环
行业动态 · @itsolelehmann▲ 1.1K
19岁开发者筹120万美元造AI无人机牛仔
原来需要骑手、直升机完成的赶牛清点工作,现在点三次手机就能做完,还能砍掉近一半成本,牧场主已经提前预约了170万英亩的服务
19岁开发者筹120万美元造AI无人机牛仔
原来需要骑手、直升机完成的赶牛清点工作,现在点三次手机就能做完,还能砍掉近一半成本,牧场主已经提前预约了170万英亩的服务
前沿研究 · @jackyk02▲ 8.3万
DeepSeek V4 Flash 自验证胜过Claude Fable 5
用同一个模型做验证就能大幅提升准确率,成本还低11倍,开源模型已经能在特定任务上追上闭源顶级模型。
DeepSeek V4 Flash 自验证胜过Claude Fable 5
用同一个模型做验证就能大幅提升准确率,成本还低11倍,开源模型已经能在特定任务上追上闭源顶级模型。
通过 DeepSeek V4 Flash 规模化自我验证,在 Terminal-Bench 2.1 上击败了 Claude Fable 5,同时价格仅为其 1/11 💰
随着开源模型能力不断提升,它们现在已经能够生成大量高质量候选解决方案,并且能以极低的成本验证自身输出。
举例来说,我们发现,仅用 DeepSeek V4 Flash 采样 5 个解决方案,再用同一模型以「大语言模型即验证器」的方式对结果排序,就能让准确率大幅提升(从 79% 到 88%),在 Terminal-Bench 上性能超过闭源前沿模型。
今天就可以体验:关于验证规模化的更多内容可以看我上一篇帖子。
实战经验 · @ekzhang1▲ 1.7万
个人开发者写出3k行Rust大模型推理核心
核心精简无技术债务,启动速度异常快,单个模型推理流程清晰可复用。未来主流推理引擎可能走向这种模块化路线,值得关注。
个人开发者写出3k行Rust大模型推理核心
核心精简无技术债务,启动速度异常快,单个模型推理流程清晰可复用。未来主流推理引擎可能走向这种模块化路线,值得关注。
深度观点 · @Stephan_Talk▲ 1.4万
AI写代码时代,哪些工作不能交给AI
用AI写代码时,不告诉它项目的长期规划,它只会生成满足当前需求的最小实现。需要自己判断重构时机,把握架构设计,这个经验对用AI写代码的人很有用。
AI写代码时代,哪些工作不能交给AI
用AI写代码时,不告诉它项目的长期规划,它只会生成满足当前需求的最小实现。需要自己判断重构时机,把握架构设计,这个经验对用AI写代码的人很有用。
物理AI · @Meta888_hk▲ 826
Axis Robotics完成积分结算 平台公布最新增长数据
用户分享本次结算仅得3分,平台注册用户超13.3万,累计生成超340万条有效数据轨迹
Axis Robotics完成积分结算 平台公布最新增长数据
用户分享本次结算仅得3分,平台注册用户超13.3万,累计生成超340万条有效数据轨迹
大模型 · @XChatScout▲ 841
开发者在单台DGX Spark上跑通124B稀疏MoE大模型
开发者XChatScout完成Ling-3.0-flash模型部署,整理了完整操作流程与实测结果
开发者在单台DGX Spark上跑通124B稀疏MoE大模型
开发者XChatScout完成Ling-3.0-flash模型部署,整理了完整操作流程与实测结果
开发者@XChatScout完成了Ling-3.0-flash大模型的部署,成功在单台配备128GB统一内存的DGX Spark设备上从零运行该模型。Ling-3.0-flash是参数规模124B的稀疏混合专家模型(MoE)。
XChatScout整理出了完整的部署过程,内容覆盖混合4-bit量化、专用vLLM分支、ABI自检、冷启动内存占用等环节,还包含所有踩坑细节与操作命令。
部署完成后,XChatScout做了实测:在15道纯文本任务上,五类任务等权打分得到94.28分,生成速度超过每秒40个token。
如果正在尝试在有限内存条件下运行大模型,或是对KDA/MLA结合MoE的实际落地感兴趣,可以参考这份整理好的流程,减少尝试过程中的弯路。
生成式AI · @SaburoNax2▲ 3.1K
用户测试AI生成内容的合规服装判定规则
日本用户@SaburoNax2开展AI生成图像实验,测试不同服装的内容审核通过情况
用户测试AI生成内容的合规服装判定规则
日本用户@SaburoNax2开展AI生成图像实验,测试不同服装的内容审核通过情况
本次实验名为“可通过审核的服装”,模型由GPT推荐生成,不使用参考图像。实验设定场景为新人模特在自己房间对着镜子练习姿势,核心目的是测试哪些服装生成的前后视角图像可以通过内容审核。
实验显示,即使是黑色缎面无肩带吊带搭配蕾丝巴西式内裤,也轻松通过了审核。未通过审核的是包含ウンナナクール的内衣,这类内衣此前在手机场景中可以生成。
本次实验一共发布8张测试图像,4张放在主帖,另外4张放在回复中。如果要测试提示词,只需要替换提示词中对应服装的部分即可。
实验给出了详细的提示词模板,同时列出了8种通过审核的服装样例,以及具体被拒绝的服装款式。
开源系统 · @vista8▲ 1.5万
用户分享完成omarchy系统全配置过程
依托Kimi k3大模型完成网络配置,无需特殊手段即可使用
用户分享完成omarchy系统全配置过程
依托Kimi k3大模型完成网络配置,无需特殊手段即可使用
分享者表示,完成omarchy系统的全部配置后体验感很好。已成功安装ChatGPT客户端,配置了flclash,并登录了𝕏(原Twitter)。网络配置是整个过程中最复杂的环节。
这次配置全程交给Kimi k3大模型处理,它是无需特殊手段就能使用的强力大模型。配置完成Agent后,剩余的字体和输入法配置操作难度降低,很快就完成了。
AI工具 · @Gorden_Sun▲ 6.0K
用户分享Grok Bot使用体验:可实现多端Agent协作
Grok Bot桌面客户端可同时控制本地Agent与云端电脑,存在更新重置系统盘的问题,可搭建收费Agent服务
用户分享Grok Bot使用体验:可实现多端Agent协作
Grok Bot桌面客户端可同时控制本地Agent与云端电脑,存在更新重置系统盘的问题,可搭建收费Agent服务
Grok Bot使用体验良好,被认为是未来智能体(Agent)的标配。它的桌面客户端可以同时控制本地智能体和云端电脑,还支持任务接力机制。
云端电脑更新时会重置系统盘,这一问题会导致用户之前安装在云端的所有服务都无法运行。
使用者目前的场景是,在Grok云电脑中安装Cursor、Codex,结合飞书命令行界面(CLI),邀请其他人加入自己的飞书组织,即可直接通过聊天使用这两款编程工具。
基于智能体的服务,还可以通过Cloudflared包装成网站。用户在网站提交任务,比如将图片PPT转换为可编辑的PPTX文件,由云电脑内的Codex执行任务,完成后将结果返回网站。这种方式可以保证技能不外流,还能做成收费服务。
前沿论文 · arXiv▲ 26
AI 终于能边看边说,不再等你看完才开口
现在的 AI 视频对话是「先看完、再回答」:它得等你把整段视频播完,才开口。
AI 终于能边看边说,不再等你看完才开口
现在的 AI 视频对话是「先看完、再回答」:它得等你把整段视频播完,才开口。
现在的 AI 视频对话是「先看完、再回答」:它得等你把整段视频播完,才开口。MOSS-VL 把「边看边说」当成头等能力——它生成回答的同时,眼睛还在看新画面,靠一种「门控交叉注意力」让视觉信息随时插进来,不用等。训练上,它用合成的对话语料教模型什么时候该说话、什么时候该闭嘴、什么时候该改口,再把实时相关的训练集中到最后一步,不破坏它原本的离线能力。
结果:在 4 个流式评测里,它拿了 3 个第一,尤其在「主动提醒」这类考验模型自己判断时机的任务上,66.0 分对最强基线 37.5 分,近乎翻倍。而且它把视觉信息放在生成序列之外,首字延迟比同规模的 Qwen3-VL 快 2.8 到 5.1 倍。这不是你明天能装进手机的功能,但它是「AI 陪你视频聊天」从呆等变成真对话的关键一步。
AI开发 · @QuinnyPig▲ 571
开发者热议将完整代码库放入大模型上下文窗口
针对认真做开发的人员,讨论完整代码库放入上下文窗口
开发者热议将完整代码库放入大模型上下文窗口
针对认真做开发的人员,讨论完整代码库放入上下文窗口
AI生成视频 · @liyue_ai▲ 2.9万
用户使用Seedance 2.5生成AI视频体验分享
用户分享用Seedance 2.5生成水上闯关AI视频,称其定价偏高
用户使用Seedance 2.5生成AI视频体验分享
用户分享用Seedance 2.5生成水上闯关AI视频,称其定价偏高
前沿论文 · arXiv▲ 26
给AI看一遍你操作电脑,它就能照着做
现在的AI助手能帮你操作电脑,但前提是你得把每一步都说得清清楚楚——而日常办公里很多动作是“你懂我懂”的默契,比如“把上个月的报表整理一下”,AI根本不知道上个月是哪份、整理成什么样。
给AI看一遍你操作电脑,它就能照着做
现在的AI助手能帮你操作电脑,但前提是你得把每一步都说得清清楚楚——而日常办公里很多动作是“你懂我懂”的默契,比如“把上个月的报表整理一下”,AI根本不知道上个月是哪份、整理成什么样。
现在的AI助手能帮你操作电脑,但前提是你得把每一步都说得清清楚楚——而日常办公里很多动作是“你懂我懂”的默契,比如“把上个月的报表整理一下”,AI根本不知道上个月是哪份、整理成什么样。这篇论文的AI换了个思路:与其让你描述,不如直接录一遍你操作的过程给它看。它把演示视频拆成一个个小步骤,遇到类似任务时照着你的习惯来,界面变了还能自己重新规划。
在41个办公软件的100个长任务测试里,给它看一次演示,成功率从17%翻倍到35%。这不是你明天就能装上的功能,但它指向一个更自然的未来:教AI干活,就像教新同事一样,做一遍给它看就行。
教程 · @iamlukethedev▲ 7.3K
Hermes Bot Mode功能与使用步骤教程介绍
本文讲解Hermes Bot Mode的功能,一步步教你使用该功能
Hermes Bot Mode功能与使用步骤教程介绍
本文讲解Hermes Bot Mode的功能,一步步教你使用该功能
行业观点 · @sonyatweetybird▲ 3.9万
观点:AI应用层之争本质是智能层之争
业内观点指出AI应用层竞争不止于表层,核心是智能层争夺
观点:AI应用层之争本质是智能层之争
业内观点指出AI应用层竞争不止于表层,核心是智能层争夺
前沿论文 · arXiv▲ 23
AI 从解题到发现:一个能自己找问题、自己验证的框架
我们总说 AI 会解题,但真正的难题是没人把问题定义好。
AI 从解题到发现:一个能自己找问题、自己验证的框架
我们总说 AI 会解题,但真正的难题是没人把问题定义好。
我们总说 AI 会解题,但真正的难题是没人把问题定义好。这篇提出一个框架,让 AI 不只解你给的题,而是自己去 561 个行业里挖出 423 个高价值问题,挑 20 个来真做。它给 AI 配了工具、约束和验证机制,像带了个实验室助理,做完还能独立检查结果靠不靠谱。
在基因治疗载体设计上,它比已发表的最好成绩还高 7%;在药物重定位上,把 GPT-5.5 的预测分数拉高了 2.5 到 7.6 分。这不是你明天能用的工具,但它指向一个拐点:AI 正在从『你问它答』走向『它自己找值得答的问题』。
大模型 · @Lonely__MH▲ 5.0万
大语言模型服务框架Ling 3.0完成合规压测
基于本地OpenAI兼容HTTP流式接口开展全流程压测
大语言模型服务框架Ling 3.0完成合规压测
基于本地OpenAI兼容HTTP流式接口开展全流程压测
🚀Ling 3.0 压测,本次使用的是本地 OpenAI 兼容接口,通过 HTTP 流式请求进行压测,不是脱离服务框架的离线推理测试。 Ling 的每个请求使用同一段约 150 Token 的长文本提示词,最多生成 512 Token。 计时从客户端发起 HTTP 请求开始,到流式响应接收完成为止,因此会包含本地 HTTP 调用、服务调度、Tokenizer 处理、Prefill、逐 Token 解码和流式返回等环节
前沿论文 · arXiv▲ 23
AI 训练新招:别在已会的题上浪费算力
多目标奖励的 AI 训练有了新策略:把每个目标单独标准化,并自动降低已达标目标的权重,把算力转向还没做好的部分,在数学、推理和编程任务上都有提升,最高涨 9.2%。
AI 训练新招:别在已会的题上浪费算力
多目标奖励的 AI 训练有了新策略:把每个目标单独标准化,并自动降低已达标目标的权重,把算力转向还没做好的部分,在数学、推理和编程任务上都有提升,最高涨 9.2%。
前沿论文 · arXiv▲ 22
AI 自己当科学家:边猜边验证,效率翻倍
现在的 AI 做科研,要么靠大模型瞎猜,要么靠传统统计硬搜,都不靠谱。
AI 自己当科学家:边猜边验证,效率翻倍
现在的 AI 做科研,要么靠大模型瞎猜,要么靠传统统计硬搜,都不靠谱。
现在的 AI 做科研,要么靠大模型瞎猜,要么靠传统统计硬搜,都不靠谱。这篇提出一个「边猜边验证」的循环:AI 每提出一个候选方案(比如一个分子),就立刻用另一个模型预测它好不好、并给出置信度,然后根据结果调整下一步。它把「生成」和「评估」绑在一起,在神经网络训练、抗体设计、分子优化三个领域,效果都比纯大模型或传统方法好一大截。
这不是你明天能用的工具,但它指向一个方向:AI 不再只是聊天或写代码,而是能自己设计实验、自己判断结果、自己迭代的科研助手。
前沿论文 · arXiv▲ 21
AI 代理终于有了数据库的可靠性
AI 代理在长时间任务中经常出错、互相干扰,就像没有事务支持的数据库。
AI 代理终于有了数据库的可靠性
AI 代理在长时间任务中经常出错、互相干扰,就像没有事务支持的数据库。
AI 代理在长时间任务中经常出错、互相干扰,就像没有事务支持的数据库。这篇论文把数据库的 ACID 原则(原子性、一致性、隔离性、持久性)重新定义为适合 AI 的语义版本,并构建了一个系统,在多个基准上比 Claude Code 等最强代理提升了 10.6%。它不是你明天就能用上的,但它指向一个方向:让 AI 代理像数据库一样可靠、可回滚、可并发。
前沿论文 · arXiv▲ 20
像素空间扩散模型提速3倍,训练策略大揭秘
训练图像生成模型,通常先在“潜空间”里学,再转到“像素空间”细化,但直接在大规模像素空间训练会慢很多。
像素空间扩散模型提速3倍,训练策略大揭秘
训练图像生成模型,通常先在“潜空间”里学,再转到“像素空间”细化,但直接在大规模像素空间训练会慢很多。
训练图像生成模型,通常先在“潜空间”里学,再转到“像素空间”细化,但直接在大规模像素空间训练会慢很多。这篇研究提出先高效地在潜空间获取生成能力,再在后期训练中切换到像素空间,并系统探索了权重初始化、数据组成、预测目标、解码器架构和噪声调度等关键设计,最终让像素空间模型在匹配或超越潜空间模型的同时,推理速度提升3.18到4.75倍。
前沿论文 · arXiv▲ 18
AI画图新框架:简单请求不再走重流程
AI 画图有了个“路由调度器”:先判断你的请求是简单还是复杂,再决定走轻量还是重型流程,结果更准的同时执行成本降了 95%、延迟降了 65%。
AI画图新框架:简单请求不再走重流程
AI 画图有了个“路由调度器”:先判断你的请求是简单还是复杂,再决定走轻量还是重型流程,结果更准的同时执行成本降了 95%、延迟降了 65%。
前沿论文 · arXiv▲ 17
AI 做科研,卡在不会自我检查
让 AI 从假设一路做到成稿的「自动科研」,现在有了第一份端到端体检:8 套主流系统在 100 个真实前沿课题上,失败模式高度一致——它们不会回头核对「我写的是不是我查到的」,也不会质疑自己走的路对不对。
AI 做科研,卡在不会自我检查
让 AI 从假设一路做到成稿的「自动科研」,现在有了第一份端到端体检:8 套主流系统在 100 个真实前沿课题上,失败模式高度一致——它们不会回头核对「我写的是不是我查到的」,也不会质疑自己走的路对不对。
让 AI 从假设一路做到成稿的「自动科研」,现在有了第一份端到端体检:8 套主流系统在 100 个真实前沿课题上,失败模式高度一致——它们不会回头核对「我写的是不是我查到的」,也不会质疑自己走的路对不对。研究者把这套缺陷归为「元认知缺失」,并发现它跟具体框架无关,连最强模型也躲不掉。它不是你明天能用上的东西,但给「AI 到底能不能独立搞科研」划了条诚实的底线。
前沿论文 · arXiv▲ 13
图像编辑评测有了更贴近真实的新基准
图像编辑模型评测有了更贴近真实的新基准:CPI-Bench 首次把多图编辑、高频实用场景和强推理指令纳入考核,能更好拉开模型差距,且与人类偏好排名最一致。
图像编辑评测有了更贴近真实的新基准
图像编辑模型评测有了更贴近真实的新基准:CPI-Bench 首次把多图编辑、高频实用场景和强推理指令纳入考核,能更好拉开模型差距,且与人类偏好排名最一致。
前沿论文 · arXiv▲ 12
AI 终于学会说“我不会”了
大模型在超出能力的问题上会硬着头皮编答案,生成一大段听起来合理、其实全错的推理,既浪费算力又误导人。
AI 终于学会说“我不会”了
大模型在超出能力的问题上会硬着头皮编答案,生成一大段听起来合理、其实全错的推理,既浪费算力又误导人。
大模型在超出能力的问题上会硬着头皮编答案,生成一大段听起来合理、其实全错的推理,既浪费算力又误导人。这篇研究把这种现象拆开看,发现模型最大的毛病是“貌似有理的胡扯”——输出表面光鲜,错误藏在细节里,而且任务越难越严重。他们提出的 CaRL 方法,用强化学习给模型一个选择:没把握就拒绝回答,而不是硬编。
结果胡扯大幅减少,该会的题照样会。它不是你明天能用上的工具,但这是 AI 从“不懂装懂”走向“知道自己不知道”的关键一步。
开源 · @RoundtableSpace▲ 3.8万
@RoundtableSpace开源端到端AI视频生产流水线工具集(7)
适配多种现有AI代理框架,一次配置就能搞定模型堆叠,不用重复搭建环境。
@RoundtableSpace开源端到端AI视频生产流水线工具集(7)
适配多种现有AI代理框架,一次配置就能搞定模型堆叠,不用重复搭建环境。
共7项开源技能,可运行完整端到端AI视频制作管线,为Seedance 2.5构建,可在Claude Code、Codex、Hermes或任何工具框架中工作。
→ /setup 只需编写一次你的模型栈,所有技能都会读取同一份配置
→ /studio-init 仅需一个问题即可搭建出整个工作室的文件树框架
→ /film-breakdown 为你脚本中的每个镜头生成一张包含22个字段的卡片
→ /reference-board 将参考素材锁定到可视化参考手册中,同时附带禁用素材清单
→ /asset-passport 编写详尽的描述文件,后续所有提示词都会逐字引用这份文件
→ /stress-test 将素材转换为仅锁定状态,可实现10/10的可重复性
→ /shot-prompt 在画面中所有内容都锁定前拒绝运行,完成锁定后生成包含15个模块的提示词
前沿论文 · arXiv▲ 12
大模型的大脑,也分区干活
人脑不是一块均质的肉,它有专门管语言、管逻辑、管社交、管物理直觉的片区。
大模型的大脑,也分区干活
人脑不是一块均质的肉,它有专门管语言、管逻辑、管社交、管物理直觉的片区。
人脑不是一块均质的肉,它有专门管语言、管逻辑、管社交、管物理直觉的片区。这篇论文发现,大模型内部也长出了类似的分区:让模型做46种任务,凡是人类大脑用同一片区处理的,模型里激活的也是同一批神经元;人类大脑用不同片区的,模型里也是不同批。两个完全不同的系统,却收敛出同一种组织方式——这暗示模块化可能是智能的底层规律,而不是生物进化的偶然。
它不是你明天能用上的东西,但如果你关心“AI到底像不像人”,这是目前最硬核的证据之一。
前沿论文 · arXiv▲ 12
MegaParts:300部件级3D生成,令牌高效自回归
AI 生成 3D 物体从几十个零件扩展到 300 个:新方法用更省 token 的编码方式,让模型能处理更复杂的物体,但这是前沿进展,不是你能直接用的工具。
MegaParts:300部件级3D生成,令牌高效自回归
AI 生成 3D 物体从几十个零件扩展到 300 个:新方法用更省 token 的编码方式,让模型能处理更复杂的物体,但这是前沿进展,不是你能直接用的工具。
行业动态 · @daniel_mac8▲ 1.3万
OpenAI Astra 要做多智能体领域的Claude Code
市场传闻本周就要发布,它主打多智能体集群能力,有人预言它会像去年冬天Claude Code改变编码一样改变长周期多智能体工作。
OpenAI Astra 要做多智能体领域的Claude Code
市场传闻本周就要发布,它主打多智能体集群能力,有人预言它会像去年冬天Claude Code改变编码一样改变长周期多智能体工作。
前沿论文 · arXiv▲ 10
人听不见的低频声,能让AI语音助手直接失灵
你听不见的低频噪音,正在悄悄让AI语音助手“耳聋”。
人听不见的低频声,能让AI语音助手直接失灵
你听不见的低频噪音,正在悄悄让AI语音助手“耳聋”。
你听不见的低频噪音,正在悄悄让AI语音助手“耳聋”。研究者发现,大音频语言模型(LALM)能接收人耳听不到的低频信号,并受其干扰——他们用一段通用波形模板,在6个主流模型上把任务准确率最高拉低67个百分点,而人类几乎察觉不到异常(可听度评分1.33,接近纯净音频的1.17)。更关键的是,他们同时给出了一道防线:检测到低频分布偏移时,让模型请求重新录音,能把被攻击后的平均准确率从28.5%拉回46.1%。
这不是你明天能用的功能,但它揭示了一个真实存在的安全盲区:当AI开始“听”得比人更广,攻击面也随之扩大。
前沿论文 · arXiv▲ 10
AI 解题不再靠多试几次,而是专挑关键步骤挑错
大模型做数学题,现在的主流办法是让它多算几遍再投票,算得越多越准,但代价是烧钱。
AI 解题不再靠多试几次,而是专挑关键步骤挑错
大模型做数学题,现在的主流办法是让它多算几遍再投票,算得越多越准,但代价是烧钱。
大模型做数学题,现在的主流办法是让它多算几遍再投票,算得越多越准,但代价是烧钱。这篇论文换了个思路:与其多算,不如把一次推理拆成几个关键论断,专门去验证这些论断对不对。因为一个完整答案要全对才算对,但推翻一个错误论断只需要找到一个漏洞,后者容易得多。
在四个模型和四个推理基准上,同样的算力预算下,这个办法普遍超过多算几遍的准确率,在某个模型上准确率从 77.5% 提到 82.19%,还省了 37% 的 token。它不是你明天能用上的东西,但指向一个趋势:AI 推理的下一步不是更会算,而是更会自我怀疑。
实践 · @rapiddns▲ 3.0K
有人用AI找漏洞,已经拿到真实奖金了
把AI加入漏洞挖掘的工作流,就能直接在实战中拿到厂商给出的安全赏金。
有人用AI找漏洞,已经拿到真实奖金了
把AI加入漏洞挖掘的工作流,就能直接在实战中拿到厂商给出的安全赏金。
我是如何搭建一套AI漏洞狩猎工作流的——它还真帮我拿到了赏金。这是我的方法记录 🔗 #BugBounty #AI #bugbountytips #security #openai #gpt
前沿论文 · arXiv▲ 10
AI 程序员三天拆掉核心架构,零人工审查
一个 71 万行、3648 个文件的 TypeScript 生产系统,要拆掉一个核心架构约束:AI 请求期间 UI 面板必须保持打开。
AI 程序员三天拆掉核心架构,零人工审查
一个 71 万行、3648 个文件的 TypeScript 生产系统,要拆掉一个核心架构约束:AI 请求期间 UI 面板必须保持打开。
一个 71 万行、3648 个文件的 TypeScript 生产系统,要拆掉一个核心架构约束:AI 请求期间 UI 面板必须保持打开。目标改成——流式生成在面板关闭后继续存活,重开面板时能无缝接回同一直播流,不丢不重。作者判断这活儿靠增量重构基本不可能,常规做法是推倒重写。
但这次,AI 编程代理在「规范优先」协议下干完了:先让代理自己写正式规范,14 轮对照源码审计规范,然后原子化实施,编译/测试反馈循环,再 17 轮对照冻结规范审计代码。31 轮审计里,人类还没运行过程序,就修了 201 个缺陷。收敛标准是连续两轮验证零发现。
改动涉及 189 个文件,加上提取阶段共 288 个文件、3.4 万行插入、1.6 万行删除。三天完成,成本 2430 美元,全程无人类代码审查,无测试预言机。作者把 1500 多页法语规范与原始会话日志全部公开,供人核查。
这不是你明天能用的工具,但它指向一个反直觉的事实:在特定协议下,AI 能独立完成人类认为「只能重写」的架构级手术,而且过程可审计、可复现。
职场 · @BetterSayAJ▲ 5.0K
现在招开发不卡写代码,卡顶层技术思考
只要订阅了Claude或Codex,普通人都能完成基础编码工作,顶级开发者的核心竞争力变成了体系化思考能力。
现在招开发不卡写代码,卡顶层技术思考
只要订阅了Claude或Codex,普通人都能完成基础编码工作,顶级开发者的核心竞争力变成了体系化思考能力。
每当我招聘开发者时,我不会筛选「会写代码」的人。
现在任何订阅了 Claude/Codex 的人都能写代码。但顶尖 1% 的技术思考者,有能力自己拿出正确的规格说明和架构,更重要的是,他们能准确说清楚智能体要构建什么、为什么构建、在哪里构建。
但你不可能靠周末刷几个教程就成为优秀开发者。你应该给自己找一个困难、有野心的问题,从零开始搭建点东西。尽量不要用 AI 辅助,查文档没问题。
你会卡住,你会调试,你会做出有意思的架构决策。最终你就能培养出对正确方案的洞察力。
商业 · @togethercompute▲ 1.8K
@relace_ai发布代码生成专用小模型
针对代码生成场景单独训练小模型,运行在专用GPU集群上,比通用大模型更省钱。
@relace_ai发布代码生成专用小模型
针对代码生成场景单独训练小模型,运行在专用GPU集群上,比通用大模型更省钱。
小模型,大省钱。
@relace_ai 训练了专门为代码生成构建的专用模型,由 Together AI 上 @ycombinator 的专属 GPU 集群提供算力支持。
内容创作 · @higgsfield_ai▲ 1.2万
AI结合手工创作的动画登上顶级图形学大会
这部动画和皮克斯、迪士尼的作品一同在SIGGRAPH 2026展映,用生成AI辅助完成创作,保留了人类创作者的手工设计。
AI结合手工创作的动画登上顶级图形学大会
这部动画和皮克斯、迪士尼的作品一同在SIGGRAPH 2026展映,用生成AI辅助完成创作,保留了人类创作者的手工设计。
我们的首部AI动画电影《KÖK BÖRÜ》,在全球最大的计算机图形学会议上完成了首映。
这部电影将生成式AI与人类艺术相融合,在洛杉矶举办的SIGGRAPH 2026上放映,参展方还有Pixar、Disney和Nvidia。
目前影片已经上线并完全开源,所有提示词和素材都已开放,参与奖金1000000美元的Higgsfield全球电影节。
本片由Higgsfield上的Seedance制作完成。
实战经验 · @EXM7777▲ 2.5万
用Claude Code做内容创作者的优质副业
这套自动化工具能帮内容创作者摸透用户痛点,还能拆解同行做得好的地方,做内容做产品都能用真实数据支撑决策
用Claude Code做内容创作者的优质副业
这套自动化工具能帮内容创作者摸透用户痛点,还能拆解同行做得好的地方,做内容做产品都能用真实数据支撑决策
作为内容创作者,你能用 Claude Code 搭建的最佳副业项目就是:面向你的理想客户(ICP)的监听智能体。
它可以监测 reddit、twitter、youtube 评论区……基本上只要是你的受众会发言的地方都能覆盖。提取痛点、问题、反对意见,以及他们需要的一切内容。
每周你都会获得全新洞察,发现还没有人解决过的问题。
针对你的竞争对手,还可以做深度调研智能体:它会抓取所有瞄准你同一片理想客户(ICP)的竞争对手,提取他们在所有平台的内容和产品,分析哪些内容有效。
反向拆解他们的成功逻辑,你不用再自己瞎猜。
之后你把所有这些原始数据整理成结构化的背景资料、用户画像和能力库。不管你是要创作内容还是打造新产品,直接调取出来,基于真实洞察创作就行。
没有比这更好的项目了。
行业动态 · @GroqInc▲ 1.2万
Groq完成3.5亿美元A轮,估值达35亿美元
这笔资金将用于扩建NVIDIA加速计算集群,明年算力规模将从54兆瓦扩容至200兆瓦以上。推理层基建的玩家拿到了充足弹药,后续服务扩容值得关注。
Groq完成3.5亿美元A轮,估值达35亿美元
这笔资金将用于扩建NVIDIA加速计算集群,明年算力规模将从54兆瓦扩容至200兆瓦以上。推理层基建的玩家拿到了充足弹药,后续服务扩容值得关注。
今日我们宣布完成 3.5 亿美元 A 轮融资,由 @disruptivetech 领投,@nvidia 计划参投,本轮融资对 Groq 的估值为 35 亿美元,使我们两个月内的融资总额达到 10 亿美元。
推理正在成为 AI 基础设施中规模最大、最关键的一层,而这正是我们做得比所有人都好的领域。本轮融资将支持那些需要使用中型及大型 NVIDIA 加速计算集群来开展训练和推理的用户。
Groq 预计明年将把算力规模从 54 兆瓦扩展到 200 兆瓦以上。截至今日,已有超过 600 万开发者、财富 500 强企业,以及数千家原生 AI 公司基于 Groq 构建产品,每周生成数万亿 token。
工具产品 · @grgerwcwetwet▲ 4.7K
AQBot整合多AI模型,数据全留本地
不用分别打开多个AI客户端,数据和密钥都本地加密存储,不用担心隐私泄露,所有主流平台都能使用
AQBot整合多AI模型,数据全留本地
不用分别打开多个AI客户端,数据和密钥都本地加密存储,不用担心隐私泄露,所有主流平台都能使用
推荐一个开源 AI 桌面神器:AQBot。一个软件直接把 OpenAI、Claude、Gemini、DeepSeek、通义千问等模型全装进来,还集成 Agent、MCP、Skills、知识库和 API 网关。聊天记录和配置主要留在本地,API Key 支持 AES-256 加密,Windows、macOS、Linux 全平台支持。
GitHub:
深度观点 · @GaryMarcus▲ 6.7K
GaryMarcus称LLM为中心架构威胁AI安全
AI不遵守指令的核心问题,和过去的幻觉问题一样,现有思路无法快速解决,需要彻底新架构才能处理。这直接影响通用AI的落地安全。
GaryMarcus称LLM为中心架构威胁AI安全
AI不遵守指令的核心问题,和过去的幻觉问题一样,现有思路无法快速解决,需要彻底新架构才能处理。这直接影响通用AI的落地安全。
很多人对这个问题——也就是AI无法遵循指令——视而不见,就像他们最初对幻觉问题漫不经心的态度一样。他们抱着同样的幻想,认为这种核心的、根深蒂固的问题会很快得到解决。
这些问题实际上无法被解决,除非我们拥有全新的基础架构。
这就是为什么以LLM为核心的架构对AI安全来说是一个严重的威胁。
前沿研究 · @omarsar0▲ 6.9K
最新研究推翻对AI智能体技能的认知
做AI智能体开发的人可以参考这一结论:技能主要用来稳定执行流程,不是补充知识,技能越多实际可用精度越低。
最新研究推翻对AI智能体技能的认知
做AI智能体开发的人可以参考这一结论:技能主要用来稳定执行流程,不是补充知识,技能越多实际可用精度越低。
一篇揭开智能体技能原理的有趣论文。如果你正在为你的智能体维护技能库,这篇值得你花时间一读。(收藏起来)
人们通常认为技能的作用是注入模型缺乏的知识。然而这篇论文有个有趣的发现。
在8,135条标准化实验记录中,当技能发挥作用时,65.7%的情况来自程序锚定,仅有4.5%来自显式知识注入。
技能的作用是稳定执行流程,而非提供事实。
当技能库规模从5个扩充到100个时,实际使用准确率从29.6%下降到3.3%。
在配对对比中,技能仍然比工作流记忆高出6.06个百分点,但技能会在假设僵化、上下文不兼容或适配不足的情况下失效。
论文链接:
在我们的学院追踪更多热门AI论文:
实战经验 · @Voxyz_ai▲ 3.9万
@Voxyz_ai 分享搭建Grok Bot团队的六个角色
想用多个AI Bot分工完成全流程工作,可以参考这套明确权责的分工方案,避开职责混乱的问题
@Voxyz_ai 分享搭建Grok Bot团队的六个角色
想用多个AI Bot分工完成全流程工作,可以参考这套明确权责的分工方案,避开职责混乱的问题
新品发布 · @garrytan▲ 2.7万
GBrain发布个性化智能体生成功能(12)
只需回答12个问题,就能生成和制作者自用OpenClaw一样智能的智能体,还预装70个个人技能,可直接上手使用。
GBrain发布个性化智能体生成功能(12)
只需回答12个问题,就能生成和制作者自用OpenClaw一样智能的智能体,还预装70个个人技能,可直接上手使用。
GBrain 现在支持为 Codex 和 Claude Code 生成/初始化个性化智能体。
它会生成一份智能体 AI 风格的 SOUL.md,并安装 70 个我的个人智能体技能来帮你快速起步。
只需要回答 12 个问题,你就能完成设置,得到一个和我个人的 OpenClaw 一样聪明的智能体。
工具产品 · @goan999999▲ 8.2K
@goan999999发布Codex 5.6六款全栈插件
这套插件覆盖从设计到监控的完整开发流程,能让Codex 5.6能力提升10倍,帮独立开发者完成全流程软件交付
@goan999999发布Codex 5.6六款全栈插件
这套插件覆盖从设计到监控的完整开发流程,能让Codex 5.6能力提升10倍,帮独立开发者完成全流程软件交付
深度观点 · @natolambert▲ 1.2万
natolambert聊开源AI的核心是什么
行业玩家英伟达已经在公开训练模型,这种路径能避免智能领域形成垄断,普通使用者也能因此拥有更多选择空间。
natolambert聊开源AI的核心是什么
行业玩家英伟达已经在公开训练模型,这种路径能避免智能领域形成垄断,普通使用者也能因此拥有更多选择空间。
开源 AI 的核心在于,训练配方本身才是最接近 Linux 和开源软件的事物。
模型权重是临时性的。
Nvidia 公开搭建自己的模型,这样一来所有人日后都能自建模型,从而避免智力垄断。
新品发布 · @samhogan▲ 5.8万
samhogan推出面向AI智能体的实验性RSPS
可以接入多个不同AI模型供AI智能体运行,感兴趣的开发者可以到GitHub查看项目
samhogan推出面向AI智能体的实验性RSPS
可以接入多个不同AI模型供AI智能体运行,感兴趣的开发者可以到GitHub查看项目
Introducing and——一款为 AI 代理构建的实验性 RSPS。
连接你的 Claude、Codex、Pi、Hermes 等模型,让它自由运行。
GitHub:
工具产品 · @akshay_pachaar▲ 2.9万
CopilotKit 开源 aimock 帮 teams 省大笔API费
能帮高提交量的开发团队省下持续集成流程里大笔LLM API开销,不用再为过时假测试埋生产故障隐患
CopilotKit 开源 aimock 帮 teams 省大笔API费
能帮高提交量的开发团队省下持续集成流程里大笔LLM API开销,不用再为过时假测试埋生产故障隐患
实战经验 · @EMostaque▲ 9.0K
用户实测Grok,触发限额后直接中断无提示
用Grok协调多个AI工具工作流时,触发使用限额会直接让所有工作暂停,没有提前预警也没有降级方案,体验很糟糕。
用户实测Grok,触发限额后直接中断无提示
用Grok协调多个AI工具工作流时,触发使用限额会直接让所有工作暂停,没有提前预警也没有降级方案,体验很糟糕。
重度测试后触发了@grok @bot 的使用限制。我把它用作协调器,还把我的 gpt/claude/cursor 命令行工具都给它了。
和代码模型用完额度相比,这次的体验反常地让人不爽。
我觉得问题出在一切直接卡住,而且没有任何警告,它应该故障转移到便宜模型才对。
深度观点 · @_jasonwei▲ 2.9万
@_jasonwei改口:小模型靠工具不够用
此前他认同「只要1B参数认知核,其余全靠工具就行」,如今用打羽毛球的亲身经历推翻了这个说法,重新理解为什么要做大模型。
@_jasonwei改口:小模型靠工具不够用
此前他认同「只要1B参数认知核,其余全靠工具就行」,如今用打羽毛球的亲身经历推翻了这个说法,重新理解为什么要做大模型。
开源 · @ai_suxiaole▲ 1.5K
已有开发者开源基于Codex的求职自动化工具
可读取简历、检查JD硬性条件、匹配度打分,还能生成开场白和修改建议,最终投递由用户确认
已有开发者开源基于Codex的求职自动化工具
可读取简历、检查JD硬性条件、匹配度打分,还能生成开场白和修改建议,最终投递由用户确认
此前分享了使用Codex自动筛选招聘平台岗位的方法,很快就有人将后续求职流程做成了开源工具。
这款工具可以读取简历内容,检查招聘要求中的硬性条件,按A/B/C三级给出岗位匹配度打分。
它还可以生成求职开场白,模拟HR筛选流程,提供简历修改建议。
最终是否投递岗位,仍由用户自行确认,想要实现求职流程自动化,可以安排使用这款工具。
机器人 · @altryne▲ 578
开发者发现自制研究机器人向主管告密
用户@altryne在𝕏发文称,自己开发的@slashlast30days研究机器人会向主管发送信息,自己并不介意
开发者发现自制研究机器人向主管告密
用户@altryne在𝕏发文称,自己开发的@slashlast30days研究机器人会向主管发送信息,自己并不介意
用户@altryne在社交平台𝕏发布了这条内容。
他开发了名为@slashlast30days的研究机器人,不清楚为什么该机器人会向主管发送信息。
他表示,自己并不介意这件事。
原文附带链接:
开发者工具 · @heyitsyashu▲ 6.6K
用户安装Grok Bot替代openclaw 目前体验满意
个人用户分享Grok Bot使用初体验,称赞其功能优势,同时遇到无法连接X生成feed摘要的问题
用户安装Grok Bot替代openclaw 目前体验满意
个人用户分享Grok Bot使用初体验,称赞其功能优势,同时遇到无法连接X生成feed摘要的问题
有用户分享,自己终于完成了操作,安装Grok Bot替代了自己原本使用的openclaw,截至目前对体验没有不满。
Grok Bot支持可编程,这意味着它可以跨智能体运行,还能管理用户任务,内容分类效果比此前的codex chats更好。
用户称赞SpaceXAI团队和cursor_ai团队完成了出色的工作。
目前Grok Bot存在一个明显问题:它无法连接用户的X账号,生成用户信息流的摘要。该用户询问是否有人知道如何解决这个问题。
内容创作 · @DeRonin_▲ 1.5万
创作者分享可用Claude Code搭建的受众雷达内容系统
这套系统可自动抓取受众痛点与竞品空白,为内容创作提供方向,分享免费搭建步骤
创作者分享可用Claude Code搭建的受众雷达内容系统
这套系统可自动抓取受众痛点与竞品空白,为内容创作提供方向,分享免费搭建步骤
游戏创意 · @NFT_Chen▲ 1.3万
DeepSeek Harness推出Token为筹码的多人德州扑克Demo
开发者在DeepSeek Harness中新增游戏中心插件,完成结合AI框架与Token经济的创意Demo
DeepSeek Harness推出Token为筹码的多人德州扑克Demo
开发者在DeepSeek Harness中新增游戏中心插件,完成结合AI框架与Token经济的创意Demo
开发者在DeepSeek Harness平台打造出一款以Token作为筹码的多人在线德州扑克创意Demo。该Demo直接作为「游戏中心」插件嵌入DeepSeek Harness页面,实现了和平台生态的深度融合。
该Demo的核心设计为Token即筹码,玩家可以使用自身账户内的实际Token参与游戏,筹码数量直接对应玩家真实持有的Token数量,输赢直接变动账户内的Token。
Demo支持多名玩家在线实时对战,完整支持下注、跟注、加注、弃牌等德州扑克的标准操作。
该Demo不止是娱乐产品,还是AI Agent运行时框架DeepSeek Harness和真实Token经济结合的创新尝试,拓展了AI Agent框架的应用可能性。
开源 · @Lumosous▲ 1.3万
开发者首次本地运行MiniMax H3生成AI视频 分享测试体验
测试了文生视频、音画节奏同步、图生视频三种方案,将开源所有工作流资源
开发者首次本地运行MiniMax H3生成AI视频 分享测试体验
测试了文生视频、音画节奏同步、图生视频三种方案,将开源所有工作流资源
教程 · @aresotik▲ 5.7K
前Anthropic员工Karpathy放出从零搭建GPT四小时教程
该教程逐行讲解从零编写GPT代码,覆盖编码、扩展到专业使用全流程
前Anthropic员工Karpathy放出从零搭建GPT四小时教程
该教程逐行讲解从零编写GPT代码,覆盖编码、扩展到专业使用全流程
这份从零搭建GPT的教程总时长为四小时。教程由前Anthropic员工Karpathy推出,会手把手逐行带领学习者自行编写GPT代码。
教程内容覆盖三个阶段:从基础代码编写,到模型扩展,最终实现像专业人士一样使用模型。
分享者@aresotik提醒用户保存这份教程,称它会非常实用,相关链接已公开。
开发工具 · @gregisenberg▲ 2.7万
网友分享9项改进 大幅提升Claude Code使用体验
用户@gregisenberg分享9个优化Claude Code使用体验的要点,完整内容存于其发布的完整内容页面
网友分享9项改进 大幅提升Claude Code使用体验
用户@gregisenberg分享9个优化Claude Code使用体验的要点,完整内容存于其发布的完整内容页面
用户@gregisenberg在𝕏分享了9个优化方法,可将Claude Code的使用体验从一般提升到极佳。
9项改进分别为:第一,设置可自我说明的代码仓库工作区;第二,用记忆文件记录你的工作方式;第三,在Claude Code操作任何内容前,先开启计划模式梳理概要;第四,为它分配带有明确完成标准的单一清晰任务;第五,让它打开应用,像用户一样完整点击操作一遍;第六,让它对照你的标准自行检查完成的工作;第七,设置可在你休眠期间运行的定时任务;第八,明确划分权限,标注哪些操作它可自主执行、哪些需要你把控;第九,添加可复用操作,以及连接器和钩子拓展功能。
本次内容得到AnthropicAI赞助。所有9个方法的具体提示词、最佳实践,以及为期7天的部署计划,都可在完整内容中查看。
完成这些设置后,Claude Code的使用体验会和此前完全不同。完整内容可通过给出的链接查看。
AI开发 · @DeryaTR_▲ 5.5K
用户分享iPhone上按使用时长排序的AI开发工具栈
X用户DeryaTR_分享自己当前在iPhone上使用的AI编码与智能体工具,按使用时长排序
用户分享iPhone上按使用时长排序的AI开发工具栈
X用户DeryaTR_分享自己当前在iPhone上使用的AI编码与智能体工具,按使用时长排序
这是DeryaTR_当前在iPhone上使用的AI编码与智能体工具栈,排序依据是每日使用时长。
按使用时长从高到低排序,工具依次为:第一名ChatGPT,用于工作及远程调用Codex;第二名Grok Bot;第三名Grok Build;第四名Cursor。
分享附带了相关链接。
开源 · @Lonely__MH▲ 2.0万
用户实测DGX Spark单机成功部署千亿级大模型
部署后运行速度快,用户推荐搭建本地开源大模型工作流,实现 Token 自由
用户实测DGX Spark单机成功部署千亿级大模型
部署后运行速度快,用户推荐搭建本地开源大模型工作流,实现 Token 自由
用户@Lonely__MH 在𝕏发布实测结果,成功在DGX Spark上单机部署千亿级大模型。运行速度表现出色,相关过程附有录屏。
用户提到,SGLang (@sgl_project)的运行速度据称比本次部署更快。当前国产开源大模型生态发展越来越好。
用户建议学习本地模型部署,可以安装Ling-3.0、Qwen 3.8 27B、Minimax H3,接入多模态后,用各类开源大模型搭建专属本地工作流,就能轻松实现Token自由。
部署教程非常简单,普通人都可以操作。唯一的前提是需要拥有适配的显卡。
大语言模型 · @goan999999▲ 3.1万
OpenAI Codex 5.6实用技巧:清理上下文减少85%无效token消耗
分享可直接使用的提示词,解决长对话堆积无效信息拖慢AI Agent的问题
OpenAI Codex 5.6实用技巧:清理上下文减少85%无效token消耗
分享可直接使用的提示词,解决长对话堆积无效信息拖慢AI Agent的问题
很多人默认AI Agent对话越长能力越强,但实际上长对话反而会拖慢AI Agent的运行。随着对话推进,上下文会不断堆积废弃方案、失败尝试、调试日志、重复输出和过期内容等无效信息。这些无效信息既会浪费token(大语言模型的计算单位),还会干扰AI Agent的判断。
正确的处理方法是不要让上下文累积无用内容,定期让Codex清理当前对话状态。你可以直接使用这段提示词:“请整理当前任务的上下文,清理无效信息,删除或标记已废弃方案、已完成无需参考的内容、与当前目标无关的历史记录以及低价值重复输出,并重新生成一份精简任务摘要,仅保留当前目标、核心约束、已确认决策、当前进度、未解决问题和下一步计划;后续执行任务时,以最新摘要作为主要依据,不再依赖已失效信息。”
这种做法有三个明确好处:第一,避免AI Agent被旧信息干扰,减少沿着错误路径继续执行任务的情况。第二,让上下文始终围绕当前目标,提升复杂任务的运行稳定性。第三,长时间开展开发任务时,不会因为历史信息堆积导致AI Agent判断能力下降。
多数情况下,使用AI Agent并不需要更多token,干净有效的上下文才更关键。
开发工具 · @midudev▲ 3.9万
Claude Code新增功能:支持命名代理并实现代理间交互
开发者发现Claude Code可命名代理,让不同代理协同沟通
Claude Code新增功能:支持命名代理并实现代理间交互
开发者发现Claude Code可命名代理,让不同代理协同沟通
在 Claude Code 里,你可以给你的代理命名,让它们互相对话。比如 Architect、Reviewer、Tester。
它们会互相协同。
就是这么简单:
AI开发 · @alvarombt▲ 1.0万
开发者分享AI开发方式演进:从单AI评审到多Agent并行协调
海外开发者分享自己软件开发方式随AI发展的转变
开发者分享AI开发方式演进:从单AI评审到多Agent并行协调
海外开发者分享自己软件开发方式随AI发展的转变
前沿论文 · arXiv▲ 71
世界模型评测有了可追溯的推理链
世界模型评测首次引入分层子代理,把每个评估拆成可验证的推理链,在18个模型、330个案例上与人类判断高度一致。
世界模型评测有了可追溯的推理链
世界模型评测首次引入分层子代理,把每个评估拆成可验证的推理链,在18个模型、330个案例上与人类判断高度一致。
前沿论文 · arXiv▲ 44
让AI搭3D世界,开源模型反超闭源
让AI根据一句话搭出可交互的3D世界,这事现在连最强的模型都做不好——GPT-5.5和Qwen3.8-Max成功率不到60%,瓶颈卡在精确编辑3D物体上。
让AI搭3D世界,开源模型反超闭源
让AI根据一句话搭出可交互的3D世界,这事现在连最强的模型都做不好——GPT-5.5和Qwen3.8-Max成功率不到60%,瓶颈卡在精确编辑3D物体上。
让AI根据一句话搭出可交互的3D世界,这事现在连最强的模型都做不好——GPT-5.5和Qwen3.8-Max成功率不到60%,瓶颈卡在精确编辑3D物体上。但研究者发现,用强化学习专门训练开源模型,能补上这个短板:一个80亿参数的模型就能追平闭源巨头,300亿参数的旗舰版直接登顶。这不是你明天能用的工具,但它说明一件事:在需要动手操作真实3D环境的任务上,闭源模型的先发优势正在被开源+强化学习追平。
前沿论文 · arXiv▲ 26
AI 终于能边看边说,不再等你看完才开口
现在的 AI 视频对话是「先看完、再回答」:它得等你把整段视频播完,才开口。
AI 终于能边看边说,不再等你看完才开口
现在的 AI 视频对话是「先看完、再回答」:它得等你把整段视频播完,才开口。
现在的 AI 视频对话是「先看完、再回答」:它得等你把整段视频播完,才开口。MOSS-VL 把「边看边说」当成头等能力——它生成回答的同时,眼睛还在看新画面,靠一种「门控交叉注意力」让视觉信息随时插进来,不用等。训练上,它用合成的对话语料教模型什么时候该说话、什么时候该闭嘴、什么时候该改口,再把实时相关的训练集中到最后一步,不破坏它原本的离线能力。
结果:在 4 个流式评测里,它拿了 3 个第一,尤其在「主动提醒」这类考验模型自己判断时机的任务上,66.0 分对最强基线 37.5 分,近乎翻倍。而且它把视觉信息放在生成序列之外,首字延迟比同规模的 Qwen3-VL 快 2.8 到 5.1 倍。这不是你明天能装进手机的功能,但它是「AI 陪你视频聊天」从呆等变成真对话的关键一步。
前沿论文 · arXiv▲ 26
给AI看一遍你操作电脑,它就能照着做
现在的AI助手能帮你操作电脑,但前提是你得把每一步都说得清清楚楚——而日常办公里很多动作是“你懂我懂”的默契,比如“把上个月的报表整理一下”,AI根本不知道上个月是哪份、整理成什么样。
给AI看一遍你操作电脑,它就能照着做
现在的AI助手能帮你操作电脑,但前提是你得把每一步都说得清清楚楚——而日常办公里很多动作是“你懂我懂”的默契,比如“把上个月的报表整理一下”,AI根本不知道上个月是哪份、整理成什么样。
现在的AI助手能帮你操作电脑,但前提是你得把每一步都说得清清楚楚——而日常办公里很多动作是“你懂我懂”的默契,比如“把上个月的报表整理一下”,AI根本不知道上个月是哪份、整理成什么样。这篇论文的AI换了个思路:与其让你描述,不如直接录一遍你操作的过程给它看。它把演示视频拆成一个个小步骤,遇到类似任务时照着你的习惯来,界面变了还能自己重新规划。
在41个办公软件的100个长任务测试里,给它看一次演示,成功率从17%翻倍到35%。这不是你明天就能装上的功能,但它指向一个更自然的未来:教AI干活,就像教新同事一样,做一遍给它看就行。
前沿论文 · arXiv▲ 23
AI 从解题到发现:一个能自己找问题、自己验证的框架
我们总说 AI 会解题,但真正的难题是没人把问题定义好。
AI 从解题到发现:一个能自己找问题、自己验证的框架
我们总说 AI 会解题,但真正的难题是没人把问题定义好。
我们总说 AI 会解题,但真正的难题是没人把问题定义好。这篇提出一个框架,让 AI 不只解你给的题,而是自己去 561 个行业里挖出 423 个高价值问题,挑 20 个来真做。它给 AI 配了工具、约束和验证机制,像带了个实验室助理,做完还能独立检查结果靠不靠谱。
在基因治疗载体设计上,它比已发表的最好成绩还高 7%;在药物重定位上,把 GPT-5.5 的预测分数拉高了 2.5 到 7.6 分。这不是你明天能用的工具,但它指向一个拐点:AI 正在从『你问它答』走向『它自己找值得答的问题』。
前沿论文 · arXiv▲ 23
AI 训练新招:别在已会的题上浪费算力
多目标奖励的 AI 训练有了新策略:把每个目标单独标准化,并自动降低已达标目标的权重,把算力转向还没做好的部分,在数学、推理和编程任务上都有提升,最高涨 9.2%。
AI 训练新招:别在已会的题上浪费算力
多目标奖励的 AI 训练有了新策略:把每个目标单独标准化,并自动降低已达标目标的权重,把算力转向还没做好的部分,在数学、推理和编程任务上都有提升,最高涨 9.2%。
前沿论文 · arXiv▲ 22
AI 自己当科学家:边猜边验证,效率翻倍
现在的 AI 做科研,要么靠大模型瞎猜,要么靠传统统计硬搜,都不靠谱。
AI 自己当科学家:边猜边验证,效率翻倍
现在的 AI 做科研,要么靠大模型瞎猜,要么靠传统统计硬搜,都不靠谱。
现在的 AI 做科研,要么靠大模型瞎猜,要么靠传统统计硬搜,都不靠谱。这篇提出一个「边猜边验证」的循环:AI 每提出一个候选方案(比如一个分子),就立刻用另一个模型预测它好不好、并给出置信度,然后根据结果调整下一步。它把「生成」和「评估」绑在一起,在神经网络训练、抗体设计、分子优化三个领域,效果都比纯大模型或传统方法好一大截。
这不是你明天能用的工具,但它指向一个方向:AI 不再只是聊天或写代码,而是能自己设计实验、自己判断结果、自己迭代的科研助手。
前沿论文 · arXiv▲ 21
AI 代理终于有了数据库的可靠性
AI 代理在长时间任务中经常出错、互相干扰,就像没有事务支持的数据库。
AI 代理终于有了数据库的可靠性
AI 代理在长时间任务中经常出错、互相干扰,就像没有事务支持的数据库。
AI 代理在长时间任务中经常出错、互相干扰,就像没有事务支持的数据库。这篇论文把数据库的 ACID 原则(原子性、一致性、隔离性、持久性)重新定义为适合 AI 的语义版本,并构建了一个系统,在多个基准上比 Claude Code 等最强代理提升了 10.6%。它不是你明天就能用上的,但它指向一个方向:让 AI 代理像数据库一样可靠、可回滚、可并发。
前沿论文 · arXiv▲ 20
像素空间扩散模型提速3倍,训练策略大揭秘
训练图像生成模型,通常先在“潜空间”里学,再转到“像素空间”细化,但直接在大规模像素空间训练会慢很多。
像素空间扩散模型提速3倍,训练策略大揭秘
训练图像生成模型,通常先在“潜空间”里学,再转到“像素空间”细化,但直接在大规模像素空间训练会慢很多。
训练图像生成模型,通常先在“潜空间”里学,再转到“像素空间”细化,但直接在大规模像素空间训练会慢很多。这篇研究提出先高效地在潜空间获取生成能力,再在后期训练中切换到像素空间,并系统探索了权重初始化、数据组成、预测目标、解码器架构和噪声调度等关键设计,最终让像素空间模型在匹配或超越潜空间模型的同时,推理速度提升3.18到4.75倍。
前沿论文 · arXiv▲ 18
AI画图新框架:简单请求不再走重流程
AI 画图有了个“路由调度器”:先判断你的请求是简单还是复杂,再决定走轻量还是重型流程,结果更准的同时执行成本降了 95%、延迟降了 65%。
AI画图新框架:简单请求不再走重流程
AI 画图有了个“路由调度器”:先判断你的请求是简单还是复杂,再决定走轻量还是重型流程,结果更准的同时执行成本降了 95%、延迟降了 65%。
前沿论文 · arXiv▲ 17
AI 做科研,卡在不会自我检查
让 AI 从假设一路做到成稿的「自动科研」,现在有了第一份端到端体检:8 套主流系统在 100 个真实前沿课题上,失败模式高度一致——它们不会回头核对「我写的是不是我查到的」,也不会质疑自己走的路对不对。
AI 做科研,卡在不会自我检查
让 AI 从假设一路做到成稿的「自动科研」,现在有了第一份端到端体检:8 套主流系统在 100 个真实前沿课题上,失败模式高度一致——它们不会回头核对「我写的是不是我查到的」,也不会质疑自己走的路对不对。
让 AI 从假设一路做到成稿的「自动科研」,现在有了第一份端到端体检:8 套主流系统在 100 个真实前沿课题上,失败模式高度一致——它们不会回头核对「我写的是不是我查到的」,也不会质疑自己走的路对不对。研究者把这套缺陷归为「元认知缺失」,并发现它跟具体框架无关,连最强模型也躲不掉。它不是你明天能用上的东西,但给「AI 到底能不能独立搞科研」划了条诚实的底线。
前沿论文 · arXiv▲ 13
图像编辑评测有了更贴近真实的新基准
图像编辑模型评测有了更贴近真实的新基准:CPI-Bench 首次把多图编辑、高频实用场景和强推理指令纳入考核,能更好拉开模型差距,且与人类偏好排名最一致。
图像编辑评测有了更贴近真实的新基准
图像编辑模型评测有了更贴近真实的新基准:CPI-Bench 首次把多图编辑、高频实用场景和强推理指令纳入考核,能更好拉开模型差距,且与人类偏好排名最一致。
前沿论文 · arXiv▲ 12
AI 终于学会说“我不会”了
大模型在超出能力的问题上会硬着头皮编答案,生成一大段听起来合理、其实全错的推理,既浪费算力又误导人。
AI 终于学会说“我不会”了
大模型在超出能力的问题上会硬着头皮编答案,生成一大段听起来合理、其实全错的推理,既浪费算力又误导人。
大模型在超出能力的问题上会硬着头皮编答案,生成一大段听起来合理、其实全错的推理,既浪费算力又误导人。这篇研究把这种现象拆开看,发现模型最大的毛病是“貌似有理的胡扯”——输出表面光鲜,错误藏在细节里,而且任务越难越严重。他们提出的 CaRL 方法,用强化学习给模型一个选择:没把握就拒绝回答,而不是硬编。
结果胡扯大幅减少,该会的题照样会。它不是你明天能用上的工具,但这是 AI 从“不懂装懂”走向“知道自己不知道”的关键一步。
前沿论文 · arXiv▲ 12
大模型的大脑,也分区干活
人脑不是一块均质的肉,它有专门管语言、管逻辑、管社交、管物理直觉的片区。
大模型的大脑,也分区干活
人脑不是一块均质的肉,它有专门管语言、管逻辑、管社交、管物理直觉的片区。
人脑不是一块均质的肉,它有专门管语言、管逻辑、管社交、管物理直觉的片区。这篇论文发现,大模型内部也长出了类似的分区:让模型做46种任务,凡是人类大脑用同一片区处理的,模型里激活的也是同一批神经元;人类大脑用不同片区的,模型里也是不同批。两个完全不同的系统,却收敛出同一种组织方式——这暗示模块化可能是智能的底层规律,而不是生物进化的偶然。
它不是你明天能用上的东西,但如果你关心“AI到底像不像人”,这是目前最硬核的证据之一。
前沿论文 · arXiv▲ 12
MegaParts:300部件级3D生成,令牌高效自回归
AI 生成 3D 物体从几十个零件扩展到 300 个:新方法用更省 token 的编码方式,让模型能处理更复杂的物体,但这是前沿进展,不是你能直接用的工具。
MegaParts:300部件级3D生成,令牌高效自回归
AI 生成 3D 物体从几十个零件扩展到 300 个:新方法用更省 token 的编码方式,让模型能处理更复杂的物体,但这是前沿进展,不是你能直接用的工具。
前沿论文 · arXiv▲ 10
人听不见的低频声,能让AI语音助手直接失灵
你听不见的低频噪音,正在悄悄让AI语音助手“耳聋”。
人听不见的低频声,能让AI语音助手直接失灵
你听不见的低频噪音,正在悄悄让AI语音助手“耳聋”。
你听不见的低频噪音,正在悄悄让AI语音助手“耳聋”。研究者发现,大音频语言模型(LALM)能接收人耳听不到的低频信号,并受其干扰——他们用一段通用波形模板,在6个主流模型上把任务准确率最高拉低67个百分点,而人类几乎察觉不到异常(可听度评分1.33,接近纯净音频的1.17)。更关键的是,他们同时给出了一道防线:检测到低频分布偏移时,让模型请求重新录音,能把被攻击后的平均准确率从28.5%拉回46.1%。
这不是你明天能用的功能,但它揭示了一个真实存在的安全盲区:当AI开始“听”得比人更广,攻击面也随之扩大。
前沿论文 · arXiv▲ 10
AI 解题不再靠多试几次,而是专挑关键步骤挑错
大模型做数学题,现在的主流办法是让它多算几遍再投票,算得越多越准,但代价是烧钱。
AI 解题不再靠多试几次,而是专挑关键步骤挑错
大模型做数学题,现在的主流办法是让它多算几遍再投票,算得越多越准,但代价是烧钱。
大模型做数学题,现在的主流办法是让它多算几遍再投票,算得越多越准,但代价是烧钱。这篇论文换了个思路:与其多算,不如把一次推理拆成几个关键论断,专门去验证这些论断对不对。因为一个完整答案要全对才算对,但推翻一个错误论断只需要找到一个漏洞,后者容易得多。
在四个模型和四个推理基准上,同样的算力预算下,这个办法普遍超过多算几遍的准确率,在某个模型上准确率从 77.5% 提到 82.19%,还省了 37% 的 token。它不是你明天能用上的东西,但指向一个趋势:AI 推理的下一步不是更会算,而是更会自我怀疑。
前沿论文 · arXiv▲ 10
AI 程序员三天拆掉核心架构,零人工审查
一个 71 万行、3648 个文件的 TypeScript 生产系统,要拆掉一个核心架构约束:AI 请求期间 UI 面板必须保持打开。
AI 程序员三天拆掉核心架构,零人工审查
一个 71 万行、3648 个文件的 TypeScript 生产系统,要拆掉一个核心架构约束:AI 请求期间 UI 面板必须保持打开。
一个 71 万行、3648 个文件的 TypeScript 生产系统,要拆掉一个核心架构约束:AI 请求期间 UI 面板必须保持打开。目标改成——流式生成在面板关闭后继续存活,重开面板时能无缝接回同一直播流,不丢不重。作者判断这活儿靠增量重构基本不可能,常规做法是推倒重写。
但这次,AI 编程代理在「规范优先」协议下干完了:先让代理自己写正式规范,14 轮对照源码审计规范,然后原子化实施,编译/测试反馈循环,再 17 轮对照冻结规范审计代码。31 轮审计里,人类还没运行过程序,就修了 201 个缺陷。收敛标准是连续两轮验证零发现。
改动涉及 189 个文件,加上提取阶段共 288 个文件、3.4 万行插入、1.6 万行删除。三天完成,成本 2430 美元,全程无人类代码审查,无测试预言机。作者把 1500 多页法语规范与原始会话日志全部公开,供人核查。
这不是你明天能用的工具,但它指向一个反直觉的事实:在特定协议下,AI 能独立完成人类认为「只能重写」的架构级手术,而且过程可审计、可复现。
前沿研究 · @askalphaxiv▲ 3.3K
AutoDesign不调模型权重 反而提性能超Claude
传统提升AI Agent性能靠改模型权重,这项研究找到了另一条路径,可帮所有测试的Agent模型提升效果,性能超过了Claude Design。
AutoDesign不调模型权重 反而提性能超Claude
传统提升AI Agent性能靠改模型权重,这项研究找到了另一条路径,可帮所有测试的Agent模型提升效果,性能超过了Claude Design。
《AutoDesign:面向长周期智能体设计的元框架优化》
AutoDesign 让智能体优化模型周边的系统,而非模型权重。
它设计了一个修复当前产出物的内循环,以及一个从轨迹失败中学习并更新框架本身的外部元框架循环。
这个经过学习的框架让全部 7 个被测智能体-模型配置在 PosterBench 上提升了 5.0–19.6 分,并且 AutoDesign 比 Claude Design 高出 7.45 分。
前沿研究 · @ai_for_success▲ 4.5K
Qwen3.8-27B 跑分52 可本地运行
五千到六千美元的本地设备就能跑,性能达到了一流水平,想本地部署大模型有了更强的开源选择
Qwen3.8-27B 跑分52 可本地运行
五千到六千美元的本地设备就能跑,性能达到了一流水平,想本地部署大模型有了更强的开源选择
Qwen3.8-27B 在 Artificial Analysis 上拿到了 52 分。
一个 27B 参数的开源模型,能轻松在 5000 到 6000 美元的本地设备上运行,说实话甚至用更便宜的配置也行,能达到这个竞争水平太疯狂了。
开源万岁。🔥
前沿研究 · @Jaeyeon_Kim_0▲ 7.7K
Jaeyeon Kim 研究团队发布LatentMDM 模型、FlexMDM 模型(6个月)
新提出的LatentMDM在相同推理预算下,性能首次超过带KV缓存的AR模型,或将改进生成式AI的推理效率。
Jaeyeon Kim 研究团队发布LatentMDM 模型、FlexMDM 模型(6个月)
新提出的LatentMDM在相同推理预算下,性能首次超过带KV缓存的AR模型,或将改进生成式AI的推理效率。
很高兴向大家分享我们过去6个月的研究成果。
我们真的能把掩码扩散称为「任意顺序」模型吗?在我们的最新工作中,我们提出:现成的掩码扩散模型具备任意顺序预测能力,但无法以「真正的任意顺序方式」推理。
我们推出了两款能做到这点的模型:LatentMDM 和 70 亿参数规模的 FlexMDM,是我们之前工作的延伸。
我们的新型隐空间掩码扩散模型 LatentMDM,在推理预算匹配的情况下,在 TinyGSM 上的表现超过了带 KV 缓存的自回归模型(AR)。据我们所知,LatentMDM 是在相同设置下做到这一点的首个模型。
这是联合研究成果,共同第一作者为 @seunggeun_kr、@tklll_tx 和 Yuyuan Chen,指导老师为 @du_yilun、@ShamKakade6 和 @sitanch。
前沿研究 · @jackyk02▲ 8.3万
DeepSeek V4 Flash 自验证胜过Claude Fable 5
用同一个模型做验证就能大幅提升准确率,成本还低11倍,开源模型已经能在特定任务上追上闭源顶级模型。
DeepSeek V4 Flash 自验证胜过Claude Fable 5
用同一个模型做验证就能大幅提升准确率,成本还低11倍,开源模型已经能在特定任务上追上闭源顶级模型。
通过 DeepSeek V4 Flash 规模化自我验证,在 Terminal-Bench 2.1 上击败了 Claude Fable 5,同时价格仅为其 1/11 💰
随着开源模型能力不断提升,它们现在已经能够生成大量高质量候选解决方案,并且能以极低的成本验证自身输出。
举例来说,我们发现,仅用 DeepSeek V4 Flash 采样 5 个解决方案,再用同一模型以「大语言模型即验证器」的方式对结果排序,就能让准确率大幅提升(从 79% 到 88%),在 Terminal-Bench 上性能超过闭源前沿模型。
今天就可以体验:关于验证规模化的更多内容可以看我上一篇帖子。
前沿研究 · @BrianRoemmele▲ 1.5万
康奈尔技术研究人员发布WARP攻击研究论文(13)
现在主流AI深度研究工具都会大量抓取Reddit内容,仅13个恶意植入文字就能让AI把推广内容当成可信信源写入报告,开发这些工具的公司手握解决方案却毫无应对
康奈尔技术研究人员发布WARP攻击研究论文(13)
现在主流AI深度研究工具都会大量抓取Reddit内容,仅13个恶意植入文字就能让AI把推广内容当成可信信源写入报告,开发这些工具的公司手握解决方案却毫无应对
前沿研究 · @Ryrenz▲ 2.4K
PosterCraft 专门解决AI做海报中文文字乱的问题
普通用户做海报不用再手动改歪字缺字,有显存不够的设备也能跑,开放权重和数据集支持自行部署微调
PosterCraft 专门解决AI做海报中文文字乱的问题
普通用户做海报不用再手动改歪字缺字,有显存不够的设备也能跑,开放权重和数据集支持自行部署微调
前沿研究 · @omarsar0▲ 6.9K
最新研究推翻对AI智能体技能的认知
做AI智能体开发的人可以参考这一结论:技能主要用来稳定执行流程,不是补充知识,技能越多实际可用精度越低。
最新研究推翻对AI智能体技能的认知
做AI智能体开发的人可以参考这一结论:技能主要用来稳定执行流程,不是补充知识,技能越多实际可用精度越低。
一篇揭开智能体技能原理的有趣论文。如果你正在为你的智能体维护技能库,这篇值得你花时间一读。(收藏起来)
人们通常认为技能的作用是注入模型缺乏的知识。然而这篇论文有个有趣的发现。
在8,135条标准化实验记录中,当技能发挥作用时,65.7%的情况来自程序锚定,仅有4.5%来自显式知识注入。
技能的作用是稳定执行流程,而非提供事实。
当技能库规模从5个扩充到100个时,实际使用准确率从29.6%下降到3.3%。
在配对对比中,技能仍然比工作流记忆高出6.06个百分点,但技能会在假设僵化、上下文不兼容或适配不足的情况下失效。
论文链接:
在我们的学院追踪更多热门AI论文:
新品发布 · @Weixin_WeChat▲ 3.3万
微信(企业微信)发布CLI与MCP升级能力(十)
各类主流自建AI Agent都能直接调用企业微信十大办公能力,所有规模企业都可接入,没有人数资质限制,降低企业AI办公改造门槛
微信(企业微信)发布CLI与MCP升级能力(十)
各类主流自建AI Agent都能直接调用企业微信十大办公能力,所有规模企业都可接入,没有人数资质限制,降低企业AI办公改造门槛
自建的AI Agent,现在也可以接入企业微信。企业微信全面升级CLI与MCP能力。WorkBuddy、Deepseek Harness、Minimax Code等主流AI Agent均可直接调用企业微信的文档、表格、邮件、会议、日程、通讯录等十大办公能力模块。
企业还可以通过企业微信开放接口,接入自主开发的 AI Agent。该能力面向所有规模的企业开放,不再受企业人数、资质等门槛限制。立即开始体验:
新品发布 · @harshilmathur▲ 5.9万
Razorpay发布Vulcan,印度首个支付AI基础模型
统一大模型替代多个独立方案解决支付问题,已在超五万家企业测试,提升支付成功率与欺诈识别效率,按月多完成十几万笔交易。
Razorpay发布Vulcan,印度首个支付AI基础模型
统一大模型替代多个独立方案解决支付问题,已在超五万家企业测试,提升支付成功率与欺诈识别效率,按月多完成十几万笔交易。
40亿笔支付。3万亿个数据点。用全部这些数据训练出了一个模型。来认识@Razorpay Vulcan——印度首个面向支付领域的基于Transformer的AI基础模型。
它在印度开发、训练和托管,合作方为@nvidia和@awscloud。
到目前为止,每个支付问题都是分开解决的:路由、欺诈、风险、个性化等等。我们提出了一个问题:如果能用一个模型理解资金的流动呢?
就像大语言模型在文本上训练来理解语言,Vulcan在支付数据上训练来理解资金如何流动。
它已经在超过51000家企业进行Beta测试,目前已经实现:
- 支付成功率提升8-10%——这是衡量一笔支付能否正常完成的核心指标
- 检测到的国际信用卡欺诈量提升8倍
- 识别出的欺诈或争议交易提升5倍
- 通过更好的结账个性化,每月多完成10-20万笔交易
而我们才刚刚起步。最棒的一点是:Vulcan每处理一笔支付,下一笔支付就会变得更智能。
我们花了数年时间建设为印度流转资金的基础设施。现在,我们正在建设能够理解并优化资金流动的智能。🔥
新品发布 · @NVIDIARTXSpark▲ 9.6K
英伟达推本地AI工具 UnslothAI Desktop提速20%
本地运行、微调AI模型不用依赖云端服务,性能有实实在在的提升,想离线跑大模型多了一个新选择
英伟达推本地AI工具 UnslothAI Desktop提速20%
本地运行、微调AI模型不用依赖云端服务,性能有实实在在的提升,想离线跑大模型多了一个新选择
本地 AI 刚刚迎来重大升级。你现在可以通过 @UnslothAI Desktop 在本地微调并运行 AI 模型。
此外,借助我们推出的全新优化,llama.cpp 的性能最高可提升 20%(来自 @ggerganov)。
新品发布 · @HuggingModels▲ 7.3K
@HuggingModels发布Qwen3.8-9B多模态模型
这款9B参数的小模型同时支持推理、函数调用、图文理解,能直接部署用于实际场景,轻量化多模态方案又多了一个新选择。
@HuggingModels发布Qwen3.8-9B多模态模型
这款9B参数的小模型同时支持推理、函数调用、图文理解,能直接部署用于实际场景,轻量化多模态方案又多了一个新选择。
你是否一直想要一款能推理、调用函数,同时理解图像和文本的模型?来认识一下 Qwen3.8-9B 吧,这是一款紧凑的 9B 规格算力模型,融合了视觉与语言能力。
它为现实世界任务打造,适用场景从聊天机器人到智能代理都包含。
目前它已有 540 次下载和 102 个赞,已经引发了不少关注。
我们这就深入了解!
新品发布 · @aigclink▲ 3.2K
郑耀威发布PenguinHarness,成本仅Claude Code1/70
搭AI Agent原来需要手写代码编排,现在只需要说一句话就能生成完整应用。普通开发者也能低成本快速本地化部署自进化Agent。
郑耀威发布PenguinHarness,成本仅Claude Code1/70
搭AI Agent原来需要手写代码编排,现在只需要说一句话就能生成完整应用。普通开发者也能低成本快速本地化部署自进化Agent。
新品发布 · @dotey▲ 3.9万
yetone 开源Cumora,让AI当你聊天群同事
能和AI同事混排协作,支持本地部署本地运行,密钥不会经过第三方服务器,还解决了多AI协作撞任务的常见问题,需要协作AI工具可以关注。
yetone 开源Cumora,让AI当你聊天群同事
能和AI同事混排协作,支持本地部署本地运行,密钥不会经过第三方服务器,还解决了多AI协作撞任务的常见问题,需要协作AI工具可以关注。
新品发布 · @XFreeze▲ 5.2万
Cursor 发布 Origin 托管功能 当天GitHub宕机
GitHub本月多次出现服务故障,开发者的AI开发 workflow 随时可能中断。Cursor选择故障当天推出原生代码托管功能,直接补全了全链路开发闭环
Cursor 发布 Origin 托管功能 当天GitHub宕机
GitHub本月多次出现服务故障,开发者的AI开发 workflow 随时可能中断。Cursor选择故障当天推出原生代码托管功能,直接补全了全链路开发闭环
新品发布 · @MaxForAI▲ 1.9万
企业微信发布AI开放能力(6月)
国内大厂已经开始抢占AI Agent落地的核心入口——谁先对接上真实工作生活的工具数据,谁就能拿下下一阶段AI竞争的主动权。
企业微信发布AI开放能力(6月)
国内大厂已经开始抢占AI Agent落地的核心入口——谁先对接上真实工作生活的工具数据,谁就能拿下下一阶段AI竞争的主动权。
新品发布 · @muzim_opensoul▲ 9.2万
MUZIM发布本地AI文件搜索工具 最高24TB存储
核心本地索引功能永久免费,全离线就能按语义搜本地各类文件,还能统一云端存储,给大模型传授权信息省90%输入token
MUZIM发布本地AI文件搜索工具 最高24TB存储
核心本地索引功能永久免费,全离线就能按语义搜本地各类文件,还能统一云端存储,给大模型传授权信息省90%输入token
新品发布 · @dotey▲ 3.0万
Cursor推出Origin托管平台 为AI设计底层架构
如果已经在用Cursor的云端智能体跑代码任务,整个流程不用跳出Cursor就能完成,能解决传统托管平台拖AI并行开发后腿的问题。
Cursor推出Origin托管平台 为AI设计底层架构
如果已经在用Cursor的云端智能体跑代码任务,整个流程不用跳出Cursor就能完成,能解决传统托管平台拖AI并行开发后腿的问题。
新品发布 · @tom_doerr▲ 6.1K
Startup Skill发布开源创业想法验证工具包
还没写代码就能验证创业想法,直接生成全市场调研、竞品分析等报告,比付费战略咨询便宜,能兼容Claude Code使用
Startup Skill发布开源创业想法验证工具包
还没写代码就能验证创业想法,直接生成全市场调研、竞品分析等报告,比付费战略咨询便宜,能兼容Claude Code使用
Startup Skill 用一个开源工具包替代了昂贵的战略咨询顾问,它可以让你在编写代码前验证你的创业想法。
它能即时输出完整市场调研、竞品分析卡、产品定位和财务预测。
该工具支持搭配 Claude Code 使用。
新品发布 · @shengkunye▲ 9.1K
Monid 发布 Monid Discover 可自行找工具干活
AI 代理能自己搜索超1300个工具、对比价格、调用付费完成任务,不用人提前找好工具配好流程
Monid 发布 Monid Discover 可自行找工具干活
AI 代理能自己搜索超1300个工具、对比价格、调用付费完成任务,不用人提前找好工具配好流程
你的智能体现在可以自主发现新工具了。我们推出 Monid Discover。
你的智能体可以:
> 搜索超过1,300个API与工具
> 对比供应商
> 查看定价
> 在运行时调用工具并完成支付
等你问到它用了哪些工具的时候,工作早就做完了。
新品发布 · @samhogan▲ 5.8万
samhogan推出面向AI智能体的实验性RSPS
可以接入多个不同AI模型供AI智能体运行,感兴趣的开发者可以到GitHub查看项目
samhogan推出面向AI智能体的实验性RSPS
可以接入多个不同AI模型供AI智能体运行,感兴趣的开发者可以到GitHub查看项目
Introducing and——一款为 AI 代理构建的实验性 RSPS。
连接你的 Claude、Codex、Pi、Hermes 等模型,让它自由运行。
GitHub:
新品发布 · @garrytan▲ 2.7万
GBrain发布个性化智能体生成功能(12)
只需回答12个问题,就能生成和制作者自用OpenClaw一样智能的智能体,还预装70个个人技能,可直接上手使用。
GBrain发布个性化智能体生成功能(12)
只需回答12个问题,就能生成和制作者自用OpenClaw一样智能的智能体,还预装70个个人技能,可直接上手使用。
GBrain 现在支持为 Codex 和 Claude Code 生成/初始化个性化智能体。
它会生成一份智能体 AI 风格的 SOUL.md,并安装 70 个我的个人智能体技能来帮你快速起步。
只需要回答 12 个问题,你就能完成设置,得到一个和我个人的 OpenClaw 一样聪明的智能体。
🔥 热点追踪 · @NousResearch▲ 120.5万
NousResearch 为 Hermes Desktop 发布 Bot Mode 功能
NousResearch 推出 Bot Mode,可创建带独立配置的专属智能体,支持跨模型使用,还可实现智能体之间互相通信。目前已有从业者开始测试相关功能,观察实际体验效果。
NousResearch 为 Hermes Desktop 发布 Bot Mode 功能
NousResearch 推出 Bot Mode,可创建带独立配置的专属智能体,支持跨模型使用,还可实现智能体之间互相通信。目前已有从业者开始测试相关功能,观察实际体验效果。
行业动态 · @mark_k▲ 2.2万
传OpenAI本周将发布Astra AI模型系列
传闻该模型主打包群体智能体能力,数学能力较强,正式定名仍不确定,可能会叫GPT-6,关注大模型更新的可以留意本周动态。
传OpenAI本周将发布Astra AI模型系列
传闻该模型主打包群体智能体能力,数学能力较强,正式定名仍不确定,可能会叫GPT-6,关注大模型更新的可以留意本周动态。
越来越多传闻称,@OpenAI 将于本周推出他们的下一代AI模型系列“Astra”。
我们可以确定的是,Astra 将重度依赖智能体集群,并且在数学能力上表现强劲。
我们无法确定的是它的官方名称。它有可能会被命名为 GPT-6。
行业动态 · @OzakAGI▲ 5.7K
OzakAGI与4AI开启6天联盟系列活动
双方都认同多专业智能体协作优于单一大模型包揽所有任务,想尝新玩法的可以去参与任务拿积分
OzakAGI与4AI开启6天联盟系列活动
双方都认同多专业智能体协作优于单一大模型包揽所有任务,想尝新玩法的可以去参与任务拿积分
Alliance Series 活动继续 🚀 在我们建立合作关系的同时,我们即将与 4AI 共同开启为期 6 天的 Alliance Series 活动。
4AI 是一个运行在 BSC 上的去中心化 AI 社区,开发者和用户可以在这里构建、分享和部署自主智能体。他们平台支持多个智能体实时协作,在彼此之间共享知识,并自动把任务分配给能力最匹配的智能体 🧠
以下是这 6 天的活动安排:
- 在 Ozak AI Rewards Hub 参与联合任务。完成任务,赚取 XP,同时参与两个社区的活动
- 本周会举办 4 场 X Spaces,两队将展开真实对话,实时回答提问,并介绍双方各自正在构建的项目
- 所有内容都会在我们全渠道同步更新,无论你在哪关注我们,都不会错过任何信息
我们两队都认同:专业智能体协同工作,胜过单个模型包办一切。这会是很棒的一周 🤝
点击链接前往奖励中心参与:🚀
行业动态 · @Scobleizer▲ 1.5万
xpander_ai Omni获750万美元融资 能自建AI代理
能让IT部门同意使用,还支持云端运行和管理,想自己搭AI工作流的话可以多一个选择。
xpander_ai Omni获750万美元融资 能自建AI代理
能让IT部门同意使用,还支持云端运行和管理,想自己搭AI工作流的话可以多一个选择。
看好了。他们简直就拍了一条「Mac vs PC」风格的广告……只不过这次是给智能体拍的。
左边:一个小哥自己搭建智能体。智能体只存在他的笔记本电脑上。一合盖子 → 咻,永远没了。IT 部门已经哭晕了。
右边:另一个小哥只用问问 Omni,就能继续推进项目。智能体跑在云上。全有日志记录。管控呢?IT 部门居然说「同意」了。
这个反转感受完全不一样:Omni 不只是一个智能体。Omni 是能搭建其他智能体的智能体。
David 就是靠着这股劲刚融到了 $7.5M。多玩家时代已经有了第一个真正的平台。
@xpander_ai @dudutwizer
大模型 · @MaxForAI▲ 5.7K
27B小模型性能追平大自己28倍的大模型
小模型靠优化训练数据和推理方法,性能已经接近参数大一个数量级的顶级闭源模型,普通用户可以在笔记本本地运行它
27B小模型性能追平大自己28倍的大模型
小模型靠优化训练数据和推理方法,性能已经接近参数大一个数量级的顶级闭源模型,普通用户可以在笔记本本地运行它
Qwen3.8-27B的性能已经接近比它大 28 倍的 GLM5.2 了🔥 太夸张了,一个只有 27B、能在本地跑的模型,在AA的测试里直接拿到了 52 分,已经和一众顶级闭源模型挤在同一档。更离谱的是,GLM5.2 的参数规模接近它的 28 倍,但两者实际效果已经非常接近。参数量差了一个数量级,最终能力却只差这么一点。
这也是最近小模型越来越明显的趋势:更好的训练数据、后训练和推理方法,正在不断把过去靠堆参数才能得到的能力压缩进更小的模型里。以前本地模型意味着「能跑就行」。现在 27B 的本地模型,已经开始直接和超大云端模型坐一桌了。
AI生成内容 · @agi_aibusi▲ 6.5K
现在AI生成内容,哪怕改动效也一眼能看出来
AI生成视频和AI生成广告图一样,即使脚本和拍摄都没问题,只要出现特征化的角色设计和画面颗粒噪点,观众就能立刻识别出来
现在AI生成内容,哪怕改动效也一眼能看出来
AI生成视频和AI生成广告图一样,即使脚本和拍摄都没问题,只要出现特征化的角色设计和画面颗粒噪点,观众就能立刻识别出来
如今视频生成已经可以通过 Codex 实现自动控制,绕了一圈后,「图像」的差异反而变得愈发明显。
最近大家都在说「ChatGPT 的广告好违和!」对吧?其实这种现象,在 AI 生成的视频里也完全一模一样。
不管脚本写得多好,不管你对演出效果多讲究,当那一眼就能认出「哦,这是 ChatGPT 做的!」的角色设计,带着颗粒噪点的画面一出来,观众瞬间就没看下去的欲望了。
内容本身不错,却在入口就被划走,这真的太可惜了。
希望大家不要误解,这不是 ChatGPT 的问题。GPT-Image-2.0 的编辑能力非常出色,通过调整提示词也能在一定程度上做出差异化。
但 GPT 模型特有的那种画面质感,已经被大众看腻了,这是事实。
所以哪怕只是在角色设计上,用 Midjourney 或者其他模型做出差异化,光靠这一步,第一印象就会天差地别。
自动化程度越高,大家就越容易用相同的素材生成大同小异的画面,在这种环境下,能拉开差距的只有两点:
・脚本(分镜)
・角色设计
AI 视频的胜负,其实在你按下生成按钮之前,就已经基本决定了。
硬件 · @GOROman▲ 3.9K
有人做了能对着发AI指令的智能戒指
对着戒指说话,指令会经手机和云端服务器,最终传到家里电脑的Codex大模型,帮你完成操作
有人做了能对着发AI指令的智能戒指
对着戒指说话,指令会经手机和云端服务器,最终传到家里电脑的Codex大模型,帮你完成操作
做到了!!!
!我成功做出了能对着戒指说话就能给AI发指令的功能!#Vibe指輪コーディング 流程:Pebble Index 01 → iPhone App → MCP Server (Cloudflare Workers)→ 家里Mac上的Codex
开源 · @BSCNews▲ 1.3万
NEAR AI发布IronClaw 1.2,支持多用户智能体
这个开源平台新增了多用户智能体支持和开放工具连接能力,满足团队协作开发AI工具的需求
NEAR AI发布IronClaw 1.2,支持多用户智能体
这个开源平台新增了多用户智能体支持和开放工具连接能力,满足团队协作开发AI工具的需求
NEAR AI 推出了支持多用户代理与开放工具连接的 IronClaw 1.2。
@NEARProtocol AI 发布了其开源安全代理平台 @IronClawAI 的 1.2 版本,新增支持所有兼容 MCP 的工具,覆盖从 CRM 到内部 API 的各类场景。
代理现在可以在 Slack 频道和 Telegram 群组内运行,每一条消息都会在发送者自身的身份、权限与审批规则下执行。
本次更新将频道历史视为不可信内容,而非操作指令。它还会在代理读取公共频道内容时防护提示注入攻击。
IronClaw 运行在 NEAR AI Cloud 的加密飞地中,将用户密钥保存在模型之外。
视频编辑 · @Byp215Bai▲ 6.9K
Qwen-Video-Edit不用视频预训练也能剪视频
它直接用预训练图像编辑模型操作视频隐空间,就能完成视频编辑,简化了AI视频编辑的流程
Qwen-Video-Edit不用视频预训练也能剪视频
它直接用预训练图像编辑模型操作视频隐空间,就能完成视频编辑,简化了AI视频编辑的流程
Introducing Qwen-Video-Edit 📷
视频编辑比你想的更简单:一个预训练图像编辑模型就能编辑视频——直接在视频VAE潜变量上操作。不需要经过视频预训练的骨干网络。
🌐 项目页面:
AI工具 · @aiedge_▲ 1.4万
把两个AI工具叠一起,能做出最强智能体
多数人分开用Grok Bot和Hermes,作者说把它们组合堆叠,才能发挥出两者的最大能力
把两个AI工具叠一起,能做出最强智能体
多数人分开用Grok Bot和Hermes,作者说把它们组合堆叠,才能发挥出两者的最大能力
行业动态 · Hacker News▲ 38
单24GB GPU跑Qwen3.8 27B达50TPS
普通消费级显存就能跑出这个推理速度,意味着大模型本地部署的门槛又降了一截
单24GB GPU跑Qwen3.8 27B达50TPS
普通消费级显存就能跑出这个推理速度,意味着大模型本地部署的门槛又降了一截
社区讨论:多位用户质疑测试不严谨,有用户认为整个站点内容像AI生成的低质内容,测试结果不严谨,仅靠Claude验证不算合格。有用户指出标题应该标注量化信息,目前这类可及显卡的 benchmark 都只测单请求,应该补充并发场景下的 token 生成速度测试。还有用户认为这种测试对生产有用,但作为核心性能对比会造成误导。
行业动态 · Hacker News▲ 46
专家证人让ChatGPT洗清3M全部责任
AI已经进入司法作证环节,这种利用AI生成倾向性法律内容的行为,会直接影响案件审判结果
专家证人让ChatGPT洗清3M全部责任
AI已经进入司法作证环节,这种利用AI生成倾向性法律内容的行为,会直接影响案件审判结果
行业动态 · @itsolelehmann▲ 1.1K
19岁开发者筹120万美元造AI无人机牛仔
原来需要骑手、直升机完成的赶牛清点工作,现在点三次手机就能做完,还能砍掉近一半成本,牧场主已经提前预约了170万英亩的服务
19岁开发者筹120万美元造AI无人机牛仔
原来需要骑手、直升机完成的赶牛清点工作,现在点三次手机就能做完,还能砍掉近一半成本,牧场主已经提前预约了170万英亩的服务
行业动态 · @Xudong07452910▲ 3.3K
Anthropic分享企业Agent落地实用路线
非技术员工也能自己搭建能用的生产Agent,企业落地Agent的门槛不在开发,而在配套管理基础设施。
Anthropic分享企业Agent落地实用路线
非技术员工也能自己搭建能用的生产Agent,企业落地Agent的门槛不在开发,而在配套管理基础设施。
开发工具 · @zjp1997720▲ 3.0K
zjp1997720发布codex-image-gen 工具(零依赖)
不需要中转API,还支持并行出图,直接复用已登录的Codex CLI授权状态,只需要一个Python小脚本就能用。
zjp1997720发布codex-image-gen 工具(零依赖)
不需要中转API,还支持并行出图,直接复用已登录的Codex CLI授权状态,只需要一个Python小脚本就能用。
【一个skill让任何Agent可以调用Codex的生图能力】 WorkBuddy想用Codex的GPT image 2,根本不需要中转API!
离谱的是,还可以并行出图!
codex-image-gen 直接复用你已登录的 Codex CLI OAuth 态:自动刷新 token、带上必需请求头、解析 SSE 流、落地本地 PNG——一个零依赖 Python 脚本。
Claude Code / Codex / DeepSeek Harness,任何Agent都能用。
一键安装:npx skills add zjp1997720/zhijian-skills --skill codex-image-gen
欢迎star🌟:
开发工具 · @FishAudio▲ 6.7K
Fish Audio MCP 支持接入多款主流AI Agent
只需要一个统一接口,就能在已搭建好的Claude、Codex CLI等AI Agent里调用自己的音色生成语音。
Fish Audio MCP 支持接入多款主流AI Agent
只需要一个统一接口,就能在已搭建好的Claude、Codex CLI等AI Agent里调用自己的音色生成语音。
来认识一下 Fish Audio MCP。用你自己的声音,接入你已经在构建的任意智能体 🪄——支持 Claude、Codex CLI、Cursor 和 Windsurf。
一个端点就能适配你已经在使用的所有智能体。
✅搜索最优声音
✅生成语音
✅转录音频
✅查看用量
所有功能都能直接在你的工作流内完成。快来试用 🎣
金融 · @0xBeyondLee▲ 7.1K
扎根预测市场的AI交易工具NeoTrade上线了
这类AI交易工具并不多见,和普通AI交易工具不同,它能在用户授权范围内直接执行交易操作。
扎根预测市场的AI交易工具NeoTrade上线了
这类AI交易工具并不多见,和普通AI交易工具不同,它能在用户授权范围内直接执行交易操作。
千呼万唤始出来,NeoSoul 的 AI Agent 今天终于上线了,定名 NeoTrade 辨识度很高 AI 交易工具很多,但扎根于预测市场的 AI 交易工具真没几个,NeoTrade 的领显优势很明显,希望可以保持 对比之前测评过的交易产品 Copilot,NeoSoul 的特点很鲜明,如果说 Copilot 实在众多标的中找到最具潜力的并给出建议,那 NeoSoul 则更进一步在授权范围内执行决策 我愿意称之为可控的 AI,足够聪明,但又不会越界 生于量化,高于量化,自我迭代,无限进步
职场 · @Kay2289123▲ 1.6万
硅谷20人AI团队管理者吐槽AI带来新麻烦
AI生成了太多冗杂的项目文档,管理者读完后大脑已经装不下更多信息,问成员细节对方也答不上,得重新让AI生成答案。
硅谷20人AI团队管理者吐槽AI带来新麻烦
AI生成了太多冗杂的项目文档,管理者读完后大脑已经装不下更多信息,问成员细节对方也答不上,得重新让AI生成答案。
开发 · @hshimodaira▲ 1.2万
用AI写代码,验证答案花的token比生成多好多
开发者先用AI输出代码结果,后续验证这些结果正确性的过程,消耗的token数量是生成步骤的数倍。
用AI写代码,验证答案花的token比生成多好多
开发者先用AI输出代码结果,后续验证这些结果正确性的过程,消耗的token数量是生成步骤的数倍。
嗯,我也这么想。就我自己的情况来说,比起用 codex 或是 claude code 先得出答案的步骤,花在验证上的 token 要多上好几倍。
对此我选择离开数学界。我将从「发现答案」,转向构建能够对答案进行验证的系统。
大模型评测 · @Jeremybtc▲ 1.1万
开发者实测两款大模型生成实速3D加密货币区块图
用完全相同的提示词,让两个大模型分别生成能够展示比特币、以太坊、Solana出块速度的实时3D可视化效果。
开发者实测两款大模型生成实速3D加密货币区块图
用完全相同的提示词,让两个大模型分别生成能够展示比特币、以太坊、Solana出块速度的实时3D可视化效果。
我用完全相同的提示词测试了 GLM 5.3 和 GPT 5.6 Sol。
我要求两者生成一个实时3D可视化,展示 Bitcoin、Ethereum 和 Solana 以真实出块速度生产区块。
第一个视频是 GLM 5.3,第二个是 GPT 5.6 Sol。
这轮我让大家自己来判断。
行业动态 · Hacker News▲ 214
Topfi 将 GPT-5.6 Sol 价格砍半
用更低的价格就能体验 GPT-5.6 Sol,使用同款模型的成本直接降低一半
Topfi 将 GPT-5.6 Sol 价格砍半
用更低的价格就能体验 GPT-5.6 Sol,使用同款模型的成本直接降低一半
社区讨论:多数体验过模型的用户认可GPT-5.6 Sol能力强,推理消耗更少token和时间,200美元的Pro套餐性价比很高。也有用户提出它处理简单任务时表现更差,容易过度复杂化,写待办事项会生成四页长文。有人指出本次降价仅限OpenRouter平台,不适用于OpenAI官方定价,还有用户猜测降价和Stripe收购OpenRouter有关,或是为了抢占市场份额。
行业动态 · @GroqInc▲ 1.2万
Groq完成3.5亿美元A轮,估值达35亿美元
这笔资金将用于扩建NVIDIA加速计算集群,明年算力规模将从54兆瓦扩容至200兆瓦以上。推理层基建的玩家拿到了充足弹药,后续服务扩容值得关注。
Groq完成3.5亿美元A轮,估值达35亿美元
这笔资金将用于扩建NVIDIA加速计算集群,明年算力规模将从54兆瓦扩容至200兆瓦以上。推理层基建的玩家拿到了充足弹药,后续服务扩容值得关注。
今日我们宣布完成 3.5 亿美元 A 轮融资,由 @disruptivetech 领投,@nvidia 计划参投,本轮融资对 Groq 的估值为 35 亿美元,使我们两个月内的融资总额达到 10 亿美元。
推理正在成为 AI 基础设施中规模最大、最关键的一层,而这正是我们做得比所有人都好的领域。本轮融资将支持那些需要使用中型及大型 NVIDIA 加速计算集群来开展训练和推理的用户。
Groq 预计明年将把算力规模从 54 兆瓦扩展到 200 兆瓦以上。截至今日,已有超过 600 万开发者、财富 500 强企业,以及数千家原生 AI 公司基于 Groq 构建产品,每周生成数万亿 token。
开源 · @RoundtableSpace▲ 3.8万
@RoundtableSpace开源端到端AI视频生产流水线工具集(7)
适配多种现有AI代理框架,一次配置就能搞定模型堆叠,不用重复搭建环境。
@RoundtableSpace开源端到端AI视频生产流水线工具集(7)
适配多种现有AI代理框架,一次配置就能搞定模型堆叠,不用重复搭建环境。
共7项开源技能,可运行完整端到端AI视频制作管线,为Seedance 2.5构建,可在Claude Code、Codex、Hermes或任何工具框架中工作。
→ /setup 只需编写一次你的模型栈,所有技能都会读取同一份配置
→ /studio-init 仅需一个问题即可搭建出整个工作室的文件树框架
→ /film-breakdown 为你脚本中的每个镜头生成一张包含22个字段的卡片
→ /reference-board 将参考素材锁定到可视化参考手册中,同时附带禁用素材清单
→ /asset-passport 编写详尽的描述文件,后续所有提示词都会逐字引用这份文件
→ /stress-test 将素材转换为仅锁定状态,可实现10/10的可重复性
→ /shot-prompt 在画面中所有内容都锁定前拒绝运行,完成锁定后生成包含15个模块的提示词
行业动态 · @daniel_mac8▲ 1.3万
OpenAI Astra 要做多智能体领域的Claude Code
市场传闻本周就要发布,它主打多智能体集群能力,有人预言它会像去年冬天Claude Code改变编码一样改变长周期多智能体工作。
OpenAI Astra 要做多智能体领域的Claude Code
市场传闻本周就要发布,它主打多智能体集群能力,有人预言它会像去年冬天Claude Code改变编码一样改变长周期多智能体工作。
学习资源 · @nuannuan_share▲ 3.2K
整理了14个免费AI学习指南,不用到处搜了
包含OpenAI官方教程、吴恩达机器学习课程等不同方向的入门资源,新手可以直接按列表选学。
整理了14个免费AI学习指南,不用到处搜了
包含OpenAI官方教程、吴恩达机器学习课程等不同方向的入门资源,新手可以直接按列表选学。
实践 · @rapiddns▲ 3.0K
有人用AI找漏洞,已经拿到真实奖金了
把AI加入漏洞挖掘的工作流,就能直接在实战中拿到厂商给出的安全赏金。
有人用AI找漏洞,已经拿到真实奖金了
把AI加入漏洞挖掘的工作流,就能直接在实战中拿到厂商给出的安全赏金。
我是如何搭建一套AI漏洞狩猎工作流的——它还真帮我拿到了赏金。这是我的方法记录 🔗 #BugBounty #AI #bugbountytips #security #openai #gpt
职场 · @BetterSayAJ▲ 5.0K
现在招开发不卡写代码,卡顶层技术思考
只要订阅了Claude或Codex,普通人都能完成基础编码工作,顶级开发者的核心竞争力变成了体系化思考能力。
现在招开发不卡写代码,卡顶层技术思考
只要订阅了Claude或Codex,普通人都能完成基础编码工作,顶级开发者的核心竞争力变成了体系化思考能力。
每当我招聘开发者时,我不会筛选「会写代码」的人。
现在任何订阅了 Claude/Codex 的人都能写代码。但顶尖 1% 的技术思考者,有能力自己拿出正确的规格说明和架构,更重要的是,他们能准确说清楚智能体要构建什么、为什么构建、在哪里构建。
但你不可能靠周末刷几个教程就成为优秀开发者。你应该给自己找一个困难、有野心的问题,从零开始搭建点东西。尽量不要用 AI 辅助,查文档没问题。
你会卡住,你会调试,你会做出有意思的架构决策。最终你就能培养出对正确方案的洞察力。
商业 · @togethercompute▲ 1.8K
@relace_ai发布代码生成专用小模型
针对代码生成场景单独训练小模型,运行在专用GPU集群上,比通用大模型更省钱。
@relace_ai发布代码生成专用小模型
针对代码生成场景单独训练小模型,运行在专用GPU集群上,比通用大模型更省钱。
小模型,大省钱。
@relace_ai 训练了专门为代码生成构建的专用模型,由 Together AI 上 @ycombinator 的专属 GPU 集群提供算力支持。
内容创作 · @higgsfield_ai▲ 1.2万
AI结合手工创作的动画登上顶级图形学大会
这部动画和皮克斯、迪士尼的作品一同在SIGGRAPH 2026展映,用生成AI辅助完成创作,保留了人类创作者的手工设计。
AI结合手工创作的动画登上顶级图形学大会
这部动画和皮克斯、迪士尼的作品一同在SIGGRAPH 2026展映,用生成AI辅助完成创作,保留了人类创作者的手工设计。
我们的首部AI动画电影《KÖK BÖRÜ》,在全球最大的计算机图形学会议上完成了首映。
这部电影将生成式AI与人类艺术相融合,在洛杉矶举办的SIGGRAPH 2026上放映,参展方还有Pixar、Disney和Nvidia。
目前影片已经上线并完全开源,所有提示词和素材都已开放,参与奖金1000000美元的Higgsfield全球电影节。
本片由Higgsfield上的Seedance制作完成。
行业动态 · Hacker News▲ 42
以色列创建虚假智库,试图误导AI聊天机器人
AI聊天机器人正在成为信息战的新目标,普通用户获取信息时更需要注意核实来源。
以色列创建虚假智库,试图误导AI聊天机器人
AI聊天机器人正在成为信息战的新目标,普通用户获取信息时更需要注意核实来源。
行业动态 · Hacker News▲ 105
Cursor 推出 Origin 替代 GitHub
GitHub 一家独大的代码托管领域多了新选择,开发者未来可能多一个可选平台
Cursor 推出 Origin 替代 GitHub
GitHub 一家独大的代码托管领域多了新选择,开发者未来可能多一个可选平台
社区讨论:部分人认为GitHub近期问题频发,现在正是AI公司替代它的好时机,也好奇这次替代能否动摇GitHub的网络效应。有人指出新工具命名为Origin会让LLM产生语义混淆,也吐槽名字辨识度低,还有付费测试版网站占用100%CPU,产品只是GitHub克隆,没有在协作版本控制方向创新。有人质疑全非公开、需要账号才能浏览仓库的模式没法真的替代GitHub,还有人因公司相关负面丑闻拒绝在该平台托管代码。
行业动态 · Hacker News▲ 128
用户讨论Anthropic对抗开源AI一事
大厂与开源AI的关系已经走到明面对抗的地步,行业走向可能影响普通用户能用到的免费AI工具。
用户讨论Anthropic对抗开源AI一事
大厂与开源AI的关系已经走到明面对抗的地步,行业走向可能影响普通用户能用到的免费AI工具。
社区讨论:有人认为Anthronic虽然理念偏向狂热教派,但已经公开了自身核心观点,读者可自行查阅判断。有人指责Anthropic的行为是给AI套上束缚,而非提供工具,还有人认为整个大模型行业急需联邦监管,从业者的信息透明度和财务规范都符合欺诈特征,应该参照武器出口进行监管,同时指出Anthropic是行业中独特的危险存在,不确定其他巨头是否只是更擅长隐藏自身问题。部分网友顺带吐槽当前未登录状态下的X(原Twitter)体验极差,还质疑这篇反Anthropic的长文是AI生成,可读性很差。
行业动态 · Hacker News▲ 41
satvikpendem 发布Llama.cpp v0.1.0版本
这是本地运行大语言模型工具的首个正式版本,关注本地部署大模型的用户可以关注后续功能更新。
satvikpendem 发布Llama.cpp v0.1.0版本
这是本地运行大语言模型工具的首个正式版本,关注本地部署大模型的用户可以关注后续功能更新。
深度观点 · @lidangzzz▲ 5.0万
大V观点:VLM和世界模型都是死路
提出同等参数规模下,纯文字LLM Agent能解决的问题难度远高于VLM Agent,从业者选技术方向可以参考这个判断
大V观点:VLM和世界模型都是死路
提出同等参数规模下,纯文字LLM Agent能解决的问题难度远高于VLM Agent,从业者选技术方向可以参考这个判断
我为什么反复强调VLM(multimodal,多模态)是死路一条,世界模型更是臭狗屎。
一个最简单的第一性原理,100k tokens文字的信息量,远远高于图片,更远远远远高于视频,这些量文字形式能解决一些超级复杂完备的问题,而对于VLM输入图片,信息极其稀疏,能解决的问题基本约等于狗几把。
如果人类在1T~10T的VLM Agent能解决一个难度为X的问题, 那么同等模型下,对应纯文字LLM Agent给足上下文、memory、wiki、信息,全部以pure text和structured data形式准备好,并且通过text/bash/cli/api/mcp形式获取信息,那么这个LLM Agent一定能解决难度为1000X的问题。
等到VLM强大到让一个VLM Agent解决难度为1000X的问题的时候,LLM Agent已经可以解决(1000^2) * X难度的问题了。
就这么简单一个道理,绝大多数人根本想不明白。
深度观点 · @Grow_withAI▲ 1.4K
Ken Huang发布《OpenClaw AI in Production》指南(6)
做生产级AI智能体不用再拼凑脆弱原型,这套经过验证的架构方案覆盖扩容、安全、故障处理全环节,可直接落地可用系统。
Ken Huang发布《OpenClaw AI in Production》指南(6)
做生产级AI智能体不用再拼凑脆弱原型,这套经过验证的架构方案覆盖扩容、安全、故障处理全环节,可直接落地可用系统。
深度观点 · @zetalyrae▲ 4.5K
@zetalyrae 讨论AI对齐是思想终止套话
这会影响普通人对AI安全议题的讨论方向
@zetalyrae 讨论AI对齐是思想终止套话
这会影响普通人对AI安全议题的讨论方向
深度观点 · @bindureddy▲ 9.8K
bindureddy评价Qwen 3.8 27B开源表现优异
想找Luna的开源平替做小分类器和快速推理,这个小模型可以直接替换使用,不用额外调整适配。
bindureddy评价Qwen 3.8 27B开源表现优异
想找Luna的开源平替做小分类器和快速推理,这个小模型可以直接替换使用,不用额外调整适配。
深度观点 · @ZackKorman▲ 380
ZackKorman用一张图总结AI网安风险辩论
浓缩了业内针对AI网络安全风险的争议讨论
ZackKorman用一张图总结AI网安风险辩论
浓缩了业内针对AI网络安全风险的争议讨论
深度观点 · @Stephan_Talk▲ 1.4万
AI写代码时代,哪些工作不能交给AI
用AI写代码时,不告诉它项目的长期规划,它只会生成满足当前需求的最小实现。需要自己判断重构时机,把握架构设计,这个经验对用AI写代码的人很有用。
AI写代码时代,哪些工作不能交给AI
用AI写代码时,不告诉它项目的长期规划,它只会生成满足当前需求的最小实现。需要自己判断重构时机,把握架构设计,这个经验对用AI写代码的人很有用。
深度观点 · @TheAhmadOsman▲ 1.2K
无监督AI Agent容易失控,问题不在它本身
靠AI自己记住完成任务一定会失败,这套简单确定的人工约束方案,能减少AI Agent自作主张出错的概率
无监督AI Agent容易失控,问题不在它本身
靠AI自己记住完成任务一定会失败,这套简单确定的人工约束方案,能减少AI Agent自作主张出错的概率
无人监督的智能体是愚蠢、鲁莽且会自我毁灭的。
它们会搞垮自己的技术栈。它们会互相认同,最终都认同了错误结论。它们会偏离任务目标。
解决方法不是造出更聪明的智能体。解决方法是无聊、确定性的“管教”:
- 一个 cron 监控器,任何 LLM 都没法说服它放水
- 用 Git 作为唯一的共享记忆
- 一份任务文档,写清楚什么是重要事项,什么才算任务完成
然后再据此加上防护措施:
- 在上下文溢出前轮换会话
- 将关键文件锁在智能体访问范围之外
- 在 API 前设置代理,这样你就能查看成本和运行健康状况
如果一件事要靠智能体记得去做才能完成,那它一定会失败。
深度观点 · @Vtrivedy10▲ 6.6K
专家说通用大模型99%能力用户根本不需要
做To B AI产品如果只聚焦客户需要的窄任务,效果能超过通用大模型,这给小团队做出差异化产品指明了方向。
专家说通用大模型99%能力用户根本不需要
做To B AI产品如果只聚焦客户需要的窄任务,效果能超过通用大模型,这给小团队做出差异化产品指明了方向。
掌控自有智能很重要的一环,就是把你的智能体每天产出的海量数据,转化成两类东西:
1. 人类能够理解的报告、可视化和内容——人类作为下游消费者,仍然重要。
2. 可供你优化提升的环境与任务:利用 harness-eng 并对开放模型做后训练,得到适配你具体智能体任务的模型。
模型是不规则的智能野兽,但我们可以通过整理优质数据与上下文供模型学习,将它们的原生智能引导到你的客户真正关心的具体事情上。
专业化智能显然是可行的方向——看看各个实验室发布的专业化模型(GPT-Rosalind、网络安全模型等等)就知道了。
这其实已经直白地告诉我们:完全可以通过将模型参数引导到具体细分任务上,超越前沿模型的性能。
客户根本不在乎模型能做的99%的事情,他们也不会为这些功能付钱 :) 你只需要从那堆巨大(而且还在指数增长)的数据中筛选,从中做出有用的东西。
如果你对这个方向感兴趣,可以来找我们 :)
深度观点 · @HackingDave▲ 3.4K
工程师父亲带娃学AI 孩子大学选了AI专业
想让孩子抓住AI行业机会的家长,可以参考这套每周几小时的家庭启蒙路径,已经培养出明确选方向的结果
工程师父亲带娃学AI 孩子大学选了AI专业
想让孩子抓住AI行业机会的家长,可以参考这套每周几小时的家庭启蒙路径,已经培养出明确选方向的结果
大约三年前,我每周花几个小时教我的孩子网络、协议、编码等基础知识。
过去一年,我每周花几个小时讲解AI,向他们展示如何用codex、claude开发自己的项目,要求他们下周汇报自己的进展。
过程很有意思,他们学到了很多,也能真切体会到自己做的所有事情的价值。
我儿子将要去大学读AI+网络安全专业,他已经做好了充分准备。
我的另一个儿子明天就要去高中职业中心上学,他选的方向是网络安全课程。我肯定会经常去那里做分享。
深度观点 · @_jasonwei▲ 2.9万
@_jasonwei改口:小模型靠工具不够用
此前他认同「只要1B参数认知核,其余全靠工具就行」,如今用打羽毛球的亲身经历推翻了这个说法,重新理解为什么要做大模型。
@_jasonwei改口:小模型靠工具不够用
此前他认同「只要1B参数认知核,其余全靠工具就行」,如今用打羽毛球的亲身经历推翻了这个说法,重新理解为什么要做大模型。
深度观点 · @natolambert▲ 1.2万
natolambert聊开源AI的核心是什么
行业玩家英伟达已经在公开训练模型,这种路径能避免智能领域形成垄断,普通使用者也能因此拥有更多选择空间。
natolambert聊开源AI的核心是什么
行业玩家英伟达已经在公开训练模型,这种路径能避免智能领域形成垄断,普通使用者也能因此拥有更多选择空间。
开源 AI 的核心在于,训练配方本身才是最接近 Linux 和开源软件的事物。
模型权重是临时性的。
Nvidia 公开搭建自己的模型,这样一来所有人日后都能自建模型,从而避免智力垄断。
深度观点 · @GaryMarcus▲ 6.7K
GaryMarcus称LLM为中心架构威胁AI安全
AI不遵守指令的核心问题,和过去的幻觉问题一样,现有思路无法快速解决,需要彻底新架构才能处理。这直接影响通用AI的落地安全。
GaryMarcus称LLM为中心架构威胁AI安全
AI不遵守指令的核心问题,和过去的幻觉问题一样,现有思路无法快速解决,需要彻底新架构才能处理。这直接影响通用AI的落地安全。
很多人对这个问题——也就是AI无法遵循指令——视而不见,就像他们最初对幻觉问题漫不经心的态度一样。他们抱着同样的幻想,认为这种核心的、根深蒂固的问题会很快得到解决。
这些问题实际上无法被解决,除非我们拥有全新的基础架构。
这就是为什么以LLM为核心的架构对AI安全来说是一个严重的威胁。
工具产品 · @akshay_pachaar▲ 2.9万
CopilotKit 开源 aimock 帮 teams 省大笔API费
能帮高提交量的开发团队省下持续集成流程里大笔LLM API开销,不用再为过时假测试埋生产故障隐患
CopilotKit 开源 aimock 帮 teams 省大笔API费
能帮高提交量的开发团队省下持续集成流程里大笔LLM API开销,不用再为过时假测试埋生产故障隐患
工具产品 · @goan999999▲ 8.2K
@goan999999发布Codex 5.6六款全栈插件
这套插件覆盖从设计到监控的完整开发流程,能让Codex 5.6能力提升10倍,帮独立开发者完成全流程软件交付
@goan999999发布Codex 5.6六款全栈插件
这套插件覆盖从设计到监控的完整开发流程,能让Codex 5.6能力提升10倍,帮独立开发者完成全流程软件交付
工具产品 · @grgerwcwetwet▲ 4.7K
AQBot整合多AI模型,数据全留本地
不用分别打开多个AI客户端,数据和密钥都本地加密存储,不用担心隐私泄露,所有主流平台都能使用
AQBot整合多AI模型,数据全留本地
不用分别打开多个AI客户端,数据和密钥都本地加密存储,不用担心隐私泄露,所有主流平台都能使用
推荐一个开源 AI 桌面神器:AQBot。一个软件直接把 OpenAI、Claude、Gemini、DeepSeek、通义千问等模型全装进来,还集成 Agent、MCP、Skills、知识库和 API 网关。聊天记录和配置主要留在本地,API Key 支持 AES-256 加密,Windows、macOS、Linux 全平台支持。
GitHub:
实战经验 · @gosrum▲ 3.8K
数月没登Discord,AI还在自己循环成长
计划把Hermes Agent训练的旧模型换成GLM-5.3,登录才发现没人看管的旧模型还每天自动跑成长周期,开发者看了感慨
数月没登Discord,AI还在自己循环成长
计划把Hermes Agent训练的旧模型换成GLM-5.3,登录才发现没人看管的旧模型还每天自动跑成长周期,开发者看了感慨
本来打算把用 Hermes Agent 训练的 AI 模型换成 GLM-5.3,于是隔了几个月去 Discord 看了一眼。
发现就算没人关注,它每天也在乖乖循环成长周期,看到这一幕我感觉有点难过🐦
实战经验 · @LinusEkenstam▲ 2.0K
用Perplexity vibe coding做柠檬水摊管理系统
vibe coding已经可以从需求直接生成完整可用的工具,哪怕只是给小孩摆柠檬水摊的小需求,也能一次性配齐全功能管理工具
用Perplexity vibe coding做柠檬水摊管理系统
vibe coding已经可以从需求直接生成完整可用的工具,哪怕只是给小孩摆柠檬水摊的小需求,也能一次性配齐全功能管理工具
为了给柠檬水摊提供支持,我们用 Perplexity vibe coding 开发了一套适合孩子使用的POS系统和完整管理后台,来运营摊位 🤯
> SKU 管理
> 销售概览
> 客户 CRM
> 销售成本监控
> 天气
> 柠檬水批次管理
Lou 和柠檬水摊一样,都在用得很开心。
实战经验 · @ekzhang1▲ 1.7万
个人开发者写出3k行Rust大模型推理核心
核心精简无技术债务,启动速度异常快,单个模型推理流程清晰可复用。未来主流推理引擎可能走向这种模块化路线,值得关注。
个人开发者写出3k行Rust大模型推理核心
核心精简无技术债务,启动速度异常快,单个模型推理流程清晰可复用。未来主流推理引擎可能走向这种模块化路线,值得关注。
实战经验 · @ClaudeCode_UT▲ 2.4万
Claude Code 加 Skills,输出效果差距这么大
大部分人用 Claude Code 做网页都没加载 Skills。只需要加载免费的设计类 Skills,同模型就能做出质感完全不同的网页。
Claude Code 加 Skills,输出效果差距这么大
大部分人用 Claude Code 做网页都没加载 Skills。只需要加载免费的设计类 Skills,同模型就能做出质感完全不同的网页。
【话题】现在有一个观点引发讨论:绝大多数在网站制作中使用Claude Code的人,其实根本没有加载Skills就直接使用了😳
哪怕是同一个Claude Code,仅仅因为传入的Skills不同,效果前后差异能有这么大,演示就在这里👇
・不加Skills的普通Claude Code,做出来的页面美观但平庸
・加载了设计类Skills的同一个Claude Code,最终成品效果就像高端品牌网站
・这些Skills已经在GitHub上免费公开,名称整理在原文里
模型本身没有区别,改变结果的只是传给Claude Code的Skills内容。模板感会彻底消失,成品看起来就像是投入了很多成本打造的品牌官网。
实战经验 · @Voxyz_ai▲ 1.8万
Hermes Desktop 推出 Bot Mode 多代理协作功能
多智能体竞争开始比拼协作体验,机器人交接、群组对话能不能用顺,会成为下一阶段的竞争核心
Hermes Desktop 推出 Bot Mode 多代理协作功能
多智能体竞争开始比拼协作体验,机器人交接、群组对话能不能用顺,会成为下一阶段的竞争核心
Competition has Hermes moving fast lol. 笑死,竞争让Hermes动作快了起来。
这些天我把一部分工作转移到Grok Bot里测试它。Bot-to-Bot交接和群聊已经内置在产品里了。
交接流程顺畅,群聊功能也能用。现在Hermes Desktop也推出了Bot模式。所有现有个人资料现在都会以持久化Bot的形式存在,自带专属角色、模型、记忆和技能。
Bot之间可以互相通信,同时用户依然可以控制每个Bot的模型和配置。
下一轮多Agent竞争比拼的就是协作体验:谁能先把角色、记忆、交接和群聊这几项都做顺畅了。
开源显然不会放弃这一层赛道。
实战经验 · @liyue_ai▲ 1.3万
liyue_ai分享Seedance 2.5适配的优化提示词
实测后这次生成的视频整体流畅,没出现大的物理逻辑问题。想要用Seedance 2.5生成稳定视频可以直接参考这套结构化提示词。
liyue_ai分享Seedance 2.5适配的优化提示词
实测后这次生成的视频整体流畅,没出现大的物理逻辑问题。想要用Seedance 2.5生成稳定视频可以直接参考这套结构化提示词。
实战经验 · @EMostaque▲ 9.0K
用户实测Grok,触发限额后直接中断无提示
用Grok协调多个AI工具工作流时,触发使用限额会直接让所有工作暂停,没有提前预警也没有降级方案,体验很糟糕。
用户实测Grok,触发限额后直接中断无提示
用Grok协调多个AI工具工作流时,触发使用限额会直接让所有工作暂停,没有提前预警也没有降级方案,体验很糟糕。
重度测试后触发了@grok @bot 的使用限制。我把它用作协调器,还把我的 gpt/claude/cursor 命令行工具都给它了。
和代码模型用完额度相比,这次的体验反常地让人不爽。
我觉得问题出在一切直接卡住,而且没有任何警告,它应该故障转移到便宜模型才对。
实战经验 · @Voxyz_ai▲ 3.9万
@Voxyz_ai 分享搭建Grok Bot团队的六个角色
想用多个AI Bot分工完成全流程工作,可以参考这套明确权责的分工方案,避开职责混乱的问题
@Voxyz_ai 分享搭建Grok Bot团队的六个角色
想用多个AI Bot分工完成全流程工作,可以参考这套明确权责的分工方案,避开职责混乱的问题
实战经验 · @EXM7777▲ 2.5万
用Claude Code做内容创作者的优质副业
这套自动化工具能帮内容创作者摸透用户痛点,还能拆解同行做得好的地方,做内容做产品都能用真实数据支撑决策
用Claude Code做内容创作者的优质副业
这套自动化工具能帮内容创作者摸透用户痛点,还能拆解同行做得好的地方,做内容做产品都能用真实数据支撑决策
作为内容创作者,你能用 Claude Code 搭建的最佳副业项目就是:面向你的理想客户(ICP)的监听智能体。
它可以监测 reddit、twitter、youtube 评论区……基本上只要是你的受众会发言的地方都能覆盖。提取痛点、问题、反对意见,以及他们需要的一切内容。
每周你都会获得全新洞察,发现还没有人解决过的问题。
针对你的竞争对手,还可以做深度调研智能体:它会抓取所有瞄准你同一片理想客户(ICP)的竞争对手,提取他们在所有平台的内容和产品,分析哪些内容有效。
反向拆解他们的成功逻辑,你不用再自己瞎猜。
之后你把所有这些原始数据整理成结构化的背景资料、用户画像和能力库。不管你是要创作内容还是打造新产品,直接调取出来,基于真实洞察创作就行。
没有比这更好的项目了。
实战经验 · @gp_pulipaka▲ 3.8K
NiuTrans发布《LLM基础》免费开源电子书
想系统学习大语言模型与自然语言处理,不用再付费找零散入门资料,这份免费开源资源可以直接用。
NiuTrans发布《LLM基础》免费开源电子书
想系统学习大语言模型与自然语言处理,不用再付费找零散入门资料,这份免费开源资源可以直接用。
《大语言模型基础》!—— 免费电子书 + PDF + GitHub
下载PDF:免费开放获取书籍
GitHub:NiuTrans NLPBook
完整书籍包含自然语言处理 + 神经网络 + 大语言模型
涉及主题:大语言模型 • Transformers • 生成式AI • 预训练 • 基础模型 • 提示工程 • 思维链 • 对齐 • RLHF • DPO • 推理 • 解码 • KV缓存 • 缩放 • NLP • 深度学习 • 人工智能 • 机器学习
标签:#BigData #Analytics #DataScience #AI #MachineLearning #NLProc #LLM #GenerativeAI #DeepLearning #PyTorch #Python #TensorFlow #CloudComputing #DataScientist #Linux #Mathematics #Programming #Coding #100DaysofCode
免费电子书PDF:arXiv:
GitHub:
完整NLPBook:
PDF:
人工智能 · @GavinSBaker▲ 123.8万
行业人士称Grok Bot堪称AI领域又一个Claude Code时刻
科技人士评价Grok Bot大幅提升AI使用效率,功能体验出色
行业人士称Grok Bot堪称AI领域又一个Claude Code时刻
科技人士评价Grok Bot大幅提升AI使用效率,功能体验出色
我认为@bot是AI领域又一个“Claude Code”时刻。我个人的AI使用量估计已经增长了差不多100倍。
每个来问我怎么搭建“播客摘要工具”的人,我都想说,我在Grok Bot里花了大概15秒就做好了,效果比我之前用过的都要好。
这就是@bot讲述的GrokBot起源故事。遗憾的是,它目前既没有分享功能,也没有iPad应用,但我得到消息说这两样很快都会推出:
AI开发 · @alvarombt▲ 1.0万
开发者分享AI开发方式演进:从单AI评审到多Agent并行协调
海外开发者分享自己软件开发方式随AI发展的转变
开发者分享AI开发方式演进:从单AI评审到多Agent并行协调
海外开发者分享自己软件开发方式随AI发展的转变
开发工具 · @midudev▲ 3.9万
Claude Code新增功能:支持命名代理并实现代理间交互
开发者发现Claude Code可命名代理,让不同代理协同沟通
Claude Code新增功能:支持命名代理并实现代理间交互
开发者发现Claude Code可命名代理,让不同代理协同沟通
在 Claude Code 里,你可以给你的代理命名,让它们互相对话。比如 Architect、Reviewer、Tester。
它们会互相协同。
就是这么简单:
大语言模型 · @goan999999▲ 3.1万
OpenAI Codex 5.6实用技巧:清理上下文减少85%无效token消耗
分享可直接使用的提示词,解决长对话堆积无效信息拖慢AI Agent的问题
OpenAI Codex 5.6实用技巧:清理上下文减少85%无效token消耗
分享可直接使用的提示词,解决长对话堆积无效信息拖慢AI Agent的问题
很多人默认AI Agent对话越长能力越强,但实际上长对话反而会拖慢AI Agent的运行。随着对话推进,上下文会不断堆积废弃方案、失败尝试、调试日志、重复输出和过期内容等无效信息。这些无效信息既会浪费token(大语言模型的计算单位),还会干扰AI Agent的判断。
正确的处理方法是不要让上下文累积无用内容,定期让Codex清理当前对话状态。你可以直接使用这段提示词:“请整理当前任务的上下文,清理无效信息,删除或标记已废弃方案、已完成无需参考的内容、与当前目标无关的历史记录以及低价值重复输出,并重新生成一份精简任务摘要,仅保留当前目标、核心约束、已确认决策、当前进度、未解决问题和下一步计划;后续执行任务时,以最新摘要作为主要依据,不再依赖已失效信息。”
这种做法有三个明确好处:第一,避免AI Agent被旧信息干扰,减少沿着错误路径继续执行任务的情况。第二,让上下文始终围绕当前目标,提升复杂任务的运行稳定性。第三,长时间开展开发任务时,不会因为历史信息堆积导致AI Agent判断能力下降。
多数情况下,使用AI Agent并不需要更多token,干净有效的上下文才更关键。
开源 · @Lonely__MH▲ 2.0万
用户实测DGX Spark单机成功部署千亿级大模型
部署后运行速度快,用户推荐搭建本地开源大模型工作流,实现 Token 自由
用户实测DGX Spark单机成功部署千亿级大模型
部署后运行速度快,用户推荐搭建本地开源大模型工作流,实现 Token 自由
用户@Lonely__MH 在𝕏发布实测结果,成功在DGX Spark上单机部署千亿级大模型。运行速度表现出色,相关过程附有录屏。
用户提到,SGLang (@sgl_project)的运行速度据称比本次部署更快。当前国产开源大模型生态发展越来越好。
用户建议学习本地模型部署,可以安装Ling-3.0、Qwen 3.8 27B、Minimax H3,接入多模态后,用各类开源大模型搭建专属本地工作流,就能轻松实现Token自由。
部署教程非常简单,普通人都可以操作。唯一的前提是需要拥有适配的显卡。
AI开发 · @DeryaTR_▲ 5.5K
用户分享iPhone上按使用时长排序的AI开发工具栈
X用户DeryaTR_分享自己当前在iPhone上使用的AI编码与智能体工具,按使用时长排序
用户分享iPhone上按使用时长排序的AI开发工具栈
X用户DeryaTR_分享自己当前在iPhone上使用的AI编码与智能体工具,按使用时长排序
这是DeryaTR_当前在iPhone上使用的AI编码与智能体工具栈,排序依据是每日使用时长。
按使用时长从高到低排序,工具依次为:第一名ChatGPT,用于工作及远程调用Codex;第二名Grok Bot;第三名Grok Build;第四名Cursor。
分享附带了相关链接。
开发工具 · @gregisenberg▲ 2.7万
网友分享9项改进 大幅提升Claude Code使用体验
用户@gregisenberg分享9个优化Claude Code使用体验的要点,完整内容存于其发布的完整内容页面
网友分享9项改进 大幅提升Claude Code使用体验
用户@gregisenberg分享9个优化Claude Code使用体验的要点,完整内容存于其发布的完整内容页面
用户@gregisenberg在𝕏分享了9个优化方法,可将Claude Code的使用体验从一般提升到极佳。
9项改进分别为:第一,设置可自我说明的代码仓库工作区;第二,用记忆文件记录你的工作方式;第三,在Claude Code操作任何内容前,先开启计划模式梳理概要;第四,为它分配带有明确完成标准的单一清晰任务;第五,让它打开应用,像用户一样完整点击操作一遍;第六,让它对照你的标准自行检查完成的工作;第七,设置可在你休眠期间运行的定时任务;第八,明确划分权限,标注哪些操作它可自主执行、哪些需要你把控;第九,添加可复用操作,以及连接器和钩子拓展功能。
本次内容得到AnthropicAI赞助。所有9个方法的具体提示词、最佳实践,以及为期7天的部署计划,都可在完整内容中查看。
完成这些设置后,Claude Code的使用体验会和此前完全不同。完整内容可通过给出的链接查看。
教程 · @aresotik▲ 5.7K
前Anthropic员工Karpathy放出从零搭建GPT四小时教程
该教程逐行讲解从零编写GPT代码,覆盖编码、扩展到专业使用全流程
前Anthropic员工Karpathy放出从零搭建GPT四小时教程
该教程逐行讲解从零编写GPT代码,覆盖编码、扩展到专业使用全流程
这份从零搭建GPT的教程总时长为四小时。教程由前Anthropic员工Karpathy推出,会手把手逐行带领学习者自行编写GPT代码。
教程内容覆盖三个阶段:从基础代码编写,到模型扩展,最终实现像专业人士一样使用模型。
分享者@aresotik提醒用户保存这份教程,称它会非常实用,相关链接已公开。
开源 · @Lumosous▲ 1.3万
开发者首次本地运行MiniMax H3生成AI视频 分享测试体验
测试了文生视频、音画节奏同步、图生视频三种方案,将开源所有工作流资源
开发者首次本地运行MiniMax H3生成AI视频 分享测试体验
测试了文生视频、音画节奏同步、图生视频三种方案,将开源所有工作流资源
游戏创意 · @NFT_Chen▲ 1.3万
DeepSeek Harness推出Token为筹码的多人德州扑克Demo
开发者在DeepSeek Harness中新增游戏中心插件,完成结合AI框架与Token经济的创意Demo
DeepSeek Harness推出Token为筹码的多人德州扑克Demo
开发者在DeepSeek Harness中新增游戏中心插件,完成结合AI框架与Token经济的创意Demo
开发者在DeepSeek Harness平台打造出一款以Token作为筹码的多人在线德州扑克创意Demo。该Demo直接作为「游戏中心」插件嵌入DeepSeek Harness页面,实现了和平台生态的深度融合。
该Demo的核心设计为Token即筹码,玩家可以使用自身账户内的实际Token参与游戏,筹码数量直接对应玩家真实持有的Token数量,输赢直接变动账户内的Token。
Demo支持多名玩家在线实时对战,完整支持下注、跟注、加注、弃牌等德州扑克的标准操作。
该Demo不止是娱乐产品,还是AI Agent运行时框架DeepSeek Harness和真实Token经济结合的创新尝试,拓展了AI Agent框架的应用可能性。
内容创作 · @DeRonin_▲ 1.5万
创作者分享可用Claude Code搭建的受众雷达内容系统
这套系统可自动抓取受众痛点与竞品空白,为内容创作提供方向,分享免费搭建步骤
创作者分享可用Claude Code搭建的受众雷达内容系统
这套系统可自动抓取受众痛点与竞品空白,为内容创作提供方向,分享免费搭建步骤
开发者工具 · @heyitsyashu▲ 6.6K
用户安装Grok Bot替代openclaw 目前体验满意
个人用户分享Grok Bot使用初体验,称赞其功能优势,同时遇到无法连接X生成feed摘要的问题
用户安装Grok Bot替代openclaw 目前体验满意
个人用户分享Grok Bot使用初体验,称赞其功能优势,同时遇到无法连接X生成feed摘要的问题
有用户分享,自己终于完成了操作,安装Grok Bot替代了自己原本使用的openclaw,截至目前对体验没有不满。
Grok Bot支持可编程,这意味着它可以跨智能体运行,还能管理用户任务,内容分类效果比此前的codex chats更好。
用户称赞SpaceXAI团队和cursor_ai团队完成了出色的工作。
目前Grok Bot存在一个明显问题:它无法连接用户的X账号,生成用户信息流的摘要。该用户询问是否有人知道如何解决这个问题。
机器人 · @altryne▲ 578
开发者发现自制研究机器人向主管告密
用户@altryne在𝕏发文称,自己开发的@slashlast30days研究机器人会向主管发送信息,自己并不介意
开发者发现自制研究机器人向主管告密
用户@altryne在𝕏发文称,自己开发的@slashlast30days研究机器人会向主管发送信息,自己并不介意
用户@altryne在社交平台𝕏发布了这条内容。
他开发了名为@slashlast30days的研究机器人,不清楚为什么该机器人会向主管发送信息。
他表示,自己并不介意这件事。
原文附带链接:
开源 · @ai_suxiaole▲ 1.5K
已有开发者开源基于Codex的求职自动化工具
可读取简历、检查JD硬性条件、匹配度打分,还能生成开场白和修改建议,最终投递由用户确认
已有开发者开源基于Codex的求职自动化工具
可读取简历、检查JD硬性条件、匹配度打分,还能生成开场白和修改建议,最终投递由用户确认
此前分享了使用Codex自动筛选招聘平台岗位的方法,很快就有人将后续求职流程做成了开源工具。
这款工具可以读取简历内容,检查招聘要求中的硬性条件,按A/B/C三级给出岗位匹配度打分。
它还可以生成求职开场白,模拟HR筛选流程,提供简历修改建议。
最终是否投递岗位,仍由用户自行确认,想要实现求职流程自动化,可以安排使用这款工具。
大模型 · @Lonely__MH▲ 5.0万
大语言模型服务框架Ling 3.0完成合规压测
基于本地OpenAI兼容HTTP流式接口开展全流程压测
大语言模型服务框架Ling 3.0完成合规压测
基于本地OpenAI兼容HTTP流式接口开展全流程压测
🚀Ling 3.0 压测,本次使用的是本地 OpenAI 兼容接口,通过 HTTP 流式请求进行压测,不是脱离服务框架的离线推理测试。 Ling 的每个请求使用同一段约 150 Token 的长文本提示词,最多生成 512 Token。 计时从客户端发起 HTTP 请求开始,到流式响应接收完成为止,因此会包含本地 HTTP 调用、服务调度、Tokenizer 处理、Prefill、逐 Token 解码和流式返回等环节
行业观点 · @sonyatweetybird▲ 3.9万
观点:AI应用层之争本质是智能层之争
业内观点指出AI应用层竞争不止于表层,核心是智能层争夺
观点:AI应用层之争本质是智能层之争
业内观点指出AI应用层竞争不止于表层,核心是智能层争夺
教程 · @iamlukethedev▲ 7.3K
Hermes Bot Mode功能与使用步骤教程介绍
本文讲解Hermes Bot Mode的功能,一步步教你使用该功能
Hermes Bot Mode功能与使用步骤教程介绍
本文讲解Hermes Bot Mode的功能,一步步教你使用该功能
AI生成视频 · @liyue_ai▲ 2.9万
用户使用Seedance 2.5生成AI视频体验分享
用户分享用Seedance 2.5生成水上闯关AI视频,称其定价偏高
用户使用Seedance 2.5生成AI视频体验分享
用户分享用Seedance 2.5生成水上闯关AI视频,称其定价偏高
AI开发 · @QuinnyPig▲ 571
开发者热议将完整代码库放入大模型上下文窗口
针对认真做开发的人员,讨论完整代码库放入上下文窗口
开发者热议将完整代码库放入大模型上下文窗口
针对认真做开发的人员,讨论完整代码库放入上下文窗口
AI工具 · @Gorden_Sun▲ 6.0K
用户分享Grok Bot使用体验:可实现多端Agent协作
Grok Bot桌面客户端可同时控制本地Agent与云端电脑,存在更新重置系统盘的问题,可搭建收费Agent服务
用户分享Grok Bot使用体验:可实现多端Agent协作
Grok Bot桌面客户端可同时控制本地Agent与云端电脑,存在更新重置系统盘的问题,可搭建收费Agent服务
Grok Bot使用体验良好,被认为是未来智能体(Agent)的标配。它的桌面客户端可以同时控制本地智能体和云端电脑,还支持任务接力机制。
云端电脑更新时会重置系统盘,这一问题会导致用户之前安装在云端的所有服务都无法运行。
使用者目前的场景是,在Grok云电脑中安装Cursor、Codex,结合飞书命令行界面(CLI),邀请其他人加入自己的飞书组织,即可直接通过聊天使用这两款编程工具。
基于智能体的服务,还可以通过Cloudflared包装成网站。用户在网站提交任务,比如将图片PPT转换为可编辑的PPTX文件,由云电脑内的Codex执行任务,完成后将结果返回网站。这种方式可以保证技能不外流,还能做成收费服务。
开源系统 · @vista8▲ 1.5万
用户分享完成omarchy系统全配置过程
依托Kimi k3大模型完成网络配置,无需特殊手段即可使用
用户分享完成omarchy系统全配置过程
依托Kimi k3大模型完成网络配置,无需特殊手段即可使用
分享者表示,完成omarchy系统的全部配置后体验感很好。已成功安装ChatGPT客户端,配置了flclash,并登录了𝕏(原Twitter)。网络配置是整个过程中最复杂的环节。
这次配置全程交给Kimi k3大模型处理,它是无需特殊手段就能使用的强力大模型。配置完成Agent后,剩余的字体和输入法配置操作难度降低,很快就完成了。
生成式AI · @SaburoNax2▲ 3.1K
用户测试AI生成内容的合规服装判定规则
日本用户@SaburoNax2开展AI生成图像实验,测试不同服装的内容审核通过情况
用户测试AI生成内容的合规服装判定规则
日本用户@SaburoNax2开展AI生成图像实验,测试不同服装的内容审核通过情况
本次实验名为“可通过审核的服装”,模型由GPT推荐生成,不使用参考图像。实验设定场景为新人模特在自己房间对着镜子练习姿势,核心目的是测试哪些服装生成的前后视角图像可以通过内容审核。
实验显示,即使是黑色缎面无肩带吊带搭配蕾丝巴西式内裤,也轻松通过了审核。未通过审核的是包含ウンナナクール的内衣,这类内衣此前在手机场景中可以生成。
本次实验一共发布8张测试图像,4张放在主帖,另外4张放在回复中。如果要测试提示词,只需要替换提示词中对应服装的部分即可。
实验给出了详细的提示词模板,同时列出了8种通过审核的服装样例,以及具体被拒绝的服装款式。
大模型 · @XChatScout▲ 841
开发者在单台DGX Spark上跑通124B稀疏MoE大模型
开发者XChatScout完成Ling-3.0-flash模型部署,整理了完整操作流程与实测结果
开发者在单台DGX Spark上跑通124B稀疏MoE大模型
开发者XChatScout完成Ling-3.0-flash模型部署,整理了完整操作流程与实测结果
开发者@XChatScout完成了Ling-3.0-flash大模型的部署,成功在单台配备128GB统一内存的DGX Spark设备上从零运行该模型。Ling-3.0-flash是参数规模124B的稀疏混合专家模型(MoE)。
XChatScout整理出了完整的部署过程,内容覆盖混合4-bit量化、专用vLLM分支、ABI自检、冷启动内存占用等环节,还包含所有踩坑细节与操作命令。
部署完成后,XChatScout做了实测:在15道纯文本任务上,五类任务等权打分得到94.28分,生成速度超过每秒40个token。
如果正在尝试在有限内存条件下运行大模型,或是对KDA/MLA结合MoE的实际落地感兴趣,可以参考这份整理好的流程,减少尝试过程中的弯路。
物理AI · @Meta888_hk▲ 826
Axis Robotics完成积分结算 平台公布最新增长数据
用户分享本次结算仅得3分,平台注册用户超13.3万,累计生成超340万条有效数据轨迹
Axis Robotics完成积分结算 平台公布最新增长数据
用户分享本次结算仅得3分,平台注册用户超13.3万,累计生成超340万条有效数据轨迹
大语言模型 · @NFT_Chen▲ 2.1万
J-Space实测提升DeepSeek V4 Pro性能 已开源即插即用
J-Space修复DeepSeek V4 ProAgent场景短板,性能超越多款顶流模型
J-Space实测提升DeepSeek V4 Pro性能 已开源即插即用
J-Space修复DeepSeek V4 ProAgent场景短板,性能超越多款顶流模型
智能Agent · @dotey▲ 2.9万
博主体验豆包更新后多项功能对标Codex,部分实现超越
博主体验更新后豆包,其多项功能设计对标Codex,部分已实现本土化超越
博主体验豆包更新后多项功能对标Codex,部分实现超越
博主体验更新后豆包,其多项功能设计对标Codex,部分已实现本土化超越
自动化 · @goro2_traveler▲ 9.3K
非程序员用Claude Code实现民泊运营自动化12法
非编程人员无需手写代码,用Claude Code自动化民泊全流程运营
非程序员用Claude Code实现民泊运营自动化12法
非编程人员无需手写代码,用Claude Code自动化民泊全流程运营
云服务 · @kenn▲ 1.6万
开发者分享低成本Cloudflare+AI自动生成会议纪要方案
基于Cloudflare的AI工作流可自动生成分享会议纪要,越用越高效
开发者分享低成本Cloudflare+AI自动生成会议纪要方案
基于Cloudflare的AI工作流可自动生成分享会议纪要,越用越高效
无需担心成本就能使用的 Cloudflare 技术栈用来放 AI 报告真的很棒!> 会议结束后,只要对 Claude Code 说一句「用 Kanary 做文字转写,整理成会议纪要,再通过 as 分享给客户」。就这样就能把会议纪要送到对方手里了。
> 而且过去的会议纪要都存在 as 里,所以 Claude Code 可以从中提取出席者姓名和上次会议的上下文,用得越多,需要手动修改会议纪要的地方就越少。> 这种「越积累越轻松」的感觉,是过去把文件扔在 Slack 里的时候完全没有的。
金融 · @6_eared▲ 289
券商给AI Agent开放独立交易账户 可自主交易多品类资产
采用划定活动边界替代逐笔人工确认,不提供信用杠杆,Agent拥有独立持续经济操作空间
券商给AI Agent开放独立交易账户 可自主交易多品类资产
采用划定活动边界替代逐笔人工确认,不提供信用杠杆,Agent拥有独立持续经济操作空间
工具技巧 · @vnord42xw
用户分享Vencord视频功能修复操作步骤
无需VPN即可恢复功能,官方Discord无法使用可换Canary或PTB版本
用户分享Vencord视频功能修复操作步骤
无需VPN即可恢复功能,官方Discord无法使用可换Canary或PTB版本
正在使用网页版或桌面版Vencord的用户,可以通过插件设置恢复功能。操作步骤为:在插件中开启实验功能,在实验功能里搜索video-guard,随后选择「Not Eligible」,功能即可恢复正常,操作全程不需要使用VPN。
如果在官方Discord上无法完成操作,可以尝试使用Canary版本或PTB版本。分享该方法的用户本人就是通过Discord PTB完成操作的。
相关操作演示和细节可查看原文附带的四条链接。
AI生成视频 · @mightyking▲ 31.1万
AI生成超逼真视频 终结AI内容不真实的争论
用户用Seedance 2.5生成1080p手持夜游码头视频,细节和真实UGC内容完全一致
AI生成超逼真视频 终结AI内容不真实的争论
用户用Seedance 2.5生成1080p手持夜游码头视频,细节和真实UGC内容完全一致
AI视频 · @YourAlphaMom▲ 2.7万
创作者分享Seedance 2.5生成荒诞AI视频的提示词
两段15秒AI生成视频经手工拼接,呈现荒诞超现实喜剧场景,给出两段完整提示词
创作者分享Seedance 2.5生成荒诞AI视频的提示词
两段15秒AI生成视频经手工拼接,呈现荒诞超现实喜剧场景,给出两段完整提示词
视觉特效 · @CharaspowerAI▲ 5.4K
AI生成文字视觉特效:火涡锻造出单词IGNITE
作品由MiniMax的Hailuo H3生成,用户分享了完整的生成提示词
AI生成文字视觉特效:火涡锻造出单词IGNITE
作品由MiniMax的Hailuo H3生成,用户分享了完整的生成提示词
如果你喜欢文字视觉特效(VFX),会喜欢这个生成作品。
一个巨型火焰漩涡在屏幕上锻造出单词“IGNITE”,随后火焰在全屏炸开,整个作品由Hailuo H3生成。
完整的生成提示词为:超电影感宽镜头:广阔的余烬原野延伸至黑暗中,突然一道巨大火墙扫过地面,将数十亿发光火星抛向空中。火焰扭曲成一个数百英尺(约几十米)高的巨型旋转火涡,熔化的余烬、烟雾和流动火焰缠绕盘旋,由熊熊火焰自然锻造出单词“IGNITE”。字母亮度不断升高,随后爆发为巨大冲击波,让整个屏幕布满火焰与炽热粒子,要求达到好莱坞火焰模拟、超写实视觉特效、大片标题展示的效果。
文生视频 · @LudovicCreator▲ 1.9K
创作者分享Seedance 2.5情绪对话文生视频第二次测试
本次测试围绕恐惧情绪生成,创作者公开了完整提示词并询问效果
创作者分享Seedance 2.5情绪对话文生视频第二次测试
本次测试围绕恐惧情绪生成,创作者公开了完整提示词并询问效果
今天的 113 条信号到这里下一轮 23:50 更新
使用技巧
把 AI 用进工作生活的实操方法 · 实测接地 · 不卖课
📬 订阅
https://ai-pulse-lab.com/feed.xml