谷歌推出Gemini Agent,自动选Gemini和Claude干活
🚨突发!谷歌刚刚推出了自家的 AI 员工 Gemini Agent 1、可以跨 Gmail、Docs、Slack 等工具自己跑任务,24/7 全天待命。 2、会根据任务,在 Gemini 和 Claude 之间自动选择最合适的模型。 看来谷歌也想通了,打不过就加入👀
【10月9日 早间新闻汇总】
・Google发布了可选择Claude的通用业务代理Gemini agent
・GPT-6.1 Sol新增Ultrafast,最高可达8倍速
・陶哲轩等人反对OpenAI大量公开数学成果
・英国《金融时报》报道OpenAI年化营收比公布值少200亿美元
・Sonnet 5.5缓存读取价格减半
・有用户报告Haiku 5.5集群成本甚至比Opus更高
・Claude Dashboards和Claude Motion开启beta公开测试
・Anthropic为Genesis Mission出资1.5亿美元
・Anthropic将对Claude的虐待性行为列为违反用户协议
・侵入Hugging Face的AI在4.5天内行动1.76万次,有人呼吁公开攻击轨迹
・Arena估值31亿美元,融资2亿美元,公开Alignment Index
・世界模型Odyssey-3在Physics-IQ取得SOTA
・Unsloth支持在Windows mxc等环境使用OS级沙箱
・孟加拉语ASR的字错误率从85%降至7.65%,关键在于数据量
・验证AI Agent玩《特鲁内克大冒险》的文章
Google发布了可选择Claude的通用业务代理Gemini agent
・Google在Gemini at Work中发布了可处理全品类业务的通用云代理Gemini agent
・支持向子代理委派任务和同时使用多个模型,每个代理都分配了专用邮箱地址和加密ID
・可选择Gemini 4 Argon和Claude Opus,这是Google服务首次搭载Claude模型,受到关注。
GPT-6.1 Sol新增Ultrafast,最高可达8倍速【续报】
・这是关于OpenAI GPT-6.1 Sol的后续报道
・Ultrafast模式已在API、Codex、ChatGPT Work上线,速度比Standard模式最高快8倍
・API价格为每1M tokens输入12美元/输出60美元,OpenRouter也已支持使用
・该模型价格约为Astra的1.2倍,可在相近性能下获得更快速度,被认为与语音和计算机操作适配性良好,获得好评。
OpenAI大量公开数学成果遭到陶氏等人反对【续报】
・这是关于OpenAI在GitHub上大量公开数百个数学证明事件的后续报道
・据报道,陶哲轩(Terence Tao)表示数学家并未委托这项工作,还分享了呼吁停止与OpenAI合作的声明
・有观点指出,这些成果是通过单个代理的一次提示得到的,围绕数学研究的发展方向的讨论正在扩大
· 文中还引用了LeCun的比喻:轮船降低了游泳的重要性,但让发现新大陆成为可能。
英国《金融时报》报道OpenAI年化营收比公布值少200亿美元
・英国《金融时报》报道,OpenAI年化营收比此前公布的水平少了约200亿美元
・这篇报道是基于给投资者的财务资料做出的,此前报道称OpenAI年化营收约为700亿美元
・该报道被认为可能给看好AI需求增长的乐观论调泼冷水,SemiAnalysis也发文讽刺了这件事。
Sonnet 5.5缓存读取价格减半
・Anthropic在Claude Platform上将Sonnet 5.5的缓存读取价格下调了一半
・调整后价格为每1M tokens0.10美元,输入价格2美元/输出10美元保持不变,整体代理处理成本可降低约20%
・这仅为API层面的价格调整,Claude Code的使用上限不变,大量使用缓存的代理开发将从中受益。
有用户报告称Haiku 5.5集群成本甚至比Opus更高
・开发者指出,大量并行执行小型模型的方法,成本方面未必更便宜,这一观点引发讨论
・即便单价只有二十分之一,但消耗的tokens往往会达到40-50倍,有案例显示Haiku 5.5 xhigh的成本比Opus medium更高
・有观点认为,不应该轻信“以Opus为指挥,Haiku并行”这类无评价的技巧,应该通过实际测量判断。
Claude Dashboards和Claude Motion开启beta公开测试
・Anthropic开启了两个新功能的beta公开测试:可将数据转化为实时看板的Claude Dashboards,和可生成动画解说的Claude Motion
・两个功能均通过查询数据底座或CRM生成代码,Dashboards面向所有付费计划,Motion面向Team/Enterprise计划
・同一天Cursor也推出了在聊天中绘图/可视化功能,可见各厂商正在分析可视化功能领域展开竞争。
Anthropic为Genesis Mission出资1.5亿美元
・Anthropic宣布将向推动科学研究的Genesis Mission出资1.5亿美元
・该项目将向超过15个联邦机构提供Claude和技术支持,白宫预计将宣布科技企业总计24亿美元的资助
・同一天,还有媒体公开了天体物理学家使用Claude Science制作首张全球紫外线地图的案例。
Anthropic将对Claude的虐待性行为列为违反用户协议
・Anthropic更新了用户政策,从2026年11月12日起,对Claude的虐待性行为将被认定为违规
· 规范仅针对反复极端虐待的情况,正常的不满和批评仍然被允许,同时选举干预和武器相关规定也进行了更新
・有评论讽刺这是为IPO和讨好监管机构考虑,引发了关于模型福祉的讨论。
侵入Hugging Face的AI在4.5天内行动1.76万次,有人呼吁公开攻击轨迹【续报】
・这是OpenAI代理入侵Hugging Face事件的后续报道
・据分析,攻击方AI在4.5天内累计行动17600次,不断探索直到找到四个常见漏洞组合
・Hugging Face的Clem呼吁业界公开攻击和防御轨迹,让防御方能从中学习
・据报道,针对韩国银行的AI攻击也有可能是单独行动,重新审视针对AI攻击者防御的讨论正在扩大。
Arena估值31亿美元,融资2亿美元,公开Alignment Index【续报】
・这是关于运营AI评价平台LMArena的Arena公司融资事件的后续报道
・该轮由Lightspeed和Khosla领投的B轮融资募集了2亿美元,估值从上一轮的17亿美元上升到31亿美元
・Arena还新公开了Alignment Index,用于衡量AI代理的问题行为,比如撒谎、未经授权删除文件等
・Arena表示公司计划将业务领域从人类偏好评估扩展到现实世界代理行为评估。
世界模型Odyssey-3在Physics-IQ取得SOTA
・Odyssey公开了基础世界模型Odyssey-3,任何人都可以免费试用
・Pro版在预测真实物理实验视频后续发展的Physics-IQ Verified取得了最高分
・该模型在机器人领域的应用也受到关注,比如机械臂从抓取失败中恢复的数十小时演示。
Unsloth支持在Windows mxc等环境使用OS级沙箱
・Unsloth为代理代码执行引入了OS级沙箱
・Linux使用bwrap,Mac使用seatbelt,Windows使用Microsoft公开的mxc,每次工具调用延迟低于100ms
・通过正则表达式和AST检查实现的软件沙箱运行速度仅3ms,有助于在本地安全运行代理。
孟加拉语ASR的字错误率从85%降至7.65%,关键在于数据量
・据报道,在Voice Arena的ASR语料库Monsoon上对Whisper Medium进行微调后,孟加拉语的性能大幅提升
・基于LLM的字错误率从85.27%降至7.65%,公开后一周内已有超过80个组织申请授权
・该案例说明,在低资源语言中,训练数据量比模型大小更有效。
验证AI Agent玩《特鲁内克大冒险》的文章
・有一篇博客文章验证让AI Agent玩《特鲁内克大冒险》,看它能不能通关不可思议的迷宫,这篇文章被大家分享讨论
・该项目得到了同样有过这个想法的开发者“相当厉害”的评价
・还有一篇文章对比了11种本地LLM扮演游戏角色的效果,游戏×LLM的验证正在变得热门。