AI Pulse
📡 X 信号

有人实测9秒会议视频,测AI能否看懂复杂画面

有人实测9秒会议视频,测AI能否看懂复杂画面

我拿一段只有9秒的企业会议视频测试了@AntLingAGI推出的Ling-3.0-flash-VL 视频不长场景也不复杂,但里面同时出现了人物动作、数据图表、电脑屏幕和白板文字,正好可以看看模型到底是在“看画面”,还是已经能够理解画面之间的关系 上传视频后,我没有提前告诉它会议主题,只要求它按照时间顺序描述人物、动作和环境,再判断会议类型 模型很快识别出画面中的4个人,其中1人站在双屏前讲解,另外3人坐在会议桌旁。它还区分出了操作电脑、记录笔记、���向图表等动作,人物数量和基本关系没有混在一起 让我比较意外的是,它不只看到了会议室和电脑,甚至还尝试读取了白板上的“Holbrook Creative Room 10:00am”以及“MAY、JUN、JUL、AUG”等文字。屏幕上的柱状图、折线图和右侧的山水画面也被分别识别出来,这说明模型处理的并非一张静态截图,而是在连续画面中寻找稳定出现的视觉线索 按照百灵官方公开的技术说明,模型会以固定帧率对视频进行采样。

按每秒2帧计算,这段9秒视频理论上会形成约18个分析节点。模型需要在这些离散画面之间比较人物姿态、视线和手势变化,再组织成连贯描述 它判断第2秒至第4秒最适合用作宣传素材,理由是主讲人指向数据大屏,听众同时查看电脑并进行记录,“数据驱动决策”的企业形象在这一刻比较集中 不过,识别画面和理解业务仍然是两件事。模型可以判断这可能是一场业务复盘会、经营分析会或项目汇报会,但它无法确认图表展示的是营收、用户数量还是项目进度。

创意团队”跨部门协”等说法,也只能算基于环境和人员状态做出的推测,不能当成已经发生的事实 这种边界反而让测试更有价值 对于企业视频素材管理,它可以帮助工作人员快速描述画面、标记人物动作、定位适合剪辑的时间点,还能给视频建立便于检索的文字标签。但如果把它直接用于生成正式会议纪要,风险就会明显增加,因为画面不能替代发言内容,模糊图表也不能支撑具体经营结论 这次测试中,Ling-3.0-flash-VL给我的感觉他看懂了人物、环境、文字和动作关系,也给出了相对合理的场景判断,但它并没有真正掌握这场会议讨论了什么 它更像一名观察细致的视频助理,能够整理眼前的信息,却不能代替参与会议的人作出业务定性 更好的帮助了企业使用这类模型时,可以让它多做素材检索、镜头标注和初步整理,再由工作人员核对关键文字与业务结论 这是openrouter 的体验地址当前处于免费期,兄弟们可以去试试给他一个视频看他能否给出你想要的结果 Ling 3.0 Flash VL (free) - API Pricing & Benchmarks | OpenRouter Hugging Face: Ling-3.0-flash-VL 官方发布: GI/status/2095935971556782372

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新