视频剪辑行业可能会因为GitHub分享源文件改变
当人们开始在 GitHub 上分享他们的剪辑工程时,视频编辑将永远改变。
我希望未来会是这样:当有人问「你是怎么做出来这个的?」,你只需要给他们发一个项目源代码的链接,智能代理也能读取和理解这个链接。
创意说明、项目源文件、时间线、素材、效果、技法、规则——所有一切都在里面。然后智能代理就能利用所有这些信息帮你做剪辑。这些项目还可以成为训练样本,就像源代码被用来训练代码模型一样。
但现在有一个问题。AI 已经在单独完成这些任务中的很多项上做得很好了:理解创意说明、使用工具、遵循并应用剪辑技法。它们也很擅长创作这些内容。但要把所有这些整合到一起仍然很难。
这也恰恰说明了为什么 AI 是专业从业者非常出色的协作伙伴,而经验不足的人用 AI 往往只会得到潦草的结果。智能代理在进行修改时,需要遵循项目上下文、制作需求、剪辑方法和你的个人风格。
目前你会发现,智能代理一直在忙着调用工具、重复步骤,并专注于执行工具操作。它们会在某个节点遗漏和混淆上下文,忘记任务的真正目的。相反,它们应该专注于需求和结果本身,应该在这部分投入更多精力。这就是目前缺少编排能力的地方。
传统视频编辑器已经有插件、扩展、预设和教程了。人们花了很多年构建这些东西。但即便这些东西都存在,当你要求智能代理做一次视频剪辑时,它也不一定能随时找到并使用它们。
让智能代理剪辑视频,你往往需要告诉它用哪个工具,给它一些方法,解释步骤,然后检查它是不是正确应用了所有东西。此外,这通常还需要花费数小时调整提示词和来回沟通。
没错,智能代理能用 Premiere、DaVinci 和 After Effects。但代价是什么?仅仅是为了在你的帮助下正确应用某个东西,就要来回沟通多少次?我们应该先聚焦于目的。一个片段或序列需要剪切、效果、动画和时序调整。
所以我们需要一个智能代理可以轻松读取的真值源,以及一个应用这些修改的简单方式。如果项目源是代码,智能代理就可以直接处理这个结构。它能看到现有内容并进行修改,不需要每次都通过应用界面一步步操作——那样每一步都要花好几分钟。
看看智能代理现在是怎么构建着陆页或仪表盘的:有大量库、组件、公开仓库和示例可以用。它们可以检查自己做了什么,读取代码,然后修改。视频剪辑领域也需要更多这样的内容,还要包含方法。
一个特效或音效应该附带使用场景的示例和规则。一个场景应该有清晰的结构。智能代理应该有可遵循的步骤,以及检查结果的方式。我们可以把这些放到技能库里,这样就不用每次在提示词里解释整个流程了。
但如果你缺少必要的项目上下文,也无法精确管理每个细节,这种方法就行不通。尤其考虑到目前视频领域还没有代码领域已经普及的验证技术,而且智能代理本身就在非常有限的上下文、资源和工具调用限制下运行。
这就是为什么我们决定在 Diffusion Studio 中将项目的真值源做成代码形式。智能代理可以读取你的剪辑、修改它们、重复它们。你甚至可以把自己的技法转化为视频制作工作流中的技能。
举个例子,我刚创建了一个转场效果,然后让 Claude Code 审查它,并按照我的结构和规则应用到正确的位置。它完成了。我把我的技法以它能读取和使用的形式给了它。
现在想象一下,更多人用源代码分享他们的剪辑。比如说,著名转场和剪辑技法创作者 Sam Kolder 用这种方法分享他自己的技法。我们可以构建很多剪辑技法的开源版本,还有我们现在通过插件使用的工具和效果。
人们可以分享场景、模板、组件和说明。其他人可以改进它们,智能代理可以访问代码并使用相关技能。这些项目也可以成为训练智能代理的有用示例。创意说明、代码、时间线和最终输出视频全都在一起。源文件显示了确切素材、生成媒体用到的提示词、时序、设置和剪辑背后的步骤。
其他人可以改进它、重复它、复制部分内容、修改它,或是尝试自己的方法。这也给我们提供了训练和测试智能代理的清晰样本。这样一来,我认为剪辑质量会好很多。
智能代理有可行的方法、参考、技法和示例可以遵循,我们也可以在一个使用成熟方法、工作流和贡献空间的环境中通过人类反馈不断改进它们。我们已经在另一个领域有了成熟的技法和工作流。我们只需要为了不同的目的把它们结合起来。
这就是为什么我们在产品中采用了这种方法。我认为未来会有更多剪辑师、动态设计师和内容创作者用这种方式分享他们的风格、剪辑方案和规则。一旦智能代理能访问这些示例和技能,哪怕是一个简单的提示词也能完成多得多的工作。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖