Diffraction创新模式:保障创作者权益,领跑物理AI训练数据市场

Image
Diffraction创新模式:保障创作者权益,领跑物理AI训练数据市场

随着人工智能(AI)技术的飞速发展,特别是机器人领域,对于大量高质量视频训练数据的需求日益增长。然而,这些关键数据大部分来源于在线创作者的作品,他们却往往未能获得应有的商业认可和公平报酬。为了弥补这一空白,位于美国俄亥俄州兰卡斯特的网红营销与数据公司Diffraction,正致力于开创一个全新的AI训练数据市场。该公司通过建立健全的合同机制、规范的数据获取流程以及清晰的数据来源验证体系,旨在保护创作者权益,确保其获得合理回报,并解决现有市场的不透明问题,从而构建一个公平透明的数据交易环境。

物理AI训练数据市场的增长与挑战

随着AI技术,特别是机器人领域的最新进展,机器需要在物理环境中执行抓取工具、穿越崎岖地形和感知水流等实际任务。这需要海量高质量的视频训练数据。然而,这些关键数据很大一部分来源于在线创作者日常制作的视频。核心问题在于,这些视频常常缺乏应有的商业认可,创作者也往往得不到公平报酬。

Image

Diffraction由联合创始人约瑟夫·索蒂尔(Joseph Sottile)和汤姆·斯旺(Tom Swann)于2022年9月创立,并计划于2026年1月推出其数据平台‘StreamGenie’。他们意识到,尽管创作者拥有大量的视频素材,但当这些素材被用于AI训练时,他们往往无法获得报酬。这一洞察促使他们着手搭建创作者与数据购买者之间的关键桥梁。

Image

将创作者权益保护置于核心地位

Diffraction指出,物理AI数据市场饱受‘欺诈’问题困扰。常见的做法包括屏幕录制、未经授权从公共来源提取内容或在没有明确权利文件的情况下汇编数据,这些都损害了数据集的合法性。为应对此问题,Diffraction将‘溯源’作为其首要设计原则,确保每个数据集都附带文件,以验证内容所有者的同意和明确的权利授予。这一前瞻性策略也旨在符合不断演变的监管环境,例如欧盟AI法案(EU AI Act)规定,自2025年8月起,通用AI模型提供商必须披露用于训练内容的摘要。

该公司许可条款明确禁止使用和复制个人肖像权以及重复使用已授权数据。此外,他们要求数据在许可到期后必须删除。Diffraction还针对视频中包含的受版权保护元素(例如背景音乐或第三方出镜)要求单独授权,从而建立起多层次的创作者权益保护框架。

需求驱动的定制数据构建与价值评估

当前,大多数物理AI数据市场采用‘投机模式’运营,即先积累大量视频内容,再等待买家。而Diffraction则采取‘按需定制’的方法,根据客户的具体要求构建数据。他们已进行了500多次内容审计,以识别哪些类型的创作者内容能产生积极的购买需求。例如,在创作者的100GB档案中,20小时的乐高组装视频可能具有即时的市场价值。

数据定价由稀缺性、技能水平和多样性这三个变量决定,每小时价格从几美元到几百美元不等。网上常见的日常任务视频价值较低。相比之下,展示特定技能的内容,例如熟练的水管工进行实际维修的视频,则拥有更高的溢价。这是因为AI训练不仅受益于观察正确的结果,还能识别熟练与非熟练操作之间的差异。Diffraction还澄清了关于创作者肖像权可能被侵犯的误解,强调物理AI训练数据侧重于行为和物理交互,而非创作者的外貌或身份。

未来路线图:从档案授权到远程操作

Diffraction为其未来规划了三阶段路线图。第一阶段是授权现有视频档案。第二阶段侧重于根据买家需求定制捕获数据。第三阶段也是最后阶段是‘远程操作’,即通过远程控制机械臂来生成演示数据。这种人类通过机器人机制直接执行任务的过程,被认为是物理AI开发中最有价值的输入数据形式之一。

实现远程操作将需要精通VR控制界面的人员以及能够运行试点项目的实验室伙伴。联合创始人约瑟夫·索蒂尔指出,通过VR头显在虚拟环境中导航的技术可以直接应用于机械臂的远程操作。他强调,熟练的创作者将通过与未来机器人技术的协同作用,创造出巨大的新价值。

Image

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注