Skip to content

Densecap 密集描述 ​

Densecap 面向第一人称视角视频,要求对整个片段连续、细粒度地描述可见内容。示例用于说明具体程度,不是封闭词表或动作分类体系。

时间轴与片段 ​

  1. 每一项陈述都以当前呈现视角的画面为依据,不引入其他机位的事实。
  2. 按时间顺序连续覆盖整个视频;第一段从 00:00 开始,最后一段在视频结束处结束,不能有空隙或重叠。
  3. 画面发生实质变化时开始新片段。不同的运动、接触、姿态变化或物体效果不要合并成粗略的一句话;操作密集时通常需要 1–3 秒片段。
  4. 时间戳应与可见证据相符。如果任务允许按 4 fps 查看并读取帧时间,使用 .00、.25、.50、.75 的四分之一秒步长;不要把这个规则套用于 VTG,VTG 按题目要求四舍五入到最近整秒。
  5. 同一时间段可以写多个句子,但每句话都必须说明该时间段内可见的变化;不要为了凑字数重复没有变化的内容。

场景、物体和空间关系 ​

  1. 在视频开始时说明与任务有关的场景状态,并在镜头或物体显著变化时更新布局、位置和背景物体。
  2. 只有每个被计数的物品都清晰可见且可以区分时,才给出精确数量;遮挡、重叠或无法辨认时使用“几个”“至少”“部分被遮挡”。
  3. 物体的类别、颜色、材质和其他属性只能写画面支持的程度。不确定时用“似乎是”“看起来像”,并在整个时间序列中保持同一称呼。
  4. 使用画面支持的空间关系,例如观看者左侧或右侧、顺时针或逆时针、沿边缘、放入容器、抵住表面。默认方向参照是观看者视角;使用其他参照时要明确说明。

手部、姿态和物理动作 ​

  1. 能可靠判断时,分别跟踪左手和右手;不能判断时只写“可见的手”,不要猜左右。
  2. 当身体姿态影响动作时,描述迈步、转身、弯腰、跪下、起身、倾身以及靠近或远离物体的路径。
  3. 写出实际的手与物体或环境的物理动作,优先使用具体动词,不要只写“整理”“处理”“操弄”。
  4. 让可观察结果成为描述重点:位置、朝向、排列、形状、支撑、容纳关系或接触状态如何变化。
  5. 把动作和前后状态放在同一描述中,例如“将一个包装放到另一个包装上,形成两层堆叠”,而不是只说“包装被整理”。
  6. 在画面可见时写出靠近、接触、保持接触、转移支撑、松开和物体留在表面上的转换。
  7. 有助于理解动作时,记录停顿、悬停、支撑固定和双手分工;不要遗漏负责稳定物体的手。

不确定性和重复动作 ​

  1. 不要仅凭预期推断隐藏内容、不可见的力、意图、言语、材质或是否成功紧固。应描述可见证据,并在需要时限定不确定性,例如“接触点部分被遮挡,但面板数值随手的位置从 28.0 变为 28.5,因此很可能按下升温控件”。不要写“标注员认为”或“标注员将其理解为”;如果需要说明推理,将它作为单独备注。
  2. 重复操作的每个循环如果有可见机械过程或不同结果,就分别描述,不要用“继续”一笔带过;同时不要在没有变化时重复相同观察。
  3. 宏观信息可以写入时间片段,例如能可靠数清的绕线圈数;看不清时写“几圈”,或描述线圈变厚、剩余线变短等可见过程。
  4. 密集操作可以参考每分钟约 1,100–1,500 个英文单词,但这不是统一字数配额。质量审核还要检查事实依据、数量、左右手、物理过程、效果、时间粒度和幻觉。

音频 ​

Batch-0 视频文件不提供音频。不要根据示例中“背景有人说话”的句子推断实际视频有音频;这类句子应视为示例错误。

Aboda VAS Help