LAT · Temporal Audio Grounding · Phase 0

听见事件,
定位发生的时间。

给定一段不超过 60 秒的混合音频,以及对目标声音事件的自然语言描述,输出唯一的起止时间区间。

Gold annotation explorer · 中文 + English
MIX / 00:60.000 GROUNDING
EVENT QUERY

“定位出音乐转折、音效与人物独白共同出现的瞬间。”

00:0000:3001:00
PREDICTED INTERVAL{"start": 18.29, "end": 21.29}
3.00s
757Phase 0 核心样本
2语言
3粗粒度事件类型
≤60s混合音频长度
20精选试听样例

Problem definition

不是识别全部内容,
而是找到描述中的声音事件。

目标事件是广义声音事件:可以是一句话、一段对话、人声情绪、音乐变化、环境声音、物体声,或多种听觉线索共同构成的片段。

Phase 0 直接继承 LAT TAG 时间戳,只做确定性的 60 秒内裁剪与相对时间平移,不引入负例,也不重写事件语义。

Minimal protocol

一个输入,唯一答案,两项指标

保持任务定义最小、明确、可复现。

01

INPUT

Mixed audio + query

audio.wav≤ 60 seconds
“Locate the first audible gunshot followed by a body falling.”
02

OUTPUT

One temporal interval

{
  "start": 36.57,
  "end": 39.57
}

秒为单位,满足 0 ≤ start < end ≤ duration。

03

EVALUATION

VAD-style temporal metrics

Macro Temporal-F1区间交并覆盖质量
Boundary-Hit@1s双边界均在 ±1 秒

Interactive gold set

戴上耳机,检查时间边界

波形中的亮色区域是 LAT 金标区间。点击波形可跳转,或使用“只播目标”检查起止点。

语言
事件
难度

20 个精选样例

LAT target interval

正在加载音频样例…

Reading notes

如何理解当前 Demo

01

它展示金标,不展示模型能力

当前网页用于审阅任务、音频与标注边界;尚未接入任何 baseline 预测。

02

事件类型是 provisional metadata

Speech、Mixed、Non-speech 来自确定性关键词规则,仅用于浏览和切片分析,可继续人工校正。

03

原始时间戳保持不变

网页中的时间是裁剪后音频坐标,由 LAT 原始时间戳做同量平移得到。