INPUT
Development scope
声学事件时间定位
目标只保留无需理解词义即可直接听见的声音:音乐与乐器、非语言人声、环境与机械声、冲击与信号,以及边界明确的复合声学事件。
对白内容、剧情和叙事推断交给 TS-ASR。本阶段以 LAT 时间戳为来源,先做声学投影与非破坏性回检;所有模型结果都是候选,不自动覆盖 gold。
Draft protocol
输入、输出与候选指标
当前协议用于数据构建和人工回检,正式版本仍在校准。
OUTPUT
One temporal interval
{
"start": 36.57,
"end": 39.57
}
秒为单位,满足 0 ≤ start < end ≤ duration。
PROPOSED EVALUATION
Draft temporal metrics
Data manufacturing
从 LAT caption 到
可审核的声学时间边界
先判断“能否只靠听觉定位”,再根据事件的时间形态选择独立证据。Gemini 负责理解 caption 与固定窗回检,不单独决定 gold。
保留 60 秒音频、原始 query 与 LAT 时间戳作为来源记录。
只有脱离对白词义后仍能直接听见的目标进入声学 benchmark。
记录声源、时间形态、起止规则与 occurrence 约束。
Gemini 只选择窗口 ID,时间由程序映射,避免自由报秒偏移。
精确边界由与事件形态匹配的独立声学证据提供。
5 条 · 固定窗 + Gemini 粗边界 + CLAP 滑窗覆盖
7 条 · 固定窗 + Gemini 粗边界 + onset / acoustic change
一致样本可保留;边界移动、新声学投影与证据冲突样本进入人工听测。
Interactive gold set
戴上耳机,检查时间边界
普通模式展示当前 gold;声学审核模式展示纯声学 query、固定窗、独立证据与最终候选。
正在加载音频样例…
Reading notes
如何理解当前 Demo
只审核直接可听见的事件
对白词义、剧情和人物关系不进入本任务;非语言人声、乐器、BGM、环境声、冲击与复合声音可以进入。
证据随时间形态变化
CLAP 主要服务持续与间歇声音;瞬态、转折和复合事件依赖固定窗与低层 onset / acoustic change。
原始时间戳始终可追溯
模型输出只生成候选。审核结论保存在浏览器并导出 JSONL,网页不会覆盖 LAT 或人工复核 manifest。