audiocards-cfaa0e82·1 events·first seen Aliases: AudioCards
A new arXiv preprint proposes a multi-axis evaluation framework for structured audio captions, addressing limitations of existing flat-text metrics when applied to heterogeneous multimodal outputs. The framework evaluates outputs across five axes—tag-sets, descriptions, logical reasoning, numeric measurements, and spectral profiles—combining LLM judges with deterministic computational metrics. Validation uses a controlled perturbation protocol that injects typed, graded errors into ground-truth annotations to confirm the framework distinguishes paraphrases from genuine corruptions. The work builds on the AudioCards dataset.