Text to audio grounding (TAG) dataset: AudioGrounding
<p>AudioGrounding dataset, including audio files and timestamp annotations.</p><p>Changes in version 2: The train/validation/test sets are re-split. The validation and test annotations are refined.</p><p> </p><p>----------------------------------------------------------</p><p><strong>References</strong></p><p>[1] Xuenan Xu, Heinrich Dinkel, Mengyue Wu and Kai Yu. "Text-to-audio grounding: Building correspondence between captions and sound events." In <i>Proceedings of IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)</i>. IEEE, 2021, pp. 606-610.</p><p>[2] Xuenan Xu, Mengyue Wu, and Kai Yu. "Investigating Pooling Strategies and Loss Functions for Weakly-Supervised Text-to-Audio Grounding via Contrastive Learning." In <i>Proceedings of IEEE International Conference on Acoustics, Speech, and Signal Processing Workshops (ICASSPW)</i>. IEEE, 2023, pp. 1-5.</p>
ShareScore
40/100
Overall dataset sharing score
Score breakdown
These five areas show where the dataset supports — or may limit — practical reuse.
- Stewardship
- 4
- Harmonization
- 4
- Access
- 20
- Reuse readiness
- 8
- Engagement
- 4