The Song Describer dataset is an evaluation dataset made of ~1.1k captions for 706 permissively licensed music recordings.
-
Updated
Dec 22, 2023 - Jupyter Notebook
The Song Describer dataset is an evaluation dataset made of ~1.1k captions for 706 permissively licensed music recordings.
Repository for CIKM 2020 resource track paper: MAEC: A Multimodal Aligned Earnings Conference Call Dataset for Financial Risk Prediction
Unlock AI power with AudioInsightsGenerator! From audio to summaries, emotion analysis, idea generation, narratives, and content filtering. Explore your audio's hidden dimensions!
AI-powered lecture summarization platform using Whisper for transcription and Llama 2 for concise, efficient summaries.
Simples e eficiente para transcrição automática de áudios em tempo real, desenvolvido em JavaScript. Com o Áudio Transcrito, você pode apertar o botão e começar a falar — o aplicativo cuidará de transcrever sua fala para texto de forma rápida e precisa. Ideal para anotações rápidas,.
O projeto Notes Expert não é um simples projeto de “notas”, pois converte o “áudio” do usuário em “texto”. Desenvolvido com Typescript, React, Tailwind CSS e outras ferramentas.
TensorFlow implementation of "Multimodal Speech Emotion Recognition using Audio and Text," IEEE SLT-18
Cross-modal audio-text alignment & retrieval: contrastive two-tower encoders + DTW alignment.
Adalah project yang menggambarkan proses mengubah rekaman video dengan format mp4 menjadi teks dengan menggunakan bahasa pemrograman Python.
The code for the paper "Audio-Text Multimodal Speech Recognition via Dual-Tower Architecture for Mandarin Air Traffic Control Communications".
To associate your repository with the audio-text topic, visit your repo's landing page and select "manage topics."