Shazam-inspired music recognition system — FAISS vector search + spectral fingerprinting, with CLAP/MuQ embeddings, FastAPI backend and React frontend.
-
Updated
May 26, 2026 - Python
Shazam-inspired music recognition system — FAISS vector search + spectral fingerprinting, with CLAP/MuQ embeddings, FastAPI backend and React frontend.
Song identification combining landmark audio fingerprinting with CNN/AST/MERT embeddings (contrastive InfoNCE), benchmarked on Jamendo with strong noise robustness.
Self-hosted audio API in one Docker container. Stem separation, mastering, MIR (BPM/key/chords), audio→MIDI, text-to-music + SFX (MusicGen/Stable Audio/Riffusion/AudioLDM2), diarization, speech enhancement, restoration, embeddings + zero-shot tagging, workflows, async + webhooks. REST + MCP. CPU + CUDA.
Music mood embedding, clustering & zero-shot labeling engine (MERT + CLAP) — a pure, stateless Python MIR toolbox.
Transfer sonic characteristics from reference sounds to a source audio using Music2Latent embeddings
multi-agent AI music production orchestrator. semantic sample search, voice-to-MIDI, Ableton control, stem separation, MIDI generation, MCP server.
Universal audio embeddings + tagging + similarity search with Streamlit demo and FastAPI; PANNs/YAMNet, FAISS/Qdrant, Grad-CAM.
Music-emotion alignment via contrastive learning. Pairs frozen MERT audio encoder with BGE text encoder in a shared 512D space for emotion-based music retrieval.
Machine learning song recommender: cultural retrieval + CLAP audio embeddings + LLM rationales, over a two-gate async FastAPI pipeline on Postgres/pgvector, with a static Next.js showcase.
Multimodal extractors for video, image, audio, text & PDF — turn any file into searchable vector embeddings (SigLIP, Gemini, E5, CLAP, ArcFace).
Audio-similarity discovery across 272,853 tracks, with strict Spotify language filtering, native Spicetify playback, anonymous feedback, and a blinded evaluator.
Self-hosted semantic music search and audio tagging over a catalog on Backblaze B2. Essentia extracts BPM, key, genre, and mood; CLAP embeddings power find-similar and plain-English text-to-audio search. All local OSS models — B2 is the only credential.
Music analysis for DJs — interpretable DSP features (BPM, four-on-floor, spectral balance, key) combined with MERT audio embeddings, UMAP genre clustering, Engine DJ playlist import and similar-track suggestions.
Cante Style Embeddings - Cantaor Identification
CLI and Python library for embedding human health acoustics using Google HeAR.
End-to-end bioacoustic search for animal vocalizations in Amazonian forest recordings using SurfPerch, Qdrant, and an interactive review UI.
Explainable music search with optional CLAP audio enrichment
To associate your repository with the audio-embeddings topic, visit your repo's landing page and select "manage topics."