Instructions to use gvij/minicpm-av-music-avqa with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use gvij/minicpm-av-music-avqa with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("openbmb/MiniCPM-V") model = PeftModel.from_pretrained(base_model, "gvij/minicpm-av-music-avqa") - Notebooks
- Google Colab
- Kaggle
MiniCPM-AV Music-AVQA Model
This is a fine-tuned MiniCPM-AV model trained on the MUSIC-AVQA-v2.0 dataset for audio-visual question answering.
Model Details
- Base Model: openbmb/MiniCPM-V
- Audio Encoder: UsefulSensors/moonshine-tiny
- Training Dataset: DraculaDragon/MUSIC-AVQA-v2.0
- Training Config:
- Epochs: 3
- Batch Size: 64
- Learning Rate: 2e-5
- LoRA Rank: 8
- LoRA Alpha: 16
- Mixed Precision: bf16
- Best Validation Loss: 0.1525
Files
audio_components.pt: Audio projector, compressor, and modality embeddingsadapter_config.json: LoRA adapter configurationadapter_model.safetensors: LoRA adapter weights (13.6M parameters)
Usage
from src.modeling_minicpm_av import MiniCPMAV, MiniCPMAVConfig
import torch
# Load model
config = MiniCPMAVConfig()
model = MiniCPMAV(config=config)
# Load pretrained weights
model.load_pretrained("gvij/minicpm-av-music-avqa")
model.eval()
# Prepare inputs
audio = torch.randn(16000) # 1 second of audio
image = PIL.Image.open('image.jpg')
question = "What instrument is playing?"
# Generate answer
answer = model.generate_with_audio(
images=image,
audio=audio,
question=question
)
print(answer)
Citation
@misc{minicpm-av,
title={MiniCPM-AV: Audio-Visual Question Answering with MiniCPM-V},
author={Gaurav Vij},
year={2025}
}
- Downloads last month
- 4
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support
Model tree for gvij/minicpm-av-music-avqa
Base model
openbmb/MiniCPM-V