Video-Text-to-Text
Transformers
Safetensors
qwen2_5_omni
text-to-audio
multimodal
video-captioning
audio-visual
ugc
Instructions to use openinterx/UGC-VideoCaptioner with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use openinterx/UGC-VideoCaptioner with Transformers:
# Load model directly from transformers import AutoProcessor, AutoModelForMultimodalLM processor = AutoProcessor.from_pretrained("openinterx/UGC-VideoCaptioner") model = AutoModelForMultimodalLM.from_pretrained("openinterx/UGC-VideoCaptioner", device_map="auto") - Notebooks
- Google Colab
- Kaggle
File size: 579 Bytes
afb17b1 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 | {
"</tool_call>": 151658,
"<tool_call>": 151657,
"<|AUDIO|>": 151646,
"<|IMAGE|>": 151655,
"<|VIDEO|>": 151656,
"<|audio_bos|>": 151647,
"<|audio_eos|>": 151648,
"<|box_end|>": 151649,
"<|endoftext|>": 151643,
"<|file_sep|>": 151664,
"<|fim_middle|>": 151660,
"<|fim_pad|>": 151662,
"<|fim_prefix|>": 151659,
"<|fim_suffix|>": 151661,
"<|im_end|>": 151645,
"<|im_start|>": 151644,
"<|quad_end|>": 151651,
"<|quad_start|>": 151650,
"<|repo_name|>": 151663,
"<|vision_bos|>": 151652,
"<|vision_eos|>": 151653,
"<|vision_pad|>": 151654
}
|