Collections of multimodal (image+text) instruction finetuning datasets tailored for visual language models like LlaVA, Fuyu, or IDEFICS.
Victor Sanh PRO
VictorSanh
AI & ML interests
None yet
Recent Activity
liked a model 4 days ago
moonshotai/Kimi-K3 upvoted an article 11 days ago
Security incident disclosure — July 2026 liked a Space 25 days ago
joelniklaus/harness-optimization