From Generalist to Specialist: Adapting Vision Language Models via Task-Specific Visual Instruction Tuning | Read Paper on Bytez