VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models | Read Paper on Bytez