Fine-Tuning MedGemma for Clinical Captioning to Enhance Multimodal RAG over Malaysia CPGs

General Vision-Language Models inadequately generate clinically-precise captions required for high-stakes medical applications, constraining Retrieval-Augmented Generation effectiveness when querying Malaysian Clinical Practice Guidelines with images. We introduce a specialization framework that adapts MedGemma into a high-quality query generator. Knowledge distillation addresses annotation limitations, synthesizing training corpora across dermatological, fundoscopic, and radiographic domains. QLORA facilitates efficient model fine-tuning. Complementary evaluation strategies validate our approach which includes classification analysis that reveals marked performance gains, and novel RAGAS framework application to caption assessment demonstrates substantial faithfulness and correctness improvements. This research establishes a robust medical VLM specialization methodology, creating a factually-grounded query generation component critical for multimodal clinical decision support systems.

Paper

Similar papers

© 2026 NYSGPT2525 LLC