Job Description
📋 Description Lead development of multimodal vision-language models within the FLUX stack Innovate on architectures beyond off-the-shelf VLMs Design fine-tuning for creative use cases (captioning, prompts) Integrate VLM/LLM with diffusion/flow pipelines for quality and controllability Evaluate emerging multimodal architectures and translate to improvements 🎯 Requirements Pretrained or significantly advanced a VLM deployed in production or public release Strong publication or production track record in multimodal architectures Deep understanding of vision-language interaction: tokenization, grounding, cross-modal attention Experience with distributed multi-node training Comfort shipping work that generalizes beyond research Experience with diffusion or flow-based models is a plus 🎁 Benefits Base Annual Salary: EU €130,000-€340,000 + Equity Flexible work options with in-person cadence at Freiburg or SF Reasonable travel support for in-person weeks