KIT_IWSLT26_IF_ SHORT_unconstrained_ primary

We participate in the unconstrained data condition. Our system is based on an end-to-end multimodal model built on Qwen2.5-Omni-7B, trained jointly across all target languages.
We employ task-balanced data interleaving with temperature-based sampling to balance heterogeneous task distributions and mitigate dominance of high-resource tasks, including ASR, speech translation (ST), spoken question answering (SQA), speech summarization (SSUM), audio captioning (ACHAP), multiple-choice QA (MC), and general instruction-following tasks.
At inference time, we use beam size of 10.
From\To de en it zh
en N/A N/A N/A N/A