Submitted by Iker GarcĂa-Ferrero 14 Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss Multiverse Computing 11 4