Gemma 4 Narrows Open Model Gap With Efficient Multimodality
Dense and MoE variants combine thinking traces, local-global attention, QAT, and MTP drafting, reaching 1451 Arena Elo with a 31B dense model.
Jul 28, 20265 min2607.02770
2 articles on SOTA Papers
Dense and MoE variants combine thinking traces, local-global attention, QAT, and MTP drafting, reaching 1451 Arena Elo with a 31B dense model.
Next-State-Prediction trains a shared latent space from video, events, and VQA data, improving balanced downstream readouts with a frozen backbone.