5月24日,字节跳动Seed团队联合香港科技大学发布多模态大模型MMProLong,基于Qwen2.5-VL构建,提出以问答对替代OCR转录的长文档训练方法。研究显示,QA训练显著优于传统文本转录,可提升模型在长上下文中的定位与检索能力。在仅12.8万Token训练预算下,模型在25.6万至51.2万Token输入下保持稳定,并在MMLongBench等基准测试中超越多款更大规模模型。该方法还可迁移至长视频理解任务,并在其他模型上验证有效性。
5月24日,字节跳动Seed团队联合香港科技大学发布多模态大模型MMProLong,基于Qwen2.5-VL构建,提出以问答对替代OCR转录的长文档训练方法。研究显示,QA训练显著优于传统文本转录,可提升模型在长上下文中的定位与检索能力。在仅12.8万Token训练预算下,模型在25.6万至51.2万Token输入下保持稳定,并在MMLongBench等基准测试中超越多款更大规模模型。该方法还可迁移至长视频理解任务,并在其他模型上验证有效性。