腾讯混元团队公布端侧翻译模型极低比特量化成果。基于1.8B的Hy-MT2-1.8B模型原始FP16体积约3.3GB,经2-bit和1.25-bit两档方案压缩后分别降至574MB和440MB,翻译质量几乎无损。该模型支持33种语言互译,并已接入哔哩哔哩直播弹幕实时翻译;在本地运行场景下,单条弹幕翻译耗时约500至800毫秒,内存占用约500至700MB。英特尔还对其进行了x86平台适配。
腾讯混元团队公布端侧翻译模型极低比特量化成果。基于1.8B的Hy-MT2-1.8B模型原始FP16体积约3.3GB,经2-bit和1.25-bit两档方案压缩后分别降至574MB和440MB,翻译质量几乎无损。该模型支持33种语言互译,并已接入哔哩哔哩直播弹幕实时翻译;在本地运行场景下,单条弹幕翻译耗时约500至800毫秒,内存占用约500至700MB。英特尔还对其进行了x86平台适配。