YouTube频道Fully Buffered在一台搭载2006年发布的Intel奔腾4 641单核处理器的旧设备上,成功运行Meta Llama 3.2 3B大模型。测试采用8GB DDR2内存及支持No-AVX指令的推理环境,实现模型加载与推理。运行过程中生成速度约为0.21 Token/秒,单次完整回答耗时约33分钟。该实验表明,在缺乏AVX指令集和高算力GPU条件下,大模型仍可运行,内存容量与指令集兼容性成为关键支撑因素,展示了大模型在极低算力硬件上的运行极限。
YouTube频道Fully Buffered在一台搭载2006年发布的Intel奔腾4 641单核处理器的旧设备上,成功运行Meta Llama 3.2 3B大模型。测试采用8GB DDR2内存及支持No-AVX指令的推理环境,实现模型加载与推理。运行过程中生成速度约为0.21 Token/秒,单次完整回答耗时约33分钟。该实验表明,在缺乏AVX指令集和高算力GPU条件下,大模型仍可运行,内存容量与指令集兼容性成为关键支撑因素,展示了大模型在极低算力硬件上的运行极限。