DeepSeek 开源首个实验性多模态模型 V4-Flash-Vision-Exp

DeepSeek 在 Hugging Face 上线 DeepSeek-V4-Flash-Vision-Exp,这是 V4 家族首款实验性多模态模型,采用 MIT License,参数量 305B。该模型基于 V4-Flash-0731 接入视觉编码器和 Aligner,面向多模态 Agent 场景,可读取网页截图、软件界面和图表并配合工具调用执行任务。此次开源包括权重、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。模型曾于 8 月 21 日先接入 DeepSeek API,十天后开放权重。官方称其多模态 Agent 能力接近 Claude Opus 4.8。

上一篇:

下一篇:

发表回复

登录后才能评论