书生·万象 3.5 开源:9 种尺寸多模态,自称感知超 GPT-5,能自部署
上海人工智能实验室在 8 月底开源了 InternVL3.5(书生·万象 3.5),一口气放出 10 亿到 2410 亿参数的 9 种尺寸,稠密和 MoE 都有。旗舰 241B-A28B 在 MMMU 拿到 77.7(开源最高分),多模态通用感知 MMStar / OCRBench 宣称超过 GPT-5。
几个和一人公司相关的点:
- 全谱系意味着你能挑「刚好够用」的那档。 端侧小模型到旗舰全有。配合动态视觉分辨率路由(ViR)和解耦部署框架(DvD),38B 在 896 分辨率下响应延迟从 369ms 压到 91ms,提升约 4 倍——中档卡也能跑出能用的体验。
- 不只是「看懂图」。 GUI 智能体(ScreenSpot 定位 92.9 分,跨 Windows / Ubuntu 自动化)、具身空间推理(VSI-Bench 69.5)、矢量图形理解生成(SGP-Bench 70.7)都明显提升。换句话说,它能做界面操作、读工程图、控制机器人路径规划这一类「从理解到行动」的活。
- 能自部署。 官方给了 transformers 调用示例,8B 单张 A100 可跑,38B 需 2 张,235B 需 8 张。ms-swift 已支持训练微调。
要泼的冷水:
- 241B 那条对一人公司基本是看个热闹,现实里 8B / 38B 才落得地,能力上限要自己压测。
- 「超越 GPT-5」是实验室基准口径,落到你的真实文档、真实界面、真实业务图,差距未必这么大,务必拿 20 条自己的样本先试。
- 多模态模型吃显存和上下文,部署前的量化、切片、批量策略都得自己调,不是下个权重就完事。
我的建议:如果你做的内容/产品涉及图片理解、文档解析、界面自动化,又不想把数据送进闭源 API,InternVL3.5 是现在国产开源里最值得本地起一个试的。先从 8B 起步,验证能解决哪一段,再决定要不要上更大尺寸。
- 报道来源:上海AI实验室发布多模态大模型书生·万象 InternVL3.5(模型权重见 Hugging Face / ModelScope 官方仓库)
原文出处 · 事实以此为准
AIBase