6月26日消息,商汤科技在近日举办的股东大会上预告了下一代旗舰多模态模型SenseNova-U1 Pro,定位为"理解·生成·行动"原生统一的多模态智能体基座,明确将GPT-Image-2作为对标对象,预计2026年7月启动邀请测试。该模型支持原生8K分辨率输出,商汤称这超过了GPT-Image-2的4K原生直出上限。
核心能力:多模态统一内核与长程设计循环
SenseNova-U1 Pro的技术路线是在同一模型内核中打通多模态理解与生成。据商汤介绍,该模型面对复杂设计需求时,能够执行设计、生成、评审的长程循环——先对任务进行整体评估,尝试不同策略,内部评估生成效果并自主调整,最终输出可直接交付的成品级结果。
商汤联合创始人林达华将其描述为"思考、理解和创作在一个大脑里面统一"。作为产品能力的直接展示,此次股东大会使用的全套20余页演示PPT由SenseNova-U1 Pro一次性生成,商汤称模型在此过程中自主完成了规划、制作和评估的全流程。
五组对比场景:从信息图到电影分镜
股东大会现场展示了五组预览场景,其中三组直接与GPT-Image-2进行对比。
知识信息图场景中,使用同一国画风"二十四节气"提示词,SenseNova-U1 Pro完整呈现全部24个节气并逐一标注日期与序号,商汤称GPT-Image-2的生成内容存在缺失。杂志跨页场景中,模型以单条提示词生成GQ风格横版跨页,包含车辆规格参数表、多角度图集和时间轴等复杂多栏混排内容。
分辨率差异在电影分镜场景中最为突出。基于同一段追逐戏提示词,SenseNova-U1 Pro输出16000×24000+像素、含40-60格的分镜稿,每格附带景别、机位与情绪标注;商汤称GPT-Image-2仅输出1024×1536像素,分辨率差距超过百倍。商汤表示该能力将为其短片智能体Seko的剧集创作提供支持。
"设计"赛道:编程之后的下一个模型竞争焦点
商汤在预告中将"交付级设计"作为模型应用的重要方向,覆盖产品开发、平面设计、工业设计、视频制作和城市规划等场景。商汤认为,在编程能力之后,设计正在成为顶级多模态模型的下一个主赛场。
值得注意的是,目前展示的五组场景均来自商汤自身的对比演示,尚无第三方独立基准测试数据。模型7月启动邀测后的实际表现,特别是在复杂商业设计场景中的稳定性和通用性,仍有待外部验证。