Loading...
紫东太初推出的通用多模态大模型ZDTaichu5.0-9B,凭借其9亿参数在空间智能赛道上取得了卓越成绩。它在9项国际权威空间理解基准测试中获得了8项同参数组别的第一名,尤其在空间感知、跨视角三维推理和具身任务规划等方面,表现优于同量级的Qwen3.5-9B和STEP3-VL-10B等模型,甚至在与闭源模型Gemini 3 Pro和Grok 4的竞争中,仍然在5个基准测试中名列前茅。此外,该模型在图文理解、光学字符识别(OCR)、视觉数学和编程等多模态能力评测中,依然位于领先水平。
ZDTaichu5.0-9B采用了先进的自适应循环推理技术,与业界前沿的闭源模型GPT-6 Astra所使用的Loop Transformer技术相似,显示出研发团队的前瞻性。同时,紫东太初还发布了其经过验证的数据生产管线方案,涵盖预训练、微调和强化学习等多个环节。
通用多模态模型在物理世界的应用面临着诸多挑战。随着数字世界能力的快速提升,物理世界却依然具有独特的复杂性。机器人在执行任务时,既需要空间感知能力,也需要在不同视角下进行三维推理和满足物理约束的操作规划。这些综合能力的评测在数字环境中难以充分体现,而在实际应用中却是必不可少的。一旦某一能力缺失,整条任务链就可能中断。 龙8体育
ZDTaichu5.0-9B解决了数据和推理机制相关的问题,确保空间具身能力的提升,同时保留通用能力。该模型在复杂空间理解任务中表现出色,能够准确定位目标物体的坐标,并输出归一化坐标,成功完成任务。相比之下,其他同类模型在定位上出现错误,只有ZDTaichu5.0-9B实现了正确的目标选择。此外,在参照系转换的任务中,该模型同样展现了出色的理解能力,能够识别由于摄像头角度变化引发的空间关系变化。
总的来看,ZDTaichu5.0-9B在推动多模态模型向物理世界迈进的过程中,展现出了其卓越的空间具身能力。