< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

商汤大装置助力智象未来实现视频生成业务向国产算力无感迁移

国产算力跑通视频生成规模化应用

国产算力走向规模商用,如何跨过从“适配验证”到“真实生产”的关键一步,正成为行业面临的新课题。近期,商汤大装置与智象未来以视频生成业务为切入,跑通了从国产算力适配到规模应用的完整链路。

对于以图像、视频生成模型为核心的AI企业而言,国产化并非简单地将模型从一种GPU迁移到另一种GPU。尤其是视频生成模型,参数规模大、推理链路长、计算密集度高,从底层算力、推理框架到模型性能、生成效果和工具链,每一个环节都可能成为国产化落地的“卡点”。

作为全球领先的多模态生成式人工智能创新企业,智象未来(HiDream.ai)致力于打造下一代原生全模态世界模型。依托自研HiDream系列大模型,智象未来持续布局商业营销、影视创作、内容创作等场景,目前,其产品已覆盖全球100多个国家和地区,服务超过5000万名专业用户及4万余家企业客户。

作为智象未来重要的AI基础设施合作伙伴,商汤大装置持续通过稳定、高效的AI基础设施,支撑其模型快速研发和迭代。此次,双方进一步将合作延伸至国产算力适配验证。

围绕智象未来重点业务,商汤大装置从底层算力替代出发,深入模型推理、性能优化、生成效果等关键环节,通过全栈技术适配与FDE专家服务,帮助智象未来实现在国产算力环境下的平稳运行,为多模态大模型的国产化部署形成可复用样板。

01依托LightX2V多卡并行,实现视频生成加速比达93%

对于视觉生成应用而言,性能不足不仅会增加用户使用成本,也会影响产品体验和业务规模化应用。因此,此次合作中,智象未来提出了明确的业务指标:在国产算力环境下,实现高清视频的高效生成,并将端到端生成时长优化至业内领先水平。

基于此具体目标,商汤大装置团队基于LightX2V进行了多卡并行优化,并进一步探索多机多卡场景下的扩展能力。首先从模型的优化入手,基于训练-推理联合优化的思路,通过LightX2V步数蒸馏、CFG蒸馏等训练方案,在保持视频质量的同时显著提升推理速度。

推理过程中,通过引入CFG双分支并行、Ulysses序列并行、TP并行等多层次并行策略,对视频生成过程中的计算任务进行拆解与协同调度,在满足业务效果的基础上提升多卡资源利用效率和并行加速能力。

最终,在国产芯片运行DiT模型的场景下,多卡并行视频生成加速比达到93%,充分释放国产算力性能。

02效果优化,提升多卡生成效果一致性

如果模型迁移到新的算力环境后生成速度提升了,但人物表情、动作、细节等出现明显变化,那么这样的国产化迁移依然难以真正进入生产环境。

在多卡推理过程中,双方团队发现,同一模型在单卡和多卡环境下可能存在细微的生成效果差异,例如人物表情等特征表现不同。针对这一问题,商汤大装置团队进一步优化多卡通信过程,通过重新注入Face特征等方式,加强多卡推理过程中的特征一致性,使多卡生成效果进一步向单卡效果对齐。

在另一个实际问题中,团队发现部分视频在尾帧位置出现手指等细节不清晰的情况。经过排查发现,问题与模型训练阶段和实际推理阶段的视频帧数存在差异有关。针对这一问题,团队对推理过程进行相应补齐和优化,使长视频生成过程中的细节表现得到改善。

商汤大装置团队通过这些细节的调整,逐一解决了国产模型适配国产算力,在走向真实生产环境过程中遇到的工程挑战。

03支持异构芯片零成本迁移

对于智象未来而言,国产化适配不仅要解决单一芯片的适配问题,还需要应对不同国产芯片之间的异构适配挑战。

针对这一问题,商汤大装置构建了统一的硬件抽象体系,通过异构硬件初始化、统一设备抽象层、Registry调度工厂、硬件算子插件等,屏蔽了不同底层硬件之间的差异。基于统一抽象体系,实现“一次开发,多平台适配”,目前已支持10余种异构芯片上的模型零成本迁移。

与此同时,商汤大装置完成了ComfyUI等主流AI开发工具生态适配,无需改变原有工作流和开发习惯,即可在国产算力平台完成应用开发与部署,大幅降低迁移和开发成本。

04 FDE专家服务:深入业务,保障全流程闭环

对于智象未来这样的AI科创企业而言,模型研发和产品迭代本身就需要投入大量资源。如果再投入大量人力完成国产化环境下的适配和迁移,无疑会增加额外的人力成本和时间成本。

为此,商汤大装置通过FDE(Forward Deployed Engineer)专家服务模式,将专业工程能力深入到智象未来业务场景。

此次合作中,商汤大装置并非仅提供底层国产算力和平台能力,而是组织专业工程团队围绕智象未来实际业务需求,深入参与国产化适配全过程:从模型迁移、算子优化、多卡并行,到生成效果调优、工具链适配,再到最终的业务效果保障,围绕实际业务指标逐项排查和解决问题。

这种“算力平台+工程专家”的协同方式,可以帮助AI企业减少国产化迁移过程中大量的工程投入,将更多研发资源聚焦于模型创新与产品迭代。

05 业务落地:国产算力支撑规模化短视频创作

在商汤大装置AI 基础设施能力和FDE专家团队的支持下,智象未来图像模型已完成国产算力适配验证,并进一步支撑规模化线上流量及短视频创作。

此次商汤大装置与智象未来的合作实践,验证了国产算力支撑视频生成业务的一条可复用路径:以底层异构算力为基础,以统一硬件抽象体系和开发工具适配为连接,以模型性能与生成效果优化为核心,再通过FDE专家服务深入业务现场,最终实现国产算力从全栈适配、技术验证到规模生产的完整闭环。

未来,双方还将围绕更多AI应用场景深化合作,共同探索国产AI基础设施与生成式AI应用融合发展的更多可能,推动国产算力从“能用”加速迈向“好用”,助力AI创新企业更加高效地实现技术创新与业务规模化落地。

本文由商汤提供,量子位获授权转载,观点归原作者所有。

版权所有,未经授权不得以任何形式转载及使用,违者必究。