Kakao推自适应分词技术提速AI视频生成

IT时代网9月9日消息,据Chosun报道,Kakao公布了一项自适应分词技术,可将AI视频生成速度提升至原来的3.2倍。Kakao于9日宣布,其研究员李妍京在国际学术会议ECCV 2026上发表论文,介绍了用于解决AI视频生成模型计算量过大、计算成本过高问题的自适应分词技术。ECCV与CVPR、ICCV并称全球计算机视觉三大顶会,今年在瑞典举行,会期至12日。随着AI研究向高分辨率、长时长视频生成发展,如何压降指数级增长的计算成本已成为关键挑战。现有的视频压缩(分词)技术无论视频内容如何都按固定比例压缩,导致静态或低运动场景也生成不必要的词元,造成计算资源浪费。Kakao针对视频帧间高度冗余的特点,开发了名为KATok的自适应分词技术,让AI根据视频的时空复杂度自主调整计算所需词元数量。在运动剧烈、信息密度高的复杂场景中分配更多词元,在静态或简单区域则剔除冗余词元,从而按视频内容自行决定所需计算负载,优化资源分配。实验显示,KATok以远少于传统方法的词元重建出高质量视频,数据压缩性能更优。应用于整个视频生成流程后,优化的词元表示使视频生成模型的训练速度提升约6.9倍,视频生成速度提升约3.2倍。Kakao应用AI模型性能负责人崔东镇表示,在高分辨率、长时长视频生成这类计算需求快速增长的环境中,KATok的自适应分词技术将带来更大的计算成本降幅,公司将在多种AI视频生成模型上验证其通用性,并将其发展为在降低计算负载的同时保持出色画质的大规模视频生成核心基础技术。

编辑:林一舟

THE END