今天的阿里TaoLive, 它是AIGC团队的一部分, 这个团队在今天开源了TaoMate-H3模型, 该模型是一个流式模型, 它具有三个步骤去除噪声就能生成一段时长为六十秒的带声音的视频的能力, 它支持四百八十p这种分辨率直至一千零八十p这种分辨率的屏幕输出功能, 并且它同时支持横向竖屏的输出模式, 目前已经在GitHub平台上上线了可供下载的链接, 同时也已经上线了在Hugging Face平台上的可供下载信息, 核心的卖点是说用户不用等待视频全部内容完成生成的过程, 能够实现边生成边播放的功能。
01三步去噪替代整段反复迭代
传统的视频生成长期以来都需要对整段内容进行反复的去噪处理, 人们不得不等待以分钟来计的时间才能看到结果。TaoMate-H3这种新技术将生成过程拆解成了许多小片段, 对于每一个片段而言, 仅仅需要三步去就能够搞定。这样一来, 第一段内容几乎在瞬间就可以产出。
在一个十秒的配置情况下, 模型会总共生成八个部分即所谓的_chunk_对象。在这个过程中会执行24次前向运算以及8次KV更新操作。其中主体部分所对应的大约是百分之一点四秒的时间。而尾部的片段所需的时间更是缩短得比较显著因此更短一些。
少步 LoRA 适配, 它把流式推理压缩到了三个去噪区间里, 模型优先完成当前片段的处理动作, 然后才去推进后续部分的发展过程, 根本不需要等待整个片段全都完成后才开始输出。
这种一段一段地产出内容的方式方式, 能够显著缩短用户那边的等待时间, 是为直播讲解场景、虚拟角色表演场景以及交互式视频应用场景提供了一个崭新的技术基础。
02KV缓存支撑分钟级连续生成
模型通过那些持续更新的音视频KV缓存, 跨越那提示词的边界, 把那些已经生成的人物、声音还有场景信息, 传递给后续的那些片段。那个缓存采用的是起始视觉参照加上近期音视频上下文的结构, 规模是固定的不会随着视频时长的增长而变化, 为那种分钟级的续写提供了稳定的上下文支撑。
当切换提示词的时候, 系统会把已经存在的KV值保留下来, 并且区分开新生成的内容和编解码最后的上下文。针对长视频里出现的亮度和色调偏移问题, 模型会以第一个片段的视觉统计数据作为参照标准, 然后对后面视频的潜在表示做均值和方差的对齐处理, 这样可以减轻画面观感随着时间变化而产生的影响。
03音频引导锁定台词节奏
声音已经深度地参与到了那个生成的过程里面, 它能够为口型的变化、表情的呈现以及动作的产生提供对应的时间上的配合工作。这个模型首先会去准备一段音频的去噪轨迹, 这段轨迹是覆盖当前段落的。
然后在进行三次去噪操作的时候, 这三次的去噪需要分别对齐到轨迹里面定义的三个不同的状态之中。最终出来的那个音频的潜在空间表示会和引导的最终终点保持一致。这样做的好处是能够避免在短片段进行续写操作的时候出现重复起句的现象。
系统在衔接不同段落的时候, 会截取上一段最后大约一秒的干净音频内容, 把这份内容当作只读的参考资料, 以此来保持音色与语气的连续性。音频引导会贯穿整个生成过程, 让台词中的停顿情况、语速快慢以及结束位置在每一个段落的层级上都保持稳定, 这样就不会因为段落切换得过于零碎而导致声音出现断裂的问题。
04分段提示词编排商品与角色叙事
创作者是可以使用分段提示词的, 这个动作可以在连续镜头中推进讲解的, 他们是逐段调整重点或表演内容的, 他们组织的是更完整的商品介绍和角色叙事, 这一方式是适用于商品短视频的, 这一方式是适用于选品介绍的, 这一方式是适用于品牌内容制作的, 这一方式也是适配于直播讲解等需要及时反馈的场景的。
这次发布了两种不同的画幅。这两种画幅下面都有人物口播和商品展示的案例。背包那个视频保留了完整的一分钟的生成结果。这样可以直观地显示出横向输出和竖向输出的效果。开发者可以据此评估不同分辨率下的构图表现怎么样。也可以评估不同分辨率下的细节表现怎么样。
05开源生态与后续模型路线图
推理代码与对应的LoRA权重以及示例提示词, 已经放在了GitHub和Hugging Face这两个平台上供人下载。那些开发者们能够根据这个材料去搞一些研究。比如说研究流式推理。
再去研究关于分块解码的事项。还要开发能够和人互动的那种应用。此外, 他们还可以围绕音视频的生成工作展开探索。同时对于应用的集成事项, 也能进行相关的探索活动。
团队计划在不久之后, 把FL2AV这个流式模型一点点地开源出来。 同时会把工作扩展到这个叫做Ref2AV的方向上面。 并且会同步把这些模型的权重也开放给大家。这样做的目的是为了支持更加丰富的音视频创作方式。我们的最终目标, 是希望流式生成这项技术能够真正地走入到更多的实际创作场景之中去。
你心里想着, 流式这种人工智能视频技术, 最快会在什么具体的场景里面真正跑得转呢? 请帮忙点个赞, 把这篇文章分享出去, 再在评论区里说说你的判断是什么样的。

