这个 8 月,AI 视频赛道的军备竞赛又升级了。

字节跳动发布 Seedance 2.5,把单次视频生成时长从 15 秒翻倍到 30 秒。同一天 MiniMax H3 开源,价格只要闭源旗舰的三分之一。

整个赛道争的还是同一个指标:谁能一口气生成得更长、更连贯、更便宜。

但这场比赛有一个所有人都默认的前提:你得先等视频生成完,看一下,才知道自己想不想改。如果想改,对不起,重新排队。

有意思的是,隔壁语音赛道已经把这个前提拆掉了。就在几周前,OpenAI 发布 GPT-Live,语音交互从说一句等一句的回合制进化成全双工——AI 能边听边说,不用等你把话讲完。

语音对话率先证明了一件事:「实时」本身就是一种新范式。

8 月 5 日,京东把同样的事情搬到了视频编辑上。

京东开源的 JoyAI-Video-Edit,是这个赛道里第一个同时做到“流式架构 + 实时速度 + 可用质量”的模型。

部署代码、技术报告、在线 Demo 和模型权重同天在 Hugging Face 和 GitHub 上放出。

开源地址:

GitHub:https://file.tonglife.net/images/c1/519a7368578c4dcd51ded579eefccb.jpg

Hugging Face:

实时视频版的Nano Banana

先说一下JoyAI-Video-Edit的效果——

720P 分辨率下模型推理速度达到每秒 30 帧,系统端到端稳定在 24FPS,而且支持任意时长的稳定流式编辑。视频可以一直播、一直改,没有时间上限。

换句话说,对着视频你可以不断动动嘴实现各种视觉特效。

变老、变年轻、变成乐高小人,甚至是拉布拉多,一句话的事,就能实时渲染出来。

太好玩了。

本文转自:凤凰网科技

原文地址: https://tech.ifeng.com/c/8vNKKmrjMj0