允中 发自 凹非寺
量子位 | 公众号QbitAI
太卷了!过去两年,视频生成模型把画面参数几乎卷了个遍。
4K、物理一致性,画面越来越真,时长也越来越长。
但传统视频生成模型生成的永远是一段固定、预设的成品视频,你无法干预剧情、不能调整视角、更不能改变下一秒画面内容。
世界模型带来的变化,恰恰在这里。
它会跟随操作实时渲染、动态生成世界。
按下前进键,前方场景实时延展生成;转身回望,身后的街道即刻演算而出。
你不再是被动的观看者,而是真正的参与者。
而现在,做这件事的团队多了起来。Google DeepMind的Genie 3、腾讯的WorldPlay、蚂蚁的LingBot-World,以及一批创业公司,都在推进这个方向。

△神仙打架,越来越有「头号玩家」那味儿
放眼当下,世界模型已经初步实现了可自由探索、实时交互的视觉场景。画面质量、帧率、持续生成时间以及稳定性,都有了很大提升。
可当你戴上耳机沉浸式体验时,就会察觉致命短板:这片世界,一片寂静。
你漫步街巷,车辆从身旁驶过,却没有呼啸而过的轰鸣;你推开厚重的木门,门板缓缓转动,却听不到一丝铰链摩擦的声响;你看到野兽就在不远处低吼,身躯清晰映入眼帘,耳边却一片死寂。
有画无声,不成世界。
首发!可交互音视频世界模型HelixWorld 1.0
现在,这块最明显的短板,终于有人补上了。
Noiz AI联合来自香港科技大学、清华大学、CMU、Google DeepMind等机构的研究员,刚刚发布了实时可交互音视频世界模型HelixWorld 1.0。
丢进去一张图和一句提示词,眼前就会展开一个持续生成的世界。
本文转自:凤凰网科技
原文地址: https://tech.ifeng.com/c/8vecu0wK14g

小同爱分享3 个月前
命没了还有轮回,钱没了,死都不甘心。 - 小同爱分享
小同爱分享6 个月前
疫情,就是让人抑郁,又没了感情。 - 小同爱分享