
赫拉克勒斯是希腊神话中的大力神,但他并非生来就是英雄。他杀了九头蛇、捉了牝鹿、扫了牛棚、摘了金苹果,完成了十二项试炼,英雄的身份才被确认。整条路走完,终点才被看见。
中国大模型的进程与此相似。文本基座从追赶到齐平,推理成本从高昂到普惠,商业化从质疑到验证。一项接一项,像在完成某种沉默的十二试炼。
7月31日,中国大模型的试炼里程碑又多了一项:沉积许久的MiniMax,发布了最新多模态模型H3。在此之前的很长一段时间里,这家公司承受着资本市场的严苛。H3的出现,让局面有了微妙的变化。 在我们试用H3之后,一个判断逐渐清晰:H3的效果已经达到甚至超越了Seedance级别的水平,真正站上了多模态视频生成的前沿。
中国大模型,又完成了一项试炼。而这,也将是MiniMax价值重估的新奇点。
01 又一个里程碑
这次MiniMax H3的推出,将多模态模型从技术演示推向了生产力场景。理由有三。
第一,全模态输入。
维特根斯坦在《逻辑哲学论》里写过一句话:我的语言的界限意味着我的世界的界限。这句话在大模型时代有了新的含义——你的表达能力有多宽,AI能帮你实现的边界就有多远。
但每个人的表达能力并不相同。有人能用文字精确描述一个画面,有人脑子里有一个完整的场景,却无论如何也说不清楚。这时候,全模态输入的价值就显现出来了。
MiniMax H3不再把图片、视频、声音的生成、编辑和参考拆成彼此独立的任务,而是由文本、图像、视频与声音共同构成多模态上下文,统一理解创作意图。
换句话说,多模态输入拓宽了用户表达的边界。那些过去因为“说不清楚”而无法实现的想法,现在有了新的表达路径。
我们用H3生成了第一视角在老北京胡同中拍照的场景。用纯语言描述时,胡同的背景很难锚定,手机第一视角的表述也不够精确,但在H3模型中,直接将老北京胡同的场景和手持手机的人物作为参考输入,输出的景深、色彩、物品细节都非常完美,效果惊人得好。
本文转自:凤凰网科技
原文地址: https://tech.ifeng.com/c/8vBdVEaynZ1

小同爱分享2 个月前
命没了还有轮回,钱没了,死都不甘心。 - 小同爱分享
小同爱分享5 个月前
疫情,就是让人抑郁,又没了感情。 - 小同爱分享