昊梵体育网

MiniMax 正式放出了视频模型 H3 的权重。 两套 H3-Bas...

MiniMax 正式放出了视频模型 H3 的权重。两套 H3-Base,分开用。一套做文生视频和首尾帧生视频,另一套同时
MiniMax 正式放出了视频模型 H3 的权重。两套 H3-Base,分开用。一套做文生视频和首尾帧生视频,另一套同时参考图片、视频和声音。任务不同,选一套就行,不用全加载。参数规模:330 亿参数的稠密单流 Transformer,编码器基于 Qwen3-VL-32B。本地部署能跑出 4 到 15 秒、带立体声的 768p 视频。这次放出的不是完整 H3 系统,但团队在 Reddit AMA 里明确说了接下来会开放什么。首先是 2K 视频模块。现在必须通过官方 API 才能用的这个模块,已经确定会放出权重。它的工作方式是把已有视频和原始参考素材重新送进模型,再生成一遍高分辨率版本,进一步还原文字、人物和画面细节。团队的说法是,未来有望在本地跑完整的 2K 工作流。其次是加速方案。一套减少计算量的优化方案也会开放,目标是让本地运行 H3 更快、更省资源。但团队也承认了两个现有问题。H3 在同时参考图片、视频和声音生成时,画面确实更容易发糊;远景和小人物也容易出现变形。这些属于模型本身的问题,MiniMax 已经在继续优化。许可限制同样需要注意。MiniMax H3 Community License 不适用于美国、欧盟、英国、韩国,这些地区需要单独申请授权。年收入超过 2000 万美元的企业,也要提前获得 MiniMax 书面授权。Reddit AMA 里还提到一件事:正在开发专门的图像模型,计划开放权重。这个图像模型走的是同一套架构思路。沿用 H3 的 VAE Encoder,图片生成单独设计 VAE Decoder。设想的工作流是:先用图像模型生成首帧,再交给 H3 继续生成视频。有意思的是,H3 本身已经表现出一定的生图和修图潜力。训练时只让模型根据「首帧 + 文字描述」预测尾帧,没有专门做图片编辑训练,但多项评测里零样本表现不弱。这也是 MiniMax 把这套架构扩展进图像模型的主要理由。#人工智能# #小红书热点观察团# #大模型# #人工智能未来# #小红书科技观察团# #AMA# #科技资讯早知道# #AI人工智能# #MiniMax# #AI新手村#