Alibaba

HappyHorse 1.0

HappyHorse 1.0 是阿里巴巴的旗舰多模态 AI 视频模型——统一的 150 亿参数 Transformer,可从单个文本或图像提示直接生成带原生同步音频的 1080p 视频。发布即登顶公开榜单,Elo 分数 1381,领先第二名 107 分。

HappyHorse 1.0 支持文生视频(T2V)、图生视频(I2V)和主体生视频(S2V):可以根据提示直接生成、把静态图像动画化,或在保留主体身份的前提下把参考主体插入生成的视频中。输出最长 15 秒、1080p、多镜头,并带原生同步音频——包括对口型对白、环境氛围和富有情感的人声表演。视频编辑能力包括视频到视频(V2V)——在保留原始结构与运动的前提下重新风格化既有素材,以及主体+视频到视频(SV2V)——在保持原始运动、构图与未受影响区域不变的前提下替换或插入参考主体。在 Astorie 中通过 Geneasy 提供商接入,目前开放文生视频与首帧图生视频两种模式。

Illustrative sample of a HappyHorse 1.0 still showing a multi-shot 1080p scene with an expressive speaking character implying native synchronized audio on the Astorie canvas
示意样例 — 代表性输出,并非模型逐帧渲染结果

支持的功能

文本生成视频
图像生成视频
视频到视频
参考图像
尾帧控制
分镜编辑
音频驱动

最适合

  • 生成视频中带对口型对白和富有情感的人声表演
  • 从单个文本或图像提示生成多镜头 1080p 视频
  • 强调原生对口型的多语种内容
  • 需要开箱即用人声 + 环境音的剧情和广告类内容
  • 把主视觉静帧扩展为完整片段的首帧图生视频工作流

优势

  • 统一的 150 亿参数 Transformer,支持音视频联合生成
  • 1080p 输出,最长 15 秒,支持多镜头构图
  • 多语种对口型、环境氛围与情感人声表演
  • 发布即登顶公开榜单(Elo 1381,领先第二名 107 分)

局限性

  • 提示词上限:非中文 5,000 字符或中文 2,500 字符
  • I2V 参考图不能超过 10MB
  • Astorie 当前仅开放文生视频与首帧图生视频,S2V/V2V/SV2V 仅在上游模型可用
  • 单一质量档位——模型内部不区分标准/专业档

使用技巧

把对白原文直接写在提示中——HappyHorse 会在同一遍次内生成对口型的同步音频。
描述期望的人声情绪(平静、激动、低语),让模型据此塑造表演风格。
首帧图生视频请上传 10MB 以内的干净主视觉静帧,模型会将其延展为多镜头片段。

Astorie 上使用 HappyHorse 1.0

Astorie 的无限画布上将 HappyHorse 1.0 与其他 AI 模型连接使用。无需 GPU,免费开始。

免费开始

相关视频模型

返回所有视频模型