如何用AI从单张图片制作动漫视频

来源: Elser AI

一张图像可以变成一帧令人信服的动漫画面,但无法变成所有画面。图像确定了单一的摄像机位置、单一的服装状态、单一的背景以及单一的时刻。AI可以推断该时刻周围的运动,但大幅度的变化会迫使它凭空创造出从未可见的信息。

最可靠的方法是将源图像视为关键帧。规划一个从它自然开始的简短动作,生成几个受控的镜头,然后将最佳结果编辑成一个序列。如果你需要不同的角度或新的故事转折,创建另一个起始图像,而不是将一个帧拉伸到超出其作用范围。

什么构成一个好的起始图像?

选择一张包含以下特征的图片:

  • 一个清晰的主题或两个主题之间的简单关系;
  • 清晰可辨的面部、手部、四肢及重要道具;
  • 与背景清晰分离;
  • 移动方向上有足够的空间;
  • 能够稳定持续数秒的照明;
  • 无意外字母、水印或畸形细节;
  • 适合最终平台的宽高比。

对于行走镜头,需包含全身及地面平面。对于情感反应,使用中近景镜头,确保眼睛和肩膀清晰可见。对于穿越环境的镜头推进,场景需要前景与背景的景深层次。

不要假设视频生成会修复不一致的眼睛、缺失的手指、断开的带子或无法辨认的物体。在动画化之前先修正静态图像。

先确定故事节拍

将镜头写作因果与回应:

原因:远处警报响起。 回应:修理工停下手中的活,看向门口,悄悄地把钥匙藏了起来。


然后决定观众必须注意到什么。如果关键点是动作,保持镜头足够宽以显示手部动作,但又要足够近以便看清物体。如果情感更为重要,则在单独生成的镜头中切换至特写。

有用的一图流节拍包括:

- 注意到画面外有东西;
- 走一两步;
- 提升或降低物体;
- 表情的变化;
- 风、雨、光、烟雾或织物的反应;
- 缓慢的摄像机推进或围绕一个基本静止的主体进行轨道运动;
- 进入或离开保持的姿势。

避免在一次生成中同时包含完整的打斗、换装、场景转换和对话交流。

## 构建运动地图

分离五行:

| 元素 | 问题 |
|---|---|
| 主题 | 角色在物理上做了什么? |
| 面部 | 目光或表情有何变化? |
| 相机 | 构图保持锁定还是移动? |
| 环境 | 什么对移动做出反应? |
| 最终状态 | 剪辑时镜头应停留在何处? |

示例:

```text

主题:关闭修复面板并升起一半。 面部:头部转动前,目光先移向门。 相机:锁定中景宽幅画面。 环境:警报响起后,悬挂的电缆晃动一次。 最终状态:隐藏的钥匙位于左臀部后方。


此地图可防止提示变成“使其更具电影感”的泛泛请求。

## 编写图像到视频的提示词

使用此公式:

```text

[初始状态] [主要操作按顺序] [面部表演] [摄像机行为] [次要生理反应] [最终状态] [需保留的详细信息]

仅输出翻译: [不要介绍的内容]


示例:

```text

从提供的画面开始,机械师在远处警报响起时暂停。她 关闭维修面板,目光移向门口,半起身的同时移动着。 她左臀后的黄铜钥匙。她的表情从专注转为戒备 注意。锁定中广角摄像头。悬挂的电缆晃动一次后静止。保护她 面部,黑色短发,橙色工作夹克,手套放置,黄铜钥匙,以及车间布局。 她保持最后的姿势,直到最后一秒。没有新角色,没有切换,没有换装。


对于竖版社交短片,同样的动作可能需要更紧凑的构图。在生成后,应重新调整构图,而非简单裁剪横版结果。

## 审慎选择运动强度

### 低运动

最适合用于肖像、对话反应、氛围循环或角色介绍。使用呼吸、眨眼、凝视、轻微的发丝飘动或缓慢的镜头推进。

### 中等运动

最适合用于转身、站立、走几步、绘制物体或环境反应。确保四肢和地面清晰可见。

### 高动态

打斗、旋转、奔跑、布料模拟或快速镜头移动需要更多推断几何体,并带来更大的身份漂移风险。将它们拆分为起手、动作和结果镜头。

先测试低或中等运动。稳定而微妙的表现比一个壮观但面部无法使用的片段更有用。

## 适用于单张图像的摄像机运动

- **锁定帧:** 对身份和性能最安全。
- **缓慢推进:** 在不暴露太多隐藏空间的情况下增加关注度。
- **缓慢拉回:** 如果源内容已包含环境细节,则此方法有效。
- **横向滑动:** 需要前景/背景分离。
- **温和轨道:** 要求模型推断未见的侧面;谨慎使用。
- **倾斜:** 当源构图支持时,有助于揭示高度。

如果摄像机揭示了图像中不存在的场景部分,模型必须自行创造。移动幅度应与源图像提供的空间信息量成比例。

## 保留动漫角色的身份

选择五到七个锚点,而不是重复所有内容:

```text

保留宽阔的鹅蛋脸、下垂的灰色眼睛、黑色短发波波头搭配铜色发夹, 橙色短款夹克,白色机械手套,黄铜钥匙,以及左脸颊上的疤痕。


然后降低风险:

- 避免从正面图像进行完整的头部旋转;
- 保持头发不遮挡面部中间;
- 避免突然的颜色和光线变化;
- 拍摄过程中请勿变换衣物;
- 保持相同的可见属性;
- 当摄像机角度发生显著变化时,使用另一个标准图像。

对于多镜头序列,制作一个小型角色参考包:中性肖像、全身像、侧面像、三种表情、服装分解以及关键道具。

## 使用 Elser AI 创建起始图像

[Elser AI](https://www.elser.ai/zh) 支持动漫向图像生成、OC 创作和图像动画。一个实用的工作流程是:

1. 在 [OC Maker](https://www.elser.ai/zh/oc-maker) 中设计角色;
2. 选择一个规范结果并保存其提示;
3. 生成具有预期宽高比和相机视角的场景图像;
4. 检查面部、手部、服装、道具和背景;
5. 打开图像动画工作流;
6. 选择项目可用的视频模型或运动控制;
7. 编写一个以动作为优先的提示词;
8. 比较并仅下载已批准的片段。

由于图像创建和动画是相互关联的,你可以修正源文件,而不是试图通过运动提示来修复每一个视觉问题。

## 在动作完成后添加声音

声音应阐明事件,而非弥补不清晰的动画。

构建层:

- 房间氛围或环境音;
- 反应的原因,例如警报、脚步声或火车;
- 同步对象声音;
- 服装或动作装饰;
- 仅在唇部动作和时机支持时才进行对话;
- 在节奏建立后的音乐。

如果视频模型生成音频,请单独审查。检查声音是否与可见时间匹配、是否包含非预期的语音、是否改变语言,或引入与场景冲突的语调。

## 将多个生成的镜头编辑成序列

一张图片转视频片段可以构成一条完整的社交媒体帖子,但叙事性作品通常需要多个镜头。

示例序列:

1. 宽阔的车间全景镜头;
2. 机械师听到警报的中景镜头;
3. 将钥匙插入隐藏在臀部后面的位置;
4. 特写反应;
5. 门洞侧壁。

为每次镜头切换生成独立的源图像。保持屏幕方向一致:如果角色在第二个镜头中看向屏幕右侧,那么揭示的原因通常应出现在对应的方向,除非剪辑有意反转空间关系。

使用提示词、模型、设置和拍摄编号来保持已接受的片段井井有条。“final-final-3.mp4”不是生产系统。

## 常见错误

### 要求过多的故事

修复:将片段缩减为一个因果回应的节拍。

### 使用海报作为源

修复:生成更清晰的框架,包含可读的身体机制和更少的装饰性覆盖。

### 描述外观而非动作

修复:以动词、时间、相机和最终状态开头。

### 让每个元素动起来

修复:优先处理主体动作,然后添加一个环境响应。

### 忽略结局

修正:要求一个稳定的保持姿势,能够干净利落地切换到下一个镜头。

### 过早提高分辨率

修复:在实际草稿设置中批准操作和身份,然后再生成最终输出。

## 常见问题

### 一张动漫图片能变成完整的视频吗?

它可以变成单次短镜头或循环播放。一个包含多个机位的连贯场景通常需要多张起始图像和剪辑。

### 我需要再次描述这个角色吗?

仅重复重要的身份锚点。图像已提供大部分外观信息;提示应聚焦于动作。

### 为什么脸部会发生变化?

大角度旋转、小面部比例、遮挡、快速动作以及光照变化迫使模型推断新的面部信息。简化镜头或使用另一个参考角度。

### 我应该添加摄像机移动吗?

只有在有助于故事叙述时才这样做。先从锁定镜头开始测试效果,必要时再加入微小的移动。

### 我能从一张图片制作唇形同步对话吗?

部分工具支持说话或口型同步工作流,但效果取决于面部角度、音频、语言和模型。应将对话视为专门步骤,而非假设任何图像转视频提示都能同步语音。

### 我应该使用什么宽高比?

在创建源之前选择:9:16用于竖屏视频,16:9用于横屏视频,或根据项目需求选择精确位置。

## 结论

要制作一个[动画视频](https://www.elser.ai/zh/ai-image-animator),从一张图像开始,先准备一个可用于生产的原画关键帧,并指导一个简短的动作。将主体、面部、摄像机、环境和最终姿势分开处理。保留少量身份锚点,并在角度或故事节拍发生变化时创建新的起始图像。目标不是强迫一张图片变成整部电影;而是将每个已批准的帧转化为可编辑的镜头。

最新发布