前言
自 2022 年 hitorino-II 第二代虚拟偶像正式进入行业以来,我们一直在思考一个问题:
视频势虚拟偶像,说到底就是做视频。那我们该怎样发展视频制作技术?
对于 hitorino 来说,角色只是内容体验的一部分。影像、美术、声音、剪辑、后期、实时渲染和技术基础设施,共同决定一档虚拟偶像节目的最终质量。作为一支以视频内容为核心的虚拟偶像团队,我们从一开始就选择把更多专业制作流程引入这个领域。
过去几年,我们持续升级声音制作、视频后期和技术工作流,并逐步建立起一套由内容创作者、声音工程师和技术人员共同参与的制作体系。
这意味着,声音不能只是用麦克风录下来、交付一个文件;画面也不能只是开着面捕、用 OBS 录下来,再用剪映加上字幕、上传平台,就算完成制作。
从录音、监听、后期处理和编码,到最终交付给观众的音频;从角色渲染、打光、材质和动画,到剪辑、调色和最终的视频输出,每一个环节都纳入了统一的制作标准。
现在,我们正在进一步提高这套标准,提升视频势虚拟偶像的竞争力。
hitorino 正在把接近参考级的视听制作与监听环境、无损音频工作流,以及更高规格的视觉处理能力引入节目制作体系。
我们的目标不是单纯提高参数。更高的采样规格、更完整的动态范围、更准确的声音还原和更精细的角色渲染,最终都服务于同一件事:创造一个遵循现实逻辑、令人信服的虚拟世界,让观众感受到虚拟偶像设定之下的真实感,也让角色的表演更有说服力。
这也是 hitorino 接下来要持续推进的方向。
我们正在把一部分原本应用于专业音频、影视制作和技术工作流的标准,逐步带入虚拟偶像内容制作。
更高的制作标准,不应该只存在于大型制作环境里。
它也应该成为虚拟偶像内容体验的一部分。
声音
本更新适用于:
- 零_hitorino(2021)
- 洲上光_hitorino(2024)
- 莱姆莱特_hitorino(2022)
- 诺娃苏奴威_hitorino (2022)
- 拉尼娅露尼丝_hitorino(2025)
- 赤栉冬_hitorino(2025)
- 伊娃艾克赛尔(2026)
要获得高质量的无损音频,只在最终渲染或编码阶段选择 48 kHz/24-bit 等高规格参数,并不能直接提升音质。
最终音质取决于整个录音与制作链路:从麦克风、前级放大器、音频接口和 A/D 转换,到录音软件中的采样率与位深设置,再到后期编辑、混音、母带处理和最终输出。每个环节都会影响声音信息最终能保留下来多少。
也就是说,无损编码只能避免在最终编码阶段继续丢失数据,无法恢复录音时就没有采集到的信息。
例如,即使最终以 48 kHz/24-bit FLAC 格式输出,如果原始录音底噪较高、存在失真或发生削波,或者录音设备的动态范围与信噪比不足,更高的文件规格也无法弥补这些问题。
声学环境同样是录音链路中的重要一环。
在未经声学处理的房间里录音时,墙壁、天花板、桌面等硬质表面的反射,可能带来明显的早期反射、梳状滤波和房间混响,也就是常说的“房混”。这些反射声一旦和人声一起录入,就成了原始信号的一部分。
即使使用高规格麦克风和音频接口,后期再借助专业去混响、语音修复或其他高端音频插件处理,往往仍要在消除房间反射和保留人声细节之间权衡。处理过度,也可能损伤细微的呼吸声、齿音、瞬态、泛音和空间细节。
因此,录制时尽可能获得干净、准确的原始声音,通常比后期修复明显的声学问题更重要。
这也是为什么在 hitorino 的无损音频制作流程中,录音空间的吸声处理、反射控制、环境噪声和麦克风摆位,与录音设备、采样率和位深以及无损编码一样,都是声音质量控制的一部分。
高规格音频的质量控制,不是到了最终的 FLAC 文件才开始。 从麦克风前的第一秒录音,就已经开始了。
hitorino 的角色们普遍都拥有经过处理的声学环境,符合规格的录制设备,而声音后期普遍具备 Avid 资质,符合规格的监听耳机及工作流,确保观众们的收听体验的下限。
在录音设备方面,hitorino 角色普遍使用来自 Neumann、RØDE、 Sennheiser、Blue 或 LEWITT 等被专业录音与内容制作行业广泛采用的品牌的麦克风,并使用专业音频接口完成录制。
在原始录音阶段,我们通常采用 48 ~ 192 kHz / 16 ~ 24-bit 或更高规格进行录制,以获得充足的动态范围与后期处理余量;根据情况,部分内容也可能采用更高采样率进行录制。
无损音频/录音棚音质
在 hitorino 节目中,无损音频是指节目所使用的配音音频默认以 48 kHz / 24-bit 或更高规格完成录制、编辑与后期制作,并在最终成品输出时采用 FLAC 无损音轨,规格为 48 kHz / 24-bit 或以上。
这与 hitorino 普通节目通常采用的 AAC 音轨有所不同,以 bilibili 平台关闭 Hi-Res 以及开启 Hi-Res 功能作为对比,关闭和开启无损的音频码率差距约在 10 倍左右。
FLAC 属于无损音频编码格式,在编码过程中不会通过有损压缩丢弃原始音频数据,因此能够更完整地保留制作阶段的声音信息,并减少最终交付过程中由音频压缩带来的额外损失。
不过,这并不意味着所有用户都能在实际聆听中明显感受到两种音轨之间的差异。
对于大多数普通听众而言,在常见播放环境、蓝牙连接或一般消费级音频设备下,AAC 与 FLAC 之间的主观听感差异可能非常有限。通常需要使用具备较好解码、输出与还原能力的播放设备,并通过有线连接搭配一定规格的耳机或监听设备,才更有可能观察到声音细节、瞬态、空间信息以及高频表现上的差异。
根据 hitorino 声音工程师在内部测试中的结果,我们推荐以下设备或更高规格的播放环境用于体验无损音轨:
- Sony WH-1000XM4 及更新型号,有线连接模式:可以辨别差异
- Apple AirPods Max USB-C,有线连接模式:可以辨别差异
- Sennheiser HD 200 Pro 及更高规格耳机:可以辨别差异
- 推荐以及其他标有 Hi-Res 或者 Hi-Res Wireless 的耳机(注意 Hi-Res Wireless 规格的耳机需要接收端支持 LDAC 编码才有实际区别)
实际听感仍会受到播放设备、DAC / 声卡、耳机、音量、环境噪声、节目本身的混音内容以及个人听觉敏感度等因素影响。
hitorino 提供无损音频的目的并不是保证所有用户都能听出区别,但通过专业的以及成体系的制作工作流可以尽可能减少最终交付观众链路中的各类问题,让节目在具备相应播放条件时,能够更接近我们在制作阶段所听到的声音,以及就算是不具备专业设备的观众也能注意到 hitorino 节目中角色的音频一般有着更少的混响,环境噪音以及显著更加具有”商业质感“的声音。
动态频谱避让
自动动态响度平衡
画面
本更新适用于:
- 零_hitorino(2021)
- 洲上光_hitorino(2024)
- 莱姆莱特_hitorino(2022)
- 诺娃苏奴威_hitorino (2022)
- 拉尼娅露尼丝_hitorino(2025)
- 赤栉冬_hitorino(2025)
- 伊娃艾克赛尔(2026)
3D
- 优化了面部表情与表现,奇怪的嘴角和表情如今已经不再出现。
- 新增 头发与服装碰撞检测 功能。角色的手部与头发、服装发生接触时,将不再直接穿透,而是根据物理效果产生自然避让与形变。
- 新增 大腿挤压与勒肉体积表现,进一步提升角色腿部的真实性,比如穿着过膝袜的角色会出现勒肉的情况,在特定姿势、服装及动作下的自然体积变化。
- 新增并优化 人体,胸部物理与臀部动态物理,角色在移动、转身及其他动作过程中将呈现更加自然的身体动态效果。
- 角色身体上的部分 服装、挂件及装饰物 现已支持独立物理摆动,并会根据角色动作产生相应的惯性与晃动效果。
- 改善后的丝袜打光效果