whisper_large_v3_encoder_fp16
更新2026-05-28 17:26发布时间2026-05-28 17:26
141
0
0
whisper_large_v3_encoder_fp16 - 1
头像
User_jh05wj
类型
Other
基础模型
Other
发布时间
2026-05-28 17:26
文件签名
bc4fb6a9bcba671a2ea09a0fe1e9369b18ee78330abfa91b358b99382dc801d5
whisper_large_v3_encoder_fp16.safetensors
1.58 GB

Whisper Large v3 Audio Encoder Model.

Used to extract speech features, perform lip-syncing, and analyze emotional rhythm, enhancing lip accuracy and audio alignment in digital human video broadcasting.

Suitable for LongCat Avatar audio-driven workflows.

作品

暂无作品