17611538698
webmaster@21cto.com

Redis 作者 antirez 再出神作:纯 C 语言写出 MiniMax-H3 引擎,M5 Max 上 3.5 秒本地生成视频

开源 0 15 1小时前
图片

21CTO 导读

继推出 DeepSeek V4 Flash 专用推理引擎 ds4 之后,Redis 之父 Salvatore Sanfilippo(antirez)再次展现了顶级 C 语言工程大师的惊人统治力。他抛弃臃肿的 Python 技术栈,用纯 C 语言为 Apple Silicon Mac 量身打造了 h3.c——一个零依赖、高吞吐的 MiniMax-H3 原生视频/音频推理引擎,彻底把生成式视频的推理算力从云端榨回到了端侧本地。

垂直切面打通:纯 C 重构多模态生成管线


antirez 在项目的 README 文件中如此写道:

“这个项目是以一系列可工作的垂直切面(Vertical Slices)方式构建的。”

从确定性单元测试、Metal 块级正确性校验,到 Prompt 文本编码、Prompt-to-Video/Audio,再到首尾帧条件锚定(First/Last Frame Control)与多模态引用,h3.c 已经用极致干净的 C 语言将整条端到端推理管线彻底跑通。

M5 Max 生产环境实测数据


在 M5 Max 统一内存平台上,h3.c 展现了以下令人吃惊的吞吐效率:

  1. 极速渲染模式:512×512 分辨率、22 帧视频,4 步去噪只需 ~3.5 秒

  2. 参考级质量模式:29 步去噪渲染仅需 ~26.4 秒

  3. Token Reduction 优化:在 45 层 + reuse-2 的去噪配置下,耗时从 16.69 秒大幅缩短至 12.60 秒

  4. INT8 深度量化(MLP + QKV + Attention Output 全量量化):在 50 层、19 个过渡帧的 512 分辨率渲染中,相比 BF16 的 36.30 秒直接斩落至 ~19.32 秒,性能提升近 100%。


工程自洽与极致内存控制:纯 C 与 Metal 的硬核艺术


h3.c 在工程架构层面最令人叹为观止的,是其完全脱离主流 AI 框架束缚的自我完备性(Self-containment)

图片

  1. 摆脱 Xcode 依赖与动态内核编译:项目无需离线编译 Metal 工具链,所有 Metal Shader 均在运行时(Runtime)动态编译加载;

  2. mmap 零拷贝与内存压榨:支持对 37 GiB 大模型进行基于文件的零拷贝内存映射(File-backed Mmap),按需读取;INT8 量化模式将峰值张量存储压缩至 ~25.9 GiB

  3. 内存屏障与复用机制:通过激活缓冲区别名复用(Buffer Alias Reuse)、融合 Kernel(Fused Kernels)以及计算图数据缓存,在 128GB 的 M5 Max 上,端到端渲染物理内存占用仅约 40 GB,实现了完美的 Zero Swap(零交换分区)


可调式“速度/质量”拨盘与 Iris 风格极客 TUI


h3.c 赋予了开发者对底层参数极其精细的掌控权。

包括去噪步数、DiT 层数、速度复用、核心复用、Token 裁减(Token Reduction)以及内部画布分辨率均可实现独立解耦调节。

为了让终端体验足够优雅,antirez 还内置了一个 Iris 风格的终端交互界面(TUI):

  1. 输入 Prompt 直接触发视频生成;

  2. !seed random 随机切换采样种子;!show 实时渲染预览;!save output.mp4 导出文件;

  3. !first / !last 快捷设置首尾帧锚定图像;

  4. 终端协议直显:原生支持 Kitty、Ghostty 以及 iTerm2/WezTerm/Konsole 等终端图形协议,让开发者可以在纯命令行窗口里直接预览视频帧


社区反馈与未来的“稀疏注意力”演进


目前,开发者社区已经开始尝试将该引擎应用于实际场景。

开发者 Meleagris 在 M5 Pro (64GB内存) MBP 上使用 Q5_K_M 量化版,表示体验相当惊艳;并指出 Q8_0 (34GB) 在 64GB 统一内存下控制好分辨率也能稳定运行。

开发者 linzhangrun 称在 M4 Max (128GB) Mac Studio 上用传统框架生成 15 秒 480p 视频耗时达 1.5 小时,目前已经在全面转向 h3.c 以期寻求数量级上的速度突破。

antirez 还在社区透露了一个重大演进方向:MiniMax 在官方 AMA 中提到 H3 架构原生支持稀疏注意力(Sparse Attention)。

antirez 这样补充说:

“那将会带来巨大的速度提升!我目前正在测试基于他们算法细节的 --sparse-attention 可选模式。” 

结语


20年前,antirez 用纯 C 语言写出了 Redis,重塑了互联网后端的内存缓存与高并发架构;20年后的今天,他再次用纯 C 语言手撕生成式视频推理引擎,打破了 Python 和大型框架对 AI 算力的垄断。

两次工程奇迹的背后,是同一种极客精神的延续——剥离一切不必要的抽象层与工程糟粕,把极致复杂的技术简化到极致,让顶级 AI 算力真正平权到个人的桌面设备之上。

作者:场长

评论

我要赞赏作者

请扫描二维码,使用微信支付哦。

分享到微信