Show HN 之后,NiceShot AI 的 26 个月:用 YOLO + OCR 给电竞录像做分析层

电竞录像自动转结构化数据,一个 Hacker News 上的项目

Hacker News 上有个项目叫 NiceShot AI,作者 niceshot-ai 花了 26 个月做一件事:把电竞比赛的录像自动转成结构化分析数据和精彩集锦。

这个方向听起来像竞品,但作者明确说,他想做的是电竞行业「忘了加的分析层」。管线大致是:游戏录像 → YOLO 检测 → 事件追踪 → OCR/上下文过滤 → 事件时间戳 → 剪辑 → 精彩集锦。

核心思路并不复杂,但有几个值得细说的点。

游戏无关的设计

作者说,支持一个新游戏,只需要换一个检测模型和配置,不用重写整个管线。这是这个项目最实在的设计决策。市面上不少 CV 分析工具,换一款游戏就要重新搭一遍,NiceShot AI 试图把这个成本压低。

它用的是 YOLO 模型来识别游戏内的 HUD 元素,然后根据这些检测结果解读击杀、死亡、勋章等事件。配合 OCR 过滤掉不该算作游戏事件的帧——比如 Call of Duty 里 KillCam 或观战状态下出现的击杀提示。

这意味着同一套系统,理论上可以复用 across 多个游戏,只要每个游戏有足够的标注数据来 fine-tune 检测器。

离线处理的选择

最初的目标其实是实时事件检测,但最终选择了离线处理。原因很实际:不想让 CV 推理占用 GPU,影响玩家的实际游戏性能。

项目目前在本地 NVIDIA GPU 上运行,作者用一块 GTX 1650 4GB 的旧笔记本跑过,能跑,但慢。这说明对消费级显卡有一定容忍度,但实时性还是问题。

这也是整个项目目前最大的技术悬念:如何在 1080p 输入下,让检测和推理的延迟降到不会干扰游戏本身。作者公开征求思路。

Video LLM 的尝试

最新的一个实验是,在 YOLO 检测出事件之后,用轻量级 Video LLM 对截取出的短片段进行分析,让模型解释发生了什么。目标是把它做成一个轻量的、可对话式的游戏教练。

这个方向有意思。不是因为 Video LLM 多厉害,而是它解决了一个实际问题:YOLO 能告诉你「谁杀了谁」,但解释不了「为什么这波操作值得看」。Video LLM 补的是这个解释层。

不过目前还处于实验阶段,没有给出具体模型名称或性能数据。

一些边界

项目 GitHub 仓库地址是 github.com/karimm-ai/NiceShot_AI,作者自己提交的消息目前只有 2 分,发布于 4 小时前(以材料时间为准)。

项目还在演进中,作者明确表示欢迎技术批评和建议。不支持实时推理、不承诺云端部署、没有给出对特定游戏的准确率数据——这些是材料里能确认的边界。

这个项目最值得关注的,是它试图证明一件事:电竞分析不一定需要游戏厂商来做,第三方用 CV + 少量配置就能覆盖多款游戏。如果这个假设成立,它的商业价值会比一个「更酷的工具」大得多。