看穿屏幕的 实时目标识别引擎
使用 AGI,改善您的游戏体验
PyTorch 机器学习 + CUDA FP16 推理, 显存直接拷贝截屏,配合自研滤波算法栈, 把识别结果以透明 HUD 叠加在屏幕上 —— 不注入输入,不干扰操作。
神经网络是怎么「看」懂这一帧画面的
一次识别 = 一次前向传播。下面三个动画分别演示:整体流程、卷积运算、残差连接。
-
01
输入张量 Input Tensor
letterbox等比缩放并补边到 640×640,BGR → RGB、/255归一化,再转 FP16 半精度写入显存。 -
02
Backbone 主干 CSP · C2f
卷积与 C2f 残差块逐级下采样,把像素抽象成特征图,输出 P3 / P4 / P5 三个尺度。
-
03
Neck 颈部 PAN-FPN
自顶向下传语义、自底向上传位置,双向融合三个尺度,小目标与大目标都不丢。
-
04
Detect Head 解耦检测头
每个尺度各自预测类别概率与边界框回归量,不再共用一支分支,分类与定位互不干扰。
-
05
输出 Threshold · NMS
按置信度阈值筛掉弱框,再用非极大值抑制去除重复框,得到最终的 类别 / 置信度 / 边界框。
从屏幕像素到屏幕上的框,一条完整的四段管线
每一帧画面都会依次经过捕获、推理、滤波与渲染四个阶段。 推理与界面完全解耦:面板拖到哪都不会影响识别节奏。
屏幕捕获
基于桌面复制接口直接取显示输出,比传统位图拷贝更省 CPU,且不受窗口遮挡影响。
DXGI · D3DGDI BitBlt自动选择多显示器YOLO 深度学习推理
letterbox 缩放与归一化后,Ultralytics YOLO 全系列检测网络在 PyTorch + CUDA 上以 FP16 半精度执行,输出类别、置信度与边界框。
YOLOv8YOLO11YOLOv10PyTorchCUDA · FP16自研滤波与运动预测
检测框指数平滑、时域滞留去闪动,并按历史轨迹外推下一时刻位置。全部为纯后处理数值计算,不参与推理,因此不增加推理耗时。
EMA SmoothHysteresisCVLeast SquaresKalman叠加层渲染
结果写入透明分层窗口并合成绘制,窗口鼠标穿透,识别内容可一键隐藏而水印常留。
Layered Windowmouse passthroughGDI+ / Direct2D自研滤波与运动预测算法栈
检测网络给的是「这一帧的框」,噪声与抖动会让它跳。DeepVision 在推理之后 接了一整套自研数值滤波层 —— 纯后处理、不加载额外模型、不做额外推理, 关闭时整条计算路径直接跳过,零附加开销。
检测框指数平滑
对边界框四条边与置信度做指数加权移动平均;无跟踪编号时退化为同类别 IoU 贪心匹配。
时域滞留去闪动
短暂遮挡或漏检时不立刻撤框,连续丢失超过阈值才移除,消除「一帧有一帧无」的高频闪烁。
运动预测三模型
为每个跟踪编号维护历史采样,外推「当前 + 提前量」时刻的中心点;结果仅用于标注,不注入输入。
# 状态 [位置, 速度, Ppp, Ppv, Pvv],P 为 2×2 协方差 def _kf_step(st, dt, z): p, v, ppp, ppv, pvv = st # 预测:速度视为随机游走 p_pred = p + v * dt ppv_pred = ppv + dt * pvv ppp_pred = ppp + dt*(2.0*ppv + dt*pvv) + _KF_Q_POS # 更新:增益由协方差直接给出 s = ppp_pred + _KF_R_POS r = z - p_pred return [p_pred + ppp_pred/s*r, v + ppv_pred/s*r, pvv + _KF_Q_VEL]
合法使用声明
DeepVision Pro 是一款工作在屏幕像素层面的实时识别与显示工具。 请在遵守当地法律法规、游戏与平台服务条款的前提下使用。
非官方产品
本软件为独立第三方工具,与任何游戏、平台或发行商均无隶属、赞助或背书关系,相关商标归各自所有者所有。
纯视觉实现
仅在屏幕像素层面完成识别与叠加显示:不注入任何输入指令、不读写进程内存、不修改游戏文件。
本机推理,数据不外发
模型推理与数据处理全部在本地完成,画面与识别结果不会上传,也不收集任何个人信息。
风险自担
使用者应自行确认所用场景的合规性,因使用本软件产生的一切后果由使用者自行承担。