
基于Pytorch的运行环境构建及在VMRD数据集上的视觉操作关系推理实验
5星
- 浏览量: 0
- 大小:None
- 文件类型:ZIP
简介:
本研究探讨了利用PyTorch框架搭建高效运行环境,并在此基础上进行VMRD数据集上的视觉操作关系推理实验。
并可以获取场景下的操作关系树以及ROI检测提取结构:使用Cascade R-CNN级联网络实现物体的目标检测,特征提取后通过抓取提议网络得到潜在ROIs,再进入级联网络中完成目标检测。
**一、基本概念**
1. **什么是目标检测**
目标检测的任务是找出图像中的所有感兴趣的对象,并确定它们的类别和位置。这是计算机视觉领域的一个核心问题之一。由于物体具有不同的外观、形状及姿态,加上成像时光照条件与遮挡等因素的影响,使得目标检测成为计算机视觉中最具挑战性的问题。
在计算机视觉中关于图像识别有四大类任务:
- **分类**(Classification):解决“是什么?”的问题。
- **定位**(Location):解决“在哪里?”的问题。
- **检测**(Detection):解决“在哪里?是什么?”的问题,即同时确定目标的位置和类别。
- **分割**(Segmentation):分为实例级与场景级别,用于判断每一个像素属于哪个物体或场景。
因此,目标检测是一个融合了分类、回归问题的任务。
2. **目标检测的核心问题**
- 分类问题:图像中包含的物体是什么?
- 定位问题:目标可能出现在任何位置。
- 大小问题:不同的大小和形状的目标。
3. **目标检测算法分类**
基于深度学习的目标检测方法主要分为两类,即Two stage与One stage。
- Two Stage
先生成区域提议(Region Proposal),再通过卷积神经网络进行样本分类。任务流程为特征提取、RP生成以及分类定位回归。
常见Two Stage目标检测算法包括R-CNN、SPP-Net、Fast R-CNN、Faster R-CNN和R-FCN等。
- One Stage
不需要区域提议,直接在网络中预测物体类别与位置。任务流程为特征提取及分类定位回归。
常见的One Stage目标检测算法有OverFeat、YOLOv1至v3系列以及SSD和RetinaNet等。
4. **目标检测应用**
- **人脸检测**:智能门禁系统、员工考勤签到、智慧超市支付验证、车站机场身份认证及公共安全监控。
- **行人检测**:辅助驾驶技术、智能监控与暴恐行为识别,以及移动监测和区域入侵预警等。
- **车辆检测**:自动驾驶汽车开发、交通违章查处及广告内容分析中的车辆类型判断。
- **遥感图像处理**:土地利用规划、道路桥梁建设监督乃至农作物生长状况评估。
**二、目标检测原理**
目标检测技术主要分为RCNN系列与YOLO系列,前者是基于区域的代表性算法,后者则以直接提取特征为主。另外还有SSD等改进型方法存在。
1. **候选区域产生**
许多目标检测技术需要生成边界框(bounding boxes)。物体候选框通常通过图像分割和区域生长技术获取;利用局部相似性特性进行合并操作能够有效识别出不同大小的物体,进而提高信息提取效率。
- 滑动窗口
利用滑窗法流程图可以直观理解其主要思路:首先对输入图片应用一系列固定尺寸的不同窗口从左到右、自上而下地移动。每次移动时使用预训练好的分类器处理当前窗口内的内容,当概率值超过某一阈值即认为检测到了物体;不同大小的滑窗都进行扫描后会得到多个可能的目标标记点集,这些区域中存在大量重叠部分需要通过非极大抑制(NMS)算法来减少冗余。最终经过筛选获得所有识别到的对象。
尽管简单直接易于理解但该方法效率较低且在设计窗口尺寸时需考虑物体的长宽比等因素,因此对于实时性要求较高的场景可能不太适用。
全部评论 (0)


