登录社区云,与社区用户共同成长
邀请您加入社区
本文提出Semi-DETR++,首个针对DETR架构的半监督目标检测框架。针对DETR一对一匹配对伪标签噪声敏感的问题,创新性地设计了阶段性混合匹配策略(SHM),在训练初期采用抗噪的软一对多匹配,后期过渡到标准一对一匹配。针对基于查询的解码器难以建立稳定对应关系的问题,提出重解码查询一致性(RQC)方法,利用解码器自身的隐式指导实现高效一致性训练。
7种交通场景目标检测数据集分享(适用于YOLO系列深度学习检测任务) 源码下载 在智能交通与自动驾驶技术快速发展的今天,如何高效、准确地感知道路环境已经成为研究与应用的核心问题。车辆、行人和交通信号灯
由于物体尺寸较小,从无人机(UAV)拍摄的图像中检测物体具有挑战性。在这项工作中,我们探索了一种简单高效的自适应变焦框架,用于无人机图像的目标检测。主要动机是,前景物体通常比普通场景图像中的物体更小且更稀疏,这阻碍了有效目标检测器的优化。因此,我们的目标是自适应地放大物体,以便更好地捕捉用于检测任务的物体特征。为了实现这一目标,需要两个核心设计:i) 如何高效地对每张图像进行非均匀变焦?ii) 如
本项目基于YOLOv11和OCSort算法实现多类别目标跟踪,并集成单目相机测距功能。采用TensorRT框架加速推理,C++实现,适用于交通场景下的目标检测、跟踪与距离估计。系统通过像素坐标反投影和地面平面约束计算目标距离,结合相机内参、外参及安装高度进行几何补偿。相比DeepSort和ByteTrack,OCSort算法在遮挡处理、轻量化和跟踪稳定性方面表现更优。项目提供完整的相机标定方法和参
本文介绍了一种基于YOLOV8的混凝土裂缝识别系统,该系统利用深度学习技术实现了对混凝土表面裂缝的自动化检测。通过构建高质量的裂缝数据集、优化网络结构、实施有效的训练策略,最终实现了高精度的裂缝检测效果。
本文介绍了一个基于YOLOv8的脑肿瘤识别系统,该系统通过深度学习技术实现了对医学影像中脑肿瘤的自动检测和定位。项目从数据集构建、模型训练、系统集成到性能评估,形成了完整的解决方案。
本系统是基于改进的YOLOV11的建筑工地头盔安全检测系统。可以实现图片检测、视频检测、摄像头检测三种方式。能够检测出是否佩戴头盔。另外添加区域报警功能,使用YOLO目标检测算法、ByteTrack跟踪算法和多边形区域检测算法对绘制的区域中未佩戴头盔的目标进行语音播报提示以及邮箱报警,并将目标保存至后台。最后使用可视化界面对检测结果进行可视化显示。技术栈使用YOLOV11目标检测、Pytorch、
YOLO26提出了一种多任务统一架构,整合了目标检测、实例分割、姿态估计和旋转框检测(OBB)四大计算机视觉任务。该架构采用共享Backbone和Neck的设计,配合轻量级任务特定Head,解决了传统方法中多模型并行带来的高开发成本、大内存占用和低推理效率问题。核心设计包括:1)共享特征提取层实现参数复用;2)模块化Head结构支持灵活任务组合;3)统一接口实现单模型多任务处理。实验表明,该架构在
本文介绍了一种基于YOLO26的交通标识智能检测系统。该系统利用深度学习技术,能够实时准确地检测和识别视频流中的4类交通标识(人行横道、限速、停车、交通灯)。文章详细阐述了数据集准备、模型配置优化、训练评估流程及部署指南,并展示了系统的高精度检测效果。该系统采用YOLO26最新算法,针对交通标识特点进行了专项优化,具有检测速度快、准确率高、易于部署等技术亮点,可为智能交通和自动驾驶提供有效支持。
本文是一篇面向零基础新手的 YOLOv11 (Ultralytics) 环境配置保姆级指南,旨在帮助用户在 Windows 系统上快速、成功地搭建目标检测环境。文章不仅提供详细的操作步骤,还汇总了高频报错的解决方案,确保用户能顺利跑通第一个检测案例。
从样本图像来看,数据集覆盖了多样化的机场地面场景:包含不同机型的飞机、各类地勤保障设备与廊桥设施,且图像中存在自然的光照变化、阴影干扰与设备遮挡,模拟了机场周转作业中的真实视觉条件。该数据集覆盖了机场周转环节的典型环境:包含白天、黄昏、夜间等不同时段的光照变化,以及晴天、阴天等天气条件,模拟了机场地面作业的真实视觉挑战,能够帮助算法更好地应对现实中的干扰因素,提升检测的鲁棒性。在使用该数据集进行学
YOLOv1:开创实时目标检测新时代 YOLOv1提出了一种革命性的目标检测方法,将传统多步骤流程统一为单一回归问题。该模型通过端到端训练,直接从图像像素预测边界框和类别概率,实现了45-155 FPS的实时处理速度。其核心创新包括: 统一架构:24层卷积网络将448x448输入转化为7x7x30预测张量,整合了坐标回归和分类任务 损失函数设计:加权平方误差平衡了定位精度(λcoord=5)与背景
精确率(Precision):预测为正的样本中实际为正的比例召回率(Recall):实际为正的样本中被正确预测为正的比例:各类别AP的平均值,是综合评价指标PrecisionTPTPFPPrecisionTPFPTPRecallTPTPFNRecallTPFNTPmAP1n∑i1nAPimAPn1i1∑nAPi。
运行直接输入 yolo26.exe C:\Users\Administrator\Desktop\yolo26-onnx-cplus\models\yolo26n.onnx 注意onnx路径要是你真实路径我的onnx路径是我桌面上地址。yolo26已经正式发布了,第一时间手搓C++代码实现YOLO26部署,首先看yolov11网络结构,发现输出shape是1x84x8400。可见yolo11和yo
grad = preds - labels # 一阶梯度hess = np.ones_like(preds) # 二阶梯度适用于 Quantile Regression、Focal Loss 等场景。梯度提升树不仅是算法,更是一种认知范式:承认当前模型的不完美,以谦卑之心,一步步修正偏差。复杂问题,可以分解为一系列简单修正;最优解,往往藏在误差的梯度方向里;真正的强大,源于对细节的极致把控。
此类行为不仅容易导致犬只走失、受伤或发生交通事故,更可能因犬只失控而引发邻里纠纷,甚至造成人身伤害,尤其对儿童、老人及怕犬人士构成潜在威胁。尽管多地已出台相关管理条例,明确要求携犬出户时必须使用牵引绳,但由于缺乏高效、常态化的监管手段,违规行为仍难以被实时发现与取证。因此,探索利用计算机视觉技术,特别是基于深度学习的实时目标检测算法,对公共区域中“遛狗未牵绳”行为进行自动识别与预警,成为提升城市宠
它有效地弥补了该领域高质量公共数据的不足,为开发更鲁棒、更智能的无人机视觉感知系统奠定了坚实的数据基础,是相关领域学者和工程师一个非常有价值的资源。该项目由研究者 futureflsl 创建和维护,汇集了多个具有针对性的子数据集,覆盖了目标检测、跟踪、语义分割等多个核心任务。这一视角带来了独特的挑战,如小目标检测、目标外观的剧烈变化等,使其成为开发和评估无人机专用视觉算法的理想测试平台。:该项目明
Java大数据机器学习在遥感图像处理中的应用与改进 本文探讨Java技术栈在遥感图像智能解译中的创新应用,构建了基于OpenCV+Spark+DeepJavaLibrary的轻量化处理架构。研究针对多源遥感数据存在的配准误差(>5像素)、季节变化影响(分类误差率25%)等问题,提出完整技术方案: 多模态预处理:实现云检测、辐射定标和几何校正的全流程自动化处理 分布式特征工程:利用Spark+
【完整源码+数据集】草莓数据集,yolov8草莓成熟度检测数据集 3207 张,草莓成熟度数据集,目标检测草莓识别算法系统实战教程,包含YOLO/VOC格式标注,训练、验证、测试集已划分。数据集中标签包含2种分类:names: ['ripe', 'unripe'],代表成熟草莓、未成熟草莓。检测场景为果园、山庄、大棚、水果加工厂等场景,可用于草莓精准采收指导、种植管理优化、病虫害间
在本文中,您将了解这种类型的 Transformer 模型。你还将学习如何使用 Python、默认 Transformer 模型和 HuggingFace Transformers 库构建自己的对象检测管道。事实上,这将非常简单,所以让我们一起来看看吧!
【数据集】【YOLO】【目标检测】共享单车数据集,共享单车识别数据集 3596 张,YOLO自行车识别算法实战训推教程,包含YOLO/VOC格式标注。数据集中包含1种分类:names: ['bike'],代表共享单车。可用于无人机共享单车识别,监控共享单车检测等。检测场景为人行道、商场、园区、非机动车道等场景,可用于单车违规停放高效治理、用户停车行为引导、城市非机动车道交通决策支撑等。基于y
计算机视觉:python车辆行人检测与跟踪系统 YOLO模型 SORT算法 PyQt5界面 目标检测+目标跟踪 深度学习 计算机✅
本文针对巡检机器人在户外环境下的视觉识别准确率低和误报警问题展开研究。通过分析发现,自然环境变化(季节、天气、光线)和工业场景复杂性(设备位置不确定、故障多样性)是主要挑战。研究提出自动优化的数据采集识别模式,通过时间序列图像对比分析环境变化,结合深度学习进行特征提取和异常判断。在某化工园区的应用验证表明,该模式将气体泄漏识别准确率从60%提升至85%以上,误报率从35%降至10%以下。未来研究可
基于python人脸识别系统 人脸检测 实时检测 深度学习 Dlib库 ResNet深度卷积神经网络 pyqt设计 大数据(源码)✅
YOLO V3目标检测核心技术解析 本文系统讲解了YOLO V3目标检测模型的核心技术要点: 样本分类机制: 采用IoU阈值严格区分正负样本和忽略样本 正样本负责计算坐标、类别和置信度损失 负样本仅产生置信度损失 损失函数设计: 引入惩罚项平衡不同尺寸目标检测 使用Sigmoid替代Softmax实现多标签分类 综合坐标损失、类别损失和置信度损失 性能评价体系: 详细解析精确率、召回率等核心指标
全卷积 + 残差连接:保证特征提取深度与效率;3 尺度特征融合:解决小目标检测痛点;9 种先验框:提升目标定位精度;Logistic 激活:支持多标签检测;速度 - 精度平衡:适配多场景需求。
文章摘要: 本文提出了一种增强型FMCW雷达速度估计方法,解决传统多普勒测速中的模糊问题。方法创新性地结合高精度但模糊的多普勒频率估计与低精度但无模糊的距离变化率估计:首先通过FFT获得模糊速度,再利用多帧距离变化计算粗略速度,最后通过模糊参数优化确定真实速度。实验表明,该方法在保持高精度的同时有效消除了速度模糊,适用于自动驾驶系统中的雷达测速。相比现有技术,该方法无需硬件修改,仅通过信号处理改进
智能监控项目:Python 多目标检测系统 目标检测 目标跟踪(YOLOv8+ByteTrack 监控/交通 源码+文档)✅
DINOv3是Meta推出的新一代通用视觉基础模型,通过自监督学习在17亿张无标注图像上训练70亿参数模型,实现了跨任务的SOTA性能。本文全文精译 DINOv3 技术报告
带 shortcut(残差连接)的 CSP 模块。
YOLOv3是目标检测领域的经典模型,通过Darknet53主干网络实现高效特征提取,并引入残差连接缓解梯度消失。其核心创新在于多尺度检测机制,利用13×13、26×26、52×52三个不同分辨率的特征图分别检测大、中、小物体。通过FPN特征金字塔网络实现特征融合,结合自上而下的上采样和自下而上的卷积路径,将深层语义信息与浅层细节特征相结合,显著提升多尺度目标检测能力。模型采用CBL模块(卷积+批
在智能视觉时代,目标检测已成为深度学习领域最具实用价值的核心技术之一。而以其端到端的高效结构与卓越的实时性能,成为工程落地与学术研究中的明星算法。本专栏从算法原理、模型设计到实验复现与工程部署,系统梳理 YOLO 系列的技术演进与关键创新,让复杂的模型调优和实战部署变得更系统。
训练阶段多,训练耗时:微调CNN网络+训练SVM+训练边框回归器预测速度慢:使用GPU,VGG16模型处理一张图像需要47s占用磁盘空间大:5000张图像产生几百G的特征文件。数据的形状变化:候选区域要经过缩放来固定大小,无法保证目标的不变形。
目标检测(Object Detection)的任务是找出图像中所有感兴趣的目标,并确定它们的(分类任务)和(回归任务)目标检测中能检测出来的物体取决于当前任务(数据集)需要检测的物体有哪些目标检测的位置信息一般有两种格式(以图片左上角为原点(0,0)):xmin, ymin, xmax, ymax分别代表x, y坐标的最小值,最大值(左上角坐标<右下角坐标)图像坐标系原点在左上角,把图像看作nda
在计算机视觉领域,目标检测一直是最具挑战性的任务之一。如何在保证检测精度的同时实现实时推理,是工业界和学术界共同关注的核心问题。美团团队推出的YOLOv6在这一平衡点上取得了重大突破,不仅在COCO数据集上刷新了最先进的精度记录,更在推理速度上实现了显著提升,为实时应用场景提供了强有力的技术支撑。
这个博客用来同步我们的一个开源工程,在 Jeston 设备上实现了 CUDA、TensorRT 的加速推理,利用 Yolo11 模型以及 Realsense D435i 运行了示例,其中的主要难点是编译模型虚拟环境。
总结 ICCV2025 对抗样本&智能安全方向相关论文及代码库链接,附有文章摘要。
训练完成后,最佳权重保存路径为:runs/detect/train/weights/best.pt,如果多次运行命令runs/detect/train2,runs/detect/train3文件夹生成只需要到数字最大文件夹查看就可以找到模型。经过上面训练可以使用模型做一步部署,比如使用onnx模型在嵌入式部署,使用engine模型在jetson上deepstream部署,使用torchscript
本文介绍了YOLOv8实战项目中异构数据集融合的关键技术。主要内容包括:1) 分析VOC与YOLO两种数据格式的核心差异,重点解析了VOC的XML标注结构和YOLO的归一化坐标特点;2) 提出多源数据集整合方案,通过自动化脚本解决类别ID映射冲突问题;3) 详细说明从VOC到YOLO格式的转换流程,包括坐标归一化处理和数据结构重组。该方案能有效提升模型在复杂场景下的泛化能力,为智能零售等实际应用提
[YOLO](You Only Look Once)是一种流行的物体检测和图像分割模型,由华盛顿大学的约瑟夫-雷德蒙(Joseph Redmon)和阿里-法哈迪(AliFarhadi)开发,YOLO 于 2015 年推出,因其高速度和高精确度而迅速受到欢迎。
《YOLO9000: Better, Faster, Stronger》是由Joseph Redmon和Ali Farhadi于2016年提出的先进实时物体检测系统。该系统在YOLO(You Only Look Once)的基础上进行了多项改进,包括批归一化、高分辨率分类器、锚框机制、维度聚类、直接位置预测和多尺度训练等,显著提升了检测精度和速度。
Swin Transformer是一种新型的视觉Transformer架构,旨在解决将Transformer从语言领域迁移到视觉领域时面临的挑战,如视觉实体尺度的变化性和图像像素的高分辨率特性。该架构采用基于移位窗口的分层设计,通过将自注意力计算限制在非重叠局部窗口内来提高效率,同时保留跨窗口连接能力。这种设计使得Swin Transformer在图像分类和密集预测任务中表现出色,超越了此前的最佳
YOLO v2通过一系列精心设计的改进,在保持YOLO系列高速特性的同时,显著提升了检测精度。其引入的锚框机制、维度聚类、多尺度训练等技术对后续的目标检测算法发展产生了深远影响。虽然现在已经有了更新的YOLO版本,但YOLO v2中的许多创新思想仍然值得学习和借鉴。