semantic-segmentation
本站收录 30 个带「semantic-segmentation」标签的 AI 开源项目
ultralyticsUltralytics 是计算机视觉领域最流行的开源工具包,提供 YOLO 系列目标检测模型(包括 YOLOv8、YOLO11 及最新的 YOLO26)的一站式★ 62,103
label-studio支持多类型数据标注的开源工具,覆盖图像、文本、音频、视频等多种数据格式,输出格式标准化,方便直接对接模型训练流程。提供灵活的标注界面、协作审核机制与丰富的集成能★ 28,371
cvatCVAT(Computer Vision Annotation Tool)是一个开源的计算机视觉标注平台,旨在帮助AI团队高效构建高质量视觉数据集。它解决了从原★ 16,821
labelmelabelme 是一个基于 Python 的图像标注工具,主要用于计算机视觉和深度学习任务中的数据准备。它解决了研究人员和开发者需要手动标注图像以构建训练数据集★ 16,201
segmentation_models.pytorchsegmentation_models.pytorch 是一个基于 PyTorch 的语义分割模型库,提供 500+ 预训练骨干网络(涵盖卷积和 Transfo★ 11,749
InternVLInternVL 是一个开源的多模态对话模型家族,旨在成为 GPT-4o 的开源替代方案,在 CVPR 2024 上获得 Oral 论文。它解决了开源社区缺乏高★ 10,169
Open3D-MLOpen3D-ML 是 Open3D 的扩展库,专注于 3D 机器学习任务,如点云语义分割、物体检测和实例分割。它提供统一的数据集加载接口(支持 Semanti★ 2,351
MambaVisionMambaVision是CVPR 2025官方发布的PyTorch实现,提出了一种混合Mamba-Transformer视觉骨干网络。它针对视觉任务中Mamba★ 2,235
CoreML-ModelsCoreML-Models 是一个将多种主流深度学习模型转换为 Apple Core ML 格式的模型仓库(Model Zoo)。它解决了 iOS/macOS ★ 1,878
lightly-trainlightly-train 是一个面向视觉模型的一体化训练框架,支持 YOLO、ViT、RT-DETR、DINOv3 等主流架构,覆盖预训练、微调和蒸馏全流程。★ 1,692
torchdistilltorchdistill 是一个基于 PyTorch 的免编码深度学习框架,专注于知识蒸馏(Knowledge Distillation)研究。它解决了知识蒸馏★ 1,633
nncfNNCF(Neural Network Compression Framework)是 Intel 开源的神经网络压缩框架,专为提升 OpenVINO 推理性能★ 1,204
FasterViTFasterViT 是一个面向视觉任务的高效 Transformer 模型,由 NVIDIA 研究人员开发,相关论文发表于 ICLR 2024。它旨在解决传统 ★ 925
pazpaz 是一个 Python 分层感知库,目标是让开发者用统一接口完成多种计算机视觉任务,包括姿态估计、目标检测、实例分割、关键点估计、人脸识别、表情识别和语义★ 711
ICASSP-2023-24-Papers这是一个汇集ICASSP 2023和2024会议论文的仓库,旨在为声学、语音和信号处理领域的研究者提供一站式的论文集合。项目解决了学术会议论文分散、难以系统追踪★ 525
yolo-ios-appyolo-ios-app 是 Ultralytics 官方推出的 iOS 应用与 Swift Package,把 YOLO 系列模型通过 Core ML 部署到★ 516
Remote-Sensing-RVSARemote-Sensing-RVSA 是遥感领域的基础模型开源项目,对应 TGRS'22 论文《Advancing Plain Vision Transfor★ 469
AgMLAgML 是一个面向农业机器学习的集中式框架,旨在解决农业领域深度学习研究中数据分散、基准不统一、模型复用难的问题。它聚合了多个公开农业数据集,覆盖图像分类、目★ 344
MTPMTP 是 JSTARS'24 论文的官方实现,提出了一种面向遥感基础模型的多任务预训练方法。它通过同时学习多个遥感任务(如场景分类、语义分割、目标检测等)来训★ 253
BiaPyBiaPy 是一个开源的 Python 库,旨在简化生物图像分析流程的构建。它基于深度学习,提供从数据预处理、模型训练到结果可视化的端到端解决方案。核心能力包括★ 212
HugsVisionHugsVision 是一个基于 Hugging Face 生态的计算机视觉工具包装库,旨在让开发者用极简的代码调用最新的视觉模型。它解决了传统视觉任务中模型集★ 199
OccAnyOccAny 是一个面向城市级 3D 占用预测的统一框架,旨在解决传统模型在多样化和非受限城市场景中泛化能力不足的问题。它通过整合 SAM2/SAM3、MUSt★ 164
paper-listpaper-list 是一个自动更新的论文列表项目,专注于图像生成领域,同时覆盖动作识别、异常检测、音频处理、分类、深度估计、图神经网络等多个方向。它通过自动化★ 161
RGBT-Perception-PapersRGBT-Perception-Papers 是一个面向 RGB-T(可见光-热红外)多模态感知领域的论文与资源汇总仓库,主要覆盖 RGB-T 显著目标检测、语★ 161
RSPRSP是《An Empirical Study of Remote Sensing Pretraining》论文的官方代码库,专注于遥感图像预训练模型的实证研究★ 159
TagLabTagLab 是一个基于 CNN 的交互式图像分割标注工具,专为海洋数据分析而设计,尤其针对珊瑚礁生态研究。它解决了海洋科学家在标注大量水下图像时效率低、缺乏专★ 124
semantic-segmentation-ml-pipeline这是一个基于TensorFlow Extended (TFX)和Google Cloud Platform (GCP)产品的语义分割机器学习流水线项目。它旨在解★ 96
CLOUDSCLOUDS 是 CVPR 2024 收录的官方实现,针对域泛化语义分割任务,提出协作基础模型框架。它解决单一基础模型在未知域(如不同城市、天气、光照)下分割性★ 77
ovamovam 是 CVPR 2024 论文的开源实现,旨在解决扩散模型在语义分割任务中应用时注意力图不准确的问题。它通过优化文本 token 来生成开放词汇的注意力★ 70
dji-tello-object-detection-segmentation这是一个面向 DJI Tello 无人机的现代实例分割项目,基于 YOLOv8 和 Detectron2 实现实时目标检测与分割。它解决了 Tello 无人机在★ 69