Сбор и разметка датасета изображений товаров
Любая выпускная квалификационная работа в области компьютерного зрения начинается с качественного датасета. Для задачи классификации складских товаров необходимо собрать репрезентативную выборку, включающую не менее 10–15 тысяч изображений на каждую категорию. Мы рекомендуем использовать комбинированный подход: снимки с реальной конвейерной линии, фотографии со складских стеллажей и синтетические рендеры, сгенерированные в Blender или Unity. Это позволит модели обобщать признаки и избежать переобучения. Разметка выполняется в формате COCO или Pascal VOC с обязательной верификацией каждым вторым аннотатором. Наш опыт показывает, что даже небольшое количество шума в разметке снижает accuracy модели на 8–12%, поэтому этапу контроля качества стоит уделить особое внимание. Для автоматизации разметки можно использовать предобученные детекторы (YOLOv8, Detectron2), но финальная вычистка всегда выполняется вручную.
Обучение модели для распознавания категорий товаров
На этапе обучения ключевой задачей становится выбор архитектуры нейросети. Для классификации товаров на складе оптимальны свёрточные сети семейства ResNet (ResNet-50, ResNet-101) и EfficientNet. Мы обучили более 20 моделей для различных складских конфигураций и установили, что использование предобученных весов ImageNet сокращает время обучения в 3–4 раза при сопоставимой точности. Гиперпараметры подбираются через Optuna: learning rate 1e-4, batch size 32, оптимизатор AdamW. Обязательно включаем аугментацию – случайное вращение, изменение яркости, сдвиг, чтобы модель не запоминала шумы датчика. Метрики качества – F1-score и confusion matrix. Для ВКР важно не только получить high accuracy, но и объяснить выбор функции потерь: кросс-энтропия с весами классов помогает сбалансировать редкие категории (например, хрупкий товар). После фиксации модели проводим тестирование на отложенной выборке (20% датасета). Если вы планируете за
Нужна помощь с написанием статьи?























