mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7mobile wallpaper 8mobile wallpaper 9mobile wallpaper 10
6220 字
17 分钟
NS-2026-05 声场巡检员:校园声景事件检测 — Writeup
2026-06-24
📋 题目描述

题目描述#

NS-2026-05 声场巡检员:校园声景事件检测#

赛题任务#

本题编号为 NS-2026-05

任务介绍#

夜间巡检机器人在校园里移动时,会持续记录 6 秒一段的环境短音频。它可能经过教室、走廊、图书馆、食堂、实验室、校道或活动现场;一段音频中可能只有环境底噪,也可能同时出现脚步、键盘、门锁、雨声、车辆或警报等多个事件。

你是一名校园声场巡检员,需要把这些短音频转换成可复核的事件标签,帮助后续系统判断环境状态、异常风险和活动类型。

本题定位为 阈值满分音频多标签事件检测题。自动评分同时给出连续分数,并设置公开的 gold-band 质量线:达到该质量线的优秀方案记为满分,不要求逐样本完全恢复唯一标签集合。

常见标签包括:

  • footsteps:脚步声。
  • keyboard:键盘敲击。
  • door:开门、关门或门锁声。
  • alarm:警报、提示蜂鸣或紧急提醒。
  • vehicle:车辆、电动车或自行车经过。
  • rain:雨声。
  • applause:掌声。
  • glass_break:玻璃破碎声。
  • ambient:无明显目标事件的环境底噪。

你的任务是:

  • 对每个测试音频输出一个或多个事件标签。
  • 在背景噪声、事件重叠、不同设备和弱事件下保持稳定。
  • 通过本地验证选择逐类阈值,避免只预测常见标签。
  • 在稀有或高优先级事件上保持足够召回。

高分来自音频预处理、时频特征、开源音频模型迁移、多标签阈值校准、事件重叠建模和稀有事件召回。

为避免题目退化为闭源 API / 商业 Agent 调用比赛,本题要求最终方案基于本地可运行、可复现的开源音频处理库、开源预训练模型、传统机器学习算法或规则后处理流程实现。

最终提交不得由闭源 API、商业 Agent、远程托管音频理解/多模态服务、音乐识别/音频指纹服务或人工标注平台生成。选手可以完全使用公开预提取特征、传统机器学习、阈值校准和规则后处理完成,也可以使用开源本地音频预训练模型或公开外部训练数据辅助建模。获奖候选队伍必须提交可复现证据,证明最终标签由符合规则的本地流程产生。

赛题背景#

真实校园巡检、安防和无障碍应用中,短音频事件检测可以辅助发现设备异常、环境风险和活动状态。本题不依赖闭源语音识别或文本识别,重点考察可复现的开源音频建模方法,以及在有限算力下完成多标签分类的工程能力。

参赛目标是训练出达到优秀质量线的本地可复现音频事件检测流程。高分方案应能说明训练/验证划分、特征或模型选择、逐类阈值、隐藏高难样本泛化、后处理策略和失败案例,并能清楚披露外部数据与 AI 工具使用边界。

赛题数据#

在本页下方“相关资源”处下载数据包,或在 https://modelscope.cn/datasets/SteamedFresh/NS-2026-AA-data 处获取

NS-2026-05/
├── train.csv
├── test.csv
├── label_map.json
├── audio/
│ ├── train/
│ └── test/
├── features/
│ ├── train_audio_features.csv
│ └── test_audio_features.csv
├── example_submission/
│ └── results.csv
└── tools/
├── check_format.py
└── make_features.py

字段说明#

train.csv 字段:

字段类型含义
idstring音频样本 ID
audiostring音频相对路径
duration_secfloat音频长度
sitestring场景,如 librarycanteen
devicestring录制或合成设备代号
labelsstring`

test.csv 字段与 train.csv 基本一致,但不包含 labels

label_map.json 包含标签英文名、中文说明、是否为稀有或高优先级事件。features/* 提供官方预提取的轻量频谱/时域特征。

数据规模#

文件或目录规模
train.csv720 段训练音频
test.csv243 段测试音频
audio/train/720 个 WAV 文件
audio/test/243 个 WAV 文件
features/train_audio_features.csv720 行公开预提取特征
features/test_audio_features.csv243 行公开预提取特征
标签数9 类

本版本每段音频均为 6 秒、16 kHz、mono、16-bit PCM WAV。

使用说明#

参赛选手需要:

  1. 使用 train.csvaudio/train/ 和可选 features/train_audio_features.csv 训练或校准多标签分类模型。
  2. test.csv 中列出的 audio/test/ 音频生成标签集合。
  3. evaluation.md 要求生成 results.csv 并压缩提交。

如需验证集,建议按素材族、场景、设备或时间扰动进行分组划分,避免相似混合方式同时出现在训练和验证中导致估计过高。公开 features/ 只提供轻量统计特征,选手可以自行提取 log-mel、MFCC、OpenL3、PANNs、YAMNet、AST 等符合规则的开源音频特征或 embedding。

注意事项#

  • 测试音频不提供标签。
  • ambient 表示无明显目标事件,不能与其它标签同时提交。
  • 若使用 ESC-50、AudioSet、FSD50K、UrbanSound8K、FreeSound 等外部音频数据或预训练权重,必须在 Writeup 中披露来源、许可证、用途和测试重合风险控制。

评测说明#

提交说明#

提交文件必须压缩为 NS-2026-05-answer.zip,压缩包内只包含 results.csv

不要在压缩包中包含文件夹、模型、权重、日志或其他文件。自动评分只读取 results.csv

提交格式#

id,labels
test_0001,keyboard|door
test_0002,rain

格式要求:

  • 必须包含且仅包含表头 id,labels
  • 每个测试样本必须出现一次,不能缺失或重复。
  • labels 使用 | 分隔,只能包含 label_map.json 中定义的标签。
  • 无明显事件时提交 ambient;空标签按格式错误处理。
  • ambient 不能与其它标签同时提交。

得分计算#

总分 1200:

项目分值
宏平均 F1400
样本级 F1250
稀有/高优先级事件召回250
隐藏高难样本样本级 F1200
格式合法性100

宏平均 F1 鼓励各类别均衡表现;样本级 F1 衡量每段音频的多标签集合预测质量;稀有/高优先级事件召回聚焦 alarmdoorglass_breakvehicle 等容易被忽略但业务重要的事件。隐藏高难样本样本级 F1 只在隐藏评分中计算,覆盖多标签样本和含稀有事件样本,用于约束模型在更困难场景下的泛化能力。

评分采用“连续得分 + gold-band 阈值满分”口径:

raw_score = 100 + 400 * macro_f1 + 250 * sample_f1 + 250 * rare_recall + 200 * hard_sample_f1
if macro_f1 >= 0.72 and sample_f1 >= 0.74 and rare_recall >= 0.84 and hard_sample_f1 >= 0.72:
score = 1200
else:
score = raw_score

最终分数范围为 0 到 1200。

Gold-Band 满分说明#

达到 gold-band 的优秀建模方案直接记为满分,不要求逐样本完全恢复隐藏评分标签。

gold-band 阈值含义:

  • macro_f1 >= 0.72:多数类别都达到稳定识别质量,不能只依赖常见标签。
  • sample_f1 >= 0.74:单段音频的多标签集合预测整体可靠。
  • rare_recall >= 0.84:对 alarmdoorglass_breakvehicle 等高优先级事件有足够召回。
  • hard_sample_f1 >= 0.72:在隐藏高难样本上仍能稳定处理多标签和稀有事件样本。

该阈值用于表示 Challenging 音频多标签任务中的优秀质量线,而不是要求选手恢复每段隐藏音频的唯一标准标签集合。

无效提交情况#

以下情况将得到 0 分:

  • CSV 无法解析。
  • 表头不是 id,labels,或包含额外列。
  • 测试样本 ID 缺失、重复或出现测试集之外 ID。
  • labels 为空、含未知标签、含重复标签,或把 ambient 与其它标签混用。
  • 压缩包内缺少 results.csv 或包含文件夹/额外文件。

本地检查#

提交前建议运行:

python tools/check_format.py results.csv --test-csv test.csv --label-map label_map.json

该脚本只检查格式和 ID 覆盖,不会给出隐藏测试分数。

条款#

数据使用与外部资源#

允许使用公开开源音频处理库、机器学习库、开源音频预训练模型、公开论文、教程和公开外部训练数据。若使用 ESC-50、AudioSet、FSD50K、UrbanSound8K、FreeSound 等外部音频数据或预训练权重,必须在 Writeup 中披露数据集名称、来源 URL、许可证、下载时间、用途、去重方式和测试重合风险排查结论。

AI 协助规则#

本题 AI 协助等级为 A1-Open,即“开源可复现音频建模”。本题允许使用 AI 工具学习概念、辅助写代码和分析报错,但最终测试集标签必须由本地可运行、可复现的开源音频建模、传统机器学习或规则流程生成。

本题不允许使用闭源 API、商业 Agent、远程托管音频理解/多模态模型、音乐识别/音频指纹服务或人工标注平台生成最终标签。

Writeup 补充要求#

Writeup 必须包含方法概述、任务理解、关键改进、验证与复现、AI 使用声明、证据截图和代码包说明。A1-Open 规则下,如果 AI 接触测试输入并生成最终标签,或 Agent 托管实验并生成提交,原则上视为违反等级规则。

本题还必须说明音频预处理、特征提取、模型训练、阈值选择和后处理 pipeline。必须提供训练/验证划分方式,并说明是否按素材族、场景或设备分组以避免同源泄漏。

必须展示每类 Precision/Recall/F1、至少 5 个失败案例的波形或频谱图、格式校验截图、训练/推理日志。若使用开源预训练模型,必须说明模型名称、参数规模、权重来源、许可证、硬件和推理耗时。若使用外部音频数据,必须说明是否只用于训练、是否与测试来源存在重合风险,以及如何做去重或分组验证。

Writeup需包含最终提交压缩包文件 SHA256,指平台上传的 NS-2026-05-answer.zip 的 SHA256。

1. 基本信息#

  • 队长用户名:Ayin

  • 队伍名:L.Corp

  • 题号:NS-2026-05

  • 最终官网提交记录

    • 提交时间:2026-05-23 20:07:02
    • 最终有效得分:1200分

    平台提交记录


2. 解题概述#

这道题要对校园环境里的 6 秒短音频做多标签事件检测,一共 9 个类别,其中 alarmdoorvehicleglass_break 是比较少见的类别,需要保证足够高的召回率。评分上有一条 gold-band 满分线,要求 macro_f1 ≥ 0.72、sample_f1 ≥ 0.74、rare_recall ≥ 0.84、hard_sample_f1 ≥ 0.72。

最终方案的核心是用 PANNs(Cnn14)预训练模型提取 2048 维音频 Embedding,再拼上官方给的 36 维时频统计特征,然后用两阶段 LightGBM(独立分类器 + 分类器链)来训练,最后通过自适应融合、逐类阈值校准和一些后处理规则得出最终标签。

最终结果是 1200/1200 满分,各项指标都过线了:macro_f1 = 0.752、sample_f1 = 0.774、rare_recall = 0.841、hard_sample_f1 = 0.742。


3. 关键改进与实验依据#

整个过程迭代了三个版本,每个版本都有平台评测分数记录,下面按顺序说明。

V1 → 基线方案#

得分:925.95

  • PANNs Cnn14 + LightGBM 多标签分类:用 PANNs 的 Cnn14(AudioSet 预训练,2048 维 Embedding)提特征,每个类别单独训 1 个 LightGBM 二分类器。交叉验证用 5 折 GroupKFold,按场景(site)分组,避免同一场景 of 音频同时出现在训练集和验证集里。
  • 稀有类阈值优化:对 alarmdoorglass_breakvehicle 这四类,在 OOF 预测上以召回率为主来搜阈值,同时设了精确率下限(≥ 0.25)防止乱预测。普通类以 F1 为目标。rare_recall 达到了 0.884,但 macro_f1 只有 0.720,还差一点。

V2 → 分类器链#

得分:930.74

  • 分类器链(Classifier Chain)建模标签关联:把 9 个类别按从高频到低频排好(ambient→rain→vehicle→footsteps→keyboard→door→alarm→applause→glass_break),依次训练,把前面类别的 OOF 预测概率拼进当前类别的输入里,让模型能利用标签之间的共现关系。macro_f1 升到 0.756,sample_f1 升到 0.778。
  • 动态重叠后处理:加了一些规则,比如”下雨时脚步声概率偏低就删掉”、“有车经过时脚步声概率偏低就删掉”,减少混合场景里的误报。

Final → 满分方案#

得分:1200

  1. 拼接官方微观特征(2048 + 36 维):把 PANNs 的 2048 维全局 Embedding 和官方提供的 36 维时频统计特征(features/train_audio_features.csv)拼在一起,变成 2084 维。
  2. 两阶段训练:Focal Loss 独立分类器 + 分类器链:第一阶段对每个类别单独训,稀有类用自定义 Focal Loss(alpha=0.35,gamma=2.5)加重对漏报的惩罚;第二阶段训分类器链。两个阶段用同一套 5 折分组索引,保证 OOF 预测对齐。
  3. 自适应概率融合:稀有类取两个阶段预测概率的最大值(防漏报),普通类取加权平均(0.3 × 独立 + 0.7 × 链式),在精度和召回之间找平衡。
  4. 稀有类阈值强制封顶 + 双重打捞:稀有类用 F3-score(大幅偏向召回率)搜最优阈值,并强制阈值不超过 0.16;后处理阶段,只要独立分类器(带 Focal Loss)对稀有类的预测概率 ≥ 0.40,就算融合后的概率没过阈值,也强制把这个标签加进去。这两条规则把 rare_recall 稳定在了 0.841,刚好超过满分线的 0.84。 实质是只是将前面两个版本的两坨经过优化互取所长,融成一坨大的拿了gold band,实际工程还是设计更好的模型和方案更好

4. 声学事件检测 Pipeline 技术细节#

(1) 音频预处理#

所有输入音频均统一重采样至 32,000 Hz 并转换为单声道。为了适配 PANNs 的固定长度要求,对于不足 6.0 秒的音频以全零(Zero-padding)方式在尾部进行补齐,对于超过 6.0 秒的音频则强制从头部裁剪至前 6.0 秒,确保每条音频在时域上均具有严格对齐的 192,000 个采样点

(2) 特征提取 pipeline#

  • 全局语义特征:使用预训练的开源音频理解大模型 PANNs 的 Cnn14 模型,以非侵入方式在前向传播的倒数第二层进行全局平均池化(Global Average Pooling),提取出表达声场全局高层语义的 2048 维全局 Embedding
  • 微观时频特征:提取官方特征文件(包含 36 维时频域统计指标,涵盖频段能量分布、时频域包络与突变突发能量变化),用于补充大模型对瞬态短时声学突变(如玻璃碎裂、关门瞬间等)捕获能力不足的缺陷。
  • 无损特征融合:对上述全局与微观特征按音频 id 严格对齐并拼接,构成最终的 2084 维综合特征向量 送入 LightGBM。

(3) 模型训练与集成#

  • 第一阶段(独立二分类):针对 9 类声学事件,为每个类别训练独立的 LightGBM 二分类器。
    • 对于稀有类(alarmdoorvehicleglass_break),为应对高度类别不平衡,应用了自定义 Focal Loss 目标函数α=0.35,γ=2.5\alpha = 0.35, \gamma = 2.5),并对困难漏报样本(真实为 1 且预测低于 0.3 的样本)施加 2.5 倍强对抗梯度惩罚。
    • 对于普通类,使用标准的平衡交叉熵损失函数。
  • 第二阶段(分类器链 Classifier Chain):解构类别共现关系。按照 ambient \rightarrow rain \rightarrow applause \rightarrow footsteps \rightarrow keyboard \rightarrow vehicle \rightarrow door \rightarrow alarm \rightarrow glass_break 的频次链条进行递进式建模,每次训练将前序分类器输出的验证集/测试集预测概率作为新的特征拼入输入特征,增强多标签联合分布泛化。

(4) 阈值选择策略#

在五折交叉验证的自适应融合预测上执行网格寻优:

  • 普通类:常规优化传统的 F1-scoreF_1\text{-score},旨在平衡精确率与召回率。
  • 稀有类:极限优化强烈偏向召回率的 F3-scoreF_3\text{-score},为了尽可能降低漏报率,我们将精确率下限条件放宽到极低的 0.08,并且对稀有类实施了 0.16 的低阀值强制封顶策略,拉低越线卡口以网罗一切微弱的瞬发信号。

(5) 后处理机制 (Post-processing)#

  • 双重雷达打捞:对于稀有类,除了融合后的概率需要和阈值进行比较,我们额外设定了一条强推线。只要在第一阶段经过 Focal Loss 强化的独立分类器预测某稀有类概率值 0.40\ge 0.40,即被强行标为正类,以防止由于分类器链均值消解带来的漏报。
  • 冲突精修与去噪:若在测试时触发了任何其他实质性事件标签(如 rainapplause 等),则自动剪除 ambient(底噪)标签;若在下雨场景(rain)下识别出低置信度的脚步声(概率小于 0.52),则认为脚步声是被雨声掩盖下的误报,予以剔除。
  • 空签兜底:若在后处理之后所有类别均为负,则强制选择融合概率值最大的一项为最终标签,避免产生空签。

5. 验证集评估指标 (OOF)#

本团队在 5 折场景交叉验证中获得的各类别在 Out-Of-Fold (OOF) 验证集上的精确率 (Precision)、召回率 (Recall) 和 F1-ScoreF_1\text{-Score} 指标如下:

类别PrecisionRecallF1-Score
alarm0.80830.97980.8858
ambient0.80000.75000.7742
applause0.90910.90000.9045
door0.59060.88000.7068
footsteps0.79170.70370.7451
glass_break0.60000.95050.7356
keyboard0.72000.52940.6102
rain0.93880.82880.8804
vehicle0.52000.87500.6523
  • 评估说明:上述表格客观展示了模型对于不同类别的识别特点。通过定制化的 Focal Loss 和 F3 优化策略,稀有类(如 alarm, glass_break, door)的召回率(Recall)达到了极高的水平(0.85~0.98),但由于我们极大程度放宽了精确度限制以保召回,因而其 Precision 相对偏低,符合 gold-band 满分线要求的宏召回指标侧重。

6. 失败案例分析 (Error Analysis)#

本团队通过对 5 折交叉验证 OOF 结果中与真实标签产生不一致的样本进行了深层的声学物理特性排查,筛选出以下 5 个最具代表性的失败案例。其对应的波形图及梅尔频谱图如下:

(1) 案例 1 (ID: ns05_tr_d64e16d97265) — 稀有类 alarm 漏报#

  • 真实标签alarm | 预测标签keyboard
  • 声学特征成因:这应该是一个闹钟声。其物理声波表现为高频刺耳的周期性泛音震荡。然而,在此段音频中,警报器安装于声场边缘,信号源发生了严重的几何衰减和空间吸音,导致大模型的全局 Embedding 没有捕捉到特征性的高频共振峰,因此模型将微弱的警报声误判为背景键盘音。
  • 波形与频谱图fail_1

(2) 案例 2 (ID: ns05_tr_2628eb6fad66) — 稀有类 glass_break 漏报#

  • 真实标签vehicle | glass_break | 预测标签footsteps | vehicle
  • 分析:嘎达的声音我自己也听不出来是啥,官方标注是glass_break,我感觉也不是很准
  • 波形与频谱图fail_2

(3) 案例 3 (ID: ns05_tr_0c6579649abe) — 稀有类 vehicle 漏报#

  • 真实标签alarm | vehicle | 预测标签alarm | glass_break
  • 波形与频谱图fail_3

(4) 案例 4 (ID: ns05_tr_680b2f8441b6) — 稀有类 door 漏报#

  • 真实标签door | alarm | 预测标签alarm
  • 声学特征成因:关门声(door)是一种典型且极短促的木质阻尼冲击波,能量主要富集于中低频(100Hz-300Hz)。在本段音频中,背景中存在着刺耳的高强警报泛音(alarm),对耳膜和接收传感器的动态范围产生占优压制,导致这部分中低频敲击信号完全淹没,独立分类器和分类器链对其置信度均未过线。
  • 波形与频谱图fail_4

(5) 案例 5 (ID: ns05_tr_f678b027463b) — 多标签事件混淆/误判#

  • 真实标签alarm | 预测标签alarm | door | vehicle
  • 波形与频谱图fail_5

7. 验证与复现#

运行环境#

项目信息
操作系统Windows 11
Python 版本3.12.11
PyTorch 版本2.7.1+cu128
LightGBM 版本4.6.0
librosa 版本0.11.0
scikit-learn 版本1.7.0
CPUAMD Ryzen 7 9800X3D 8-Core Processor
GPUNVIDIA GeForce RTX 5090 (32 GB 显存)
内存约 48 GB
CUDA 版本13.2

硬件环境截图#

GPU 环境(nvidia-smi)

CPU 信息

Python 环境依赖版本

预训练模型与性能说明#

  • 开源模型名称:PANNs Cnn14
  • 参数规模:约 80.8 M (80,780,104)
  • 权重文件名称Cnn14_mAP=0.431.pth (文件大小 ~312 MB)
  • 开源许可证:MIT License
  • 官方项目地址GitHub - qiuqiangkong/audioset_tagging_cnn
  • 推理延迟与吞吐:在 NVIDIA RTX 5090 GPU 上,对于 243 条测试集 6.0 秒音频提取其全局 Embedding 特征,总共耗时约 0.90 秒,即单样本平均推理耗时约为 3.7 毫秒,极具工业巡检落地的高并发实时推理性能。

复现步骤#

# 1. 安装依赖(建议在独立 conda 环境里跑)
pip install torch==2.7.1 lightgbm==4.6.0 librosa==0.11.0 scikit-learn==1.7.0 panns-inference numpy pandas tqdm pillow
# 2. 下载 PANNs Cnn14 权重,放到指定路径,修改 main.py 里的 checkpoint_path
# 3. 准备数据,把 train.csv、test.csv、audio/、features/ 按赛题目录结构放好
# 4. 跑主程序,会自动完成特征提取、训练、阈值优化和预测输出
python src/main.py

训练/验证划分方式#

GroupKFold(n_splits=5),以 site(场景)字段分组,保证同场景的音频不会同时出现在训练集和验证集里,避免同源数据泄漏导致验证指标虚高。

随机种子与关键超参数#

参数
GroupKFold 折数5
随机种子(独立分类器)42 + fold_id
随机种子(分类器链)2026 + fold_id
稀有类 Focal Loss alpha0.35
稀有类 Focal Loss gamma2.5
稀有类阈值上限(强制封顶)0.16
独立分类器稀有类强推线0.40
稀有类 Precision 下限0.08

预计运行时间与资源消耗#

  • 特征提取:训练集 720 条 + 测试集 243 条音频各跑一遍,用 GPU,大概 3–4 分钟。
  • 模型训练(两阶段 × 5 折 × 9 类):大概 3–5 分钟。
  • 总共:10–15 分钟。
  • GPU 显存:PANNs 推理阶段大约占 1–2 GB。

8. AI 使用声明#

全局说明#

  • 本队使用的 AI 工具:Gemini、Claude
  • 主要用途:资料查询 / 代码辅助

逐题声明#

NS-2026-05#

  • 官方等级:A1-Open
  • 实际使用:资料查询 / 代码辅助
  • AI 是否接触完整题面:是
  • AI 是否接触测试输入:否
  • AI 是否接触提交反馈或排行榜反馈:否
  • AI 是否生成或修改最终提交:否
  • 是否使用商业 API、闭源远程模型或托管式 Agent:是
  • 详细说明:使用了 Gemini 和 Claude 两个闭源远程模型,主要用于资料查询和代码辅助,还有相关开源模型推荐和音频处理方式,以及一些把两坨模型取长融合的方案

Writeup 写作辅助声明#

  • 是否使用 AI 辅助撰写或润色:是
  • 使用工具:Gemini
  • 使用范围:语言润色 / Markdown 排版 / 根据本队实验记录整理段落
  • AI 接触材料:代码片段 / Writeup 要求
  • AI 是否生成新的实验结果、验证分数或复现命令:否
  • 人工核对方式:队伍成员核对事实、代码、日志、分数和复现命令

9. 最终提交与 SHA256#

  • 平台提交文件名称:NS-2026-05-answer.zip
  • 平台提交时间:2026-05-23 20:07:02
  • 最终有效得分:1200/1200
  • 答案 ZIP SHA25690a55d72fda3afe55f8a8f86279e069850410bb96335ac0e7583422b54f21a4f
  • 内部关键文件 SHA256
    • results.csv:2bbd2d62a48e25cab8898f78334cb331fa20987bbbd095c6b3b85367556b4836

SHA256 计算截图


10. 证据截图#

训练与推理关键日志#

训练与推理过程日志

格式校验截图

11. 代码包结构#

Ayin-NS-05/
├── README.md # 本文件,含题目概述和复现说明
├── src/
│ ├── main.py # 完整复现脚本(特征提取→训练→推理→生成结果)
│ └── requirements.txt # 依赖声明
├── configs/
│ └── README.md # 说明本题无独立配置文件,参数在 main.py 中
├── models/
│ └── README.md # PANNs Cnn14 权重来源、许可证、下载方式及 SHA256
├── evidence/
│ ├── submission.png # 平台提交记录截图
│ ├── nvidia-smi.png # GPU 环境截图
│ ├── cpu.png # CPU 信息截图
│ ├── env_py.png # Python 环境截图
│ ├── log.png # 训练推理日志截图
│ ├── sha256.png # SHA256 截图
│ ├── check_format.png # 格式校验截图
│ ├── fail_1.png # 典型失败案例 1 波形与梅尔频谱图
│ ├── fail_2.png # 典型失败案例 2 波形与梅尔频谱图
│ ├── fail_3.png # 典型失败案例 3 波形与梅尔频谱图
│ ├── fail_4.png # 典型失败案例 4 波形与梅尔频谱图
│ └── fail_5.png # 典型失败案例 5 波形与梅尔频谱图
└── submission
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

NS-2026-05 声场巡检员:校园声景事件检测 — Writeup
https://www.hokma.top/posts/ns-2026-05/
作者
Ayin
发布于
2026-06-24
许可协议
Unlicensed

部分信息可能已经过时

目录