Skip to content

Latest commit

 

History

History
112 lines (96 loc) · 5.9 KB

File metadata and controls

112 lines (96 loc) · 5.9 KB

一、竞赛目标与评测思路

  • 核心目标
    • 面向真实工业场景,从有限历史数据中学习“观测-动作-奖励”闭环策略,在离线环境严格验证有效性与安全性,筛选能在有限线上测试中仍保持稳健的方案。
  • 为什么强调离线验证
    • 工业系统不可直接上线未经验证模型;在线评测存在公平性与安全性风险。流程参考真实生产:先离线严控验证,再进行次数有限的线上测试,偏离预期会被立即终止。
  • 工业贴合性
    • 数据已按“观测/动作/奖励”预处理;文档描述模拟器核心特性。鼓励特征工程、因果与结构学习、可靠控制等纯数据驱动方法,发掘可落地的控制策略。

二、赛程与数据/模拟器设置

  • 初复赛关系
    • 初赛:使用初赛模拟器生成的数据训练与验证。
    • 复赛:在“系统特性一致、参数不同”的新模拟器上采集与评测,用于检验泛化。
  • 提交与测试频率
    • 初赛:每日可提交 1 次(排行榜每日 5:00 刷新)。
    • 复赛:更严格的次数限制。

三、测试输出与可见性

  • 平台返回结果
    • 单次总体评分(累计奖励均值),复赛按该指标排名。
  • 不公开完整轨迹的原因
    • 防止将测试轨迹作为额外训练数据引入分布外信息;符合离线强化学习的设定与难点。

四、本地验证与环境隔离

  • 本地工具
    • 使用 test_agent.py 与 evaluator.py 进行接口与流程的本地验证(与线上评测流程一致)。
  • 环境建议
    • 训练与测试环境分离;测试环境仅安装 environment.yaml 中依赖,确保离线可复现与可推理。

五、提交与排行榜机制

  • 展示与刷新
    • 排行榜仅展示最近一次提交的成绩(并非历史最佳成绩)。榜单每日凌晨5:00更新,期间可能存在数据处理的排队与延迟现象。因此,建议避免在排行榜刷新时间临近时进行成绩提交,以免影响数据同步与排名更新。
  • 无分/Pending/Done 无分处理
    • 次日 5:00 仍无分多为评测失败。请:
      1. 本地用 evaluator.py 与 test_agent.py 先行验证;
      2. 核查压缩包结构与命名;
      3. 若仍异常,按要求私聊并邮件提交包排查。

六、提交包格式与文件结构(强制)

  • 仅支持 .zip;大小写/拼写敏感;避免多一层目录。以群文件 submission_example.zip 为准。
  • 评测仅拷贝 agent/ 目录参与测试,所有推理代码与权重必须置于 agent/ 内。

七、环境与硬件

  • 评测环境
    • Linux;16 核 CPU、32GB RAM、单张 RTX 4090;串行队列测试;无网络。
  • 依赖与可移植性
    • 训练环境不限;推理必须在仓库 environment.yaml 指定依赖下稳定运行。
    • 可在 Windows 训练,但需确保提交在 Linux 环境可无缝推理。
  • ONNX
    • 支持。environment.yaml 已包含 onnxruntime==1.23.0。复杂模型建议导出 ONNX 提升加载与推理性能。

八、评测逻辑与评分口径

  • 评分
    • 服务器加载策略,与模拟器逐步交互,按轨迹累计奖励均值计分。
  • 交互与观测
    • 每步都有奖励;评测从第 1 步起逐步在线交互,仅提供当步观测(不提供整段轨迹)。
  • 观测维度与示例
    • 环境观测为 5 维。示例展示用过去 30 步历史窗口进行预测,可自行调整。
  • 低分或负分原因
    • 奖励包含惩罚项;明显错误控制会产生较大负奖励。

九、次数与流程管理

  • 时间与晋级
    • 以平台公告为准。
  • 为什么不开放高频测试
    • 离线强化学习强调少量或无在线交互;每日一次已兼顾调试与公平。

十、常见错误与排查清单

  • 结构/加载错误
    • “找不到 agent/ 或 agent.py”“结构错误”:检查是否多层目录、文件名大小写/拼写、PolicyAgent 是否正确继承 BaseAgent、模型相对路径是否正确。
  • 本地分数“固定”
    • 本地分数仅用于验证流程可跑通,不代表线上真实成绩。
  • 本地通过但线上无分/报错
    • 常见原因:依赖缺失、超时、未启用 GPU、模型过大加载慢、路径错误、目录层级异常。可将提交包发送主办方邮箱,按日志排查。

十一、模型与性能约束

  • 资源限制
    • 压缩包 ≤ 10 MB;单次测试 ≤ 5 分钟。
  • 性能建议
    • 精简权重、移除冗余文件、优先 ONNX 导出与半精度/量化(若适配)。
  • 预测方式
    • 评测按步给观测,是否滚动/使用历史窗口可自定。
  • GPU 使用
    • 提供 1× RTX 4090。大模型请开启 GPU 推理避免超时。

十二、报名与平台支持

  • 平台事务(队伍、缴费、提交流程等)
    • 请联系平台答疑老师。
  • 系统异常(提交失败、下载失败、权限问题)
    • 先核对结构与格式,必要时重新打包为 .zip;联系平台答疑老师。

十三、代码获取与快速开始

  • 官方仓库
  • 快速开始
    • conda env create -f environment.yaml
    • 参考 baseline.ipynb 训练
    • 使用 test_agent.py、evaluator.py 本地验证推理流程
  • 必要实现
    • 在 agent/agent.py 中实现并暴露 PolicyAgent(继承 BaseAgent);所有推理依赖与权重置于 agent/;测试环境离线、无网络。

十四、支持与深度协助

  • 参考样例
    • 以群文件 submission_example.zip 为准,提交结构需严格对齐。
  • 深度排查
    • 问题仍未定位时,私聊竞赛技术人员,并将提交包发送至 907824623@qq.com 协助分析。
  • 自查三件套
    • 仓库 README 与 environment.yaml
    • 报名系统“失败原因”提示
    • 本地 evaluator.py/test_agent.py 是否完整跑通