- 核心目标
- 面向真实工业场景,从有限历史数据中学习“观测-动作-奖励”闭环策略,在离线环境严格验证有效性与安全性,筛选能在有限线上测试中仍保持稳健的方案。
- 为什么强调离线验证
- 工业系统不可直接上线未经验证模型;在线评测存在公平性与安全性风险。流程参考真实生产:先离线严控验证,再进行次数有限的线上测试,偏离预期会被立即终止。
- 工业贴合性
- 数据已按“观测/动作/奖励”预处理;文档描述模拟器核心特性。鼓励特征工程、因果与结构学习、可靠控制等纯数据驱动方法,发掘可落地的控制策略。
- 初复赛关系
- 初赛:使用初赛模拟器生成的数据训练与验证。
- 复赛:在“系统特性一致、参数不同”的新模拟器上采集与评测,用于检验泛化。
- 提交与测试频率
- 初赛:每日可提交 1 次(排行榜每日 5:00 刷新)。
- 复赛:更严格的次数限制。
- 平台返回结果
- 单次总体评分(累计奖励均值),复赛按该指标排名。
- 不公开完整轨迹的原因
- 防止将测试轨迹作为额外训练数据引入分布外信息;符合离线强化学习的设定与难点。
- 本地工具
- 使用 test_agent.py 与 evaluator.py 进行接口与流程的本地验证(与线上评测流程一致)。
- 环境建议
- 训练与测试环境分离;测试环境仅安装 environment.yaml 中依赖,确保离线可复现与可推理。
- 展示与刷新
- 排行榜仅展示最近一次提交的成绩(并非历史最佳成绩)。榜单每日凌晨5:00更新,期间可能存在数据处理的排队与延迟现象。因此,建议避免在排行榜刷新时间临近时进行成绩提交,以免影响数据同步与排名更新。
- 无分/Pending/Done 无分处理
- 次日 5:00 仍无分多为评测失败。请:
- 本地用 evaluator.py 与 test_agent.py 先行验证;
- 核查压缩包结构与命名;
- 若仍异常,按要求私聊并邮件提交包排查。
- 次日 5:00 仍无分多为评测失败。请:
- 仅支持 .zip;大小写/拼写敏感;避免多一层目录。以群文件 submission_example.zip 为准。
- 评测仅拷贝 agent/ 目录参与测试,所有推理代码与权重必须置于 agent/ 内。
- 评测环境
- Linux;16 核 CPU、32GB RAM、单张 RTX 4090;串行队列测试;无网络。
- 依赖与可移植性
- 训练环境不限;推理必须在仓库 environment.yaml 指定依赖下稳定运行。
- 可在 Windows 训练,但需确保提交在 Linux 环境可无缝推理。
- ONNX
- 支持。environment.yaml 已包含 onnxruntime==1.23.0。复杂模型建议导出 ONNX 提升加载与推理性能。
- 评分
- 服务器加载策略,与模拟器逐步交互,按轨迹累计奖励均值计分。
- 交互与观测
- 每步都有奖励;评测从第 1 步起逐步在线交互,仅提供当步观测(不提供整段轨迹)。
- 观测维度与示例
- 环境观测为 5 维。示例展示用过去 30 步历史窗口进行预测,可自行调整。
- 低分或负分原因
- 奖励包含惩罚项;明显错误控制会产生较大负奖励。
- 时间与晋级
- 以平台公告为准。
- 为什么不开放高频测试
- 离线强化学习强调少量或无在线交互;每日一次已兼顾调试与公平。
- 结构/加载错误
- “找不到 agent/ 或 agent.py”“结构错误”:检查是否多层目录、文件名大小写/拼写、PolicyAgent 是否正确继承 BaseAgent、模型相对路径是否正确。
- 本地分数“固定”
- 本地分数仅用于验证流程可跑通,不代表线上真实成绩。
- 本地通过但线上无分/报错
- 常见原因:依赖缺失、超时、未启用 GPU、模型过大加载慢、路径错误、目录层级异常。可将提交包发送主办方邮箱,按日志排查。
- 资源限制
- 压缩包 ≤ 10 MB;单次测试 ≤ 5 分钟。
- 性能建议
- 精简权重、移除冗余文件、优先 ONNX 导出与半精度/量化(若适配)。
- 预测方式
- 评测按步给观测,是否滚动/使用历史窗口可自定。
- GPU 使用
- 提供 1× RTX 4090。大模型请开启 GPU 推理避免超时。
- 平台事务(队伍、缴费、提交流程等)
- 请联系平台答疑老师。
- 系统异常(提交失败、下载失败、权限问题)
- 先核对结构与格式,必要时重新打包为 .zip;联系平台答疑老师。
- 官方仓库
- 快速开始
- conda env create -f environment.yaml
- 参考 baseline.ipynb 训练
- 使用 test_agent.py、evaluator.py 本地验证推理流程
- 必要实现
- 在 agent/agent.py 中实现并暴露 PolicyAgent(继承 BaseAgent);所有推理依赖与权重置于 agent/;测试环境离线、无网络。
- 参考样例
- 以群文件 submission_example.zip 为准,提交结构需严格对齐。
- 深度排查
- 问题仍未定位时,私聊竞赛技术人员,并将提交包发送至 907824623@qq.com 协助分析。
- 自查三件套
- 仓库 README 与 environment.yaml
- 报名系统“失败原因”提示
- 本地 evaluator.py/test_agent.py 是否完整跑通