训练分数很高,不代表模型适合新数据。一个可信的预测流程,需要将数据划分、预处理、模型比较与最终评估连成完整步骤。
先明确预测时能知道什么
选择变量时要模拟实际预测时间点。结果发生之后才有的信息,即使能提高分数,也不应作为预测输入。时间数据还要注意保持前后顺序。
把预处理放在验证流程内
缺失值填补、标准化和特征选择,应只从训练部分学习,再应用到验证部分。交叉验证中每一折都要重复这一过程,避免信息泄漏。
用合适的指标和误差分析比较
先设简单基线,再比较 Ridge 或决策树等方法。回归和分类使用不同指标;类别不平衡时,仅看准确率可能产生误导。保留独立测试集用于最终评估。
这个片段能帮助你什么
辅导重点:Python 建模、交叉验证、数据泄漏检查与结果解释。
本页展示方法,不承诺特定模型准确率或课程成绩。