Advanced
Open
Pro
min_child_samples as a Regularizer
You are training a LightGBM model on a dataset with 500,000 rows.
A colleague sets min_child_samples=1 arguing: "More specific splits
give lower training error, which is always better."
- Explain why
min_child_samples=1is dangerous. - What does this parameter physically prevent in the tree structure?
- How would you choose an appropriate value for a 500,000-row dataset?
- How does
min_child_samplesinteract withnum_leaves?
Share this question