python - 区分过拟合与良好预测

coder 2023-05-23 原文

这些是关于如何计算和减少机器学习中的过度拟合的问题。我认为许多机器学习新手都会有同样的问题，所以我试着用我的例子和问题说清楚，希望这里的答案可以帮助其他人。

我有一个非常小的文本样本，我正在尝试预测与它们相关的值。我已经使用 sklearn 来计算 tf-idf，并将它们插入到回归模型中进行预测。这给了我 26 个具有 6323 个特征的样本 - 不是很多。我知道:

>> count_vectorizer = CountVectorizer(min_n=1, max_n=1)
>> term_freq = count_vectorizer.fit_transform(texts)
>> transformer = TfidfTransformer()
>> X = transformer.fit_transform(term_freq) 
>> print X.shape

(26, 6323)

将这 26 个样本的 6323 个特征 (X) 和相关分数 (y) 插入到 LinearRegression 模型中，可以提供良好的预测。这些是使用留一法交叉验证获得的，来自 cross_validation.LeaveOneOut(X.shape[0], indices=True):

using ngrams (n=1):
     human  machine  points-off  %error
      8.67    8.27    0.40       1.98
      8.00    7.33    0.67       3.34
      ...     ...     ...        ...
      5.00    6.61    1.61       8.06
      9.00    7.50    1.50       7.50
mean: 7.59    7.64    1.29       6.47
std : 1.94    0.56    1.38       6.91

相当不错!使用 ngrams (n=300) 而不是 unigrams (n=1) 会出现类似的结果，这显然是不对的。任何文本中都没有出现 300 个单词，因此预测应该会失败，但它不会:

using ngrams (n=300):
      human  machine  points-off  %error
       8.67    7.55    1.12       5.60
       8.00    7.57    0.43       2.13
       ...     ...     ...        ...
mean:  7.59    7.59    1.52       7.59
std :  1.94    0.08    1.32       6.61

问题 1: 这可能意味着预测模型对数据过度拟合。我只知道这一点，因为我为我知道不能产生好的结果的 ngrams (n=300) 选择了一个极值。但如果我没有这方面的知识，你通常如何判断模型过度拟合？换句话说，如果使用了合理的度量 (n=1)，你怎么知道好的预测是过度拟合的结果，而模型只是运行良好？

问题 2: 防止过拟合(在这种情况下)以确保预测结果好坏的最佳方法是什么？

问题 3: 如果使用 LeaveOneOut 交叉验证，模型怎么可能过拟合而得到好的结果？过度拟合意味着预测准确性会受到影响 - 那么为什么它不会影响对被遗漏文本的预测呢？我能想到的唯一原因:在主要为 0 的 tf-idf 稀疏矩阵中，文本之间有很强的重叠，因为有很多术语是 0 - 然后回归认为文本高度相关。

请回答任何问题，即使您不知道所有问题。谢谢!

最佳答案

how would you normally tell that the model is over-fitting?

One useful rule of thumb是当您的模型在其自己的训练集上的性能比在其保留验证集或交叉验证设置中的表现要好得多时，您可能会过度拟合。不过，这还不是全部。

我链接到的博客文章描述了测试过拟合的过程:绘制训练集和验证集误差作为训练集大小的函数。如果它们在图的右端显示出稳定的间隙，则可能是过度拟合。

What is the best way of preventing over-fitting (in this situation) to be sure that the prediction results are good or not?

使用保留测试集。仅在您完全完成模型选择(超参数调整)后才对这个集合进行评估；不要训练它，不要在(交叉)验证中使用它。你在测试集上得到的分数就是模型的最终评价。这应该显示您是否不小心过度拟合了验证集。

[机器学习 session 有时会像比赛一样设置，直到研究人员将最终模型交付给组织者之后才将测试集提供给研究人员。同时，他们可以随意使用训练集，例如通过使用交叉验证测试模型。 Kaggle做类似的事情。]

If LeaveOneOut cross validation is used, how can the model possibly over-fit with good results?

因为您可以在此交叉验证设置中尽可能多地调整模型，直到它在 CV 中表现得几乎完美。

作为一个极端示例，假设您已经实现了一个本质上是随机数生成器的估算器。您可以继续尝试随机种子，直到您找到一个在交叉验证中产生非常低错误的“模型”，但这并不是您找到了正确的模型。这意味着你已经过度适应了交叉验证。

另见 this interesting warstory .

关于python - 区分过拟合与良好预测，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/12253151/

良好 python strong code section numpy machine-learning regression scikit-learn

有关python - 区分过拟合与良好预测的更多相关文章

python - 如何使用 Ruby 或 Python 创建一系列高音调和低音调的蜂鸣声？ - 2
关闭。这个问题是opinion-based.它目前不接受答案。想要改进这个问题？更新问题，以便editingthispost可以用事实和引用来回答它.关闭4年前。Improvethisquestion我想在固定时间创建一系列低音和高音调的哔哔声。例如:在150毫秒时发出高音调的蜂鸣声在151毫秒时发出低音调的蜂鸣声200毫秒时发出低音调的蜂鸣声250毫秒的高音调蜂鸣声有没有办法在Ruby或Python中做到这一点？我真的不在乎输出编码是什么(.wav、.mp3、.ogg等等)，但我确实想创建一个输出文件。
Python 相当于 Perl/Ruby ||= - 2
这个问题在这里已经有了答案:关闭10年前。PossibleDuplicate:Pythonconditionalassignmentoperator对于这样一个简单的问题表示歉意，但是谷歌搜索||=并不是很有帮助；)Python中是否有与Ruby和Perl中的||=语句等效的语句？例如:foo="hey"foo||="what"#assignfooifit'sundefined#fooisstill"hey"bar||="yeah"#baris"yeah"另外，类似这样的东西的通用术语是什么？条件分配是我的第一个猜测，但Wikipediapage跟我想的不太一样。
java - 什么相当于 ruby 的 rack 或 python 的 Java wsgi？ - 2
什么是ruby的rack或python的Java的wsgi？还有一个路由库。最佳答案来自Python标准PEP333:Bycontrast,althoughJavahasjustasmanywebapplicationframeworksavailable,Java's"servlet"APImakesitpossibleforapplicationswrittenwithanyJavawebapplicationframeworktoruninanywebserverthatsupportstheservletAPI.ht
华为OD机试用Python实现 -【明明的随机数】 2023Q1A - 2
华为OD机试题本篇题目：明明的随机数题目输入描述输出描述：示例1输入输出说明代码编写思路最近更新的博客华为od2023|什么是华为od，od薪资待遇，od机试题清单华为OD机试真题大全，用Python解华为机试题|机试宝典【华为OD机试】全流程解析+经验分享,题型分享,防作弊指南华为o
python - 如何读取 MIDI 文件、更改其乐器并将其写回？ - 2
我想解析一个已经存在的.mid文件，改变它的乐器，例如从“acousticgrandpiano”到“violin”，然后将它保存回去或作为另一个.mid文件。根据我在文档中看到的内容，该乐器通过program_change或patch_change指令进行了更改，但我找不到任何在已经存在的MIDI文件中执行此操作的库.他们似乎都只支持从头开始创建的MIDI文件。最佳答案 MIDIpackage会为您完成此操作，但具体方法取决于midi文件的原始内容。一个MIDI文件由一个或多个音轨组成，每个音轨是十六个channel中任何一个上的
「Python｜Selenium｜场景案例」如何定位iframe中的元素？ - 2
本文主要介绍在使用Selenium进行自动化测试或者任务时，对于使用了iframe的页面，如何定位iframe中的元素文章目录场景描述解决方案具体代码场景描述当我们在使用Selenium进行自动化测试的时候，可能会遇到一些界面或者窗体是使用HTML的iframe标签进行承载的。对于iframe中的标签，如果直接查找是无法找到的，会抛出没有找到元素的异常。比如近在咫尺的例子就是，CSDN的登录窗体就是使用的iframe，大家可以尝试通过F12开发者模式查看到的tag_name,class_name,id或者xpath来定位中的页面元素，会抛出NoSuchElementException异常。解决
python ffmpeg 使用 pyav 转换一组图像到视频 - 2
2022/8/4更新支持加入水印水印必须包含透明图像，并且水印图像大小要等于原图像的大小pythonconvert_image_to_video.py-f30-mwatermark.pngim_dirout.mkv2022/6/21更新让命令行参数更加易用新的命令行使用方法pythonconvert_image_to_video.py-f30im_dirout.mkvFFMPEG命令行转换一组JPG图像到视频时，是将这组图像视为MJPG流。我需要转换一组PNG图像到视频，FFMPEG就不认了。pyav内置了ffmpeg库，不需要系统带有ffmpeg工具因此我使用ffmpeg的python包装p
Python 刷Leetcode题库，顺带学英语单词（31） - 2
ValidPalindromeGivenastring,determineifitisapalindrome,consideringonlyalphanumericcharactersandignoringcases. [#125]Example:"Aman,aplan,acanal:Panama"isapalindrome."raceacar"isnotapalindrome.Haveyouconsiderthatthestringmightbeempty?Thisisagoodquestiontoaskduringaninterview.Forthepurposeofthisproblem
python - 是否可以使用 Ruby 或 Python 禁用 anchor /引用来发出有效的 YAML？ - 2
是否可以在PyYAML或Ruby的Psych引擎中禁用创建anchor和引用(并有效地显式列出冗余数据)？也许我在网上搜索时遗漏了一些东西，但在Psych中似乎没有太多可用的选项，而且我也无法确定PyYAML是否允许这样做.基本原理是我必须序列化一些数据并将其以可读的形式传递给一个不是真正的技术同事进行手动验证。有些数据是多余的，但我需要以最明确的方式列出它们以提高可读性(anchor和引用是提高效率的好概念，但不是人类可读性)。Ruby和Python是我选择的工具，但如果有其他一些相当简单的方法来“展开”YAML文档，它可能就可以了。最佳答案
.net - .NET 将如何影响 Python 和 Ruby 应用程序？ - 2
我很好奇.NET将如何影响Python和Ruby应用程序。用IronPython/IronRuby编写的应用程序是否会非常特定于.NET环境，以至于它们实际上将变得特定于平台？如果他们不使用任何.NET功能，那么IronPython/IronRuby相对于非.NET同类产品的优势是什么？最佳答案我不能说任何关于IronRuby的东西，但是大多数Python实现(如IronPython、Jython和PyPy)都试图尽可能忠实于CPython实现。不过，IronPython正在迅速成为这方面的佼佼者之一，并且在PlanetPyth

python - 区分过拟合与良好预测

有关python - 区分过拟合与良好预测的更多相关文章

随机推荐