php - 如何通过单个查询从带有 where 过滤器的 30k MySQL 表中快速选择 3 条随机记录？

coder 2023-06-10 原文

嗯，这是一个非常古老的问题，从未得到真正的解决方案。我们想要一个包含大约 30k 条记录的表中的 3 个随机行。从 MySQL 的角度来看，这张表并没有那么大，但如果它代表一个商店的产品，它就具有代表性。例如，当一个人在网页中呈现 3 个随机产品时，随机选择很有用。我们想要一个满足这些条件的单一 SQL 字符串解决方案:

在 PHP 中，PDO 或 MySQLi 的记录集必须正好有 3 行。
它们必须通过不使用存储过程的单个 MySQL 查询获得。
解决方案必须快速，例如繁忙的 apache2 服务器，MySQL 查询在许多情况下是瓶颈。所以它必须避免创建临时表等。
这 3 条记录不得连续，即它们不得彼此相邻。

该表有以下字段:

CREATE TABLE Products (
  ID INT(8) NOT NULL AUTO_INCREMENT,
  Name VARCHAR(255) default NULL,
  HasImages INT default 0,
  ...
) ENGINE=InnoDB DEFAULT CHARSET=utf8;

WHERE 约束是 Products.HasImages=1 允许仅获取具有可在网页上显示的图像的记录。大约三分之一的记录满足 HasImages=1 的条件。

寻找完美，我们先抛开现有的存在缺陷的解决方案:

我。 This basic solution使用 ORDER BY RAND()，

太慢了，但保证每次查询都有 3 个真正随机的记录:

SELECT ID, Name FROM Products WHERE HasImages=1 ORDER BY RAND() LIMIT 3;

*CPU大约0.10s，扫描9690行因为WHERE子句，使用where； 使用临时；在 Debian Squeeze 双核 Linux 机器上使用文件排序，还不错，但是

不能像使用临时表和文件排序那样扩展到更大的表，并且在测试 Windows7::MySQL 系统上进行第一次查询需要 8.52 秒。这么差的性能，要避免一个网页不是吗？

二。 riedsio的亮解使用 JOIN ... RAND(),

来自 MySQL select 10 random rows from 600K rows fast ，此处改编仅对单个随机记录有效，因为以下查询几乎总是连续记录。实际上，它只获得了 ID 中 3 条连续记录的随机集:

SELECT Products.ID, Products.Name
FROM Products
INNER JOIN (SELECT (RAND() * (SELECT MAX(ID) FROM Products)) AS ID)
  AS t ON Products.ID >= t.ID
WHERE (Products.HasImages=1)
ORDER BY Products.ID ASC
LIMIT 3;

*CPU大约0.01-0.19s，随机扫描3200、9690、12000行左右，但大多是9690条记录，使用where。

三。最好的解决方案似乎是 WHERE ... RAND(),

见于 MySQL select 10 random rows from 600K rows fast由 bernardo-siu 提议:

SELECT Products.ID, Products.Name FROM Products
WHERE ((Products.Hasimages=1) AND RAND() < 16 * 3/30000) LIMIT 3;

*CPU 大约 0.01 - 0.03s，扫描 9690 行，使用 where。

这里3是希望的行数，30000是表Products的RecordCount，16是放大选择的实验系数，以保证3条记录的选择。我不知道在什么基础上，因子 16 是可接受的近似值。

我们在大多数情况下得到 3 条随机记录，而且速度非常快，但这并不保证:有时查询只返回 2 行，有时甚至根本没有记录。

以上三种方法扫描满足WHERE子句的表的所有记录，这里是9690行。

更好的 SQL 字符串？

最佳答案

丑陋，但又快又随意。很快就会变得非常难看，尤其是在下面描述的调整中，所以请确保你真的想要这样。

(SELECT Products.ID, Products.Name
FROM Products
    INNER JOIN (SELECT RAND()*(SELECT MAX(ID) FROM Products) AS ID) AS t ON Products.ID >= t.ID
WHERE Products.HasImages=1
ORDER BY Products.ID
LIMIT 1)

UNION ALL

(SELECT Products.ID, Products.Name
FROM Products
    INNER JOIN (SELECT RAND()*(SELECT MAX(ID) FROM Products) AS ID) AS t ON Products.ID >= t.ID
WHERE Products.HasImages=1
ORDER BY Products.ID
LIMIT 1)

UNION ALL

(SELECT Products.ID, Products.Name
FROM Products
    INNER JOIN (SELECT RAND()*(SELECT MAX(ID) FROM Products) AS ID) AS t ON Products.ID >= t.ID
WHERE Products.HasImages=1
ORDER BY Products.ID
LIMIT 1)

第一行出现的频率超出预期

如果您的表中的 ID 之间有很大的差距，那么紧随这些差距之后的行将有更大的机会被此查询获取。在某些情况下，它们出现的频率会明显高于应有的频率。这通常无法解决，但有一个针对常见特殊情况的修复:当 0 和表中的第一个现有 ID 之间存在间隙时。

代替子查询 (SELECT RAND()*<max_id> AS ID)使用类似 (SELECT <min_id> + RAND()*(<max_id> - <min_id>) AS ID)

删除重复项

如果按原样使用，查询可能会返回重复的行。使用 UNION 可以避免这种情况。而不是 UNION ALL .这种方式将合并重复项，但查询不再保证准确返回 3 行。您也可以通过获取比您需要的更多的行并像这样限制外部结果来解决这个问题:

(SELECT ... LIMIT 1)
UNION (SELECT ... LIMIT 1)
UNION (SELECT ... LIMIT 1)
...
UNION (SELECT ... LIMIT 1)
LIMIT 3

但仍然不能保证会提取 3 行。它只是让它更有可能。

关于php - 如何通过单个查询从带有 where 过滤器的 30k MySQL 表中快速选择 3 条随机记录？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/18943417/

有关php - 如何通过单个查询从带有 where 过滤器的 30k MySQL 表中快速选择 3 条随机记录？的更多相关文章

ruby - 如何使用 Nokogiri 的 xpath 和 at_xpath 方法 - 2
我正在学习如何使用Nokogiri，根据这段代码我遇到了一些问题:require'rubygems'require'mechanize'post_agent=WWW::Mechanize.newpost_page=post_agent.get('http://www.vbulletin.org/forum/showthread.php?t=230708')puts"\nabsolutepathwithtbodygivesnil"putspost_page.parser.xpath('/html/body/div/div/div/div/div/table/tbody/tr/td/div
ruby - 如何从 ruby 中的字符串运行任意对象方法？ - 2
总的来说，我对ruby还比较陌生，我正在为我正在创建的对象编写一些rspec测试用例。许多测试用例都非常基础，我只是想确保正确填充和返回值。我想知道是否有办法使用循环结构来执行此操作。不必为我要测试的每个方法都设置一个assertEquals。例如:describeitem,"TestingtheItem"doit"willhaveanullvaluetostart"doitem=Item.new#HereIcoulddotheitem.name.shouldbe_nil#thenIcoulddoitem.category.shouldbe_nilendend但我想要一些方法来使用
python - 如何使用 Ruby 或 Python 创建一系列高音调和低音调的蜂鸣声？ - 2
关闭。这个问题是opinion-based.它目前不接受答案。想要改进这个问题？更新问题，以便editingthispost可以用事实和引用来回答它.关闭4年前。Improvethisquestion我想在固定时间创建一系列低音和高音调的哔哔声。例如:在150毫秒时发出高音调的蜂鸣声在151毫秒时发出低音调的蜂鸣声200毫秒时发出低音调的蜂鸣声250毫秒的高音调蜂鸣声有没有办法在Ruby或Python中做到这一点？我真的不在乎输出编码是什么(.wav、.mp3、.ogg等等)，但我确实想创建一个输出文件。
ruby-on-rails - 如何验证 update_all 是否实际在 Rails 中更新 - 2
给定这段代码defcreate@upgrades=User.update_all(["role=?","upgraded"],:id=>params[:upgrade])redirect_toadmin_upgrades_path,:notice=>"Successfullyupgradeduser."end我如何在该操作中实际验证它们是否已保存或未重定向到适当的页面和消息？最佳答案在Rails3中，update_all不返回任何有意义的信息，除了已更新的记录数(这可能取决于您的DBMS是否返回该信息)。http://ar.ru
ruby-on-rails - 'compass watch' 是如何工作的/它是如何与 rails 一起使用的 - 2
我在我的项目目录中完成了compasscreate.和compassinitrails。几个问题:我已将我的.sass文件放在public/stylesheets中。这是放置它们的正确位置吗？当我运行compasswatch时，它不会自动编译这些.sass文件。我必须手动指定文件:compasswatchpublic/stylesheets/myfile.sass等。如何让它自动运行？文件ie.css、print.css和screen.css已放在stylesheets/compiled。如何在编译后不让它们重新出现的情况下删除它们？我自己编译的.sass文件编译成compiled/t
ruby - ECONNRESET (Whois::ConnectionError) - 尝试在 Ruby 中查询 Whois 时出错 - 2
我正在用Ruby编写一个简单的程序来检查域列表是否被占用。基本上它循环遍历列表，并使用以下函数进行检查。require'rubygems'require'whois'defcheck_domain(domain)c=Whois::Client.newc.query("google.com").available?end程序不断出错(即使我在google.com中进行硬编码)，并打印以下消息。鉴于该程序非常简单，我已经没有什么想法了-有什么建议吗？/Library/Ruby/Gems/1.8/gems/whois-2.0.2/lib/whois/server/adapters/base.
ruby - 如何将脚本文件的末尾读取为数据文件(Perl 或任何其他语言) - 2
我正在寻找执行以下操作的正确语法(在Perl、Shell或Ruby中):#variabletoaccessthedatalinesappendedasafileEND_OF_SCRIPT_MARKERrawdatastartshereanditcontinues. 最佳答案 Perl用__DATA__做这个:#!/usr/bin/perlusestrict;usewarnings;while(){print;}__DATA__Texttoprintgoeshere 关于ruby-如何将脚
ruby - 通过 rvm 升级 rubygems 的问题 - 2
尝试通过RVM将RubyGems升级到版本1.8.10并出现此错误:$rvmrubygemslatestRemovingoldRubygemsfiles...Installingrubygems-1.8.10forruby-1.9.2-p180...ERROR:Errorrunning'GEM_PATH="/Users/foo/.rvm/gems/ruby-1.9.2-p180:/Users/foo/.rvm/gems/ruby-1.9.2-p180@global:/Users/foo/.rvm/gems/ruby-1.9.2-p180:/Users/foo/.rvm/gems/rub
ruby - 如何指定 Rack 处理程序 - 2
Rackup通过Rack的默认处理程序成功运行任何Rack应用程序。例如:classRackAppdefcall(environment)['200',{'Content-Type'=>'text/html'},["Helloworld"]]endendrunRackApp.new但是当最后一行更改为使用Rack的内置CGI处理程序时，rackup给出“NoMethodErrorat/undefinedmethod`call'fornil:NilClass”:Rack::Handler::CGI.runRackApp.newRack的其他内置处理程序也提出了同样的反对意见。例如Rack
ruby - 如何每月在 Heroku 运行一次 Scheduler 插件？ - 2
在选择我想要运行操作的频率时，唯一的选项是“每天”、“每小时”和“每10分钟”。谢谢!我想为我的Rails3.1应用程序运行调度程序。最佳答案这不是一个优雅的解决方案，但您可以安排它每天运行，并在实际开始工作之前检查日期是否为当月的第一天。关于ruby-如何每月在Heroku运行一次Scheduler插件？，我们在StackOverflow上找到一个类似的问题： https://stackoverflow.com/questions/8692687/