mongodb - 与MySQL相比，MongoDB/NoSQL允许更快的聚合(MapReduce)有什么根本区别

coder 2023-10-28 原文

招呼！
我有以下问题。我有一个包含大量行的表，我需要搜索这些行，然后按许多参数对搜索结果进行分组。假设桌子是

id, big_text, price, country, field1, field2, ..., fieldX

我们运行这样的请求

SELECT .... WHERE 
[use FULLTEXT index to MATCH() big_text] AND 
[use some random clauses that anyway render indexes useless, 
like: country IN (1,2,65,69) and price<100]

这将显示为搜索结果，然后我们需要获取这些搜索结果并按多个字段对其进行分组以生成搜索筛选器

(results) GROUP BY field1
(results) GROUP BY field2
(results) GROUP BY field3
(results) GROUP BY field4

这是我需要的一个简单的例子，手头的实际任务甚至更成问题，例如，有时第一个结果查询也会自己分组。这种功能的例子就是这个网站
http://www.indeed.com/q-sales-jobs.html
（搜索结果和左边的过滤器）
我已经对mysql的功能做了深入的研究，现在我完全看不出mysql有这种可能。粗略地说，mysql表只是hdd上的一堆行，索引是这些表的微小版本，按索引字段排序并指向实际行。当然，这是一个超级简单化的方法，但关键是，我不知道如何解决这个问题，即如何使用多个索引，能够快速地按s分组（当查询到达group-by-index时，由于范围搜索和其他原因，完全没有用）。我知道mysql（或类似的数据库）有很多有用的东西，比如索引合并、松散的索引扫描等等，但这还远远不够，上面的查询仍然需要很长时间才能执行。
我被告知nosql可以解决这个问题，它使用一些全新的数据存储和处理方法，包括聚合任务。我想知道的是一些快速的原理性解释。我的意思是我只是想快速的看一眼，这样我就能真正看到它做到了，因为目前我根本不明白怎么可能做到这一点。我的意思是，数据仍然是数据，必须放在内存中，索引仍然是索引，有它们的所有限制。如果这确实是可能的，那么我将开始详细研究nosql。
另外，请不要告诉我去读一本关于nosql的大书。我已经为mysql做了这项工作，结果发现它在我的情况下是不可用的：）所以我想在拿到一本大书之前对这项技术有一些初步的了解。
谢谢！

最佳答案

“nosql”基本上有四种类型，但四种类型中有三种非常相似，以至于可以在其上编写sql语法（包括mongodb和它的疯狂查询语法[我说javascript是我最喜欢的语言之一]）。
关键价值存储
这些是像redis这样的简单nosql系统，基本上是一个非常漂亮的哈希表。您有一个稍后要获取的值，因此您为它分配一个键并将其填充到数据库中，一次只能查询单个对象，并且只能通过单个键。
你肯定不想要这个。
文件存储
这比关键值存储高出一步，也是大多数人在说nosql（比如mongodb）时所说的。
基本上，这些是具有层次结构的对象（如xml文件、json文件和计算机科学中的任何其他类型的树结构），但是树上不同节点的值可以被索引。与传统的基于行的sql数据库相比，它们在查找时具有更高的“速度”，因为它们在连接时会牺牲性能。
如果您在mysql数据库中从一个包含大量列的表中查找数据（假设它不是视图/虚拟表），并且假设您已经为查询正确地编制了索引（这可能是您的实际问题），那么像mongodb这样的文档数据库不会给您带来比mysql数据库更大的好处。SQL，所以您可能不想仅仅因为这个原因迁移过来。
柱状存储器
这些是最像sql数据库的。事实上，有些（如sybase）实现了sql语法，而另一些（cassandra）则没有。它们将数据存储在列而不是行中，因此添加和更新成本很高，但大多数查询成本很低，因为每列本质上都是隐式索引的。
但是，如果您的查询不能使用索引，那么使用列存储比使用常规sql数据库要好得多。
图形存储
图形数据库扩展到sql之外。任何可以用图论表示的东西，包括键值、文档数据库和sql数据库，都可以用图形数据库来表示，比如neo4j。
图数据库使连接尽可能便宜（相对于文档数据库），但它们必须这样做，因为即使是一个简单的“行”查询也需要许多连接才能检索。
表扫描类型查询可能比标准sql数据库慢，因为要检索数据（以不连接的方式存储）需要所有额外的连接。
那么解决办法是什么？
你可能已经注意到我没有回答你的问题。我不是说“你完成了”，但真正的问题是如何执行查询。
你确定你不能更好地索引你的数据吗？有一些东西，比如Multiple Column Keys可以提高特定查询的性能。Microsoft的SQL Server有一个适用于您提供的示例的full text key type和PostgreSQL can emulate it。
与SQL数据库相比，大多数NoSQL数据库的真正优势是Map Reduce——具体来说，它集成了一个完整的图灵完整语言，该语言运行在可以编写查询约束的高速上。查询函数可以编写为快速“失效”不匹配的查询，或者快速返回满足“优先级”要求的记录，而在sql中执行同样的操作则要麻烦一些。
然而，最后，您正试图解决的确切问题是：带有可选过滤参数的文本搜索通常称为search engine，并且有非常专门的引擎来处理这个特定的问题。我建议Apache Solr执行这些查询。
基本上，将文本字段、“filter”字段和表的主键转储到solr中，让它为文本字段编制索引，通过它运行查询，如果需要之后的完整记录，请查询sql数据库以获取从solr获得的特定索引。它需要更多的内存和第二个进程，但可能会最好地满足您的需要，这里。
为什么所有这些文字都能得到这个答案？
因为你问题的题目和你问题的内容没有任何关系，所以我两个都回答了。：）

关于mongodb - 与MySQL相比，MongoDB/NoSQL允许更快的聚合(MapReduce)有什么根本区别，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/9828780/

MapReduce mongodb br 的 section mongodb-query nosql

有关mongodb - 与MySQL相比，MongoDB/NoSQL允许更快的聚合(MapReduce)有什么根本区别的更多相关文章

ruby - 为什么我可以在 Ruby 中使用 Object#send 访问私有(private)/ protected 方法？ - 2
类classAprivatedeffooputs:fooendpublicdefbarputs:barendprivatedefzimputs:zimendprotecteddefdibputs:dibendendA的实例a=A.new测试a.foorescueputs:faila.barrescueputs:faila.zimrescueputs:faila.dibrescueputs:faila.gazrescueputs:fail测试输出failbarfailfailfail.发送测试[:foo,:bar,:zim,:dib,:gaz].each{|m|a.send(m)resc
ruby-on-rails - Rails - 子类化模型的设计模式是什么？ - 2
我有一个模型:classItem项目有一个属性“商店”基于存储的值，我希望Item对象对特定方法具有不同的行为。Rails中是否有针对此的通用设计模式？如果方法中没有大的if-else语句，这是如何干净利落地完成的？最佳答案通常通过Single-TableInheritance. 关于ruby-on-rails-Rails-子类化模型的设计模式是什么？，我们在StackOverflow上找到一个类似的问题： https://stackoverflow.co
ruby - 什么是填充的 Base64 编码字符串以及如何在 ruby 中生成它们？ - 2
我正在使用的第三方API的文档状态:"[O]urAPIonlyacceptspaddedBase64encodedstrings."什么是“填充的Base64编码字符串”以及如何在Ruby中生成它们。下面的代码是我第一次尝试创建转换为Base64的JSON格式数据。xa=Base64.encode64(a.to_json) 最佳答案他们说的padding其实就是Base64本身的一部分。它是末尾的“=”和“==”。Base64将3个字节的数据包编码为4个编码字符。所以如果你的输入数据有长度n和n%3=1=>"=="末尾用于填充n%
ruby - 解析 RDFa、微数据等的最佳方式是什么，使用统一的模式/词汇(例如 schema.org)存储和显示信息 - 2
我主要使用Ruby来执行此操作，但到目前为止我的攻击计划如下:使用gemsrdf、rdf-rdfa和rdf-microdata或mida来解析给定任何URI的数据。我认为最好映射到像schema.org这样的统一模式，例如使用这个yaml文件，它试图描述数据词汇表和opengraph到schema.org之间的转换:#SchemaXtoschema.orgconversion#data-vocabularyDV:name:namestreet-address:streetAddressregion:addressRegionlocality:addressLocalityphoto:i
ruby - 为什么 4.1%2 使用 Ruby 返回 0.0999999999999996？但是 4.2%2==0.2 - 2
为什么4.1%2返回0.0999999999999996？但是4.2%2==0.2。最佳答案参见此处:WhatEveryProgrammerShouldKnowAboutFloating-PointArithmetic实数是无限的。计算机使用的位数有限(今天是32位、64位)。因此计算机进行的浮点运算不能代表所有的实数。0.1是这些数字之一。请注意，这不是与Ruby相关的问题，而是与所有编程语言相关的问题，因为它来自计算机表示实数的方式。关于ruby-为什么4.1%2使用Ruby返
ruby - ruby 中的 TOPLEVEL_BINDING 是什么？ - 2
它不等于主线程的binding，这个toplevel作用域是什么？此作用域与主线程中的binding有何不同？>ruby-e'putsTOPLEVEL_BINDING===binding'false 最佳答案事实是，TOPLEVEL_BINDING始终引用Binding的预定义全局实例，而Kernel#binding创建的新实例>Binding每次封装当前执行上下文。在顶层，它们都包含相同的绑定(bind)，但它们不是同一个对象，您无法使用==或===测试它们的绑定(bind)相等性。putsTOPLEVEL_BINDINGput
ruby - Infinity 和 NaN 的类型是什么？ - 2
我可以得到Infinity和NaNn=9.0/0#=>Infinityn.class#=>Floatm=0/0.0#=>NaNm.class#=>Float但是当我想直接访问Infinity或NaN时:Infinity#=>uninitializedconstantInfinity(NameError)NaN#=>uninitializedconstantNaN(NameError)什么是Infinity和NaN？它们是对象、关键字还是其他东西？最佳答案您看到打印为Infinity和NaN的只是Float类的两个特殊实例的字符串
ruby-on-rails - 如果 Object::try 被发送到一个 nil 对象，为什么它会起作用？ - 2
如果您尝试在Ruby中的nil对象上调用方法，则会出现NoMethodError异常并显示消息:"undefinedmethod‘...’fornil:NilClass"然而，有一个tryRails中的方法，如果它被发送到一个nil对象，它只返回nil:require'rubygems'require'active_support/all'nil.try(:nonexisting_method)#noNoMethodErrorexceptionanymore那么try如何在内部工作以防止该异常？最佳答案像Ruby中的所有其他对象
ruby - 为什么 SecureRandom.uuid 创建一个唯一的字符串？ - 2
关闭。这个问题需要detailsorclarity.它目前不接受答案。想改进这个问题吗？通过editingthispost添加细节并澄清问题.关闭8年前。Improvethisquestion为什么SecureRandom.uuid创建一个唯一的字符串？SecureRandom.uuid#=>"35cb4e30-54e1-49f9-b5ce-4134799eb2c0"SecureRandom.uuid方法创建的字符串从不重复？
ruby - 触发器 ruby 中 3 点范围运算符和 2 点范围运算符的区别 - 2
请帮助我理解范围运算符...和..之间的区别，作为Ruby中使用的“触发器”。这是PragmaticProgrammersguidetoRuby中的一个示例:a=(11..20).collect{|i|(i%4==0)..(i%3==0)?i:nil}返回:[nil,12,nil,nil,nil,16,17,18,nil,20]还有:a=(11..20).collect{|i|(i%4==0)...(i%3==0)?i:nil}返回:[nil,12,13,14,15,16,17,18,nil,20] 最佳答案触发器(又名f/f)是

mongodb - 与MySQL相比，MongoDB/NoSQL允许更快的聚合(MapReduce)有什么根本区别

有关mongodb - 与MySQL相比，MongoDB/NoSQL允许更快的聚合(MapReduce)有什么根本区别的更多相关文章

随机推荐