草庐IT

javascript - 用JavaScript过滤垃圾邮件的最佳方法是什么?

coder 2025-01-14 原文

最近,我受到启发,用Greasemonkey样式的JavaScript编写了垃圾邮件过滤器,用于我使用的多个容易出现垃圾邮件的网站(尤其是在评论中)。在考虑有关如何执行此操作的选项时,我意识到我有几个选项,每个选项都有优点/缺点。 这个问题的我的目标是扩展我创建的列表,并希望确定使用JavaScript进行客户端垃圾邮件过滤的最佳方法。

至于什么使垃圾邮件过滤器成为“最佳”过滤器,我会说以下是标准:

  • 最准确的
  • 最不容易受到攻击
  • 最快的
  • 最透明的

  • 另外,请注意,我正在尝试使用Greasemonkey Userscripts过滤不属于我的网站上已经存在的内容。换句话说,我无法阻止垃圾邮件;我只能过滤它。

    到目前为止,这是我的尝试,以列出各种方法及其缺点和好处的列表:

    基于规则的过滤器:

    它的作用:通过将点值分配给不同的标准(即所有大写字母,所有非字母数字等)来对消息“评级”,具体取决于得分,消息会被丢弃或保留。

    好处:
  • 易于实现
  • 大多是透明的

  • 缺点:
  • 透明-通常很容易对代码进行反向工程以发现规则,从而制作不会被拾取的消息
  • 难以平衡点值(误报)
  • 可能很慢;每条消息必须执行多个规则,很多时候使用正则表达式
  • 在客户端环境中,需要服务器交互或用户交互来更新规则

  • 贝叶斯过滤:

    它的作用:分析单词频率(或三字母组合词频率),并将其与经过训练的数据进行比较。

    好处:
  • 无需制定规则
  • 快速(相对)
  • 艰难地逆向工程

  • 缺点:
  • 需要培训才能有效
  • 受过训练的数据必须仍可被JavaScript访问;通常采用人类可读的JSON,XML或平面文件
  • 的形式
  • 数据集可以获得相当大的
  • 设计不良的过滤器很容易与常见单词的良好帮助混淆,以降低垃圾邮件评级
  • 以前没有出现过的单词无法准确分类。有时会导致整个消息
  • 的错误分类
  • 在客户端环境中,需要服务器交互或用户交互来更新规则

  • 贝叶斯过滤-服务器端:

    作用:通过将每条消息提交到远程服务器进行分析来应用贝叶斯过滤服务器端。

    好处:
  • 常规贝叶斯过滤的所有好处
  • 培训数据未透露给用户/反向工程师

  • 缺点:
  • 交通拥挤
  • 仍然容易受到不常见单词
  • 的攻击
  • 仍然容易添加常用词以减少垃圾邮件
  • 服务本身可能被滥用
  • 要训练分类器,可能希望允许用户提交垃圾邮件样本以进行训练。攻击者可能滥用此服务

  • 黑名单:

    它的作用:将一组条件应用于消息或消息的某些属性。如果一个或多个(或特定数量的)条件匹配,则拒绝该消息。类似于基于规则的过滤,因此请参阅其描述以了解详细信息。

    验证码等:

    对于这种类型的应用程序不可行。我正在尝试将这些方法应用于已经存在的站点。 Greasemonkey将用于执行此操作;在有人安装我的脚本之前,我不能在其他地方不需要验证码。

    谁能帮我填补空白?谢谢,

    最佳答案

    没有“最佳”方法,尤其是对于所有用户或所有情况。

    把事情简单化:

  • 让GM脚本最初隐藏所有包含链接的注释,甚至可能包含普遍不正确的单词(F * ck,长老等)。 ;)
  • 然后,脚本与您的服务器联系,并让服务器根据X准则(下面将对此进行更多说明)来判断每个注释。
  • 根据服务器响应显示或隐藏注释。如果发生超时,请根据用户首选项设置显示或显示(“过滤器服务器关闭时该怎么办?(显示/隐藏带链接的注释)”)。
  • 就是GM脚本了。其余的由服务器处理。

  • 至于实际的服务器/过滤条件...
    最重要的是不敢假设您可以猜测用户将要过滤的内容! 这会因人而异,甚至因心情而异。

    将服务器设置为使用错误词,错误链接目标(例如,.ru和.cn域)和公共(public)垃圾邮件筛选服务的组合。

    最重要的是为用户提供某种方式来选择并理想地调整所应用的内容。

    关于javascript - 用JavaScript过滤垃圾邮件的最佳方法是什么?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/3868643/

    有关javascript - 用JavaScript过滤垃圾邮件的最佳方法是什么?的更多相关文章

    1. ruby - 如何使用 Nokogiri 的 xpath 和 at_xpath 方法 - 2

      我正在学习如何使用Nokogiri,根据这段代码我遇到了一些问题:require'rubygems'require'mechanize'post_agent=WWW::Mechanize.newpost_page=post_agent.get('http://www.vbulletin.org/forum/showthread.php?t=230708')puts"\nabsolutepathwithtbodygivesnil"putspost_page.parser.xpath('/html/body/div/div/div/div/div/table/tbody/tr/td/div

    2. ruby - 如何从 ruby​​ 中的字符串运行任意对象方法? - 2

      总的来说,我对ruby​​还比较陌生,我正在为我正在创建的对象编写一些rspec测试用例。许多测试用例都非常基础,我只是想确保正确填充和返回值。我想知道是否有办法使用循环结构来执行此操作。不必为我要测试的每个方法都设置一个assertEquals。例如:describeitem,"TestingtheItem"doit"willhaveanullvaluetostart"doitem=Item.new#HereIcoulddotheitem.name.shouldbe_nil#thenIcoulddoitem.category.shouldbe_nilendend但我想要一些方法来使用

    3. ruby - 为什么我可以在 Ruby 中使用 Object#send 访问私有(private)/ protected 方法? - 2

      类classAprivatedeffooputs:fooendpublicdefbarputs:barendprivatedefzimputs:zimendprotecteddefdibputs:dibendendA的实例a=A.new测试a.foorescueputs:faila.barrescueputs:faila.zimrescueputs:faila.dibrescueputs:faila.gazrescueputs:fail测试输出failbarfailfailfail.发送测试[:foo,:bar,:zim,:dib,:gaz].each{|m|a.send(m)resc

    4. ruby-on-rails - 使用 Ruby on Rails 进行自动化测试 - 最佳实践 - 2

      很好奇,就使用ruby​​onrails自动化单元测试而言,你们正在做什么?您是否创建了一个脚本来在cron中运行rake作业并将结果邮寄给您?git中的预提交Hook?只是手动调用?我完全理解测试,但想知道在错误发生之前捕获错误的最佳实践是什么。让我们理所当然地认为测试本身是完美无缺的,并且可以正常工作。下一步是什么以确保他们在正确的时间将可能有害的结果传达给您? 最佳答案 不确定您到底想听什么,但是有几个级别的自动代码库控制:在处理某项功能时,您可以使用类似autotest的内容获得关于哪些有效,哪些无效的即时反馈。要确保您的提

    5. ruby - Facter::Util::Uptime:Module 的未定义方法 get_uptime (NoMethodError) - 2

      我正在尝试设置一个puppet节点,但ruby​​gems似乎不正常。如果我通过它自己的二进制文件(/usr/lib/ruby/gems/1.8/gems/facter-1.5.8/bin/facter)在cli上运行facter,它工作正常,但如果我通过由ruby​​gems(/usr/bin/facter)安装的二进制文件,它抛出:/usr/lib/ruby/1.8/facter/uptime.rb:11:undefinedmethod`get_uptime'forFacter::Util::Uptime:Module(NoMethodError)from/usr/lib/ruby

    6. ruby-on-rails - Rails - 子类化模型的设计模式是什么? - 2

      我有一个模型:classItem项目有一个属性“商店”基于存储的值,我希望Item对象对特定方法具有不同的行为。Rails中是否有针对此的通用设计模式?如果方法中没有大的if-else语句,这是如何干净利落地完成的? 最佳答案 通常通过Single-TableInheritance. 关于ruby-on-rails-Rails-子类化模型的设计模式是什么?,我们在StackOverflow上找到一个类似的问题: https://stackoverflow.co

    7. Ruby 方法() 方法 - 2

      我想了解Ruby方法methods()是如何工作的。我尝试使用“ruby方法”在Google上搜索,但这不是我需要的。我也看过ruby​​-doc.org,但我没有找到这种方法。你能详细解释一下它是如何工作的或者给我一个链接吗?更新我用methods()方法做了实验,得到了这样的结果:'labrat'代码classFirstdeffirst_instance_mymethodenddefself.first_class_mymethodendendclassSecond使用类#returnsavailablemethodslistforclassandancestorsputsSeco

    8. ruby - 什么是填充的 Base64 编码字符串以及如何在 ruby​​ 中生成它们? - 2

      我正在使用的第三方API的文档状态:"[O]urAPIonlyacceptspaddedBase64encodedstrings."什么是“填充的Base64编码字符串”以及如何在Ruby中生成它们。下面的代码是我第一次尝试创建转换为Base64的JSON格式数据。xa=Base64.encode64(a.to_json) 最佳答案 他们说的padding其实就是Base64本身的一部分。它是末尾的“=”和“==”。Base64将3个字节的数据包编码为4个编码字符。所以如果你的输入数据有长度n和n%3=1=>"=="末尾用于填充n%

    9. ruby - 解析 RDFa、微数据等的最佳方式是什么,使用统一的模式/词汇(例如 schema.org)存储和显示信息 - 2

      我主要使用Ruby来执行此操作,但到目前为止我的攻击计划如下:使用gemsrdf、rdf-rdfa和rdf-microdata或mida来解析给定任何URI的数据。我认为最好映射到像schema.org这样的统一模式,例如使用这个yaml文件,它试图描述数据词汇表和opengraph到schema.org之间的转换:#SchemaXtoschema.orgconversion#data-vocabularyDV:name:namestreet-address:streetAddressregion:addressRegionlocality:addressLocalityphoto:i

    10. ruby - 为什么 4.1%2 使用 Ruby 返回 0.0999999999999996?但是 4.2%2==0.2 - 2

      为什么4.1%2返回0.0999999999999996?但是4.2%2==0.2。 最佳答案 参见此处:WhatEveryProgrammerShouldKnowAboutFloating-PointArithmetic实数是无限的。计算机使用的位数有限(今天是32位、64位)。因此计算机进行的浮点运算不能代表所有的实数。0.1是这些数字之一。请注意,这不是与Ruby相关的问题,而是与所有编程语言相关的问题,因为它来自计算机表示实数的方式。 关于ruby-为什么4.1%2使用Ruby返

    随机推荐