基本上,我正在尝试使用 goroutines 编写并发站点地图爬虫。一个站点地图可以包含指向多个站点地图的链接,这些站点地图可以包含指向其他站点地图等的链接。
现在,这是我的设计:
worker:
- receives url from channel
- processesUrl(url)
processUrl:
for each link in lookup(url):
- if link is sitemap:
channel <- url
else:
print(url)
main:
- create 10 workers
- chanel <- root url
问题是 worker 在 processUrl() 完成之前不会接受来自 channel 的新 url,并且 processUrl 在 worker 从 channel 接受新 url 之前不会完成,如果它正在向 channel 添加 url .我可以使用什么并发设计将 url 添加到没有 channel 且没有忙等待或不等待 channel <- url 的任务队列中?
如果有帮助,这里是实际代码:
func (c *SitemapCrawler) worker() {
for {
select {
case url := <-urlChan:
fmt.Println(url)
c.crawlSitemap(url)
}
}
}
func crawlUrl(url string) {
defer crawlWg.Done()
crawler := NewCrawler(url)
for i := 0; i < MaxCrawlRate*20; i++ {
go crawler.worker()
}
crawler.getSitemaps()
pretty.Println(crawler.sitemaps)
crawler.crawlSitemaps()
}
func (c SitemapCrawler) crawlSitemap(url string) {
c.limiter.Take()
resp, err := MakeRequest(url)
if err != nil || resp.StatusCode != 200 {
crawlWg.Done()
return
}
var resp_txt []byte
if strings.Contains(resp.Header.Get("Content-Type"), "html") {
crawlWg.Done()
return
} else if strings.Contains(url, ".gz") || resp.Header.Get("Content-Encoding") == "gzip" {
reader, err := gzip.NewReader(resp.Body)
if err != nil {
crawlWg.Done()
panic(err)
} else {
resp_txt, err = ioutil.ReadAll(reader)
if err != nil {
crawlWg.Done()
panic(err)
}
}
reader.Close()
} else {
resp_txt, err = ioutil.ReadAll(resp.Body)
if err != nil {
//panic(err)
crawlWg.Done()
return
}
}
io.Copy(ioutil.Discard, resp.Body)
resp.Body.Close()
d, err := libxml2.ParseString(string(resp_txt))
if err != nil {
crawlWg.Done()
return
}
results, err := d.Find("//*[contains(local-name(), 'loc')]")
if err != nil {
crawlWg.Done()
return
}
locs := results.NodeList()
printLock.Lock()
for i := 0; i < len(locs); i++ {
newUrl := locs[i].TextContent()
if strings.Contains(newUrl, ".xml") {
crawlWg.Add(1)
//go c.crawlSitemap(newUrl)
urlChan <- newUrl
} else {
fmt.Println(newUrl)
}
}
printLock.Unlock()
crawlWg.Done()
}
最佳答案
当 channel 没有缓冲时,对 channel 的写操作是阻塞的。
创建缓冲 channel :
urlChan := make(chan string, len(allUrls))
但是,当此 channel 已满时,写操作将再次阻塞。
或者,您可以使用开关。当写入“失败”时,它将立即下降到默认值
select {
case urlChan <- url:
fmt.Println("received message")
default:
fmt.Println("no activity")
}
要在写入 channel 时超时,请执行以下操作
select {
case urlChan <- url:
fmt.Println("received message")
case <-time.After(5 * time.Second):
fmt.Println("timed out")
}
或者最后把write事件放到一个单独的go channel中
func write() {
urlChan <- url
}
go write()
关于go - 如何从从该 channel 接收数据的 goroutine 添加一个对象到该 channel ?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/47826429/
我正在学习如何使用Nokogiri,根据这段代码我遇到了一些问题:require'rubygems'require'mechanize'post_agent=WWW::Mechanize.newpost_page=post_agent.get('http://www.vbulletin.org/forum/showthread.php?t=230708')puts"\nabsolutepathwithtbodygivesnil"putspost_page.parser.xpath('/html/body/div/div/div/div/div/table/tbody/tr/td/div
总的来说,我对ruby还比较陌生,我正在为我正在创建的对象编写一些rspec测试用例。许多测试用例都非常基础,我只是想确保正确填充和返回值。我想知道是否有办法使用循环结构来执行此操作。不必为我要测试的每个方法都设置一个assertEquals。例如:describeitem,"TestingtheItem"doit"willhaveanullvaluetostart"doitem=Item.new#HereIcoulddotheitem.name.shouldbe_nil#thenIcoulddoitem.category.shouldbe_nilendend但我想要一些方法来使用
关闭。这个问题是opinion-based.它目前不接受答案。想要改进这个问题?更新问题,以便editingthispost可以用事实和引用来回答它.关闭4年前。Improvethisquestion我想在固定时间创建一系列低音和高音调的哔哔声。例如:在150毫秒时发出高音调的蜂鸣声在151毫秒时发出低音调的蜂鸣声200毫秒时发出低音调的蜂鸣声250毫秒的高音调蜂鸣声有没有办法在Ruby或Python中做到这一点?我真的不在乎输出编码是什么(.wav、.mp3、.ogg等等),但我确实想创建一个输出文件。
给定这段代码defcreate@upgrades=User.update_all(["role=?","upgraded"],:id=>params[:upgrade])redirect_toadmin_upgrades_path,:notice=>"Successfullyupgradeduser."end我如何在该操作中实际验证它们是否已保存或未重定向到适当的页面和消息? 最佳答案 在Rails3中,update_all不返回任何有意义的信息,除了已更新的记录数(这可能取决于您的DBMS是否返回该信息)。http://ar.ru
我在我的项目目录中完成了compasscreate.和compassinitrails。几个问题:我已将我的.sass文件放在public/stylesheets中。这是放置它们的正确位置吗?当我运行compasswatch时,它不会自动编译这些.sass文件。我必须手动指定文件:compasswatchpublic/stylesheets/myfile.sass等。如何让它自动运行?文件ie.css、print.css和screen.css已放在stylesheets/compiled。如何在编译后不让它们重新出现的情况下删除它们?我自己编译的.sass文件编译成compiled/t
我正在寻找执行以下操作的正确语法(在Perl、Shell或Ruby中):#variabletoaccessthedatalinesappendedasafileEND_OF_SCRIPT_MARKERrawdatastartshereanditcontinues. 最佳答案 Perl用__DATA__做这个:#!/usr/bin/perlusestrict;usewarnings;while(){print;}__DATA__Texttoprintgoeshere 关于ruby-如何将脚
Rackup通过Rack的默认处理程序成功运行任何Rack应用程序。例如:classRackAppdefcall(environment)['200',{'Content-Type'=>'text/html'},["Helloworld"]]endendrunRackApp.new但是当最后一行更改为使用Rack的内置CGI处理程序时,rackup给出“NoMethodErrorat/undefinedmethod`call'fornil:NilClass”:Rack::Handler::CGI.runRackApp.newRack的其他内置处理程序也提出了同样的反对意见。例如Rack
使用带有Rails插件的vim,您可以创建一个迁移文件,然后一次性打开该文件吗?textmate也可以这样吗? 最佳答案 你可以使用rails.vim然后做类似的事情::Rgeneratemigratonadd_foo_to_bar插件将打开迁移生成的文件,这正是您想要的。我不能代表textmate。 关于ruby-使用VimRails,您可以创建一个新的迁移文件并一次性打开它吗?,我们在StackOverflow上找到一个类似的问题: https://sta
我需要从一个View访问多个模型。以前,我的links_controller仅用于提供以不同方式排序的链接资源。现在我想包括一个部分(我假设)显示按分数排序的顶级用户(@users=User.all.sort_by(&:score))我知道我可以将此代码插入每个链接操作并从View访问它,但这似乎不是“ruby方式”,我将需要在不久的将来访问更多模型。这可能会变得很脏,是否有针对这种情况的任何技术?注意事项:我认为我的应用程序正朝着单一格式和动态页面内容的方向发展,本质上是一个典型的网络应用程序。我知道before_filter但考虑到我希望应用程序进入的方向,这似乎很麻烦。最终从任何
我想要做的是有2个不同的Controller,client和test_client。客户端Controller已经构建,我想创建一个test_clientController,我可以使用它来玩弄客户端的UI并根据需要进行调整。我主要是想绕过我在客户端中内置的验证及其对加载数据的管理Controller的依赖。所以我希望test_clientController加载示例数据集,然后呈现客户端Controller的索引View,以便我可以调整客户端UI。就是这样。我在test_clients索引方法中试过这个:classTestClientdefindexrender:template=>