python - 如何解决 xml.etree.ElementTree.iterparse() 中的 Unicode 错误？

coder 2024-06-27 原文

我正在使用 Python 的 xml.etree.ElementTree 模块的 iterparse() 方法读取一个巨大的(数千兆字节)XML 文件。问题是在某些 XML 文件的文本中偶尔会出现 Unicode 错误(或者至少 Python 3 认为是 Unicode 错误)。我的循环是这样设置的:

import xml.etree.ElementTree as etree

def foo():
    # ...
    f = open(filename, encoding='utf-8')
    xmlit = iter(etree.iterparse(f, events=('start', 'end')))
    (event, root) = next(xmlit)
    for (event, elem) in xmlit: # line 26
        if event != 'end':
            continue
        if elem.tag == 'foo':
            do_something()
            root.clear()
        elif elem.tag == 'bar':
            do_something_else()
            root.clear()
    # ...

当遇到带有 Unicode 错误的元素时，我得到一个带有以下回溯的错误:

Traceback (most recent call last):
  File "<path to above file>", line 26, in foo
    for (event, elem) in xmlit:
  File "C:\Python32\lib\xml\etree\ElementTree.py", line 1314, in __next__
    self._parser.feed(data)
  File "C:\Python32\lib\xml\etree\ElementTree.py", line 1668, in feed
    self._parser.Parse(data, 0)
UnicodeEncodeError: 'utf-8' codec can't encode character '\ud800' in position 16383: surrogates not allowed

由于错误发生在 for 循环迭代之间，我唯一可以包装 try block 的地方是 for 循环之外，它将意味着我无法继续下一个 XML 元素。

我的解决方案优先级如下:

接收一个不一定有效的 Unicode 字符串作为元素的文本，而不是引发异常。
接收替换或删除无效字符的有效 Unicode 字符串。
跳过包含无效字符的元素并转到下一个元素。

如何在不亲自修改 ElementTree 代码的情况下实现这些解决方案？

最佳答案

首先，关于 ElementTree 的所有内容在这里可能都不相关。尝试枚举 f = open(filename, encoding='utf-8') 返回的文件，您可能会遇到同样的错误。

如果是这样，解决方案是覆盖默认编码错误处理程序，如 the docs 中所述。 :

errors is an optional string that specifies how encoding and decoding errors are to be handled–this cannot be used in binary mode. Pass 'strict' to raise a ValueError exception if there is an encoding error (the default of None has the same effect), or pass 'ignore' to ignore errors. (Note that ignoring encoding errors can lead to data loss.) 'replace' causes a replacement marker (such as '?') to be inserted where there is malformed data. When writing, 'xmlcharrefreplace' (replace with the appropriate XML character reference) or 'backslashreplace' (replace with backslashed escape sequences) can be used. Any other error handling name that has been registered with codecs.register_error() is also valid.

所以，你可以这样做:

f = open(filename, encoding='utf-8', errors='replace')

这符合您的第二要务——无效字符将被替换为 '?'。

没有办法满足您的第一优先级，因为没有办法表示“不一定有效的 Unicode 字符串”。根据定义，Unicode 字符串是一系列 Unicode 代码点，这就是 Python 处理 str 类型的方式。如果您有无效的 UTF-8 并想将其转换为字符串，则需要指定如何将其转换为字符串——这就是 errors 的用途.

或者，您可以以二进制模式打开文件，将 UTF-8 作为 bytes 对象单独保留，而不是尝试将其转换为 Unicode str对象，但是您只能使用与 bytes 对象一起工作的 API。 (我相信 ElementTree 的 lxml 实现实际上可以做到这一点，但内置的不能，但不要引用我的话。)但即使你这样做了，它不会让你走得太远，因为 XML 代码本身会尝试解释无效的 UTF-8，然后它需要知道你想对错误做什么，这通常会更难指定，因为它在更下方。

最后一点:

Since the error occurs in between for loop iterations, the only place I can wrap a try block is outside the for loop, which would mean I cannot continue to the next XML element.

好吧，您实际上不必使用for 循环；您可以将其转换为带有显式 next 调用的 while 循环。任何时候您需要执行此操作，这通常表明您做错了什么 — 但有时这表明您正在处理损坏的库，这是唯一可用的解决方法。

这个:

for (event, elem) in xmlit: # line 26
    doStuffWith(event, elem)

实际上等同于:

while True:
    try:
        event, elem = next(xmlit)
    except StopIteration:
        break
    doStuffWith(event, elem)

现在，有一个明显的地方可以添加 try — 尽管您甚至不需要这样做；您可以将另一个 except 附加到现有的 try。

问题是，你要在这里做什么？无法保证迭代器在抛出异常后能够继续。事实上，所有创建迭代器的最简单方法都不能够这样做。在这种情况下，您可以自行测试是否属实。

在极少数情况下，当您需要这样做并且它确实有帮助时，您可能希望将其包装起来。像这样:

def skip_exceptions(it):
    while True:
      try:
          yield next(it)
      except StopIteration:
          raise
      except Exception as e:
          logging.info('Skipping iteration because of exception {}'.format(e))

然后你就可以:

for (event, elem) in skip_exceptions(xmlit):
    doStuffWith(event, elem)

关于python - 如何解决 xml.etree.ElementTree.iterparse() 中的 Unicode 错误？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/14163801/

ElementTree iterparse code 39 Unicode python xml python-3.x

有关python - 如何解决 xml.etree.ElementTree.iterparse() 中的 Unicode 错误？的更多相关文章

ruby - 如何使用 Nokogiri 的 xpath 和 at_xpath 方法 - 2
我正在学习如何使用Nokogiri，根据这段代码我遇到了一些问题:require'rubygems'require'mechanize'post_agent=WWW::Mechanize.newpost_page=post_agent.get('http://www.vbulletin.org/forum/showthread.php?t=230708')puts"\nabsolutepathwithtbodygivesnil"putspost_page.parser.xpath('/html/body/div/div/div/div/div/table/tbody/tr/td/div
ruby - 如何从 ruby 中的字符串运行任意对象方法？ - 2
总的来说，我对ruby还比较陌生，我正在为我正在创建的对象编写一些rspec测试用例。许多测试用例都非常基础，我只是想确保正确填充和返回值。我想知道是否有办法使用循环结构来执行此操作。不必为我要测试的每个方法都设置一个assertEquals。例如:describeitem,"TestingtheItem"doit"willhaveanullvaluetostart"doitem=Item.new#HereIcoulddotheitem.name.shouldbe_nil#thenIcoulddoitem.category.shouldbe_nilendend但我想要一些方法来使用
ruby - 其他文件中的 Rake 任务 - 2
我试图在一个项目中使用rake，如果我把所有东西都放到Rakefile中，它会很大并且很难读取/找到东西，所以我试着将每个命名空间放在lib/rake中它自己的文件中，我添加了这个到我的rake文件的顶部:Dir['#{File.dirname(__FILE__)}/lib/rake/*.rake'].map{|f|requiref}它加载文件没问题，但没有任务。我现在只有一个.rake文件作为测试，名为“servers.rake”，它看起来像这样:namespace:serverdotask:testdoputs"test"endend所以当我运行rakeserver:testid时
ruby-on-rails - Ruby net/ldap 模块中的内存泄漏 - 2
作为我的Rails应用程序的一部分，我编写了一个小导入程序，它从我们的LDAP系统中吸取数据并将其塞入一个用户表中。不幸的是，与LDAP相关的代码在遍历我们的32K用户时泄漏了大量内存，我一直无法弄清楚如何解决这个问题。这个问题似乎在某种程度上与LDAP库有关，因为当我删除对LDAP内容的调用时，内存使用情况会很好地稳定下来。此外，不断增加的对象是Net::BER::BerIdentifiedString和Net::BER::BerIdentifiedArray，它们都是LDAP库的一部分。当我运行导入时，内存使用量最终达到超过1GB的峰值。如果问题存在，我需要找到一些方法来更正我的代
ruby-on-rails - unicode 字符串的长度 - 2
在我的Rails(2.3，Ruby1.8.7)应用程序中，我需要将字符串截断到一定长度。该字符串是unicode，在控制台中运行测试时，例如'א'.length，我意识到返回了双倍长度。我想要一个与编码无关的长度，以便对unicode字符串或latin1编码字符串进行相同的截断。我已经了解了Ruby的大部分unicode资料，但仍然有些一头雾水。应该如何解决这个问题？最佳答案 Rails有一个返回多字节字符的mb_chars方法。试试unicode_string.mb_chars.slice(0,50)
python - 如何使用 Ruby 或 Python 创建一系列高音调和低音调的蜂鸣声？ - 2
关闭。这个问题是opinion-based.它目前不接受答案。想要改进这个问题？更新问题，以便editingthispost可以用事实和引用来回答它.关闭4年前。Improvethisquestion我想在固定时间创建一系列低音和高音调的哔哔声。例如:在150毫秒时发出高音调的蜂鸣声在151毫秒时发出低音调的蜂鸣声200毫秒时发出低音调的蜂鸣声250毫秒的高音调蜂鸣声有没有办法在Ruby或Python中做到这一点？我真的不在乎输出编码是什么(.wav、.mp3、.ogg等等)，但我确实想创建一个输出文件。
ruby-on-rails - Rails 3 中的多个路由文件 - 2
Rails2.3可以选择随时使用RouteSet#add_configuration_file添加更多路由。是否可以在Rails3项目中做同样的事情？最佳答案在config/application.rb中:config.paths.config.routes在Rails3.2(也可能是Rails3.1)中，使用:config.paths["config/routes"] 关于ruby-on-rails-Rails3中的多个路由文件，我们在StackOverflow上找到一个类似的问题
ruby-on-rails - 如何验证 update_all 是否实际在 Rails 中更新 - 2
给定这段代码defcreate@upgrades=User.update_all(["role=?","upgraded"],:id=>params[:upgrade])redirect_toadmin_upgrades_path,:notice=>"Successfullyupgradeduser."end我如何在该操作中实际验证它们是否已保存或未重定向到适当的页面和消息？最佳答案在Rails3中，update_all不返回任何有意义的信息，除了已更新的记录数(这可能取决于您的DBMS是否返回该信息)。http://ar.ru
ruby-on-rails - 'compass watch' 是如何工作的/它是如何与 rails 一起使用的 - 2
我在我的项目目录中完成了compasscreate.和compassinitrails。几个问题:我已将我的.sass文件放在public/stylesheets中。这是放置它们的正确位置吗？当我运行compasswatch时，它不会自动编译这些.sass文件。我必须手动指定文件:compasswatchpublic/stylesheets/myfile.sass等。如何让它自动运行？文件ie.css、print.css和screen.css已放在stylesheets/compiled。如何在编译后不让它们重新出现的情况下删除它们？我自己编译的.sass文件编译成compiled/t
ruby-on-rails - Rails 常用字符串(用于通知和错误信息等) - 2
大约一年前，我决定确保每个包含非唯一文本的Flash通知都将从模块中的方法中获取文本。我这样做的最初原因是为了避免一遍又一遍地输入相同的字符串。如果我想更改措辞，我可以在一个地方轻松完成，而且一遍又一遍地重复同一件事而出现拼写错误的可能性也会降低。我最终得到的是这样的:moduleMessagesdefformat_error_messages(errors)errors.map{|attribute,message|"Error:#{attribute.to_s.titleize}#{message}."}enddeferror_message_could_not_find(obje

python - 如何解决 xml.etree.ElementTree.iterparse() 中的 Unicode 错误？

有关python - 如何解决 xml.etree.ElementTree.iterparse() 中的 Unicode 错误？的更多相关文章

随机推荐