草庐IT

xml - 将 XML 转换为纯文本 - 我应该如何忽略/处理 XSLT 中的空格?

coder 2024-06-23 原文

我正在尝试使用 XSLT 将 XML 文件转换为 dokuwiki 使用的标记。这在某种程度上确实有效,但 XSL 文件中的缩进被插入到结果中。目前,我有两个选择:完全放弃这个 XSLT 东西,找到另一种方法将 XML 转换为 dokuwiki 标记,或者从 XSL 文件中删除大约 95% 的空白,使它几乎不可读并且成为维护的噩梦。

有没有什么方法可以在 XSL 文件中保持缩进而不将所有空格传递到最终文档?

背景:我正在将 autodoc 工具从静态 HTML 页面迁移到 dokuwiki,这样每当应用程序团队遇到文档记录不佳的代码时,应用程序团队就可以进一步记录由服务器团队开发的 API。其逻辑是为 autodoc 工具预留每个页面的一部分,并允许在该 block 之外的任何地方进行评论。我正在使用 XSLT,因为我们已经拥有可从 XML 转换为 XHTML 的 XSL 文件,而且我假设重写 XSL 比从头开始推出我自己的解决方案更快。

编辑:啊,对,愚蠢的我,我忽略了缩进属性。 (其他背景说明:我是 XSLT 的新手。)另一方面,我仍然需要处理换行符。 Dokuwiki 使用管道来区分表格列,这意味着表格行中的所有数据必须在一行上。有没有一种方法可以抑制输出换行符(只是偶尔),这样我就可以以某种可读的方式为每个表格单元格做一些相当复杂的逻辑?

最佳答案

在 XSLT 转换的结果中出现不需要的空白的三个原因:

  1. 来自源文档中节点之间的空白
  2. 来自源文档节点内的空白
  3. 来自样式表的空白

我将讨论所有这三个,因为很难说出空格的来源,因此您可能需要使用多种策略。

要解决源文档中节点之间的空白,您应该使用 <xsl:strip-space>去除出现在两个节点之间的任何空白,然后使用 <xsl:preserve-space>保留可能出现在混合内容中的重要空白。例如,如果您的源文档如下所示:

<ul>
  <li>This is an <strong>important</strong> <em>point</em></li>
</ul>

然后你会想要忽略 <ul> 之间的空格和 <li></li> 之间和 </ul> , 这并不重要,但保留 <strong> 之间的空白和 <em>元素,重要的(否则你会得到“This is an **important***point*”)。为此使用

<xsl:strip-space elements="*" />
<xsl:preserve-space elements="li" />

elements <xsl:preserve-space> 上的属性基本上应该列出文档中包含混合内容的所有元素。

Aside: using <xsl:strip-space> also reduces the size of the source tree in memory, and makes your stylesheet more efficient, so it's worth doing even if you don't have whitespace problems of this sort.

要解决出现在源文档节点内的空白,您应该使用 normalize-space() .例如,如果您有:

<dt>
  a definition
</dt>

而且您可以确定 <dt> element 不会包含任何你想用它做某事的元素,那么你可以这样做:

<xsl:template match="dt">
  ...
  <xsl:value-of select="normalize-space(.)" />
  ...
</xsl:template>

前导和尾随空格将从 <dt> 的值中去除元素,你只会得到字符串 "a definition" .

要解决来自样式表的空白,这可能是您遇到的问题,当您在模板中包含如下文本时:

<xsl:template match="name">
  Name:
  <xsl:value-of select="." />
</xsl:template>

XSLT 样式表的解析方式与其处理的源文档相同,因此上述 XSLT 被解释为包含 <xsl:template> 的树。带有 match 的元素第一个子节点是文本节点,第二个子节点是 <xsl:value-of> 的属性带有 select 的元素属性。文本节点有前导和尾随空格(包括换行符);因为它是样式表中的文字文本,所以它会被逐字复制到结果中,并带有所有前导和尾随空格。

但是 XSLT 样式表中的 一些 空白被自动去除,即节点之间的空白。您的结果中没有换行符,因为 <xsl:value-of> 之间有换行符和 <xsl:template> 的结束.

要在结果中仅获取您想要的文本,请使用 <xsl:text>像这样的元素:

<xsl:template match="name">
  <xsl:text>Name: </xsl:text>
  <xsl:value-of select="." />
</xsl:template>

XSLT处理器会忽略节点间出现的换行和缩进,只输出<xsl:text>内的文本元素。

关于xml - 将 XML 转换为纯文本 - 我应该如何忽略/处理 XSLT 中的空格?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/184431/

有关xml - 将 XML 转换为纯文本 - 我应该如何忽略/处理 XSLT 中的空格?的更多相关文章

  1. ruby - 如何使用 Nokogiri 的 xpath 和 at_xpath 方法 - 2

    我正在学习如何使用Nokogiri,根据这段代码我遇到了一些问题:require'rubygems'require'mechanize'post_agent=WWW::Mechanize.newpost_page=post_agent.get('http://www.vbulletin.org/forum/showthread.php?t=230708')puts"\nabsolutepathwithtbodygivesnil"putspost_page.parser.xpath('/html/body/div/div/div/div/div/table/tbody/tr/td/div

  2. ruby - 如何从 ruby​​ 中的字符串运行任意对象方法? - 2

    总的来说,我对ruby​​还比较陌生,我正在为我正在创建的对象编写一些rspec测试用例。许多测试用例都非常基础,我只是想确保正确填充和返回值。我想知道是否有办法使用循环结构来执行此操作。不必为我要测试的每个方法都设置一个assertEquals。例如:describeitem,"TestingtheItem"doit"willhaveanullvaluetostart"doitem=Item.new#HereIcoulddotheitem.name.shouldbe_nil#thenIcoulddoitem.category.shouldbe_nilendend但我想要一些方法来使用

  3. ruby - 其他文件中的 Rake 任务 - 2

    我试图在一个项目中使用rake,如果我把所有东西都放到Rakefile中,它会很大并且很难读取/找到东西,所以我试着将每个命名空间放在lib/rake中它自己的文件中,我添加了这个到我的rake文件的顶部:Dir['#{File.dirname(__FILE__)}/lib/rake/*.rake'].map{|f|requiref}它加载文件没问题,但没有任务。我现在只有一个.rake文件作为测试,名为“servers.rake”,它看起来像这样:namespace:serverdotask:testdoputs"test"endend所以当我运行rakeserver:testid时

  4. ruby-on-rails - 在 Rails 中将文件大小字符串转换为等效千字节 - 2

    我的目标是转换表单输入,例如“100兆字节”或“1GB”,并将其转换为我可以存储在数据库中的文件大小(以千字节为单位)。目前,我有这个:defquota_convert@regex=/([0-9]+)(.*)s/@sizes=%w{kilobytemegabytegigabyte}m=self.quota.match(@regex)if@sizes.include?m[2]eval("self.quota=#{m[1]}.#{m[2]}")endend这有效,但前提是输入是倍数(“gigabytes”,而不是“gigabyte”)并且由于使用了eval看起来疯狂不安全。所以,功能正常,

  5. ruby-on-rails - Ruby net/ldap 模块中的内存泄漏 - 2

    作为我的Rails应用程序的一部分,我编写了一个小导入程序,它从我们的LDAP系统中吸取数据并将其塞入一个用户表中。不幸的是,与LDAP相关的代码在遍历我们的32K用户时泄漏了大量内存,我一直无法弄清楚如何解决这个问题。这个问题似乎在某种程度上与LDAP库有关,因为当我删除对LDAP内容的调用时,内存使用情况会很好地稳定下来。此外,不断增加的对象是Net::BER::BerIdentifiedString和Net::BER::BerIdentifiedArray,它们都是LDAP库的一部分。当我运行导入时,内存使用量最终达到超过1GB的峰值。如果问题存在,我需要找到一些方法来更正我的代

  6. python - 如何使用 Ruby 或 Python 创建一系列高音调和低音调的蜂鸣声? - 2

    关闭。这个问题是opinion-based.它目前不接受答案。想要改进这个问题?更新问题,以便editingthispost可以用事实和引用来回答它.关闭4年前。Improvethisquestion我想在固定时间创建一系列低音和高音调的哔哔声。例如:在150毫秒时发出高音调的蜂鸣声在151毫秒时发出低音调的蜂鸣声200毫秒时发出低音调的蜂鸣声250毫秒的高音调蜂鸣声有没有办法在Ruby或Python中做到这一点?我真的不在乎输出编码是什么(.wav、.mp3、.ogg等等),但我确实想创建一个输出文件。

  7. ruby-on-rails - Rails 3 中的多个路由文件 - 2

    Rails2.3可以选择随时使用RouteSet#add_configuration_file添加更多路由。是否可以在Rails3项目中做同样的事情? 最佳答案 在config/application.rb中:config.paths.config.routes在Rails3.2(也可能是Rails3.1)中,使用:config.paths["config/routes"] 关于ruby-on-rails-Rails3中的多个路由文件,我们在StackOverflow上找到一个类似的问题

  8. ruby-on-rails - 如何验证 update_all 是否实际在 Rails 中更新 - 2

    给定这段代码defcreate@upgrades=User.update_all(["role=?","upgraded"],:id=>params[:upgrade])redirect_toadmin_upgrades_path,:notice=>"Successfullyupgradeduser."end我如何在该操作中实际验证它们是否已保存或未重定向到适当的页面和消息? 最佳答案 在Rails3中,update_all不返回任何有意义的信息,除了已更新的记录数(这可能取决于您的DBMS是否返回该信息)。http://ar.ru

  9. ruby-on-rails - 'compass watch' 是如何工作的/它是如何与 rails 一起使用的 - 2

    我在我的项目目录中完成了compasscreate.和compassinitrails。几个问题:我已将我的.sass文件放在public/stylesheets中。这是放置它们的正确位置吗?当我运行compasswatch时,它不会自动编译这些.sass文件。我必须手动指定文件:compasswatchpublic/stylesheets/myfile.sass等。如何让它自动运行?文件ie.css、print.css和screen.css已放在stylesheets/compiled。如何在编译后不让它们重新出现的情况下删除它们?我自己编译的.sass文件编译成compiled/t

  10. ruby - 使用 ruby​​ 将 HTML 转换为纯文本并维护结构/格式 - 2

    我想将html转换为纯文本。不过,我不想只删除标签,我想智能地保留尽可能多的格式。为插入换行符标签,检测段落并格式化它们等。输入非常简单,通常是格式良好的html(不是整个文档,只是一堆内容,通常没有anchor或图像)。我可以将几个正则表达式放在一起,让我达到80%,但我认为可能有一些现有的解决方案更智能。 最佳答案 首先,不要尝试为此使用正则表达式。很有可能你会想出一个脆弱/脆弱的解决方案,它会随着HTML的变化而崩溃,或者很难管理和维护。您可以使用Nokogiri快速解析HTML并提取文本:require'nokogiri'h

随机推荐