草庐IT

java - 如何处理一个非常大的文本文件?

coder 2023-08-31 原文

我目前正在编写一些需要处理非常大的文本文件(至少几个 GiB)的东西。这里需要的(这是固定的)是:

  • 基于 CSV,遵循 RFC 4180,但嵌入式换行符除外
  • 随机读取行,但主要是逐行读取并接近末尾
  • 在末尾追加几行
  • (换行)。显然,需要重写文件的其余部分,这种情况也很少见,所以目前不是特别重要

文件的大小不允许将其完全保留在内存中(这也是不可取的,因为在附加时应尽快保留更改)。

我曾考虑过使用内存映射区域作为进入文件的窗口,如果请求超出其范围的行,该区域会四处移动。当然,那个阶段我还没有字节级别以上的抽象。为了实际处理内容,我有一个 CharsetDecoder 给我一个 CharBuffer。现在的问题是,我可以在 CharBuffer 中处理文本行,但我还需要知道该行在文件中的字节偏移量(以保留行索引的缓存和偏移量,这样我就不必再次从头扫描文件来查找特定行)。

有没有办法将 CharBuffer 中的偏移量映射到匹配的 ByteBuffer 中的偏移量?对于 ASCII 或 ISO-8859-* 来说显然是微不足道的,对于 UTF-8 和 ISO 2022 或 BOCU-1 来说事情会变得非常丑陋(并不是我实际上期望后两者,但 UTF-8 应该是这里的默认值– 仍然存在问题)。

我想我可以再次将CharBuffer 的一部分转换为字节并使用长度。要么它有效,要么我遇到变音符号问题,在这种情况下,我可能会强制使用 NFC 或 NFD 以确保文本始终被明确编码。

不过,我想知道这是否是去这里的方式。有更好的选择吗?

预计到达时间:此处对常见问题和建议的一些回复:

这是用于模拟运行的数据存储,旨在成为成熟数据库的小型本地替代方案。我们确实也有数据库后端,并且它们已被使用,但对于它们不可用或不适用的情况,我们确实需要它。

我也只支持 CSV 的一个子集(没有嵌入式换行符),但目前还可以。这里的问题点几乎是我无法预测行有多长,因此需要创建文件的粗略映射。

至于我上面概述的:我一直在思考的问题是我可以很容易地在字符级别(U+000D + U+000A)上确定一行的结尾,但是我不想假设这个在字节级别上看起来像 0A 0D(对于 UTF-16 已经失败,例如,它是 0D 00 0A 0000 0D 00 0A)。我的想法是,我可以通过不硬编码我当前使用的编码细节来改变字符编码。但我想我可以坚持使用 UTF-8 并忽略其他所有内容。不过,不知何故感觉不对。

最佳答案

在 Java 字符序列(实际上是 UTF-16)和字节之间保持 1:1 映射非常困难,字节可以是任何内容,具体取决于您的文件编码。即使使用 UTF-8,1 个字节到 1 个字符的“明显”映射也仅适用于 ASCII。 UTF-16 和 UTF-8 都不能保证一个 unicode 字符可以存储在单机 charbyte 中。

我会将我的窗口作为字节缓冲区而不是字符缓冲区维护到文件中。然后为了在字节缓冲区中找到行结尾,我将 Java 字符串 "\r\n"(或者可能只是 "\n")编码为字节序列使用与文件所在的编码相同的编码。然后我将使用该字节序列在字节缓冲区中搜索行结尾。缓冲区中结束的行的位置 + 缓冲区距文件开头的偏移量精确映射到行结束的文件中的字节位置。

追加行只是寻找文件末尾并添加新行的一种情况。换行更棘手。我想我会维护一个列表或 map ,其中包含更改行的字节位置以及更改内容。准备好编写更改时:

  1. 按字节位置对更改列表进行排序
  2. 读取原始文件直到下一次更改并将其写入临时文件。
  3. 将更改的行写入临时文件。
  4. 跳过原始文件中更改的行。
  5. 除非您已到达原始文件的末尾,否则返回第 2 步
  6. 将临时文件移到原始文件上。

关于java - 如何处理一个非常大的文本文件?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/4722743/

有关java - 如何处理一个非常大的文本文件?的更多相关文章

  1. ruby - 使用 Vim Rails,您可以创建一个新的迁移文件并一次性打开它吗? - 2

    使用带有Rails插件的vim,您可以创建一个迁移文件,然后一次性打开该文件吗?textmate也可以这样吗? 最佳答案 你可以使用rails.vim然后做类似的事情::Rgeneratemigratonadd_foo_to_bar插件将打开迁移生成的文件,这正是您想要的。我不能代表textmate。 关于ruby-使用VimRails,您可以创建一个新的迁移文件并一次性打开它吗?,我们在StackOverflow上找到一个类似的问题: https://sta

  2. ruby-on-rails - Rails - 一个 View 中的多个模型 - 2

    我需要从一个View访问多个模型。以前,我的links_controller仅用于提供以不同方式排序的链接资源。现在我想包括一个部分(我假设)显示按分数排序的顶级用户(@users=User.all.sort_by(&:score))我知道我可以将此代码插入每个链接操作并从View访问它,但这似乎不是“ruby方式”,我将需要在不久的将来访问更多模型。这可能会变得很脏,是否有针对这种情况的任何技术?注意事项:我认为我的应用程序正朝着单一格式和动态页面内容的方向发展,本质上是一个典型的网络应用程序。我知道before_filter但考虑到我希望应用程序进入的方向,这似乎很麻烦。最终从任何

  3. ruby-on-rails - 渲染另一个 Controller 的 View - 2

    我想要做的是有2个不同的Controller,client和test_client。客户端Controller已经构建,我想创建一个test_clientController,我可以使用它来玩弄客户端的UI并根据需要进行调整。我主要是想绕过我在客户端中内置的验证及其对加载数据的管理Controller的依赖。所以我希望test_clientController加载示例数据集,然后呈现客户端Controller的索引View,以便我可以调整客户端UI。就是这样。我在test_clients索引方法中试过这个:classTestClientdefindexrender:template=>

  4. ruby-on-rails - 如果 Object::try 被发送到一个 nil 对象,为什么它会起作用? - 2

    如果您尝试在Ruby中的nil对象上调用方法,则会出现NoMethodError异常并显示消息:"undefinedmethod‘...’fornil:NilClass"然而,有一个tryRails中的方法,如果它被发送到一个nil对象,它只返回nil:require'rubygems'require'active_support/all'nil.try(:nonexisting_method)#noNoMethodErrorexceptionanymore那么try如何在内部工作以防止该异常? 最佳答案 像Ruby中的所有其他对象

  5. ruby - 为什么 SecureRandom.uuid 创建一个唯一的字符串? - 2

    关闭。这个问题需要detailsorclarity.它目前不接受答案。想改进这个问题吗?通过editingthispost添加细节并澄清问题.关闭8年前。Improvethisquestion为什么SecureRandom.uuid创建一个唯一的字符串?SecureRandom.uuid#=>"35cb4e30-54e1-49f9-b5ce-4134799eb2c0"SecureRandom.uuid方法创建的字符串从不重复?

  6. java - 等价于 Java 中的 Ruby Hash - 2

    我真的很习惯使用Ruby编写以下代码:my_hash={}my_hash['test']=1Java中对应的数据结构是什么? 最佳答案 HashMapmap=newHashMap();map.put("test",1);我假设? 关于java-等价于Java中的RubyHash,我们在StackOverflow上找到一个类似的问题: https://stackoverflow.com/questions/22737685/

  7. ruby-on-rails - Enumerator.new 如何处理已通过的 block ? - 2

    我在理解Enumerator.new方法的工作原理时遇到了一些困难。假设文档中的示例:fib=Enumerator.newdo|y|a=b=1loopdoy[1,1,2,3,5,8,13,21,34,55]循环中断条件在哪里,它如何知道循环应该迭代多少次(因为它没有任何明确的中断条件并且看起来像无限循环)? 最佳答案 Enumerator使用Fibers在内部。您的示例等效于:require'fiber'fiber=Fiber.newdoa=b=1loopdoFiber.yieldaa,b=b,a+bendend10.times.m

  8. ruby-on-rails - Rails - 从另一个模型中创建一个模型的实例 - 2

    我有一个正在构建的应用程序,我需要一个模型来创建另一个模型的实例。我希望每辆车都有4个轮胎。汽车模型classCar轮胎模型classTire但是,在make_tires内部有一个错误,如果我为Tire尝试它,则没有用于创建或新建的activerecord方法。当我检查轮胎时,它没有这些方法。我该如何补救?错误是这样的:未定义的方法'create'forActiveRecord::AttributeMethods::Serialization::Tire::Module我测试了两个环境:测试和开发,它们都因相同的错误而失败。 最佳答案

  9. ruby - 用 Ruby 编写一个简单的网络服务器 - 2

    我想在Ruby中创建一个用于开发目的的极其简单的Web服务器(不,不想使用现成的解决方案)。代码如下:#!/usr/bin/rubyrequire'socket'server=TCPServer.new('127.0.0.1',8080)whileconnection=server.acceptheaders=[]length=0whileline=connection.getsheaders想法是从命令行运行这个脚本,提供另一个脚本,它将在其标准输入上获取请求,并在其标准输出上返回完整的响应。到目前为止一切顺利,但事实证明这真的很脆弱,因为它在第二个请求上中断并出现错误:/usr/b

  10. ruby - 一个 YAML 对象可以引用另一个吗? - 2

    我想让一个yaml对象引用另一个,如下所示:intro:"Hello,dearuser."registration:$introThanksforregistering!new_message:$introYouhaveanewmessage!上面的语法只是它如何工作的一个例子(这也是它在thiscpanmodule中的工作方式。)我正在使用标准的ruby​​yaml解析器。这可能吗? 最佳答案 一些yaml对象确实引用了其他对象:irb>require'yaml'#=>trueirb>str="hello"#=>"hello"ir

随机推荐