c - 从C文件中读取unicode字符

coder 2024-06-20 原文

我正在尝试从 .csv 文件中读取 UTF-8 字符串，然后将其写入控制台。

a.csv内容:

Gijón

在对该主题进行了一整天的研究后，我发现执行此类操作的正确方法应该类似于以下内容:

int main(int argc, char *argv[])
{
    char *locale = setlocale(LC_ALL, "");
    printf("locale: %s\n", locale);

    const int MAX_LINE_SIZE = 1024;
    char line[MAX_LINE_SIZE];
    wchar_t wline[MAX_LINE_SIZE];

    // Attempt 0: no special handling
    FILE* stream = fopen("a.csv", "r");
    fgets(line, MAX_LINE_SIZE, stream);
    printf("%s\n", line); // Expected to print "GijÃ³n", prints "GijÃ³n"
    fclose(stream);

    // Attempt 1: mbstowcs
    mbstowcs(wline, line, MAX_LINE_SIZE);
    wprintf(L"%ls\n", wline); // Expected to print "Gijón", prints "GijÃ³n"

    // Attempt 2: fgetws
    stream = fopen("a.csv", "r");
    fgetws(wline, MAX_LINE_SIZE, stream);
    wprintf(L"%ls\n", wline); // Expected to print "Gijón", prints "GijÃ³n"
    fclose(stream);

    // Attempt 3: _wfopen
    stream = _wfopen(L"a.csv", L"rb");
    fgetws(wline, MAX_LINE_SIZE, stream);
    wprintf(L"%ls\n", wline); // Expected to print "Gijón", prints ""
    fclose(stream);

    // Printing command line parameter
    mbstowcs(wline, argv[1], MAX_LINE_SIZE);
    wprintf(L"%ls\n", wline); // Properly prints "Gijón"
}

但是运行这个程序会导致:

.\myprogram.exe Gijón
locale: Spanish_Spain.1252
GijÃ³n
GijÃ³n

Gijón

我不认为这是控制台本身的问题，因为 argv[1] 转换工作正常。

我错过了什么？

最佳答案

wchar_t 和 wide char 函数(wfopen 等)主要在 Windows 中用于处理 UTF16 编码中的 Unicode。

UTF8 使用 char 和相同的 ASCII 兼容 C 函数(fopen 等)要读取 UTF8，您可以对 ASCII 使用相同的 C 函数。

Windows 不完全支持读取和显示 UTF8，因此您必须在 UTF8 和 UTF16 之间进行转换才能正确显示文本。 Windows 10 确实为控制台 Windows 提供 UTF8 支持，请参阅相关主题。

#include <stdio.h>
#include <windows.h>

int main(void)
{
    const char* filename = "a.csv";
    FILE* fp = fopen(filename, "r");
    char buf[1000];
    fgets(buf, sizeof(buf), fp);

    if(strlen(buf) > 2)
        if(strncmp(buf, "\xFF\xFE", 2) == 0)
        {
            printf("UTF16-LE\n");
            fclose(fp);
            fp = fopen(filename, "rb");
            wchar_t wbuf[1000] = { 0 };
            fgets((char*)wbuf, sizeof(buf), fp);
            MessageBoxW(0, wbuf, L"UTF16-LE", 0);
            return 0;
        }

    if(strlen(buf) > 3)
        if(strncmp(buf, "\xEF\xBB\xBF", 3) == 0)
            printf("UTF8 with BOM\n");

    //assume UTF8 and convert to UTF16:
    int size = MultiByteToWideChar(CP_UTF8, 0, buf, -1, NULL, 0);
    wchar_t *utf16 = malloc((size + 1) * sizeof(wchar_t));
    MultiByteToWideChar(CP_UTF8, 0, buf, -1, utf16, size);

    MessageBoxA(0, buf, "ANSI", 0);
    MessageBoxW(0, utf16, L"UTF8 converted", 0);
    return 0;
}

如果源文件是 UTF8，那么您基本上将其视为 ASCII。请注意像 strtok 这样的函数，它不能处理超出 ASCII 范围的输入字符。唯一的其他麻烦是当您尝试在 Windows 中打印它时。将下面的示例与自定义 printf 函数结合使用:

void printf_utf8(const char* format, ...)
{
    va_list args;
    va_start(args, format);
    int len = _vscprintf(format, args) + 1; 
    char *buf = malloc(len);
    vsprintf(buf, format, args);

    //convert to UTF16 and print
    int wbuf_size = MultiByteToWideChar(CP_UTF8, 0, buf, -1, NULL, 0);
    wchar_t *wbuf = malloc((wbuf_size + 1) * sizeof(wchar_t));
    MultiByteToWideChar(CP_UTF8, 0, buf, -1, wbuf, wbuf_size);

    DWORD temp;
    HANDLE h = GetStdHandle(STD_OUTPUT_HANDLE);
    WriteConsoleW(h, wbuf, wcslen(wbuf), &temp, 0);

    free(wbuf);
    free(buf);
}

int main(void)
{
    FILE* fp = fopen("a.csv", "r");
    if(!fp)
        return 0;
    char buf[1000];
    fgets(buf, sizeof(buf), fp);
    printf_utf8("Test %s %d\n", buf, 123);
    return 0;
}

关于c - 从C文件中读取unicode字符，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/52797349/

unicode 从 34 code buf c windows character-encoding console

有关c - 从C文件中读取unicode字符的更多相关文章

ruby - 如何从 ruby 中的字符串运行任意对象方法？ - 2
总的来说，我对ruby还比较陌生，我正在为我正在创建的对象编写一些rspec测试用例。许多测试用例都非常基础，我只是想确保正确填充和返回值。我想知道是否有办法使用循环结构来执行此操作。不必为我要测试的每个方法都设置一个assertEquals。例如:describeitem,"TestingtheItem"doit"willhaveanullvaluetostart"doitem=Item.new#HereIcoulddotheitem.name.shouldbe_nil#thenIcoulddoitem.category.shouldbe_nilendend但我想要一些方法来使用
Ruby 解析字符串 - 2
我有一个字符串input="maybe(thisis|thatwas)some((nice|ugly)(day|night)|(strange(weather|time)))"Ruby中解析该字符串的最佳方法是什么？我的意思是脚本应该能够像这样构建句子:maybethisissomeuglynightmaybethatwassomenicenightmaybethiswassomestrangetime等等，你明白了......我应该一个字符一个字符地读取字符串并构建一个带有堆栈的状态机来存储括号值以供以后计算，还是有更好的方法？也许为此目的准备了一个开箱即用的库？
ruby - 使用 RubyZip 生成 ZIP 文件时设置压缩级别 - 2
我有一个Ruby程序，它使用rubyzip压缩XML文件的目录树。gem。我的问题是文件开始变得很重，我想提高压缩级别，因为压缩时间不是问题。我在rubyzipdocumentation中找不到一种为创建的ZIP文件指定压缩级别的方法。有人知道如何更改此设置吗？是否有另一个允许指定压缩级别的Ruby库？最佳答案这是我通过查看rubyzip内部创建的代码。level=Zlib::BEST_COMPRESSIONZip::ZipOutputStream.open(zip_file)do|zip|Dir.glob("**/*")d
ruby - 其他文件中的 Rake 任务 - 2
我试图在一个项目中使用rake，如果我把所有东西都放到Rakefile中，它会很大并且很难读取/找到东西，所以我试着将每个命名空间放在lib/rake中它自己的文件中，我添加了这个到我的rake文件的顶部:Dir['#{File.dirname(__FILE__)}/lib/rake/*.rake'].map{|f|requiref}它加载文件没问题，但没有任务。我现在只有一个.rake文件作为测试，名为“servers.rake”，它看起来像这样:namespace:serverdotask:testdoputs"test"endend所以当我运行rakeserver:testid时
ruby-on-rails - 在 Rails 中将文件大小字符串转换为等效千字节 - 2
我的目标是转换表单输入，例如“100兆字节”或“1GB”，并将其转换为我可以存储在数据库中的文件大小(以千字节为单位)。目前，我有这个:defquota_convert@regex=/([0-9]+)(.*)s/@sizes=%w{kilobytemegabytegigabyte}m=self.quota.match(@regex)if@sizes.include?m[2]eval("self.quota=#{m[1]}.#{m[2]}")endend这有效，但前提是输入是倍数(“gigabytes”，而不是“gigabyte”)并且由于使用了eval看起来疯狂不安全。所以，功能正常，
ruby-on-rails - unicode 字符串的长度 - 2
在我的Rails(2.3，Ruby1.8.7)应用程序中，我需要将字符串截断到一定长度。该字符串是unicode，在控制台中运行测试时，例如'א'.length，我意识到返回了双倍长度。我想要一个与编码无关的长度，以便对unicode字符串或latin1编码字符串进行相同的截断。我已经了解了Ruby的大部分unicode资料，但仍然有些一头雾水。应该如何解决这个问题？最佳答案 Rails有一个返回多字节字符的mb_chars方法。试试unicode_string.mb_chars.slice(0,50)
ruby-on-rails - Rails 3 中的多个路由文件 - 2
Rails2.3可以选择随时使用RouteSet#add_configuration_file添加更多路由。是否可以在Rails3项目中做同样的事情？最佳答案在config/application.rb中:config.paths.config.routes在Rails3.2(也可能是Rails3.1)中，使用:config.paths["config/routes"] 关于ruby-on-rails-Rails3中的多个路由文件，我们在StackOverflow上找到一个类似的问题
ruby - 将差异补丁应用于字符串/文件 - 2
对于具有离线功能的智能手机应用程序，我正在为Xml文件创建单向文本同步。我希望我的服务器将增量/差异(例如GNU差异补丁)发送到目标设备。这是计划:Time=0Server:hasversion_1ofXmlfile(~800kiB)Client:hasversion_1ofXmlfile(~800kiB)Time=1Server:hasversion_1andversion_2ofXmlfile(each~800kiB)computesdeltaoftheseversions(=patch)(~10kiB)sendspatchtoClient(~10kiBtransferred)Cl
ruby-on-rails - Rails 常用字符串(用于通知和错误信息等) - 2
大约一年前，我决定确保每个包含非唯一文本的Flash通知都将从模块中的方法中获取文本。我这样做的最初原因是为了避免一遍又一遍地输入相同的字符串。如果我想更改措辞，我可以在一个地方轻松完成，而且一遍又一遍地重复同一件事而出现拼写错误的可能性也会降低。我最终得到的是这样的:moduleMessagesdefformat_error_messages(errors)errors.map{|attribute,message|"Error:#{attribute.to_s.titleize}#{message}."}enddeferror_message_could_not_find(obje
ruby - 如何将脚本文件的末尾读取为数据文件(Perl 或任何其他语言) - 2
我正在寻找执行以下操作的正确语法(在Perl、Shell或Ruby中):#variabletoaccessthedatalinesappendedasafileEND_OF_SCRIPT_MARKERrawdatastartshereanditcontinues. 最佳答案 Perl用__DATA__做这个:#!/usr/bin/perlusestrict;usewarnings;while(){print;}__DATA__Texttoprintgoeshere 关于ruby-如何将脚

c - 从C文件中读取unicode字符

有关c - 从C文件中读取unicode字符的更多相关文章

随机推荐