converter buffers transmitidos em utf8-string


183

Quero fazer uma solicitação HTTP usando o node.js para carregar algum texto de um servidor da web. Como a resposta pode conter muito texto (alguns megabytes), desejo processar cada parte do texto separadamente. Eu posso conseguir isso usando o seguinte código:

var req = http.request(reqOptions, function(res) {
    ...
    res.setEncoding('utf8');
    res.on('data', function(textChunk) {
        // process utf8 text chunk
    });
});

Isso parece funcionar sem problemas. No entanto, eu quero suportar a compactação HTTP, então eu uso o zlib:

var zip = zlib.createUnzip();

// NO res.setEncoding('utf8') here since we need the raw bytes for zlib
res.on('data', function(chunk) {
    // do something like checking the number of bytes downloaded
    zip.write(chunk); // give the raw bytes to zlib, s.b.
});

zip.on('data', function(chunk) {
    // convert chunk to utf8 text:
    var textChunk = chunk.toString('utf8');

    // process utf8 text chunk
});

Isso pode ser um problema para caracteres de vários bytes, como o '\u00c4'que consiste em dois bytes: 0xC3e 0x84. Se o primeiro byte for coberto pelo primeiro pedaço ( Buffer) e o segundo byte pelo segundo pedaço, chunk.toString('utf8')ele produzirá caracteres incorretos no final / início do pedaço de texto. Como posso evitar isso?

Dica: Eu ainda preciso do buffer (mais especificamente o número de bytes no buffer) para limitar o número de bytes baixados. Portanto, usar res.setEncoding('utf8')como no primeiro código de exemplo acima para dados não compactados não se adequa às minhas necessidades.

Respostas:


289

Buffer único

Se você tiver um único, Bufferpoderá usar seu toStringmétodo que converterá todo ou parte do conteúdo binário em uma string usando uma codificação específica. O padrão é utf8se você não fornecer um parâmetro, mas defini explicitamente a codificação neste exemplo.

var req = http.request(reqOptions, function(res) {
    ...

    res.on('data', function(chunk) {
        var textChunk = chunk.toString('utf8');
        // process utf8 text chunk
    });
});

Buffers transmitidos

Se você tiver transmitido buffers como na pergunta acima, onde o primeiro byte de um caractere de vários bytes UTF8pode estar contido no primeiro Buffer(bloco) e o segundo byte no segundo Buffer, você deve usar a StringDecoder. :

var StringDecoder = require('string_decoder').StringDecoder;

var req = http.request(reqOptions, function(res) {
    ...
    var decoder = new StringDecoder('utf8');

    res.on('data', function(chunk) {
        var textChunk = decoder.write(chunk);
        // process utf8 text chunk
    });
});

Dessa forma, bytes de caracteres incompletos são armazenados em buffer pelo StringDecoderaté que todos os bytes necessários sejam gravados no decodificador.


63
Você também pode chunk.toString ('utf8');
Zugwalt

1
Adicione a sugestão acima na sua resposta como uma atualização para benefício de outras pessoas. Muito Obrigado !
FacePalm 21/11

9
@joshperry: sry, mas como o texto da minha pergunta explica: chunk.toString('utf8')nem sempre funciona por causa de caracteres de vários bytes no UTF8. Não entendi por que você mudou minha resposta, que supera explicitamente esse problema usando a StringDecoder. Eu sinto falta de algo aqui? Tenha nodemudado alguma coisa?
Biggie

8
Mudei o título do tópico e editei a resposta. Agora ele mostra as duas soluções: converter buffers transmitidos e um único buffer usando toString.
Biggie

1
Obrigado por mostrar como lidar adequadamente com a situação em que os caracteres de vários bytes são divididos em partes. Muitos outros recursos na Internet ignoram isso completamente, o que leva ao código de buggy que geralmente não falha até que esteja em produção.
Jlh

-4
var fs = require("fs");

function readFileLineByLine(filename, processline) {
    var stream = fs.createReadStream(filename);
    var s = "";
    stream.on("data", function(data) {
        s += data.toString('utf8');
        var lines = s.split("\n");
        for (var i = 0; i < lines.length - 1; i++)
            processline(lines[i]);
        s = lines[lines.length - 1];
    });

    stream.on("end",function() {
        var lines = s.split("\n");
        for (var i = 0; i < lines.length; i++)
            processline(lines[i]);
    });
}

var linenumber = 0;
readFileLineByLine(filename, function(line) {
    console.log(++linenumber + " -- " + line);
});
Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.