Quero fazer uma solicitação HTTP usando o node.js para carregar algum texto de um servidor da web. Como a resposta pode conter muito texto (alguns megabytes), desejo processar cada parte do texto separadamente. Eu posso conseguir isso usando o seguinte código:
var req = http.request(reqOptions, function(res) {
...
res.setEncoding('utf8');
res.on('data', function(textChunk) {
// process utf8 text chunk
});
});
Isso parece funcionar sem problemas. No entanto, eu quero suportar a compactação HTTP, então eu uso o zlib:
var zip = zlib.createUnzip();
// NO res.setEncoding('utf8') here since we need the raw bytes for zlib
res.on('data', function(chunk) {
// do something like checking the number of bytes downloaded
zip.write(chunk); // give the raw bytes to zlib, s.b.
});
zip.on('data', function(chunk) {
// convert chunk to utf8 text:
var textChunk = chunk.toString('utf8');
// process utf8 text chunk
});
Isso pode ser um problema para caracteres de vários bytes, como o '\u00c4'que consiste em dois bytes: 0xC3e 0x84. Se o primeiro byte for coberto pelo primeiro pedaço ( Buffer) e o segundo byte pelo segundo pedaço, chunk.toString('utf8')ele produzirá caracteres incorretos no final / início do pedaço de texto. Como posso evitar isso?
Dica: Eu ainda preciso do buffer (mais especificamente o número de bytes no buffer) para limitar o número de bytes baixados. Portanto, usar res.setEncoding('utf8')como no primeiro código de exemplo acima para dados não compactados não se adequa às minhas necessidades.