Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados


2
Estatística PRESS para regressão de crista
Nos mínimos quadrados comuns, regredindo um vetor alvo contra um conjunto de preditores , a matriz de chapéu é calculada comoyyyXXX H=X(XtX)−1XtH=X(XtX)−1XtH = X (X^tX)^{-1} X^t e a PRESS (soma residual prevista dos quadrados) é calculada por SSP=∑i(ei1−hii)2SSP=∑i(ei1−hii)2SS_P = \sum_i \left( \frac{e_i}{1-h_{ii}}\right)^2 onde é o th residual e o são …



1
Imputação de uma variável censurada
Eu tenho um conjunto de dados médicos com aproximadamente 200 variáveis. Uma das variáveis ​​é um biomarcador (concentração de uma enzima específica). Sua distribuição está correta, e o problema é que valores acima de um determinado nível são censurados / cortados nesse nível. Portanto, enquanto a média da variável é …

3
É necessário prejudicar e reciclar dados de séries temporais ao usar métodos de aprendizado de máquina?
Por exemplo: Quero prever valores futuros de uma série temporal com base em valores anteriores de várias séries temporais 'usando uma ANN e / ou SVM. As entradas terão valores defasados ​​em cada série temporal e os resultados serão previsões um passo à frente (previsões com horizontes adicionais serão feitas …

4
Erro médio quadrático ou erro quadrático médio
Como um falante de inglês não nativo, fiquei pensando qual expressão quadrada ou quadrada eu deveria usar. Por exemplo, em média quadrada de erro ou média quadrado erro. Segundo a Internet, parece que ambas as formas são usadas indistintamente. Uma expressão é mais quadrada que a outra?

1
Técnicas para aprendizado on-line incremental do classificador em dados de fluxo
Quais podem ser boas técnicas para enfrentar esse problema abstrato? Você tem um fluxo de dados de um sinal contínuo, como o de um sensor físico. Esse sinal tem valores reais (discretizados), nenhum atributo; características adicionais (por exemplo, potência, correlação automática, entropia) podem ser extraídas. Você pode atribuir uma etiqueta …

1
Como funciona a imputação de ratos?
Fiquei me perguntando se alguém tinha experiência usando a função de ratos, como descrito em ratos: Imputação multivariada por equações encadeadas em R (JSS 2011 45 (3))? Eu tenho um conjunto de dados com um número de variáveis, cada uma com diferentes graus de dados ausentes. Minha pergunta principal é: …


2
Taxa de aceitação no algoritmo Metropolis – Hastings
No algoritmo Metropolis – Hastings para amostragem de uma distribuição de destino, deixe: πEuπEu\pi_{i} seja a densidade alvo no estadoEuEui , πjπj\pi_j é a densidade alvo no estado propostojjj , heu jhEujh_{ij} é a densidade proposta para a transição para o estadojjj dado o estado atualEuEui , umaeu jumaEuja_{ij} é …

4
Melhor método para transformar sequência de baixa discrepância em distribuição normal?
Há algum tempo que uso seqüências de baixa discrepância nas Distribuições uniformes, pois achei suas propriedades úteis (principalmente em computação gráfica por sua aparência aleatória e por sua capacidade de cobrir densamente [0,1] de maneira incremental). Por exemplo, valores aleatórios acima, valores da sequência de Halton abaixo: Eu estava pensando …

1
Técnicas de categorização / segmentação
Primeiro, deixe-me dizer que estou um pouco fora da minha profundidade aqui; portanto, se essa pergunta precisar ser reformulada ou encerrada como duplicada, informe-me. Pode ser que eu não tenha o vocabulário adequado para expressar minha pergunta. Estou trabalhando em uma tarefa de processamento de imagem na qual identifico recursos …



Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.