Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

3
Como selecionar rapidamente variáveis ​​importantes de um conjunto de dados muito grande?
Eu tenho um conjunto de dados com cerca de 2.000 variáveis ​​binárias / 200.000 linhas e estou tentando prever uma única variável dependente binária. Meu principal objetivo, neste estágio, não é obter precisão de previsão, mas identificar quais dessas variáveis ​​são preditores importantes. Gostaria de reduzir o número de variáveis …


2
Permitir que os dados determinem os anteriores e, em seguida, execute o modelo usando esses anteriores? (por exemplo, anteriores orientados a dados do mesmo conjunto de dados)
Entendo que não devemos permitir que o mesmo conjunto de dados que estamos analisando direcione / defina como são as distribuições anteriores em uma análise bayesiana. Especificamente, não é apropriado definir distribuições anteriores para uma análise bayesiana com base em estatísticas resumidas do mesmo conjunto de dados que você utilizará …
9 bayesian  prior 





6
Como agrupar / centralizar variáveis ​​em R?
Bloqueado . Esta pergunta e suas respostas estão bloqueadas porque a questão está fora do tópico, mas tem um significado histórico. No momento, não está aceitando novas respostas ou interações. As funções que eu estou familiarizado incluem a escala da base R, a nova escala do ARM. Talvez a melhor …

1
Como interpretar valores de p de 0 ou 1?
Fiz uma ANOVA descobrindo, por exemplo, uma interação entre gênero e série do que gostaria de saber em que séries meninos e meninas diferem, mas em muitos casos encontro valores-p (ajustados) de 0 e 1. Como / por que isso é possível? Não parece certo ... as.factor(gender) 1 16 16.2 …
9 r 


3
Efeitos aleatórios podem ser aplicados apenas a variáveis ​​categóricas?
Essas perguntas podem parecer estúpidas, mas ... é correto que efeitos aleatórios possam ser aplicados apenas a variáveis ​​categóricas (como identificação individual, identificação de população, ...), por exemplo, digamos que é uma variável categórica:xixix_i ~ β x iyiyiy_iβxiβxi\beta_{x_i} ~ N o r m ( μ , ô 2 )βxiβxi\beta_{x_i}Norm(μ,δ2)Norm(μ,δ2)Norm(\mu, \delta^2) …

3
Como posso simular microdados do censo para pequenas áreas usando uma amostra de microdados a 1% em grande escala e agregar estatísticas na pequena área?
Eu gostaria de realizar uma análise multivariada em nível individual em pequenos níveis de agregação geográfica (distritos de coleta de censo da Austrália). Claramente, o censo não está disponível nesses pequenos níveis de agregação por razões de privacidade, por isso estou investigando outras alternativas. Quase todas as variáveis ​​de interesse …




Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.