Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

4
Que proporção de distribuições independentes fornece uma distribuição normal?
A proporção de duas distribuições normais independentes fornece uma distribuição de Cauchy. A distribuição t é uma distribuição normal dividida por uma distribuição qui-quadrado independente. A proporção de duas distribuições qui-quadrado independentes fornece uma distribuição F. Estou procurando uma razão de distribuições contínuas independentes que forneçam uma variável aleatória normalmente …

1
Como encontrar um intervalo de previsão do GBM
Estou trabalhando com modelos GBM usando o pacote de interpolação e procurando um método para resolver os intervalos de previsão dos meus dados previstos. Eu pesquisei bastante, mas só tenho algumas idéias para encontrar intervalos de previsão para a Floresta Aleatória. Qualquer ajuda / código R seria muito apreciada!



1
t.test retorna um erro "os dados são essencialmente constantes"
R version 3.1.1 (2014-07-10) -- "Sock it to Me" > bl <- c(140, 138, 150, 148, 135) > fu <- c(138, 136, 148, 146, 133) > t.test(fu, bl, alternative = "two.sided", paired = TRUE) Error in t.test.default(fu, bl, alternative = "two.sided", paired = TRUE) : data are essentially constant Depois, …
12 r  t-test 

4
Boa forma de remover valores discrepantes?
Estou trabalhando em estatísticas para compilações de software. Eu tenho dados para cada build em aprovação / reprovação e tempo decorrido e geramos ~ 200 deles / semana. A taxa de sucesso é fácil de agregar, posso dizer que 45% passaram em uma determinada semana. Mas também gostaria de agregar …



1
Compreendendo a saída da análise de mediação em R
Estou tentando entender o pacote de mediação em R, usando a vinheta do pacote. Estou lutando para entender a saída da mediate()função. require("mediation") require("sandwich") data("framing") med.fit <- lm(emo ~ treat + age + educ + gender + income, data = framing) out.fit <- glm(cong_mesg ~ emo + treat + age …
12 r  mediation 


3
A ideia de fazer com que os dados tenham média zero
Costumo ver pessoas que fazem com que uma dimensão / recurso de um conjunto de dados seja de média zero, removendo a média de todos os elementos. Mas eu nunca entendi por que fazer isso? Qual é o efeito de fazer isso como uma etapa de pré-processamento? Melhora o desempenho …


3
Qual é a melhor maneira de remodelar / reestruturar dados?
Sou assistente de pesquisa de um laboratório (voluntário). Eu e um pequeno grupo fomos encarregados da análise de dados para um conjunto de dados extraídos de um grande estudo. Infelizmente, os dados foram coletados com um aplicativo on-line de algum tipo e não foram programados para gerar os dados da …
12 r  excel  data-cleaning 

2
São normalmente distribuídos X e Y com maior probabilidade de resultar em resíduos normalmente distribuídos?
Aqui, a interpretação errônea da suposição de normalidade na regressão linear é discutida (que a 'normalidade' refere-se ao X e / ou Y ao invés dos resíduos), e o pôster pergunta se é possível ter X e Y distribuídos normalmente. e ainda tem resíduos normalmente distribuídos. Minha pergunta é: normalmente …

3
Qual teste estatístico usar no teste A / B?
Temos duas coortes de 1000 amostras cada. Medimos 2 quantidades em cada coorte. O primeiro é uma variável binária. O segundo é um número real que segue uma distribuição de cauda pesada. Queremos avaliar qual coorte apresenta melhor desempenho para cada métrica. Há muitos testes estatísticos para você escolher: as …
12 ab-test 

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.