Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

2
Regressão linear vs. não-linear
Eu tenho um conjunto de valores xxx e yyy que são teoricamente relacionados exponencialmente: y=axby=axby = ax^b Uma maneira de obter os coeficientes é aplicando logaritmos naturais em ambos os lados e ajustando um modelo linear: > fit <- lm(log(y)~log(x)) > a <- exp(fit$coefficients[1]) > b <- fit$coefficients[2] Outra maneira …

1
Ao construir um modelo de regressão usando conjuntos de modelagem / validação separados, é apropriado "recircular" os dados de validação?
Suponha que eu tenha uma divisão 80/20 entre observações de modelagem / validação. Ajustei um modelo ao conjunto de dados de modelagem e me sinto confortável com o erro que estou vendo no conjunto de dados de validação. Antes de lançar meu modelo para escorar observações futuras, é apropriado combinar …


1
Floresta aleatória e previsão
Estou tentando entender como a Random Forest funciona. Tenho uma idéia de como as árvores são construídas, mas não consigo entender como a Random Forest faz previsões em amostras fora do saco. Alguém poderia me dar uma explicação simples, por favor? :)


1
Variável dependente padronizada dentro de um grupo em modelos de dados em painel?
A padronização de uma variável dependente dentro do grupo de identificação faz sentido? O documento de trabalho a seguir (desaceleração do desmatamento na Amazônia Legal; Preços ou políticas ?, pdf ) usa uma variável dependente padronizada para analisar o efeito da mudança de política geral no Brasil sobre o desmatamento. …


2
Quando registrar / expandir suas variáveis ​​ao usar modelos aleatórios de floresta?
Estou fazendo regressão usando florestas aleatórias para prever preços com base em vários atributos. O código é escrito em Python usando o Scikit-learn. Como você decide se deve transformar suas variáveis ​​usando exp/ logantes de usá-las para se ajustar ao modelo de regressão? É necessário ao usar uma abordagem do …

1
Previsão em modelos de efeitos mistos: o que fazer com efeitos aleatórios?
Vamos considerar este conjunto de dados hipotéticos: set.seed(12345) num.subjects <- 10 dose <- rep(c(1,10,50,100), num.subjects) subject <- rep(1:num.subjects, each=4) group <- rep(1:2, each=num.subjects/2*4) response <- dose*dose/10 * group + rnorm(length(dose), 50, 30) df <- data.frame(dose=dose, response=response, subject=subject, group=group) podemos usar lmepara modelar a resposta com um modelo de efeito aleatório: …

1
Amostra grande assintótica / teoria - Por que se preocupar?
Espero que essa pergunta não seja marcada como "geral demais" e espero que comece uma discussão que beneficie a todos. Nas estatísticas, gastamos muito tempo aprendendo grandes teorias de amostra. Estamos profundamente interessados ​​em avaliar as propriedades assintóticas de nossos estimadores, incluindo se são assintoticamente imparciais, assintoticamente eficientes, sua distribuição …

3
Como calcular os principais componentes rotacionados em varimax em R?
Executei o PCA em 25 variáveis ​​e selecionei os 7 principais PCs usando prcomp. prc <- prcomp(pollutions, center=T, scale=T, retx=T) Eu fiz a rotação varimax nesses componentes. varimax7 <- varimax(prc$rotation[,1:7]) E agora desejo varimax rotacionar os dados rotacionados com PCA (como ele não faz parte do objeto varimax - apenas …
13 r  pca  factor-rotation 


1
Os erros padrão do bootstrap e os intervalos de confiança são apropriados nas regressões em que a suposição de homoscedasticidade é violada?
Se nas regressões OLS padrão, duas suposições são violadas (distribuição normal de erros, homocedasticidade), o bootstrapping de erros padrão e intervalos de confiança é uma alternativa apropriada para obter resultados significativos com relação à significância dos coeficientes do regressor? Os testes de significância com erros padrão de inicialização e intervalos …



Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.