Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

1
Localizando outliers em um gráfico de dispersão
Eu tenho um conjunto de pontos de dados que deveriam ficar em um lugar geométrico e seguir um padrão, mas existem alguns pontos de dispersão do lugar geométrico principal que causam incerteza em minha análise final. Eu gostaria de obter um local limpo para aplicá-lo mais tarde em minha análise. …

1
Que interpretação têm os parâmetros de um modelo linear generalizado com codificação de efeitos?
library(lme4) out <- glmer(cbind(incidence, size - incidence) ~ period + (1 | herd), data = cbpp, family = binomial, contrasts = list(period = "contr.sum")) summary(out) Fixed effects: Estimate Std. Error z value Pr(>|z|) (Intercept) -2.32337 0.22129 -10.499 < 2e-16 *** period1 0.92498 0.18330 5.046 4.51e-07 *** period2 -0.06698 0.22845 -0.293 …


1
Comparando resíduos entre regressões OLS e não OLS
Suponha que você queira estimar um modelo linear: ( nnn observações da resposta p + 1p+1p+1 preditores) E ( yEu) = β0 0+ ∑j = 1pβjxeu jE(yEu)=β0 0+∑j=1pβjxEuj\mathbb{E}(y_i) = \beta_0 + \sum_{j=1}^p \beta_j x_{ij} Uma maneira de fazer isso é através da solução OLS, ou seja, escolha os coeficientes para …



1
Quantificando quanto "mais correlação" uma matriz de correlação A contém em comparação com uma matriz de correlação B
Eu tenho 2 matrizes de correlação e B (usando o coeficiente de correlação linear de Pearson através do corrcoef de Matlab () ). Gostaria de quantificar quanto "mais correlação" A contém comparação com B . Existe alguma métrica ou teste padrão para isso?AAABBBAAABBB Por exemplo, a matriz de correlação contém …


1
Teoria de valores extremos: parâmetros lognormal de GEV
A distribuição Lognormal pertence ao domínio máximo de atração de Gumbel , onde: FlogN(x;μ,σ)=Φ(lnx−μσ)FlogN(x;μ,σ)=Φ(ln⁡x−μσ)F^{logN}(x; \mu,\sigma)=\Phi\left(\frac{\ln x - \mu}{\sigma}\right), FGum(x;μ,β)=e−exp(−x−μβ)FGum(x;μ,β)=e−exp⁡(−x−μβ)F^{Gum}(x;\mu,\beta) = e^{-\exp\left({-\frac{x-\mu}{\beta}}\right)} Minha pergunta : Temos e ?μ=μμ=μ\mu=\muσ=βσ=β\sigma=\beta A distribuição Generalized Extreme Value também usa a notação (Gumbel é o caso limite ), e comparar os CDFs para Standard-Lognormal e Standard-Gumbel …

2
Como preparar interações de variáveis ​​categóricas no scikit-learn?
Qual é a melhor maneira de preparar interações de recursos categóricos antes de se adaptar ao scikit-learn? Com statsmodelseu poderia dizer convenientemente em estilo R smf.ols(formula = 'depvar ~ C(var1)*C(var2)', data=df).fit()(o mesmo em Stata com regress depvar i.var1##i.var2). Pode sklearn.preprocessing.PolynomialFeatures(na v0.15, atualmente dev) ser usado com variáveis ​​categóricas?


1
Residuais em regressão de poisson
O Guia para Iniciantes do Zuur 2013 do GLM e GLMM sugere a validação de uma regressão de Poisson, plotando os resíduos de Pearsons em relação aos valores ajustados. Zuur afirma que não devemos ver os resíduos se espalhando à medida que os valores ajustados aumentam, como o gráfico anexado …


2
Regressão múltipla em estatísticas direcionais / circulares?
Estou tentando desenvolver um modelo preditivo para uma variável dependente angular (em usando várias medidas independentes - também variáveis ​​angulares, em - como preditores. Cada preditor está significativamente, mas não extremamente, fortemente correlacionado com a variável dependente. Como posso combinar os preditores para determinar um modelo preditivo para a variável …


Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.