Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

3
Previsão de variação de dados heterocedásticos
Estou tentando fazer uma regressão em dados heterocedásticos em que estou tentando prever as variações de erro, bem como os valores médios em termos de um modelo linear. Algo assim: y(x,t)ξ(x,t)y¯(x,t)σ(x,t)=y¯(x,t)+ξ(x,t),∼N(0,σ(x,t)),=y0+ax+bt,=σ0+cx+dt.y(x,t)=y¯(x,t)+ξ(x,t),ξ(x,t)∼N(0,σ(x,t)),y¯(x,t)=y0+ax+bt,σ(x,t)=σ0+cx+dt.\begin{align}\\ y\left(x,t\right) &= \bar{y}\left(x,t\right)+\xi\left(x,t\right),\\ \xi\left(x,t\right) &\sim N\left(0,\sigma\left(x,t\right)\right),\\ \bar{y}\left(x,t\right) &= y_{0}+ax+bt,\\ \sigma\left(x,t\right) &= \sigma_{0}+cx+dt. \end{align} Em palavras, os dados consistem em …



2
Regressão de Ridge - interpretação bayesiana
Ouvi dizer que a regressão de cordilheira pode ser derivada como a média de uma distribuição posterior, se o prior for adequadamente escolhido. A intuição de que as restrições definidas nos coeficientes de regressão pelas anteriores (por exemplo, distribuições normais padrão em torno de 0) são idênticas / substitui a …


1
O que significa explicar a variação?
Em particular, estou me perguntando por que temos esse conceito Múltiplo R (que posso entender como a correlação entre as pontuações observadas e previstas na regressão múltipla) e, em seguida, um conceito separado R ao quadrado, que é apenas o quadrado ou R. Fui informado de que R ao quadrado …


3
SVM para dados não balanceados
Quero tentar usar SVMs (Support Vector Machines) no meu conjunto de dados. Antes de tentar o problema, fui avisado de que os SVMs não apresentam bom desempenho em dados extremamente desequilibrados. No meu caso, posso ter entre 95 e 98% de 0 e 2-5% de 1. Tentei encontrar recursos que …

2
Cálculo da AIC “manualmente” em R
Eu tentei calcular o AIC de uma regressão linear em R, mas sem usar a AICfunção, assim: lm_mtcars <- lm(mpg ~ drat, mtcars) nrow(mtcars)*(log((sum(lm_mtcars$residuals^2)/nrow(mtcars))))+(length(lm_mtcars$coefficients)*2) [1] 97.98786 No entanto, AICfornece um valor diferente: AIC(lm_mtcars) [1] 190.7999 Alguém poderia me dizer o que estou fazendo de errado?


4
Armadilhas a evitar ao transformar dados?
Consegui uma forte relação linear entre minha variável e Y após transformar duplamente a resposta. O modelo era Y ∼ X, mas eu o transformei em √XXXYYYY∼XY∼XY\sim X melhorarR20,19-0,76.YX−−√∼X−−√YX∼X\sqrt{\frac{Y}{X}}\sim \sqrt{X}R2R2R^2 Claramente fiz uma cirurgia decente sobre esse relacionamento. Alguém pode discutir as armadilhas de fazer isso, como perigos de transformações …

1
Como obter previsões estritamente positivas?
Estou trabalhando em uma série temporal cujos valores são estritamente positivos . Trabalhando com vários modelos, incluindo AR, MA, ARMA, etc, não consegui encontrar uma maneira fácil de obter previsões estritamente positivas. Estou usando R para fazer minhas previsões, e tudo o que pude encontrar foi forecast.hts {hts} que possui …



1
Qual é a intuição por trás de amostras intercambiáveis ​​sob a hipótese nula?
Os testes de permutação (também chamados de teste de randomização, teste de re-randomização ou teste exato) são muito úteis e úteis quando a suposição de distribuição normal exigida por, por exemplo, t-testnão é atendida e quando a transformação dos valores pela classificação do teste não-paramétrico como Mann-Whitney-U-testlevaria a mais informações …
15 hypothesis-testing  permutation-test  exchangeability  r  statistical-significance  loess  data-visualization  normal-distribution  pdf  ggplot2  kernel-smoothing  probability  self-study  expected-value  normal-distribution  prior  correlation  time-series  regression  heteroscedasticity  estimation  estimators  fisher-information  data-visualization  repeated-measures  binary-data  panel-data  mathematical-statistics  coefficient-of-variation  normal-distribution  order-statistics  regression  machine-learning  one-class  probability  estimators  forecasting  prediction  validation  finance  measurement-error  variance  mean  spatial  monte-carlo  data-visualization  boxplot  sampling  uniform  chi-squared  goodness-of-fit  probability  mixture  theory  gaussian-mixture  regression  statistical-significance  p-value  bootstrap  regression  multicollinearity  correlation  r  poisson-distribution  survival  regression  categorical-data  ordinal-data  ordered-logit  regression  interaction  time-series  machine-learning  forecasting  cross-validation  binomial  multiple-comparisons  simulation  false-discovery-rate  r  clustering  frequency  wilcoxon-mann-whitney  wilcoxon-signed-rank  r  svm  t-test  missing-data  excel  r  numerical-integration  r  random-variable  lme4-nlme  mixed-model  weighted-regression  power-law  errors-in-variables  machine-learning  classification  entropy  information-theory  mutual-information 

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.