Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

1
Por que você precisa fornecer um modelo de variograma quando está krigando?
Sou muito novo em estatísticas espaciais e assisto a muitos tutoriais, Mas eu realmente não entendo por que você precisa fornecer um modelo de variograma quando krige. Estou usando o pacote gstat no R, e este é o exemplo que eles fornecem: library(sp) data(meuse) coordinates(meuse) = ~x+y data(meuse.grid) str(meuse.grid) gridded(meuse.grid) …
9 spatial 


2
Agrupando dados ruidosos ou com outliers
Eu tenho dados barulhentos de duas variáveis ​​como esta. x1 <- rep(seq(0,1, 0.1), each = 3000) set.seed(123) y1 <- rep (c(0.2, 0.8, 0.3, 0.9, 0.65, 0.35,0.7,0.1,0.25, 0.3, 0.95), each = 3000) set.seed(1234) e1 = rnorm(length(x1), 0.07,0.07) set.seed(1223) e2 = rnorm(length(x1), 0.07,0.07) set.seed(1334) yn <- rnorm(20000, 0.5,0.9) set.seed(2344) xn <- rnorm(20000, …

1
Padronizando recursos ao usar o LDA como uma etapa de pré-processamento
Se uma Análise Discriminante Linear de várias classes (ou às vezes também leio Análise Discriminante Múltipla) for usada para redução de dimensionalidade (ou transformação após redução de dimensionalidade via PCA), entendo que, em geral, uma "normalização do escore Z" (ou padronização) de os recursos não serão necessários, mesmo que sejam …

1
Entendendo a decomposição de valor singular no contexto do LSI
Minha pergunta é geralmente sobre Decomposição de Valor Singular (SVD), e particularmente sobre Indexação Semântica Latente (LSI). Digamos, eu tenho que contém frequências de 5 palavras para 7 documentos.Aword×documentAword×document A_{word \times document} A = matrix(data=c(2,0,8,6,0,3,1, 1,6,0,1,7,0,1, 5,0,7,4,0,5,6, 7,0,8,5,0,8,5, 0,10,0,0,7,0,0), ncol=7, byrow=TRUE) rownames(A) <- c('doctor','car','nurse','hospital','wheel') Fico Fatorização matriz para usando SVD: …



2
História: o papel da estatística na astronomia
Recentemente, afirmei corajosamente diante de um grupo de estudantes do oitavo ano razoavelmente inteligentes que a astronomia contribuiu muito para os fundamentos da estatística e que muitos conceitos estatísticos foram inventados para uso em astronomia. No entanto, olhando para trás, fiquei bastante decepcionado. Erros, a média e o desvio médio …


1
Qual é o CDF de duas amostras de e do teste unilateral de Kolmogorov-Smirnov?
Estou tentando entender como obter valores- para o teste unilateral de Kolmogorov-Smirnov e estou lutando para encontrar CDFs para e no caso de duas amostras. O abaixo é citado em alguns lugares como CDF para em um caso de uma amostra:pppD+n1,n2Dn1,n2+D^{+}_{n_{1},n_{2}}D−n1,n2Dn1,n2−D^{-}_{n_{1},n_{2}}D+nDn+D^{+}_{n} p+n(x)=P(D+n≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jpn+(x)=P(Dn+≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jp^{+}_{n}\left(x\right) = \text{P}\left(D^{+}_{n} \ge x | \text{H}_{0}\right) = x\sum_{j=0}^{\lfloor …

2
Por que uma correlação de postos de Pearson é válida, apesar da suposição de normalidade?
Atualmente, estou lendo suposições para correlações de Pearson. Uma suposição importante para o teste t subsequente parece ser que ambas as variáveis ​​provêm de distribuições normais; se não o fizerem, é recomendável o uso de medidas alternativas, como o Spearman rho. A correlação de Spearman é calculada como a correlação …


1
Simulando Convergência em Probabilidade para uma constante
Os resultados assintóticos não podem ser comprovados por simulação em computador, porque são afirmações que envolvem o conceito de infinito. Mas devemos ter a sensação de que as coisas realmente marcham da maneira que a teoria nos diz. Considere o resultado teórico limn → ∞P( | Xn| >ϵ)=0,ε > 0limn→∞P(|Xn|>ϵ)=0,ϵ>0\lim_{n\rightarrow\infty}P(|X_n|>\epsilon) …

1
Sobre-amostragem com variáveis ​​categóricas
Gostaria de executar uma combinação de superamostragem e subamostragem para equilibrar meu conjunto de dados com aproximadamente 4000 clientes divididos em dois grupos, onde um dos grupos tem uma proporção de aproximadamente 15%. Examinei o SMOTE ( http://www.inside-r.org/packages/cran/DMwR/docs/SMOTE ) e o ROSE ( http://cran.r-project.org/web/packages/ROSE/ ROSE.pdf ), mas ambos criam novas …


Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.