Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

4
Por que ? (Uma regressão linear variável)
Nota: = soma dos quadrados total, = soma dos erros quadrados e = soma dos quadrados por regressão. A equação no título é frequentemente escrita como:SSTSSTSSTSSESSESSESSRSSRSSR ∑i=1n(yi−y¯)2=∑i=1n(yi−y^i)2+∑i=1n(y^i−y¯)2∑i=1n(yi−y¯)2=∑i=1n(yi−y^i)2+∑i=1n(y^i−y¯)2\sum_{i=1}^n (y_i-\bar y)^2=\sum_{i=1}^n (y_i-\hat y_i)^2+\sum_{i=1}^n (\hat y_i-\bar y)^2 Pergunta bastante direta, mas estou procurando uma explicação intuitiva. Intuitivamente, parece-me que faria mais sentido. Por …

1
Probabilidade máxima restrita com classificação de coluna menor que a completa de
Esta questão lida com a estimativa de máxima verossimilhança restrita (REML) em uma versão específica do modelo linear, a saber: Y=X(α)β+ϵ,ϵ∼Nn(0,Σ(α)),Y=X(α)β+ϵ,ϵ∼Nn(0,Σ(α)), Y = X(\alpha)\beta + \epsilon, \\ \epsilon\sim N_n(0, \Sigma(\alpha)), onde X(α)X(α)X(\alpha) é uma matriz ( ) parametrizada por , como . é um vetor desconhecido de parâmetros incômodos; o …

2
Como suavizar dados e forçar a monotonicidade
Eu tenho alguns dados que gostaria de suavizar para que os pontos suavizados diminuam monotonicamente. Meus dados diminuem acentuadamente e depois começam a se espalhar. Aqui está um exemplo usando R df <- data.frame(x=1:10, y=c(100,41,22,10,6,7,2,1,3,1)) ggplot(df, aes(x=x, y=y))+geom_line() O que é uma boa técnica de suavização que eu poderia usar? …



3
Para intuição, quais são alguns exemplos da vida real de variáveis ​​aleatórias não correlacionadas, mas dependentes?
Ao explicar por que não correlacionado não implica independente, existem vários exemplos que envolvem um monte de variáveis ​​aleatórias, mas todas parecem muito abstratas: 1 2 3 4 . Essa resposta parece fazer sentido. Minha interpretação: Uma variável aleatória e seu quadrado podem não estar correlacionados (já que aparentemente a …


3
Por que o número de variáveis ​​uniformes contínuas em (0,1) necessárias para que sua soma exceda um tem a média
Vamos resumir um fluxo de variáveis aleatórias, Xi∼iidU(0,1)Xi∼iidU(0,1)X_i \overset{iid}\sim \mathcal{U}(0,1) ; seja YYY o número de termos que precisamos para que o total exceda um, ou seja, YYY é o menor número que X1+X2+⋯+XY>1.X1+X2+⋯+XY>1.X_1 + X_2 + \dots + X_Y > 1. Por que a média de YYY igual a …

3
Referências que justificam o uso de misturas gaussianas
Os modelos de mistura gaussiana (GMMs) são atraentes porque são simples de trabalhar tanto analiticamente quanto na prática e são capazes de modelar algumas distribuições exóticas sem muita complexidade. Há algumas propriedades analíticas que devemos esperar manter que não são claras em geral. Em particular: Diga SnSnS_n é a classe …







Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.