Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

2
Qual é o nome dessa medida de correlação / associação entre variáveis ​​binárias?
Existem várias medidas de associação (ou contingência ou correlação) entre duas variáveis ​​aleatórias binárias e , entre outrasXXXYYY Pearson coeficiente phi V de Cramér Gostaria de saber como o seguinte número se relaciona a medidas conhecidas, se é estatisticamente interessante, e sob qual nome é (possivelmente) discutido:κκ\kappa κ=1−2N|X△Y|κ=1−2N|X△Y|\kappa = 1 …


1
O que é cov (X, Y), onde X = min (U, V) e Y = máx (U, V) para variáveis ​​normais independentes (0,1) U e V?
Deixei: U,V∼i.i.d.N(0,1)U,V∼i.i.d.N(0,1)U, V \overset{i.i.d.}{\sim} \mathcal{N}(0,1) , ou seja, variáveis ​​aleatórias normais padrão independentes. X=min(U,V)X=min(U,V)X=\min(U,V) Y=max(U,V)Y=max(U,V)Y=\max(U,V) Qual é a covariância de XXX e YYY ? Relacionado: O que é cov (X, Y), onde X = min (U, V) e Y = max (U, V) para variáveis uniformes independentes (0,1) U e …

2
Análise de dados dados como intervalos em vez de pontos
Eu tenho um conjunto de dados que não é fornecido como x=x1,…,xn,x=x1,…,xn, \boldsymbol{x} = x_1, \dots, x_n, mas como pares xinterval=(x(start)1,x(end)1),…,(x(start)n,x(end)n).xinterval=(x1(start),x1(end)),…,(xn(start),xn(end)).\boldsymbol{x}_{interval} = (x^{(start)}_1, x^{(end)}_1), \dots, (x^{(start)}_n, x^{(end)}_n). Para cada par (x(start)i,x(end)i),(xi(start),xi(end)),(x^{(start)}_i, x^{(end)}_i), o verdadeiro xixix_i está no intervalo (x(start)i,x(end)i),(xi(start),xi(end)),(x^{(start)}_i, x^{(end)}_i), mas não se sabe onde. No contexto, isso significa que …

3
Como interpretar o Bootstrap?
Eu sou um novato de verdade quando se trata de estatística, por favor, não me julgue e minha pergunta;) Estou fazendo uma análise de regressão linear com o SPSS e, como meus dados não são normalmente distribuídos nem mostram homoscedasticidade, decidi usar o bootstrap. Agora, estou realmente confuso quando se …

1
Interpretando a saída TukeyHSD em R
Eu executei uma ANOVA simples em R e, em seguida, gerei as seguintes comparações de médias de TukeyHSD (): Eu tenho uma idéia muito boa (eu acho) do que tudo isso significa, exceto o 'p adj'. Se eu estiver correto: A diferença nas pontuações dos testes entre os Juniors e …
7 r  tukey-hsd 


2
Gerando um conjunto de dados de alta dimensão onde o vizinho mais próximo se torna sem sentido
No artigo " Quando o 'vizinho mais próximo' é significativo? ", Lemos que, Mostramos que, sob certas condições amplas (em termos de distribuição de dados e consultas ou carga de trabalho), à medida que a dimensionalidade aumenta, a distância do vizinho mais próximo se aproxima da distância do vizinho mais …


3
Interpretação dos efeitos marginais médios
Fiz uma regressão em que a variável dependente está ganhando (1 = vitória). Dado que minha regressão é probit, quero entender o coeficiente. Eu fiz margins, dydx()para minha variável independente (efeitos marginais médios). Isso produziu um resultado de -.41. O que isto significa? Isso significa que a probabilidade de ganhar …

1
Qual método de inicialização é o mais preferido?
Talvez essa pergunta dependa dos dados fornecidos, mas existe um método "melhor" de inicialização do que os outros? Estou simplesmente usando um conjunto de dados de uma variável (que consiste nas diferenças entre as pontuações de futebol (2 equipes) nas últimas 15 semanas) .. Primeiro, observe a inclinação correta desses …





Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.