Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

3
Um normal dividido por fornece uma distribuição t - prova
Seja e .W ~ χ 2 ( s )Z∼N(0,1)Z∼N(0,1)Z \sim N(0,1)W∼χ2(s)W∼χ2(s)W \sim \chi^2(s) Se e são distribuídos independentemente, a variável segue uma distribuição com graus de liberdade .W Y = ZZZZWWW tsY=ZW/s√Y=ZW/sY = \frac{Z}{\sqrt{W/s}}tttsss Estou procurando uma prova desse fato; uma referência é boa o suficiente se você não quiser …


2
Bons exemplos de seções estatísticas em artigos de periódicos acadêmicos aplicados
Sou bioestatístico trabalhando em um campo aplicado e sou responsável por escrever a seção de métodos estatísticos para os trabalhos em que colaboro. Ao ler muitos artigos acadêmicos, encontrei muitos exemplos de seções de estatísticas mal escritas (a maioria é entediante, pouco informativa e carece de precisão, detalhes e compreensão …



1
A convergência quase certa não implica convergência completa
Dizemos que convergem completamente para se para cada .X1,X2,…X1,X2,…X_1, X_2, \ldotsXXXϵ&gt;0ϵ&gt;0\epsilon>0 ∑∞n=1P(|Xn−X|&gt;ϵ)&lt;∞∑n=1∞P(|Xn−X|&gt;ϵ)&lt;∞\sum_{n=1}^\infty \text{P}\left(|X_n-X|>\epsilon\right) <\infty Com o lema de Borel Cantelli, é fácil provar que a convergência completa implica convergência quase certa. Estou procurando um exemplo, quase certo de que a convergência não pode ser comprovada com Borel Cantelli. Isto é, …

1
A fórmula para o teste Bayesiano A / B não faz sentido
Estou usando a fórmula do teste ab Bayesiano para calcular os resultados do teste AB usando a metodologia Bayesiana. Pr(pB&gt;pA)=∑i=0αB−1B(αA+i,βB+βA)(βB+i)B(1+i,βB)B(αA,βA)Pr(pB&gt;pA)=∑i=0αB−1B(αA+i,βB+βA)(βB+i)B(1+i,βB)B(αA,βA) \Pr(p_B > p_A) = \sum^{\alpha_B-1}_{i=0} \frac{B(\alpha_A+i,\beta_B+\beta_A)}{(\beta_B+i)B(1+i,\beta_B)B(\alpha_A, \beta_A)} Onde αAαA\alpha_A em um mais o número de sucessos de A βAβA\beta_A em um mais o número de falhas para A αBαB\alpha_B em …
10 r  bayesian  ab-test 

2
Implementação de validação cruzada aninhada
Estou tentando descobrir se meu entendimento da validação cruzada aninhada está correto, por isso escrevi este exemplo de brinquedo para verificar se estou certo: import operator import numpy as np from sklearn import cross_validation from sklearn import ensemble from sklearn.datasets import load_boston # set random state state = 1 # …


1
O que é a matriz de covariância assintótica?
É verdade que a matriz de covariância assintótica é igual à matriz de covariância das estimativas de parâmetros? se não, o que é? E qual é a diferença entre a matriz de covariância e a matriz de covariância assintótica nesse caso? Desde já, obrigado!


3
Existem equivalentes normalizados para Skewness e Kurtosis?
Qual seria o equivalente normalizado ao Skewness que teria a mesma unidade que os dados? Da mesma forma, qual seria o equivalente normalizado à curtose? Idealmente, essas funções devem ser lineares com relação aos dados, o que significa que, se todas as observações fossem multiplicadas por um fator n, a …

2
Determinante da matriz de informações de Fisher para um modelo superparameterizado
Considere uma variável aleatória Bernoulli com o parâmetro (probabilidade de sucesso). A função de probabilidade e as informações de Fisher (uma matriz ) são:X∈{0,1}X∈{0,1}X\in\{0,1\}θθ\theta1×11×11 \times 1 L1(θ;X)I1(θ)=p(X|θ)=θX(1−θ)1−X=detI1(θ)=1θ(1−θ)L1(θ;X)=p(X|θ)=θX(1−θ)1−XI1(θ)=detI1(θ)=1θ(1−θ) \begin{align} \mathcal{L}_1(\theta;X) &= p(\left.X\right|\theta) = \theta^{X}(1-\theta)^{1-X} \\ \mathcal{I}_1(\theta) &= \det \mathcal{I}_1(\theta) = \frac{1}{\theta(1-\theta)} \end{align} Agora considere uma versão "com excesso de parâmetros" com …

1
É
No teste de hipótese estatística, a hipótese nula geralmente assume a forma de (pelo menos nos livros que li): ou H 0 : θ = θ 0 H 0 : θ ≤ θ 0 H 0 : θ 1 ≤ θ ≤ θ 2H0 0H0H_0H0 0:H0 0:θ = θ0 0θ …

2
Como devo modelar interações entre variáveis ​​explicativas quando uma delas pode ter termos quadráticos e cúbicos?
Espero sinceramente que tenha formulado esta pergunta de forma que ela possa ser respondida definitivamente - caso contrário, informe-me e tentarei novamente! Eu também acho que devo usar R para essas análises. Eu tenho várias medidas plant performance (Ys)que eu suspeito que foram influenciadas por quatro tratamentos que eu impus-- …

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.