Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

2
Se eu provar o estimador de
Deixei XiXiX_i ser uma variável aleatória iid com pdf f(x|θ)f(x|θ)f(\mathbf{x}|\theta), Onde E(Xi)=6θ2E(Xi)=6θ2E(X_i) = 6\theta^2e θ>0θ>0\theta > 0. Eu calculei um estimador para o parâmetro (θθ\theta) do f(x|θ)f(x|θ)f(\mathbf{x}|\theta) ser estar θ^=x¯/6−−−√θ^=x¯/6\hat{\theta} = \sqrt{\bar{x}/6}. Para provar que este é um estimador imparcial, devo provar queE(θ^)=E(x¯/6−−−√)E(θ^)=E(x¯/6)E(\hat{\theta}) = E\left(\sqrt{\bar{x}/6}\right). No entanto, desdeθ^2=x¯/6θ^2=x¯/6\hat{\theta}^2 = \bar{x}/6, …

1
Por que a maioria dos meus pontos é classificada como ruído usando o DBSCAN?
Estou usando vários algoritmos de cluster do sklearn para agrupar alguns dados e não consigo descobrir o que está acontecendo com o DBSCAN. Meus dados são uma matriz de termos de documento do TfidfVectorizer, com algumas centenas de documentos pré-processados. Código: tfv = TfidfVectorizer(stop_words=STOP_WORDS, tokenizer=StemTokenizer()) data = tfv.fit_transform(dataset) db = …


1
A prova de Bernoulli é o limite do Beta
É claro para mim, pela inspeção, que se corrigirmos (assim, fixar a média) e deixar , a distribuição Beta se aproxima de um Bernoulli ( ) distribuição.β=1−μμαβ=1−μμα\beta = \frac{1-\mu}{\mu} \alphaα→0α→0\alpha \rightarrow 0μμ\mu Por exemplo: par(mfrow = c(1, 2), oma = c(0, 0, 1.5, 0)) xx = seq(0, 1, length.out = …



1
A inferência baseada no modelo de regressão completo (global) é apropriada?
A inferência é baseada em um modelo completo e, em caso afirmativo, em que circunstâncias? Suponha que você esteja interessado no relacionamento potencial entre uma variável de resposta e várias variáveis ​​preditoras de candidatos e use alguma forma de regressão (por exemplo, modelo linear generalizado) para responder a isso. Uma …

1
A expectativa de estatísticas suficientes transversal a todo o espaço em uma família exponencial?
Uma família exponencial é definida usando dois ingredientes: - uma densidade base q0(x)q0(x)q_0(x) - um número suficiente de estatísticas Si(x)Si(x)S_i(x) A família é todas as densidades de probabilidade que podem ser escritas como: q(x|(λ)i)∝q0(x)exp(∑iλiSi(x))q(x|(λ)i)∝q0(x)exp⁡(∑iλiSi(x)) q(x| (\lambda)_i ) \propto q_0(x) \exp \left( \sum_i \lambda_i S_i(x) \right) É sabido que a relação …

1
Apartamento anterior em bayesiano? Intervalos de confiança nas estatísticas clássicas se transformam em intervalos confiáveis?
Sabemos confidence intervalque não pode ser usado para declaração de probabilidade, isso é algo reservado credible interval. No entanto, as técnicas freqüentistas mais comumente usadas (por exemplo, intervalos de confiança para médias e proporções) são equivalentes a intervalos credíveis bayesianos para alguns anteriores específicos. Um exemplo comum é o plano …


3
Explicação passo a passo da validação cruzada com dobras K com pesquisa em grade para otimizar hiperparâmetros
Estou ciente das vantagens da validação cruzada k-fold (e deixe-o-fora), bem como das vantagens de dividir seu conjunto de treinamento para criar um terceiro conjunto de 'validação', que você usa para avaliar modele o desempenho com base nas opções de hiperparâmetros, para que você possa otimizar e ajustá-los e escolher …


1
Qual intervalo de previsão binomial funciona bem para probabilidades de cauda, ​​ou seja, para grandes
Estou trabalhando em um problema com as seguintes qualidades. Os dados disponíveis são numerosos - da ordem dexxx10610610^6 O CDF tem suporte sobre números reais não negativos.FXFXF_X Eu não sei .FXFXF_X Podemos assumir que os dados são iid. Estou tentando estimar a probabilidade de uma amostra futura extraída de ficar …



Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.