Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

2
Os pressupostos do modelo de teste são considerados p-hacking / fishing?
"P-hacking", "fishing" e "garden of bifurcação", como explicado aqui e aqui, descrevem um estilo exploratório de análise de dados, semelhante a uma pesquisa que produz estimativas tendenciosas. O teste de premissas do modelo (por exemplo, normalidade, homocedasticidade em regressão) usa testes estatísticos no mesmo conjunto de dados usado para ajustar …



1
Quando é importante ter um estimador imparcial?
Temos algumas perguntas e respostas sobre quando alguém prefere uma estimativa tendenciosa a uma imparcial, mas não encontrei nada na pergunta inversa: Em que situações é importante considerar apenas estimadores imparciais ? Muita ênfase é colocada no conceito de imparcialidade, nos cursos estatísticos introdutórios, mas nunca li uma defesa convincente …

2
Se , qual o tamanho ?
Se , onde e for uma sequência de variáveis ​​aleatórias positivas, qual o tamanho ?E|Xn|=O(an)E|Xn|=O(an)\mathbb{E}|X_n|=O(a_n)an→0an→0a_n\to 0XnXnX_nYn=Xnln(1Xn)Yn=Xnln⁡(1Xn)Y_n = X_n\ln\left(\frac{1}{X_n}\right) Minha tentativa: pela desigualdade de Markov implica e . Resta avaliar . Para alguma sequência positiva de variáveis ​​aleatóriasE|Xn|=O(an)E|Xn|=O(an)\mathbb{E}|X_n|=O(a_n)Xn=Op(an)Xn=Op(an)X_n=O_p(a_n)Yn=Op(an)ln(1Xn)Yn=Op(an)ln⁡(1Xn)Y_n = O_p(a_n)\ln\left(\frac{1}{X_n}\right)ln(1Xn)ln⁡(1Xn)\ln\left(\frac{1}{X_n}\right)Zn=Op(1)Zn=Op(1)Z_n=O_p(1) Xn=umanZn⟺em(Xn) = ln(uman) + ln(Zn)⟺em(1 1Xn)em(1 1uman)=em(Zn)em(uman)+ 1Xn=anZn⟺ln⁡(Xn)=ln⁡(an)+ln⁡(Zn)⟺ln⁡(1Xn)ln⁡(1an)=ln⁡(Zn)ln⁡(an)+1\begin{equation} \begin{aligned} X_n = …


2
Quantos americanos, escolhidos aleatoriamente, são necessários para ter 50% de chance de dois morarem no mesmo estado ou em estados adjacentes?
fundo Estou estudando coincidências comuns e coincidências "próximas" que, no entanto (indevidamente) impressionam a pessoa comum. A pergunta abaixo é uma extensão do famoso problema do aniversário , que pergunta "Quantas pessoas, escolhidas aleatoriamente, são necessárias para que haja 50% de chance de duas delas compartilharem o mesmo aniversário?" A …



1
Quantifique a semelhança de sacos de palavras
Eu tenho dois conjuntos de dados que contêm as palavras mais comuns e suas frequências de dois artigos diferentes. por exemplo: A = [apple: 23, healthy: 15, tasty: 4] B = [apple: 19, healthy: 21, bad: 7] Ambos os conjuntos de dados contêm palavras semelhantes. Quero encontrar uma medida que …





1
Encontrando a distribuição da soma das Variáveis ​​Aleatórias Lognormal
Eu estou tentando encontrar a distribuição da soma de 2 variáveis ​​aleatórias lognormal. Consultei a literatura disponível em Cross validated, Stack overflow e poucos documentos antes de postar isso. Eu usei a convolução para encontrar a distribuição da soma de 2 rvs lognormais. A aproximação funciona para a diferença. Mas, …

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.