Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

2
Cálculo manual do valor p para o teste t: como evitar valores maiores que
Esses dois métodos para calcular o valor-p devem ser equivalentes: t.test(rats.drug,mu=1.2)$p.value 2*pt((mean(rats.drug)-1.2)*sqrt(n)/sd(rats.drug),df=n-1) O problema com o segundo método é que existe o risco de obter valores maiores que (na verdade, até ):111222 2*pt((1.5-1.2)*sqrt(100)/.5,df=100-1) [1] 2 Obviamente, isso pode ser remediado por 2*pt((1.5-1.2)*sqrt(100)/.5,df=100-1,lower=F) [1] 3.245916e-08 Minha pergunta Obviamente, o algoritmo da …
8 r  t-test  p-value 

1
Revise o artigo sobre filtro de partículas
Encontrei on-line um rascunho de um excelente artigo de revisão de Zhe Chen intitulado "Filtragem Bayesiana: Dos Filtros de Kalman aos Filtros de Partículas e Além". Segundo o Google Scholar, a citação para a versão publicada é "Statistics 182 (1), 1-69, 2003", mas a revista que encontro com esse nome …


1
Fórmula de Schuette – Nesbitt
Eu estava lendo o artigo sobre a fórmula de Schuette-Nesbitt , que é descrita como "uma generalização do princípio de inclusão-exclusão" , que possui versões combinatória e probabilística. Outro site deu uma prova de eventos dependentes (download em pdf) e encontrou um terceiro que o compara ao Teorema de Waring …

1
Termos de erro versus inovações
Notei que às vezes chamamos os termos de erro de "inovações". Não entendo se isso ocorre em situações especiais ou se esses termos podem ser usados ​​um pelo outro. Outra pergunta é "por que chamamos os termos de erro de" inovações "? Obrigado

1
Derivando o algoritmo K-means como um limite de Maximização de Expectativas para Misturas Gaussianas
Christopher Bishop define o valor esperado da função de probabilidade do log de dados completos (ou seja, assumindo que recebemos os dados observáveis ​​X e os dados latentes Z) da seguinte maneira: EZ[lnp(X,Z∣μ,Σ,π)]=∑n=1N∑k=1Kγ(znk){lnπk+lnN(xn∣ μk,Σk)}(1)(1)EZ[ln⁡p(X,Z∣μ,Σ,π)]=∑n=1N∑k=1Kγ(znk){ln⁡πk+ln⁡N(xn∣ μk,Σk)} \mathbb{E}_\textbf{Z}[\ln p(\textbf{X},\textbf{Z} \mid \boldsymbol{\mu}, \boldsymbol{\Sigma}, \boldsymbol{\pi})] = \sum_{n=1}^N \sum_{k=1}^K \gamma(z_{nk})\{\ln \pi_k + \ln \mathcal{N}(\textbf{x}_n \mid …

3
Converter taxa de riscos em razão de chances
Na metanálise: como convertemos as taxas de risco em alguns estudos em odds ratio? Existem estudos de controle de casos e coortes a serem incluídos e alguns deles relatam taxas de risco. Os dados brutos não são relatados de forma a calcular o odds ratio.

1
Quais são os principais tópicos de pesquisa para a dissertação de doutorado em Bioestatística?
Estive pensando em escolher tópicos de pesquisa para a dissertação de doutorado em Bioestatística. Desejo conhecer alguns tópicos importantes de pesquisa nos últimos anos. Até onde eu sei, alguns tópicos importantes de pesquisa são: Análise de dados de alta dimensão; inferência causal em experimentos e estudos observacionais; propensity score matching; …


2
Distribuições inclinadas para regressão logística
Tenho desenvolvido um modelo de regressão logística baseado em dados retrospectivos de um banco de dados nacional de trauma de traumatismo craniano no Reino Unido. O principal resultado é a mortalidade em 30 dias (indicada como Outcome30medida). Outras medidas em todo o banco de dados com evidências publicadas de efeito …




2
Por que as misturas de conjugados a priori são importantes?
Eu tenho uma pergunta sobre a mistura de conjugados anteriores. Aprendi e digo a mistura de conjugados anteriores algumas vezes quando estou aprendendo bayesiano. Estou me perguntando por que esse teorema é tão importante, como vamos aplicá-lo quando estivermos fazendo uma análise bayesiana. Para ser mais específico, um teorema de …

1
Por que eu gostaria de inicializar ao calcular um teste t de amostra independente? (como justificar, interpretar e relatar um teste t com bootstrap)
Digamos que eu tenho duas condições, e meu tamanho de amostra para as duas condições é extremamente baixo. Digamos que só tenho 14 observações na primeira condição e 11 na outra. Eu quero usar o teste t para testar se as diferenças médias são significativamente diferentes umas das outras. Primeiro, …

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.