Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

2
Condições para o estimador M convergir para a verdadeira média
Dado amostras iid de uma distribuição gaussiana X1,...,Xn∼N(μ,σ)X1,...,Xn∼N(μ,σ)X_1,...,X_n \sim N(\mu,\sigma) e o estimador M-, μm=argmina∑ρ(|Xi−a|)μm=argmina∑ρ(|Xi−a|)\mu_m = \underset{a}{\operatorname{argmin}} \sum\rho(|X_i-a|) , o que propriedades em ρρ\rho são suficientes para garantir μm→μμm→μ\mu_m \rightarrow \mu na probabilidade? É ρρ\rho sendo estritamente convexa e estritamente crescente suficiente?
10 estimation 

4
Detecção de outlier online
Desejo processar imagens de microscopia segmentadas automaticamente para detectar imagens e / ou segmentações defeituosas, como parte de um pipeline de geração de imagens de alto rendimento. Há vários parâmetros que podem ser calculados para cada imagem e segmentação brutas e que se tornam "extremos" quando a imagem está com …
10 outliers  online 

4
Por que os demógrafos fornecem taxas por 100.000 pessoas?
Parece universal que as estatísticas demográficas sejam dadas em termos de 100.000 habitantes por ano. Por exemplo, taxas de suicídio, taxas de homicídio, ano de vida ajustado por incapacidade, a lista continua. Por quê? Se estivéssemos falando sobre química, partes por milhão (ppm) são comuns. Por que o ato de …
10 demography  units 




2
Posso testar a validade de dados anteriores?
Problema Estou escrevendo uma função R que executa uma análise bayesiana para estimar uma densidade posterior, dados e dados prévios informados. Gostaria que a função envie um aviso se o usuário precisar reconsiderar o anterior. Nesta questão, estou interessado em aprender a avaliar a priori. As perguntas anteriores abordaram a …

1
Cálculo / estimativa rápidos de um sistema linear de baixo escalão
Os sistemas lineares de equações são difundidos nas estatísticas computacionais. Um sistema especial que encontrei (por exemplo, na análise fatorial) é o sistema A x = bAx=bAx=b onde Aqui é uma matriz diagonal com uma diagonal estritamente positiva, é uma matriz semi-definida positiva simétrica (com ) e é uma matriz …

3
Técnica de rastreamento aleatório
Eu conheci a seguinte técnica de rastreamento aleatório em M. Seeger, "Atualizações de baixa classificação para a decomposição de Cholesky", Universidade da Califórnia em Berkeley, Tech. Rep. 2007. tr(A)=E[xTAx]tr⁡(A)=E[xTAx]\operatorname{tr}(\mathbf{A}) = {E[\mathbf{x}^T \mathbf{A} \mathbf{x}]} onde .x∼N(0,I)x∼N(0,I)\mathbf{x} \sim N(\mathbf{0},\mathbf{I}) Como uma pessoa sem profundos conhecimentos de matemática, me pergunto como essa igualdade …

2
Como estimar parâmetros para um filtro Kalman
Em uma pergunta anterior, perguntei sobre o ajuste de distribuições para alguns dados empíricos não gaussianos. Foi-me sugerido offline, que eu poderia tentar assumir que os dados são gaussianos e ajustar primeiro um filtro Kalman. Então, dependendo dos erros, decida se vale a pena desenvolver algo mais sofisticado. Isso faz …

3
Qual é a diferença entre ITT e ATE?
Estou com problemas para entender os diferentes estimadores que podem ser usados ​​em uma avaliação de impacto. Eu sei que o estimador de intenção de tratar (ITT) compara diferenças entre indivíduos elegíveis sem o programa e indivíduos elegíveis com o programa, independentemente da conformidade. No entanto, pensei que o efeito …

2
Justificativa do uso da AUC?
Especialmente no lado orientado para a ciência da computação da literatura de aprendizado de máquina, a AUC (área sob a curva característica do operador do receptor) é um critério popular para avaliar classificadores. Quais são as justificativas para usar a AUC? Por exemplo, existe uma função de perda específica para …

6
Melhor maneira de interagir com uma sessão R em execução na nuvem
Bloqueado . Esta pergunta e suas respostas estão bloqueadas porque a questão está fora do tópico, mas tem um significado histórico. No momento, não está aceitando novas respostas ou interações. Tenho R rodando no Amazon EC2, usando uma versão modificada do AMI do biocondutor . Atualmente, estou usando o putty …
10 r 

2
Otimização da variância média do portfólio Markowitz em R
Tenho 5 séries de retorno total de câmbio em mercados emergentes, para as quais estou prevendo retornos futuros de período único (1 ano). Gostaria de construir um portfólio otimizado de variância média de Markowitz da série 5, usando variações e covariâncias históricas (1) e minhas próprias previsões de retornos esperados. …
10 r 


Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.