Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

2
Resíduos de Pearson
Uma pergunta de iniciante sobre o resíduo de Pearson no contexto do teste do qui-quadrado para a qualidade do ajuste: Além da estatística de teste, a chisq.testfunção de R reporta o resíduo de Pearson: (obs - exp) / sqrt(exp) Entendo por que olhar para a diferença bruta entre valores observados …

1
Limites superiores para a densidade da cópula?
O limite superior de Fréchet-Hoeffding se aplica à função de distribuição de cópula e é dado por C(u1,...,ud)≤min{u1,..,ud}.C(u1,...,ud)≤min{u1,..,ud}.C(u_1,...,u_d)\leq \min\{u_1,..,u_d\}. Existe um limite superior semelhante (no sentido de que depende das densidades marginais) para a cópula densidade c(u1,...,ud)c(u1,...,ud)c(u_1,...,u_d) vez do CDF? Qualquer referência seria muito apreciada.

1
Pergunta sobre como normalizar o coeficiente de regressão
Não tenho certeza se normalizar é a palavra correta a ser usada aqui, mas tentarei ilustrar o que estou tentando perguntar. O estimador usado aqui é de mínimos quadrados. Suponha que você tem y=β0+β1x1y=β0+β1x1y=\beta_0+\beta_1x_1 , você pode centralizá-lo em torno da média de y=β′0+β1x′1y=β0′+β1x1′y=\beta_0'+\beta_1x_1' onde β′0=β0+β1x¯1β0′=β0+β1x¯1\beta_0'=\beta_0+\beta_1\bar x_1 e x′1=x−x¯x1′=x−x¯x_1'=x-\bar x …

1
Distribuição com
Existe alguma informação lá fora sobre a distribuição cujo nnn º cumulant é dada por 1n1n\frac 1 n ? A função geradora de cumulante é da forma κ(t)=∫10etx−1x dx.κ(t)=∫01etx−1x dx. \kappa(t) = \int_0 ^ 1 \frac{e^{tx} - 1}{x} \ dx. Corri através dele como a distribuição limitadora de algumas variáveis …

1
Critérios para definir a largura da janela STL s.
Usando Rpara executar a decomposição do STL, s.windowcontrola a rapidez com que o componente sazonal pode mudar. Valores pequenos permitem mudanças mais rápidas. Definir a janela sazonal como infinita equivale a forçar o componente sazonal a ser periódico (ou seja, idêntico ao longo dos anos). Minhas perguntas: Se eu tiver …



2
A matriz de informações observadas é um estimador consistente da matriz de informações esperadas?
Estou tentando provar que a matriz de informações observada avaliada no estimador de verossimilhança máxima fraca consistentemente consistente (MLE) é um estimador fracamente consistente da matriz de informações esperada. Este é um resultado amplamente citado, mas ninguém fornece uma referência ou uma prova (acabei as 20 primeiras páginas de resultados …

2
Escolhendo o parâmetro de complexidade no CART
Na rotina rpart () para criar modelos CART, você especifica o parâmetro de complexidade para o qual deseja remover sua árvore. Eu vi duas recomendações diferentes para escolher o parâmetro de complexidade: Escolha o parâmetro de complexidade associado ao erro mínimo possível de validação cruzada. Este método é recomendado pelo …
16 r  cart  rpart 

2
Que distribuições anteriores poderiam / deveriam ser usadas para a variação em um modelo bayesisan hierárquico quando a variação média é de interesse?
Em seu artigo amplamente citado, distribuições anteriores para parâmetros de variância em modelos hierárquicos (916 citação até agora no Google Scholar) Gelman propõe que boas distribuições prévias não informativas para a variação em um modelo bayesiano hierárquico são a distribuição uniforme e a distribuição de meia tonelada. Se eu entendi …



2
Quais processos podem gerar dados ou parâmetros distribuídos por Laplace (duplo exponencial)?
Muitas distribuições têm "mitos de origem" ou exemplos de processos físicos que descrevem bem: Você pode obter dados normalmente distribuídos a partir de somas de erros não correlacionados pelo Teorema do Limite Central Você pode obter dados distribuídos binomialmente de lançamentos independentes de moedas ou variáveis ​​distribuídas por Poisson a …

4
Enquadrando a distribuição binomial negativa para sequenciamento de DNA
A distribuição binomial negativa tornou-se um modelo popular para dados de contagem (especificamente o número esperado de leituras de seqüenciamento dentro de uma determinada região do genoma de um determinado experimento) em bioinformática. As explicações variam: Alguns o explicam como algo que funciona como a distribuição de Poisson, mas tem …

1
Como simular a partir de uma cópula gaussiana?
Suponha que eu tenha duas distribuições marginais univariadas, digamos e , das quais eu possa simular. Agora, construa sua distribuição conjunta usando uma cópula gaussiana , denominada . Todos os parâmetros são conhecidos.FFFGGGC(F,G;Σ)C(F,G;Σ)C(F,G;\Sigma) Existe um método não MCMC para simular a partir desta cópula?

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.