Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

3
Como testar se a variação de duas distribuições é diferente se as distribuições não são normais
Estou estudando duas populações geograficamente isoladas da mesma espécie. Inspecionando as distribuições, vejo que ambas são bimodais (há certa sazonalidade em sua ocorrência), mas os picos em uma população são muito mais altos e mais estreitos (ou seja, a variação dos picos locais é menor). Que tipo de teste estatístico …

3
Demonstração do viés quantil da amostra
Ao fazer algumas simulações, percebi que o quantil da amostra é um estimador tendencioso do quantil verdadeiro. E, de acordo com minhas simulações, uma potencialmente muito tendenciosa. Fiquei surpreso com esse resultado, pois o CDF empírico não é tendencioso, mas depois de algumas pesquisas na Internet, descobri que era verdade …


1
Mapas auto-organizados vs. k-means do kernel
Para um aplicativo, quero agrupar dados (potencialmente dimensionais) e extrair a probabilidade de pertencer a um cluster. Eu considero no momento mapas auto-organizados ou kernel significa fazer o trabalho. Quais são os prós e os contras de cada classificador para esta tarefa? Estou com saudades de outros algoritmos de cluster …

2
Procurando o 'cotovelo' nos dados
Subitização é a enumeração rápida e precisa de telas de baixa numerosidade, diferenciada da contagem por uma não linearidade acentuada no gráfico dos tempos de resposta. Abaixo está um gráfico representativo, de Watson, DG, Maylor, EA e Bruce, LAM (2007). Observe que o tempo médio de enumeração para as exibições …


1
Por que usar bayesglm?
Minha pergunta geral é: por que usar em bayesglmvez de outros métodos de classificação? Nota: Estou interessado apenas em previsão. Eu tenho uma quantidade decente de dados (~ 100.000 obs). Sinto que o tamanho da amostra é grande o suficiente para que os parâmetros de uma regressão logística regular sejam …




2
Aproximando as quantidades relativas de moedas no Canadá
Seria possível aproximar com precisão as quantidades relativas de Loonies , Twoonies , moedas, moedas de dez centavos, nickles (e talvez o centavo descontinuado) em circulação, simplesmente obtendo uma amostra suficientemente grande de moedas pelo uso diário? No uso diário, refiro-me às moedas que você troca novamente quando faz uma …



1
O residual, e, é um estimador do erro,
Esta questão surgiu em outro tópico que eu comecei, então pensei em obter mais opiniões das pessoas sobre isso. Minha pergunta é O residual, e, é um estimador do erro, ?ϵϵ\epsilon A razão pela qual pergunto é a seguinte. No OLS, a variação dos resíduos, , é conhecida como variação …

3
Como executar a classificação Random Forest não supervisionada usando o código de Breiman?
Estou trabalhando com o código de floresta aleatória de Breiman ( http://stat-www.berkeley.edu/users/breiman/RandomForests/cc_manual.htm#c2 ) para classificação de dados de satélite (aprendizado supervisionado). Estou usando um conjunto de dados de treinamento e teste com tamanho de amostra de 2000 e tamanho variável 10. Os dados são classificados em duas classes, A e …

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.