Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

1
logloss vs gini / auc
Treinei dois modelos (classificadores binários usando o h2o AutoML) e quero selecionar um para usar. Eu tenho os seguintes resultados: model_id auc logloss logloss_train logloss_valid gini_train gini_valid DL_grid_1 0.542694 0.287469 0.092717 0.211956 0.872932 0.312975 DL_grid_2 0.543685 0.251431 0.082616 0.186196 0.900955 0.312662 as colunas auce loglosssão as métricas de validação cruzada …








2
Inicialização de peso CNN xavier
Em alguns tutoriais, constatei que a inicialização do peso "Xavier" (artigo: Entendendo a dificuldade de treinar redes neurais profundas de avanço ) é uma maneira eficiente de inicializar os pesos das redes neurais. Para camadas totalmente conectadas, havia uma regra prática nesses tutoriais: Var(W)=2nin+nout,simpler alternative:Var(W)=1ninVar(W)=2nin+nout,simpler alternative:Var(W)=1ninVar(W) = \frac{2}{n_{in} + n_{out}}, …

3
Como derivar a interpretação probabilística da AUC?
Por que a área sob a curva ROC tem a probabilidade de um classificador classificar uma instância "positiva" escolhida aleatoriamente (a partir das previsões obtidas) mais alta que uma instância "positiva" escolhida aleatoriamente (a partir da classe positiva original)? Como alguém prova essa afirmação matematicamente usando integral, fornecendo os CDFs …
14 probability  roc  auc 




2
Sobredispersão em regressão logística
Estou tentando entender o conceito de super-dispersão na regressão logística. Eu li que a super-dispersão ocorre quando a variação observada de uma variável de resposta é maior do que seria esperado da distribuição binomial. Mas se uma variável binomial pode ter apenas dois valores (1/0), como pode ter uma média …


Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.