Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados


2
Modelos hierárquicos para múltiplas comparações - contexto de múltiplos resultados
Acabei de (re) ler Por que de Gelman (geralmente) não precisamos nos preocupar com múltiplas comparações . Em particular, a seção "Múltiplos resultados e outros desafios" menciona o uso de um modelo hierárquico para situações em que existem várias medidas relacionadas da mesma pessoa / unidade em diferentes momentos / …

2
Posso usar o bootstrapping, por que ou por que não?
Atualmente, estou trabalhando em estimativas de biomassa usando imagens de satélite. Definirei rapidamente o plano de fundo da minha pergunta e depois explicarei a questão estatística em que estou trabalhando. fundo Problema Estou tentando estimar biomassa em uma área na França. Minha resposta é a densidade do volume de madeira …
10 bootstrap 


2
Por que as distribuições são importantes?
Isso pode ser o mesmo que as perguntas mais bobas já feitas neste fórum, mas, depois de ter recebido respostas sólidas e significativas para uma pergunta anterior, pensei em estender minha sorte novamente. Há muito tempo fico confuso sobre a importância das distribuições estatísticas, especialmente no que se refere ao …

1
Sugestão de teste estatístico
Preciso encontrar um teste estatístico apropriado (teste da razão de verossimilhança, teste t etc.) sobre o seguinte: Seja ser uma amostra iid de um vector aleatório ( X ; Y ) e assumir que ( Y X ) ~ N [ ( μ 1 μ 2 ) , ( 1 …





1
Por que Anova () e drop1 () forneceram respostas diferentes para os GLMMs?
Eu tenho um GLMM do formulário: lmer(present? ~ factor1 + factor2 + continuous + factor1*continuous + (1 | factor3), family=binomial) Quando uso drop1(model, test="Chi"), obtenho resultados diferentes dos que utilizo Anova(model, type="III")na embalagem do carro ou summary(model). Estes dois últimos dão as mesmas respostas. Usando um monte de dados fabricados, …
10 r  anova  glmm  r  mixed-model  bootstrap  sample-size  cross-validation  roc  auc  sampling  stratification  random-allocation  logistic  stata  interpretation  proportion  r  regression  multiple-regression  linear-model  lm  r  cross-validation  cart  rpart  logistic  generalized-linear-model  econometrics  experiment-design  causality  instrumental-variables  random-allocation  predictive-models  data-mining  estimation  contingency-tables  epidemiology  standard-deviation  mean  ancova  psychology  statistical-significance  cross-validation  synthetic-data  poisson-distribution  negative-binomial  bioinformatics  sequence-analysis  distributions  binomial  classification  k-means  distance  unsupervised-learning  euclidean  correlation  chi-squared  spearman-rho  forecasting  excel  exponential-smoothing  binomial  sample-size  r  change-point  wilcoxon-signed-rank  ranks  clustering  matlab  covariance  covariance-matrix  normal-distribution  simulation  random-generation  bivariate  standardization  confounding  z-statistic  forecasting  arima  minitab  poisson-distribution  negative-binomial  poisson-regression  overdispersion  probability  self-study  markov-process  estimation  maximum-likelihood  classification  pca  group-differences  chi-squared  survival  missing-data  contingency-tables  anova  proportion 

2
Como faço para gerar números de acordo com uma distribuição Soliton?
A distribuição Soliton é uma distribuição de probabilidade discreta sobre um conjunto com a função de massa de probabilidade{1,…,N}{1,…,N}\{1,\dots, N\} p(1)=1N,p(k)=1k(k−1)for k∈{2,…,N}p(1)=1N,p(k)=1k(k−1)for k∈{2,…,N} p(1)=\frac{1}{N},\qquad p(k)=\frac{1}{k(k-1)}\quad\text{for }k\in\{2,\dots, N\} Eu gostaria de usá-lo como parte de uma implementação de um código LT , idealmente em Python, onde um gerador uniforme de números …


3
De onde veio o termo "aprender um modelo"
Muitas vezes, ouvi os mineradores de dados aqui usarem esse termo. Como estatístico que trabalhou em problemas de classificação, estou familiarizado com o termo "treinar um classificador" e presumo que "aprenda um modelo" significa a mesma coisa. Não me importo com o termo "treinar um classificador". Isso parece retratar a …

1
Fatores de Bayes com antecedentes impróprios
Eu tenho uma pergunta sobre a comparação de modelos usando fatores Bayes. Em muitos casos, os estatísticos estão interessados ​​em usar uma abordagem bayesiana com anteriores impróprios (por exemplo, alguns anteriores de Jeffreys e anteriores de referência). Minha pergunta é: nos casos em que a distribuição posterior dos parâmetros do …

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.