Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

1
Kernel de transição Gibbs Sampler
Seja a distribuição de destino em que é absolutamente continuamente escrita na medida de Lebesgue dimensional, ou seja:ππ\pi(Rd,B(Rd))(Rd,B(Rd))(\mathbb{R}^d,\mathcal{B}(\mathbb{R^d}))ddd ππ\pi admite uma densidade em com π(x1,...,xd)π(x1,...,xd)\pi(x_1,...,x_d)λdλd\lambda^dλd(dx1,...,dxd)=λ(dx1)⋅⋅⋅λ(dxd)λd(dx1,...,dxd)=λ(dx1)⋅⋅⋅λ(dxd)\lambda^d(dx_1,...,dx_d) = \lambda(dx_1) \cdot \cdot \cdot \lambda (dx_d) Vamos supor que os condicionais completos de sejam conhecidos. Portanto, o núcleo de transição do Gibbs-Sampler é claramente …

2
Problemas com detecção de outlier
Em um post do blog, Andrew Gelman escreve : A regressão passo a passo é uma dessas coisas, como detecção externa e gráficos de pizza, que parecem populares entre os não estatísticos, mas são considerados pelos estatísticos uma piada. Entendo a referência aos gráficos de setores circulares, mas por que …

3
Encontre distribuição e transforme em distribuição normal
Eu tenho dados que descrevem com que frequência um evento ocorre durante uma hora ("número por hora", nph) e quanto tempo os eventos duram ("duração em segundos por hora", dph). Estes são os dados originais: nph <- c(2.50000000003638, 3.78947368414551, 1.51456310682008, 5.84686774940732, 4.58823529414907, 5.59999999993481, 5.06666666666667, 11.6470588233699, 1.99999999998209, NA, 4.46153846149851, 18, 1.05882352939726, …
8 normal-distribution  data-transformation  logistic  generalized-linear-model  ridge-regression  t-test  wilcoxon-signed-rank  paired-data  naive-bayes  distributions  logistic  goodness-of-fit  time-series  eviews  ecm  panel-data  reliability  psychometrics  validity  cronbachs-alpha  self-study  random-variable  expected-value  median  regression  self-study  multiple-regression  linear-model  forecasting  prediction-interval  normal-distribution  excel  bayesian  multivariate-analysis  modeling  predictive-models  canonical-correlation  rbm  time-series  machine-learning  neural-networks  fishers-exact  factorisation-theorem  svm  prediction  linear  reinforcement-learning  cdf  probability-inequalities  ecdf  time-series  kalman-filter  state-space-models  dynamic-regression  index-decomposition  sampling  stratification  cluster-sample  survey-sampling  distributions  maximum-likelihood  gamma-distribution 

2
Modelo de Previsão Eleitoral de Nate Silver
Nate Silver teve bastante sucesso em prever os resultados das eleições americanas no passado, algo que é descrito em seu livro The Signal and the Noise . O livro contém algumas descrições do modelo usado, e uma postagem no blog dele descreve o modelo usado para as eleições de 2014. …

1
Sobre valores negativos da AIC
Minha pergunta está relacionada ao segmento Valores negativos para AIC no Modelo Misto Geral . Costumo receber valores negativos de AIC do software que uso. Eu noto mais isso quando estou fazendo séries temporais. Mas aqui está o que eu não entendo. Ao definir o AIC como A IC= 2 …
8 aic 



2
Que desvio o glmnet está usando para comparar valores de
Um critério para selecionar o valor ideal de λλ\lambda com uma rede elástica ou regressão penalizada semelhante é examinar um gráfico do desvio em relação à faixa de λλ\lambda e selecione λλ\lambda quando o desvio é minimizado (ou λλ\lambda dentro de um erro padrão do mínimo). No entanto, estou tendo …
8 r  glmnet 


2
Quais são algumas das razões pelas quais os mínimos quadrados com ponderação iterativa não convergiriam quando usados ​​para regressão logística?
Eu tenho usado a função glm.fit em R para ajustar parâmetros a um modelo de regressão logística. Por padrão, o glm.fit usa mínimos quadrados ponderados iterativamente para ajustar os parâmetros. Quais são algumas das razões pelas quais esse algoritmo falharia ao convergir quando usado para regressão logística?


5
Por que os regressores irrelevantes se tornam estatisticamente significativos em amostras grandes?
Estou tentando entender melhor a significância estatística, os tamanhos dos efeitos e similares. Tenho uma percepção (talvez errada) de que mesmo regressores irrelevantes geralmente se tornam estatisticamente significativos em grandes amostras . Por irrelevante, quero dizer que não há explicação no assunto por que o regressor deve estar relacionado à …

3
Como obter a função quantil quando uma forma analítica da distribuição não é conhecida
O problema vem da página 377-379 deste [0] documento. Dada uma distribuição contínua FFF e um fixo z∈Rz∈Rz\in\mathbb{R}, considere: Lz(t)=PF(|z−Z|≤t)Lz(t)=PF(|z−Z|≤t)L_z(t)=P_F(|z-Z|\leq t) e H(z)=L−1z(0.5)=medZ∼F|z−Z|H(z)=Lz−1(0.5)=medZ∼F|z−Z|H(z)=L^{-1}_z(0.5)=\underset{Z\sim F}{\mbox{med}}|z-Z| z Z ∼ F zL−1z(u)=inf{t:Lz(t)>u}Lz−1(u)=inf{t:Lz(t)>u}L^{-1}_z(u)=\inf\{t:L_z(t)>u\}zzzZ∼FZ∼FZ\sim Fzzz L(t)=PF(H(Z)≤t)L(t)=PF(H(Z)≤t)L(t)=P_F(H(Z)\leq t) Agora, eu não tenho uma expressão analítica para (na verdade, tenho certeza de que uma expressão analítica não …

1
Trabalhando com a amostra de bootstrap versus a amostra original
Considere uma amostra de números reais. Digamos que queremos estimar a tendência central da população e ter uma noção da nossa incerteza em torno dessa estimativa. Vamos deixar de lado as suposições sobre a distribuição da população por um momento e considerar as duas abordagens a seguir. Obtenha uma amostra …

2
Visualização e overplotting: alternativa para dispersões
Eu tenho um grande conjunto de dados de países que estão lotados (como você pode ver abaixo), mas preciso dos rótulos e dos outliers - também tenho muitos gráficos, por isso seria tedioso redefinir a janela e adicionar dados falsos para os outliers. Existe uma boa alternativa para um gráfico …

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.