Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

1
Derivação da mudança de variáveis ​​de uma função de densidade de probabilidade?
No reconhecimento de padrões de livros e aprendizado de máquina (fórmula 1.27), fornece py(y)=px(x)∣∣∣dxdy∣∣∣=px(g(y))|g′(y)|py(y)=px(x)|dxdy|=px(g(y))|g′(y)|p_y(y)=p_x(x) \left | \frac{d x}{d y} \right |=p_x(g(y)) | g'(y) | ondex=g(y)x=g(y)x=g(y),px(x)px(x)p_x(x)é o pdf que corresponde apy(y)py(y)p_y(y) com relação à alteração da variável. Os livros dizem que é porque as observações que caem no intervalo (x,x+δx)(x,x+δx)(x, x …

1
Um estimador imparcial da razão de dois coeficientes de regressão?
Suponha que você ajuste uma regressão linear / logística g(y)=a0+a1⋅x1+a2⋅x2g(y)=a0+a1⋅x1+a2⋅x2g(y) = a_0 + a_1\cdot x_1 + a_2\cdot x_2 , com o objetivo de uma estimativa imparcial de a1a2a1a2\frac{a_1}{a_2} . Você está muito confiante de que tantoa1a1a_1quantoa2a2a_2 são muito positivos em relação ao ruído em suas estimativas. Se você tem a …




1
Como a descida estocástica do gradiente poderia economizar tempo em comparação com a descida padrão do gradiente?
A Descida de gradiente padrão calcularia o gradiente para todo o conjunto de dados de treinamento. for i in range(nb_epochs): params_grad = evaluate_gradient(loss_function, data, params) params = params - learning_rate * params_grad Para um número predefinido de épocas, primeiro calculamos o vetor de gradiente weights_grad da função de perda para …

2
Somos freqüentistas realmente apenas bayesianos implícitos / inconscientes?
Para um dado problema de inferência, sabemos que uma abordagem bayesiana geralmente difere na forma e nos resultados de uma abordagem fequentista. Os freqüentistas (geralmente me incluem) frequentemente apontam que seus métodos não requerem um prévio e, portanto, são mais "orientados a dados" do que "orientados a julgamento". Obviamente, os …

2
O que significa dizer que um evento "acontece eventualmente"?
Considere uma caminhada aleatória unidimensional nos números inteiros com o estado inicial : x ∈ ZZZ\mathbb{Z}x∈Zx∈Zx\in\mathbb{Z} Sn=x+∑i=1nξiSn=x+∑i=1nξi\begin{equation} S_n=x+\sum^n_{i=1}\xi_i \end{equation} onde os incrementos são IID tais que . P { ξ i = 1 } = P { ξ i = - 1 } = 1ξiξi\xi_iP{ξi=1}=P{ξi=−1}=12P{ξi=1}=P{ξi=−1}=12P\{\xi_i=1\}=P\{\xi_i=-1\}=\frac{1}{2} Pode-se provar que (1) Px{Sn …


2
Como o ABC e o MCMC diferem em suas aplicações?
No meu entender, a Computação Bayesiana Aproximada (ABC) e Monte Carlo da Cadeia de Markov (MCMC) têm objetivos muito semelhantes. Abaixo, descrevo minha compreensão desses métodos e como percebo as diferenças em sua aplicação aos dados da vida real. Computação Bayesiana Aproximada ABC consiste em amostrar um parâmetro de um …

4
A precisão da máquina de aumento de gradiente diminui à medida que o número de iterações aumenta
Estou experimentando o algoritmo da máquina de aumento de gradiente através do caretpacote em R. Usando um pequeno conjunto de dados de admissões de faculdade, executei o seguinte código: library(caret) ### Load admissions dataset. ### mydata <- read.csv("http://www.ats.ucla.edu/stat/data/binary.csv") ### Create yes/no levels for admission. ### mydata$admit_factor[mydata$admit==0] <- "no" mydata$admit_factor[mydata$admit==1] <- …
15 machine-learning  caret  boosting  gbm  hypothesis-testing  t-test  panel-data  psychometrics  intraclass-correlation  generalized-linear-model  categorical-data  binomial  model  intercept  causality  cross-correlation  distributions  ranks  p-value  z-test  sign-test  time-series  references  terminology  cross-correlation  definition  probability  distributions  beta-distribution  inverse-gamma  missing-data  paired-comparisons  paired-data  clustered-standard-errors  cluster-sample  time-series  arima  logistic  binary-data  odds-ratio  medicine  hypothesis-testing  wilcoxon-mann-whitney  unsupervised-learning  hierarchical-clustering  neural-networks  train  clustering  k-means  regression  ordinal-data  change-scores  machine-learning  experiment-design  roc  precision-recall  auc  stata  multilevel-analysis  regression  fitting  nonlinear  jmp  r  data-visualization  gam  gamm4  r  lme4-nlme  many-categories  regression  causality  instrumental-variables  endogeneity  controlling-for-a-variable 


1
Quais são algumas boas perguntas da entrevista para candidatos a desenvolvedores de algoritmos estatísticos?
Estou entrevistando pessoas para uma posição de desenvolvedor / pesquisador de algoritmos em um contexto de estatística / aprendizado de máquina / mineração de dados. Estou procurando perguntas para determinar, especificamente, a familiaridade, compreensão e fluidez de um candidato com a teoria subjacente, por exemplo, propriedades básicas de expectativa e …



Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.