Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

1
Teste de Fisher em R
Suponha que tenhamos o seguinte conjunto de dados: Men Women Dieting 10 30 Non-dieting 5 60 Se eu executar o teste exato de Fisher em R, o que significa alternative = greater(ou menos)? Por exemplo: mat = matrix(c(10,5,30,60), 2,2) fisher.test(mat, alternative="greater") Eu recebo o p-value = 0.01588e odds ratio = …

1
Variável categórica de regressão linear R valor "oculto"
Este é apenas um exemplo que encontrei várias vezes, portanto não tenho dados de amostra. Executando um modelo de regressão linear em R: a.lm = lm(Y ~ x1 + x2) x1é uma variável contínua. x2é categórico e possui três valores, por exemplo, "Baixo", "Médio" e "Alto". No entanto, a saída …
10 r  regression  categorical-data  regression-coefficients  categorical-encoding  machine-learning  random-forest  anova  spss  r  self-study  bootstrap  monte-carlo  r  multiple-regression  partitioning  neural-networks  normalization  machine-learning  svm  kernel-trick  self-study  survival  cox-model  repeated-measures  survey  likert  correlation  variance  sampling  meta-analysis  anova  independence  sample  assumptions  bayesian  covariance  r  regression  time-series  mathematical-statistics  graphical-model  machine-learning  linear-model  kernel-trick  linear-algebra  self-study  moments  function  correlation  spss  probability  confidence-interval  sampling  mean  population  r  generalized-linear-model  prediction  offset  data-visualization  clustering  sas  cart  binning  sas  logistic  causality  regression  self-study  standard-error  r  distributions  r  regression  time-series  multiple-regression  python  chi-squared  independence  sample  clustering  data-mining  rapidminer  probability  stochastic-processes  clustering  binary-data  dimensionality-reduction  svd  correspondence-analysis  data-visualization  excel  c#  hypothesis-testing  econometrics  survey  rating  composite  regression  least-squares  mcmc  markov-process  kullback-leibler  convergence  predictive-models  r  regression  anova  confidence-interval  survival  cox-model  hazard  normal-distribution  autoregressive  mixed-model  r  mixed-model  sas  hypothesis-testing  mediation  interaction 

1
Que problemas devo observar ao combinar várias séries temporais?
Digamos que eu tenha várias séries temporais, por exemplo, vários registros de temperatura de várias estações em uma região. Quero obter um único registro de temperatura para toda a região com a qual possa descrever aspectos do clima regional. A abordagem intuitiva pode ser simplesmente medir a média de todas …



2
Como tratar corretamente vários pontos de dados por cada sujeito
Atualmente, estou discutindo com alguém sobre como tratar corretamente os dados com várias medidas para cada sujeito. Nesse caso, os dados foram coletados para cada sujeito dentro de um curto período de tempo para diferentes condições dentro de cada sujeito. Todas as medidas reúnem exatamente a mesma variável, apenas múltiplas. …


2
Como simular resultados multivariados em R?
Na maioria das situações, lidamos apenas com uma variável de resultado / resposta como . No entanto, em alguns cenários, especialmente nos dados clínicos, as variáveis ​​de resultado podem ser de alta dimensão / multivariada. Tais como Y = β x + ϵ , onde Y contém variáveis Y 1 …




1
Valores ausentes na variável de resposta no JAGS
Gelman e Hill (2006) dizem: No Bugs, os resultados ausentes em uma regressão podem ser manipulados facilmente, simplesmente incluindo o vetor de dados, NAs e tudo. Os bugs modelam explicitamente a variável de resultado e, portanto, é trivial usar esse modelo para, de fato, atribuir valores ausentes a cada iteração. …

2
Floresta aleatória em dados agrupados
Estou usando floresta aleatória em dados agrupados de alta dimensão (50 variáveis ​​numéricas de entrada) que possuem uma estrutura hierárquica. Os dados foram coletados com 6 repetições em 30 posições de 70 objetos diferentes, resultando em 12600 pontos de dados, que não são independentes. Parece que a floresta aleatória está …

1
Objeções à randomização
Nos ensaios clínicos - uma perspectiva metodológica , Steven Piantadosi escreve (cap.13, p. 334): No capítulo 2, observei as objeções à randomização por Abel e Koch (1997) e Urbach (1993) e indiquei o valor de estudar suas preocupações e prováveis ​​erros. Eles rejeitam a randomização como um significa validar certos …


Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.