Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados


1
Inferência no modelo linear com heterocedasticidade condicional
Suponha que eu observe vetores variáveis ​​independentes e e a variável dependente . Gostaria de ajustar um modelo do formulário: que é uma função com duas funções diferenciáveis ​​de valor positivo, é um parâmetro de escala desconhecido e é uma variável aleatória gaussiana de média variável e variação zero (assumida …


2
Regressão logística ponderada por caso
Estou analisando alguns problemas de regressão logística. ("regular" e "condicional"). Idealmente, eu gostaria de ponderar cada um dos casos de entrada para que o glm se concentre mais em prever os casos de maior peso corretamente, às custas de possivelmente classificar incorretamente os casos de menor peso. Certamente isso já …
9 logistic 


2
Distribuição do desvio padrão
Esta questão abordou a distribuição normal, mas estou me perguntando o que se sabe sobre a distribuição do desvio padrão de uma amostra de tamanho n extraída de uma distribuição arbitrária. Em particular, qual é o desvio padrão do desvio padrão? Para uma distribuição normal, o sd do sd é …

2
Compreendendo os resultados da regressão de crista
Eu sou novo na regressão cume. Quando apliquei a regressão linear, obtive os seguintes resultados: >myridge = lm.ridge(y ~ ma + sa + lka + cb + ltb , temp, lamda = seq(0,0.1,0.001)) > select(myridge) modified HKB estimator is 0.5010689 modified L-W estimator is 0.3718668 smallest value of GCV at …


3
Boxplot para várias distribuições?
Preciso desenhar 20 distribuições em um único gráfico em R, e isso não me parece bom (confuso) com boxplot regular (20 caixas), mesmo com boxwex = 0,3. Você poderia me sugerir como plotar um tipo de boxplot em R para as 20 distribuições, com pontos para mediana e apenas uma …
9 r  boxplot 

1
Como escolher o número de divisões em rpart ()?
Eu tenho usado rpart.controlpara minsplit=2, e obteve os seguintes resultados de rpart()função. Para evitar o ajuste excessivo dos dados, preciso usar as divisões 3 ou 7? Não devo usar divisões 7? Por favor deixe-me saber. Variáveis ​​realmente usadas na construção de árvores: [1] ct_a ct_b usr_a Root node error: 23205/60 …
9 r  cart  rpart 

4
Clustering com medidas de distância assimétricas
Como você agrupa um recurso com uma medida de distância assimétrica? Por exemplo, digamos que você esteja agrupando um conjunto de dados com dias da semana como um recurso - a distância de segunda a sexta-feira não é a mesma que a distância de sexta a segunda-feira. Como você incorpora …

2
Em qual configuração você esperaria que o modelo encontrado pelo LARS diferisse mais do modelo encontrado por pesquisa exaustiva?
Um pouco mais de informação; Suponha que você sabe de antemão quantas variáveis ​​selecionar e que define a penalidade de complexidade no procedimento LARS para ter exatamente tantas variáveis ​​com coeficientes diferentes de 0, custos de computação não são um problema (o número total de variáveis ​​é pequeno, digamos 50), …


1
Como somar duas variáveis ​​que estão em escalas diferentes?
Se eu tiver duas variáveis ​​seguindo duas distribuições diferentes e tendo desvios padrão diferentes ... Como preciso transformar duas variáveis ​​para que, quando somar, os dois resultados não sejam "conduzidos" por um mais volátil. Por exemplo ... A variável A é menos volátil que a variável B (varia de 0 …


Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.