Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados





2
Localizando o índice da coluna pelo nome em R [fechado]
Fechadas. Esta questão está fora de tópico . No momento, não está aceitando respostas. Deseja melhorar esta pergunta? Atualize a pergunta para que ela esteja no tópico de Validação cruzada. Fechado há 6 anos . Em um quadro de dados, gostaria de obter o índice da coluna por nome. Por …
11 r 



1
Simulação da série ARIMA (1,1,0)
Eu adaptei os modelos ARIMA às séries temporais originais, e o melhor modelo é o ARIMA (1,1,0). Agora eu quero simular a série desse modelo. Escrevi o modelo simples AR (1), mas não conseguia entender como ajustar a diferença no modelo ARI (1,1,0). O seguinte código R para a série …
11 r  time-series  arima 

2
Variância de duas variáveis ​​aleatórias ponderadas
Deixei: Desvio padrão da variável aleatóriaA=σ1=5A=σ1=5A =\sigma_{1}=5 Desvio padrão da variável aleatóriaB=σ2=4B=σ2=4B=\sigma_{2}=4 Então a variação de A + B é: Var(w1A+w2B)=w21σ21+w22σ22+2w1w2p1,2σ1σ2Var(w1A+w2B)=w12σ12+w22σ22+2w1w2p1,2σ1σ2Var(w_{1}A+w_{2}B)= w_{1}^{2}\sigma_{1}^{2}+w_{2}^{2}\sigma_{2}^{2} +2w_{1}w_{2}p_{1,2}\sigma_{1}\sigma_{2} Onde: p1,2p1,2p_{1,2} é a correlação entre as duas variáveis ​​aleatórias. w1w1w_{1} é o peso da variável aleatória A w2w2w_{2} é o peso da variável aleatória B w1+w2=1w1+w2=1w_{1}+w_{2}=1 …

4
Como você testa uma implementação de k-means?
Isenção de responsabilidade: postei esta pergunta no Stackoverflow, mas achei que talvez isso seja mais adequado para esta plataforma. Como você testa sua própria implementação de k-means para conjuntos de dados multidimensionais? Eu estava pensando em executar uma implementação já existente (ou seja, Matlab) nos dados e comparar os resultados …

3
Como realizar o teste t com amostras enormes?
Eu tenho duas populações, uma com N = 38.704 (número de observações) e outra com N = 1.313.662. Esses conjuntos de dados têm ~ 25 variáveis, todas contínuas. Eu calculei a média de cada um em cada conjunto de dados e calculei a estatística do teste usando a fórmula t …
11 t-test 


2
Soft-limiar vs. Lasso penalização
Estou tentando resumir o que entendi até agora na análise multivariada penalizada com conjuntos de dados de alta dimensão, e ainda luto para obter uma definição adequada da penalização de limiar suave versus penalização por Lasso (ou ).L1L1L_1 Mais precisamente, usei a regressão PLS esparsa para analisar a estrutura de …


1
Qual a diferença entre splines cúbicos restritos e splines penalizados?
Estou lendo muito sobre o uso de splines em vários problemas de regressão. Alguns livros (por exemplo, modelos lineares ricamente parametrizados da Hodges ) recomendam splines penalizadas. Outros (por exemplo, estratégias de modelagem de regressão de Harrell ) optam por splines cúbicos restritos. Quão diferentes são esses, na prática? Você …

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.