Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados


3
Escore e semelhança da distância euclidiana
Estou apenas trabalhando com o livro Inteligência Coletiva (de Toby Segaran) e me deparei com a pontuação da distância euclidiana. No livro, o autor mostra como calcular a semelhança entre duas matrizes de recomendação (ou seja, .pessoa × filme ↦ pontuação )pessoa×filme↦Ponto)\textrm{person} \times \textrm{movie} \mapsto \textrm{score}) Ele calcula a distância …

1
Entropia Diferencial
A entropia diferencial do VR gaussiano é log2(σ2πe−−−√)log2⁡(σ2πe)\log_2(\sigma \sqrt{2\pi e}). Isso depende deσσ\sigma, que é o desvio padrão. Se normalizarmos a variável aleatória para que ela tenha variação unitária, sua entropia diferencial cai. Para mim, isso é contra-intuitivo, porque a complexidade Kolmogorov da constante de normalização deve ser muito pequena …


2
Expectativa condicional da variável aleatória exponencial
For a random variable X∼Exp(λ)X∼Exp(λ)X\sim \text{Exp}(\lambda) (E[X]=1λE[X]=1λ\mathbb{E}[X] = \frac{1}{\lambda}) I feel intuitively that E[X|X>x]E[X|X>x]\mathbb{E}[X|X > x] should equal x+E[X]x+E[X]x + \mathbb{E}[X] since by the memoryless property the distribution of X|X>xX|X>xX|X > x is the same as that of XXX but shifted to the right by xxx. However, I'm struggling to …


3
Implementação de laço não negativo em R
Estou procurando algum código-fonte aberto ou uma biblioteca existente que eu possa usar. Tanto quanto eu digo, o pacote glmnet não é muito facilmente extensível para cobrir o caso não negativo. Posso estar errado, qualquer pessoa com alguma idéia muito apreciada. Por não negativo, quero dizer que todos os coeficientes …
13 r  lasso 


3
Como você pode lidar com estimativas instáveis ​​de
Estabilidade beta em regressão linear com alta multicolinearidade? Digamos que em uma regressão linear, as variáveis x1x1x_1 e x2x2x_2 têm alta multicolinearidade (a correlação é de cerca de 0,9). Estamos preocupados com a estabilidade do coeficiente ββ\beta , portanto temos que tratar a multicolinearidade. A solução do livro seria apenas …



2
Encontrando os melhores recursos nos modelos de interação
Eu tenho uma lista de proteínas com seus valores de característica. Uma tabela de amostra é assim: ...............Feature1...Feature2...Feature3...Feature4 Protein1 Protein2 Protein3 Protein4 Linhas são proteínas e colunas são características. Eu também tenho uma lista de proteínas que interagem também; por exemplo Protein3, Protein4 Protein1, Protein2 Protein4, Protein1 Problema : Para …

2
Por que usar uma distribuição beta no parâmetro Bernoulli para regressão logística hierárquica?
Atualmente, estou lendo o excelente livro "Doing Bayesian Data Analysis" de Kruschke. No entanto, o capítulo sobre regressão logística hierárquica (capítulo 20) é um tanto confuso. A Figura 20.2 descreve uma regressão logística hierárquica em que o parâmetro de Bernoulli é definido como uma função linear nos coeficientes transformados através …

2
Problema com e1071 libsvm?
Eu tenho um conjunto de dados com duas classes sobrepostas, sete pontos em cada classe, os pontos estão no espaço bidimensional. Em R, e estou executando svmo e1071pacote para criar um hiperplano de separação para essas classes. Estou usando o seguinte comando: svm(x, y, scale = FALSE, type = 'C-classification', …

1
Sequência de Halton vs Sequência de Sobol?
A partir de uma resposta em uma pergunta anterior , fui direcionado para a sequência de Halton, para criar um conjunto de vetores que cobria um espaço de amostra uniforme de maneira bastante uniforme. Mas a página da wikipedia menciona que números primos mais altos são geralmente altamente correlacionados no …

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.