Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados





2
A linearidade da variância
Eu acho que as duas fórmulas a seguir são verdadeiras: Var(aX)=a2Var(X)Var(aX)=a2Var(X) \mathrm{Var}(aX)=a^2 \mathrm{Var}(X) enquanto a é um número constante Var(X+Y)=Var(X)+Var(Y)Var(X+Y)=Var(X)+Var(Y) \mathrm{Var}(X + Y)=\mathrm{Var}(X)+\mathrm{Var}(Y) seXXX ,YYY são independentes No entanto, não tenho certeza do que está errado com o abaixo: Var(2X)=Var(X+X)=Var(X)+Var(X)Var(2X)=Var(X+X)=Var(X)+Var(X)\mathrm{Var}(2X) = \mathrm{Var}(X+X) = \mathrm{Var}(X) + \mathrm{Var}(X) que não seja igual …


1
Pacote R para floresta aleatória ponderada? opção classwt?
Estou tentando usar a floresta aleatória para prever o resultado de um conjunto de dados extremamente desequilibrado (a taxa de classe minoritária é de apenas 1% ou até menos). Como o algoritmo tradicional de floresta aleatória minimiza a taxa de erro geral, em vez de prestar atenção especial às classes …
16 r  random-forest 

3
O que exatamente é uma distribuição?
Conheço muito pouco de Probabilidade e Estatística e desejo aprender. Vejo a palavra "distribuição" usada em todo o lugar em diferentes contextos. Por exemplo, uma variável aleatória discreta tem uma "distribuição de probabilidade". Eu sei o que é isso. Uma variável aleatória contínua possui uma função de densidade de probabilidade; …


3
Por que uma estatística suficiente contém todas as informações necessárias para calcular qualquer estimativa do parâmetro?
Acabei de começar a estudar estatística e não consigo entender intuitivamente a suficiência. Para ser mais preciso, não consigo entender como mostrar que os dois parágrafos a seguir são equivalentes: Grosso modo, dado um conjunto X de dados independentes distribuídos de forma idêntica condicionados a um parâmetro desconhecido θ, uma …



1
Qual é o intervalo típico de valores possíveis para o parâmetro de contração na regressão penalizada?
Na regressão de laço ou cordão, é necessário especificar um parâmetro de retração, geralmente chamado por λλ\lambda ou αα\alpha . Esse valor geralmente é escolhido por meio da validação cruzada, verificando-se vários valores diferentes nos dados de treinamento e ver qual produz melhor, por exemplo, nos dados de teste. Qual …


1
A probabilidade de log no GLM garantiu convergência para os máximos globais?
Minhas perguntas são: Os modelos lineares generalizados (GLMs) garantem convergir para um máximo global? Se sim, por quê? Além disso, que restrições existem na função de link para garantir a convexidade? Meu entendimento dos GLMs é que eles maximizam uma função de probabilidade altamente não-linear. Assim, eu imaginaria que existem …

Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.