Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados



1
Por que ln [E (x)]> E [ln (x)]?
Estamos lidando com a distribuição lognormal em um curso de finanças e meu livro apenas afirma que isso é verdade, o que acho frustrante, pois meus conhecimentos em matemática não são muito fortes, mas quero a intuição. Alguém pode me mostrar por que esse é o caso?


1
Equivalência das especificações de efeito aleatório (0 + fator | grupo) e (1 | grupo) + (1 | grupo: fator) em caso de simetria composta
Douglas Bates afirma que os seguintes modelos são equivalentes "se a matriz de variância-covariância para efeitos aleatórios com valor vetorial tiver uma forma especial, chamada simetria composta" ( slide 91 desta apresentação ): m1 <- lmer(y ~ factor + (0 + factor|group), data) m2 <- lmer(y ~ factor + (1|group) …


1
Usando o iloc para definir valores [fechado]
Fechadas. Esta questão está fora de tópico . No momento, não está aceitando respostas. Deseja melhorar esta pergunta? Atualize a pergunta para que ela esteja no tópico de Validação cruzada. Fechado há 2 anos . Essa linha retorna as 4 primeiras linhas no quadro de dados combinedparafeature_a combined.iloc[0:4]["feature_a"] Como esperado, …
13 python  pandas 

2
Otimização e aprendizado de máquina
Eu queria saber quanto do aprendizado de máquina requer otimização. Pelo que ouvi, estatísticas é um tópico matemático importante para pessoas que trabalham com aprendizado de máquina. Da mesma forma, qual é a importância de alguém que trabalha com aprendizado de máquina para aprender sobre otimização convexa ou não convexa?


2
Eu não entendo a variação do binômio
Eu me sinto muito idiota mesmo fazendo uma pergunta tão básica, mas aqui vai: Se eu tiver uma variável aleatória XXX que podem assumir valores 000 e 111 , com P(X=1)=pP(X=1)=pP(X=1) = p e P(X=0)=1−pP(X=0)=1−pP(X=0) = 1-p , então se eu desenhar nnn amostras fora dele, eu vou chegar uma …

8
Pesquisas: 25% de uma grande base de usuários é representativa?
Atualmente, meu empregador está realizando uma pesquisa ampla sobre as atitudes em relação ao escritório, ou seja, sentimentos. No passado, eles abriram a pesquisa para todas as áreas da empresa (vamos assumir 10 departamentos muito diferentes) e para todos os funcionários (assumir 1000 funcionários no total em toda a empresa) …

1
Se
Encontrei uma prova de uma das propriedades do modelo ARCH que diz que, se , { X t } é estacionário se f ∑ p i = 1 b i &lt; 1 em que o modelo ARCH é:E(X2t)&lt;∞E(Xt2)&lt;∞\mathbb{E}(X_t^2) < \infty{Xt}{Xt}\{X_t\}∑pi=1bi&lt;1∑i=1pbi&lt;1\sum_{i=1}^pb_i < 1 Xt=σtϵtXt=σtϵtX_t = \sigma_t\epsilon_t σ2t=b0+b1X2t−1+...bpX2t−pσt2=b0+b1Xt−12+...bpXt−p2\sigma_t^2 = b_0 + b_1X_{t-1}^2 …

4
Normas
Uma norma é única (pelo menos em parte) porque está no limite entre não convexo e convexo. Uma norma é a norma convexa 'mais esparsa' (certo?).L1L1L_1p=1p=1p=1L1L1L_1 Entendo que a norma euclidiana tem raízes na geometria e tem uma interpretação clara quando as dimensões têm as mesmas unidades. Mas não entendo …

4
Deveria se preocupar com a multicolinearidade ao usar modelos não lineares?
Digamos que temos um problema de classificação binária com recursos principalmente categóricos. Usamos algum modelo não linear (por exemplo, XGBoost ou Random Forests) para aprendê-lo. Ainda se deve preocupar com a multicolinearidade? Por quê? Se a resposta acima for verdadeira, como combatê-la, considerando que estamos usando esses tipos de modelos …


Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.