Um embedding transforma cada termo num vetor denso de números. Abaixo: o caminho do texto ao vetor, a matriz termo × dimensão (heatmap), o vetor de um termo selecionado e a aritmética de vetores que torna o sentido operável.
Do texto ao vetor
1 · Texto
“furto mediante fraude eletrônica”
→
2 · Tokens
furto · mediante · fraude · eletrônica
→
3 · Modelo
camada de embedding mapeia cada token a um vetor
→
4 · Vetor denso
[0.31, -0.12, 0.88, …]
→
5 · Espaço
ponto/posição entre os demais sentidos
Matriz do embedding
Termo × dimensão (24 dimensões densas)
Cada linha é o vetor de um termo. As cores são os valores das dimensões — negativos e positivos. Num modelo real, as dimensões são opacas; aqui são deterministicamente derivadas de 8 traços jurídicos. Clique numa linha.
−+passe o mouse numa célula para ver o valor
Termo selecionado
—
Vetor denso (24 dim):
Traços interpretáveis (8 dim):
Vizinhos no espaço do embedding
Maior similaridade do cosseno
cos(θ)=A·B / (‖A‖‖B‖) — calculado no vetor denso de 24 dimensões.
Aritmética de vetores
Operar com sentidos
O famoso “rei − homem + mulher ≈ rainha”, no domínio penal. Escolha termos e dimensões; o resultado é o conceito mais próximo do vetor obtido.