IA na RAÇA! - TOKENS (FAIXA BRANCA) ⬜️
Cristiano de Magalhães | IA fácil para TODOS
0:00 / 0:00
IA na RAÇA! - TOKENS (FAIXA BRANCA) ⬜️
217 просмотров · 8 дней назад
Cristiano de Magalhães | IA fácil para TODOS
19 подписчиков
217 просмотров · 8 дней назад
Token é um pedaço de palavra. E cada pedaço tem um CPF.
Não é a palavra inteira: é o pedaço. Às vezes com o espaço grudado na frente,
às vezes só uma letra. E cada pedaço desses recebe um número que o identifica —
o token ID, que funciona como o CPF daquele pedaço. É esse número que a IA
processa, porque não existe operação matemática em cima de uma palavra.
Neste vídeo eu abro o tokenizador da própria OpenAI e mostro isso acontecendo,
ao vivo, em português: a frase sendo cortada, cada pedaço ganhando o seu número,
e o mesmo "o" recebendo IDs diferentes só por ter um espaço antes.
E tem uma coisa que quase ninguém sabe: cada empresa corta de um jeito. A mesma
frase de 61 caracteres vira 29 tokens no GPT-3, 23 no GPT-4 e 17 no GPT-5.
Mesmo texto, três cortes diferentes — e no fim do vídeo eu explico o que isso
muda na conta que você paga.
Faixa branca: sem fórmula, sem pré-requisito, com as palavras do dia a dia.
O TOKENIZADOR QUE EU USO NO VÍDEO
https://platform.openai.com/tokenizer
A TRILHA, NA ORDEM
1. O que é inteligência artificial (o panorama)
• IA na RAÇA! - INTELIGÊNCIA ARTIFICIAL DE M...
2. Machine Learning e Deep Learning
• IA na RAÇA! - MACHINE LEARNING E DEEP LEAR...
3. Tokens
• IA na RAÇA! - TOKENS (FAIXA BRANCA) ⬜️
4. Tensores
• IA na RAÇA! - TENSORES (FAIXA BRANCA) ⬜️
5. Embeddings
[ainda não publicado]
6. LLM — o que é, pré-treino, uso e pós-treino
[ainda não publicado]
PLAYLIST DA TRILHA LLM
• IA na RAÇA! - TRILHA LLM
LINKS DAS PLAYLISTS DE TODAS AS FAIXAS NO FINAL
O TOKENIZADOR QUE EU USO NO VÍDEO
https://platform.openai.com/tokenizer
CAPÍTULOS
00:00 Todo mundo que usa IA esbarra em token
00:37 ChatGPT, Claude e Gemini cobram por token — o que você manda e o que recebe
01:11 De onde vem a palavra "token"
01:22 A escultura que vale 100 moedas de ouro
01:56 Na faixa branca: token é pedaço de palavra
02:25 O token ID — o "CPF" do pedaço de palavra
03:01 Por que isso depende do vídeo de Deep Learning
03:28 Não existe operação matemática em cima de uma palavra
04:09 Onde o número vai parar: tensor e embedding
05:15 O que levar deste vídeo
05:56 A frase do exemplo: "O céu está azul"
07:01 Cada empresa tokeniza do seu jeito
07:28 A OpenAI mudou a tokenização do português
09:13 A primeira palavra da frase não leva o espaço
10:25 Como a LLM junta espaço + palavra
11:23 Distribuindo os CPFs no exemplo
13:20 Como um tokenizador melhor separaria "está" e "estava"
15:11 Resumo: pedaço, símbolo e CPF
16:36 Na ferramenta: o tokenizador da OpenAI
18:11 61 caracteres: 29 tokens no GPT-3, 23 no GPT-4, 17 no GPT-5
19:23 Vendo as divisões, cor por cor
20:33 Contando os tokens e os pontos
21:12 A anomalia: o ponto final que recebeu o mesmo CPF
24:04 Cada empresa faz do seu jeito — e talvez um dia convirja
24:30 Por que comparar preço por token não diz nada
26:03 As duas playlists
#tokens #tokenizacao #iagenerativa #chatgpt #llm #inteligenciaartificial
Comenta e compartilha!
Se quiser, me segue ou se conecte comigo no LinkedIn:
/ crisdemagalhaes
--
🥋 TODAS AS FAIXAS: • IA na RAÇA! - TODAS AS FAIXAS 🥋
⚪️ FAIXA BRANCA: • FAIXA BRANCA - IA na RAÇA! ⬜️ ⬜️
🔴 FAIXA VERMELHA: 🚧 em construção - • FAIXA VERMELHA - IA na RAÇA! 🟥 🟥
🟣 FAIXA ROXA: • IA na RAÇA! - FAIXA ROXA 🟪 🟪
⚫️ FAIXA PRETA: 🚧 em construção - • FAIXA PRETA - IA na RAÇA! ⬛️ ⬛️