Arquivos texto, binários e encoding
Objetivo
Compreender que todos os arquivos são bytes e que texto exige uma codificação.
Conceitos essenciais
Texto
Arquivo de texto é interpretado como caracteres usando encoding definido ou inferido.
Binário
Chamamos de binário, na prática, formatos cuja estrutura não é destinada à leitura direta como caracteres.
UTF-8
O curso adota UTF-8 para arquivos textuais didáticos.
Quebras de linha
LF e CRLF são convenções diferentes de final de linha; ferramentas de versionamento podem normalizá-las.
BOM
UTF-8 pode ser encontrado com ou sem BOM; para nossos arquivos de código e configuração, preferimos UTF-8 sem BOM salvo exigência específica.
Modelo mental
BYTES → ENCODING/FORMATO → TEXTO ou ESTRUTURA BINÁRIAExemplo e demonstração
Um arquivo PHP iniciado com bytes inesperados antes de certos headers pode causar efeitos indesejados em contextos Web; por isso encoding e bytes invisíveis importam.
Experimento / prática
- Crie um TXT UTF-8 e observe a codificação no editor.
- Compare quebra de linha de um arquivo quando sua ferramenta permitir.
Erros comuns
- Todo arquivo binário é executável.
- UTF-8 significa um byte por caractere.
Resumo
Ao concluir esta aula, revise o modelo mental e tente explicá-lo com suas próprias palavras antes de avançar.