Instructions to use marioluciofjr/layakedin with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Laya
How to use marioluciofjr/layakedin with Laya:
# No code snippets available yet for this library. # To use this model, check the repository files and the library's documentation. # Want to help? PRs adding snippets are welcome at: # https://github.com/huggingface/huggingface.js
- Notebooks
- Google Colab
- Kaggle
layakedin
layakedin classifica temas de posts de CEOs no LinkedIn em 8 famílias temáticas, usando a taxonomia do relatório Presença digital dos CEOs no LinkedIn (Elementar/FGV). Recebe o tema e, se houver, a descrição do post, e devolve a família mais provável com probabilidades calibradas para todas as 8.
É um fine-tuning do checkpoint multilíngue do Laya (convaiinnovations/laya, subpasta multilingual, encoder mmBERT-base, 322M parâmetros), um modelo de decisão não autorregressivo que responde a perguntas tipadas em uma única passagem.
Enquanto modelos generativos comuns funcionam como redatores que geram o texto, o layakedin atua estritamente como um classificador. Ou seja, uma triagem ágil que lê temas e posts e descrições de posts do LinkedIn, organizando entre 8 famílias temáticas, informando com transparência matemática o grau de certeza de cada escolha.
A opção pelo fine-tuning (treinamento direcionado) superou simples instruções (prompts) e sistemas de busca (RAG) porque ensinou o modelo a reconhecer nuances corporativas sutis de forma automática e consistente. Enquanto um comando via prompt pode variar o formato das respostas e o RAG apenas consulta pastas externas como um bibliotecário em estantes, o modelo ajustado gravou essas regras em sua própria estrutura para decidir em milissegundos.
A arquitetura do Laya multilíngue traz como força a velocidade e probabilidades calibradas, mas tem como limitação a dependência de um formato rígido de perguntas, perdendo eficácia diante de gírias, piadas ou textos informais. Para proteger a privacidade e evitar a exposição de dados de executivos reais, 5 mil exemplos de temas fictícios foram gerados e curadas via Gemini Spark e Claude Chat, espelhando com fidelidade a taxonomia cuja pesquisa original da Elementar/FGV está disponível para leitura e download no endereço oficial: https://elementarcomunicacao.com.br/pesquisa-ceos-linkedin-reputacao-valor-de-mercado/#baixar
Este é um projeto independente. Ele não é afiliado, endossado nem mantido pela Elementar ou pela FGV. A taxonomia foi usada como referência a partir do relatório público.
Famílias temáticas
| Rótulo | Família | Abrange |
|---|---|---|
clima |
Clima / Sustentabilidade / Transição Energética | Emissões, descarbonização, energia renovável, ESG ambiental, biodiversidade, água |
trabalho |
Trabalho / Futuro do Trabalho | Relações de trabalho, saúde mental no trabalho, jornada, requalificação, carreira |
tecnologia |
Tecnologia / IA / Governança de Plataformas | IA, dados, privacidade, cibersegurança, regulação digital |
democracia |
Democracia / Instituições / Regulação | Estado de direito, agências reguladoras, integridade, transparência, eleições |
diversidade |
Diversidade / Inclusão / Desigualdade | Raça, gênero, LGBTQIA+, pessoas com deficiência, idade, desigualdade |
desenvolvimento |
Desenvolvimento Nacional / Política Industrial | Política industrial, infraestrutura, comércio exterior, competitividade |
outro_publico |
Other Public Issue | Educação pública, saúde pública, segurança, cultura, consumo |
negocio |
Non-sociopolitical Business Content | Resultados, prêmios, lançamentos, marcos da empresa, sem tema público |
Como usar
pip install "laya>=0.3.20"
import laya
agente = laya.load("marioluciofjr/layakedin")
# Pergunta usada no treino; ela fica salva na configuração do modelo.
pergunta = agente.cfg["pergunta"]
estado = {
"tema": "Nossa usina solar reduziu 40% das emissões da fábrica",
"descricao": "Post sobre a meta de neutralidade de carbono até 2030.", # opcional
}
resposta = agente.predict(estado, pergunta)["answers"]["familia"]
print(resposta["choice"]) # família mais provável, ex.: "clima"
print(resposta["answer_confidence"]) # probabilidade calibrada da família escolhida
print(resposta["probabilities"]) # probabilidades das 8 famílias
Para classificar muitos temas de uma vez, use agente.predict_batch(lista_de_estados, pergunta, batch_size=32).
Importante: use a pergunta salva em agente.cfg["pergunta"], sem alterar a instrução nem as descrições das famílias. O modelo aprendeu a associar exatamente esses textos às famílias.
Dados de treino
- Base: 5.000 exemplos em português, sendo 625 por família. Cada exemplo tem
tema,descricao(vazia em 20% dos casos) efamilia. - Composição:
- 2.782 exemplos vêm de uma base sintética original de temas de posts de 16 CEOs fictícios, com rótulos padronizados e revisados;
- 2.218 exemplos novos foram escritos para cobrir as famílias em 20 setores adicionais.
- Divisão por CEO: os 4 CEOs do teste (bolsa de valores, hotelaria, seguros e siderurgia) não aparecem no treino nem na validação.
| Partição | Exemplos |
|---|---|
| Treino | 3.926 |
| Validação | 496 |
| Teste | 578 |
Todos os textos são sintéticos. A base não contém posts reais do LinkedIn nem dados pessoais de pessoas reais.
Procedimento de treino
| Item | Valor |
|---|---|
| Checkpoint base | convaiinnovations/laya, subpasta multilingual |
| Método | RLCD (gradiente de política com regras de pontuação próprias) + entropia cruzada, como no notebook oficial do Laya |
| Épocas | 4, com a melhor versão restaurada (época 2) |
| Lote efetivo | 32 (8 × acúmulo de 4) |
| Taxa de aprendizado | 2,5e-5 no encoder e 1e-4 na cabeça de decisão, com decaimento em cosseno |
| Opções embaralhadas no treino | Sim, para evitar viés de posição |
max_len / head_max_len |
1024 / 384 |
| Calibração | Temperatura 3,78 para perguntas choice, ajustada na validação |
| Tempo | 11,7 minutos em uma GPU no Google Colab |
Avaliação
Resultado no conjunto de teste (578 exemplos de 4 CEOs que o modelo nunca viu no treino):
| Métrica | Laya multilíngue sem ajuste | layakedin |
|---|---|---|
| Acurácia | 0,270 | 0,829 |
| F1-macro | 0,247 | 0,830 |
| F1-macro: linhas vindas da base original | 0,163 | 0,556 |
| F1-macro: linhas novas | 0,336 | 0,962 |
| ECE (erro de calibração) | 0,451 | 0,053 |
O número mais realista é o F1-macro de 0,556 nas linhas da base original. As linhas novas são mais prototípicas e, por isso, mais fáceis de acertar.
Confusões mais frequentes:
- trabalho ↔ tecnologia, em temas de carreira que falam de dados ou IA;
- diversidade ↔ trabalho / outro_publico, em temas de etarismo, maternidade ou acessibilidade;
- negocio ↔ clima, em conquistas da empresa com tema ambiental, como uma certificação ou uma frota elétrica;
- tecnologia ↔ democracia, em infraestrutura e governança do mercado financeiro.
Várias dessas fronteiras são ambíguas também para quem rotula os dados.
Uso pretendido
- Pesquisa e análise exploratória de comunicação de lideranças empresariais no LinkedIn.
- Triagem e pré-classificação de temas antes de uma revisão humana.
- Planejamento editorial, para mapear o equilíbrio entre temas públicos e corporativos.
Limitações e vieses
- Dados sintéticos: o desempenho em posts reais ainda não foi medido. Antes de usar o modelo em pesquisa, valide-o com uma amostra real anotada por pessoas.
- Um rótulo por texto: um post pode tratar de mais de uma família. O modelo sempre escolhe uma; use as probabilidades para identificar os casos ambíguos.
- Contexto brasileiro: a taxonomia e os exemplos refletem temas do Brasil (ex.: COP30, LGPD, reforma tributária, BRICS).
- Idioma: foi treinado em português. O encoder é multilíngue, mas o desempenho em outros idiomas não foi avaliado.
- Fora do escopo:
- avaliar pessoas, empresas ou posicionamentos políticos;
- tomar decisões automatizadas com consequências para indivíduos;
- tratar a saída como verdade sem revisão humana.
Dica de uso: trate predições com answer_confidence abaixo de 0,5 como incertas e revise-as manualmente.
Licença e créditos
- Licença: Apache 2.0 (ver
LICENSE). - Modelo base: Laya, da Convai Innovations, também sob Apache 2.0. Este repositório contém pesos modificados a partir dele.
- Encoder: mmBERT-base.
- Taxonomia temática: relatório Presença digital dos CEOs no LinkedIn (Elementar/FGV), Anexo I.
- Autor do fine-tuning: Mário Lúcio.
Citação
@misc{layakedin2026,
title = {layakedin: classificação de temas de posts de CEOs no LinkedIn em famílias temáticas},
author = {Mário Lúcio},
year = {2026},
url = {https://huggingface.co/marioluciofjr/layakedin},
note = {Fine-tuning de convaiinnovations/laya (multilingual)}
}
- Downloads last month
- 28
Model tree for marioluciofjr/layakedin
Base model
convaiinnovations/layaEvaluation results
- Acurácia on Base sintética de temas de posts de CEOs (teste com CEOs nunca vistos)test set self-reported0.829
- F1-macro on Base sintética de temas de posts de CEOs (teste com CEOs nunca vistos)test set self-reported0.830
- F1-macro (somente linhas originais) on Base sintética de temas de posts de CEOs (teste com CEOs nunca vistos)test set self-reported0.556
- Expected Calibration Error on Base sintética de temas de posts de CEOs (teste com CEOs nunca vistos)test set self-reported0.053