Quem usa pesquisa em IA como referencia diaria sentiu falta quando o PapersWithCode original saiu do ar. Niels Rogge, do time de open-source da Hugging Face, anunciou no dia 24 de maio o relancamento do site em paperswithcode.co e ja entregou, em uma semana, uma leva de novos recursos. O foco e voltar a ser o ponto central para rastrear estado da arte (SOTA) em benchmarks de IA.
O que voltou (e o que e novo)
O PapersWithCode na sua versao classica funcionava como leaderboard publico para benchmarks de visao computacional, NLP e outras areas. A revivificacao na Hugging Face mantem essa proposta, mas comeca incluindo dominios que entraram em peso depois: agentes, forecasting de series temporais, ASR e mais.
A novidade central desta semana e o suporte a multiplas metricas por benchmark. O Open ASR Leaderboard agora reporta Word Error Rate (WER, taxa de erro por palavra) e o Inverse Real-Time Factor (RTFx, fator de velocidade de inferencia). O leaderboard de Object Detection no COCO ja mostra mAP (mean Average Precision) ao lado de frames por segundo. Em uma area onde o trade-off entre qualidade e velocidade quase sempre define a escolha de modelo na producao, comparar so um numero virou luxo que nao da mais.
Papers que nao estao no Arxiv
Outro ponto pratico: o site aceita submissoes para fora do Arxiv. Da para incluir repositorios do GitHub, blog posts, BiorXiv e outras origens. Quem submete um paper recebe enriquecimento automatico via IA com tags de tarefa e metodo, links para repositorio, evals e mais. O exemplo citado pelo proprio Niels e o DeepSeek-v4, que entrou no sistema sem nunca ter ido ao Arxiv.
O recurso vale especialmente para times de pesquisa industrial que publicam menos em pre-print e mais em blogs tecnicos ou repositorios diretos. O custo de visibilidade desse tipo de trabalho cai bastante.
Lineage de papers e novos metodos
Quando um paper tem predecessor ou continuacao, o site agora mostra essa relacao com um banner sobre o resumo. Os exemplos publicos sao Mamba-3, DINOv2 e GLM-4.5 — onde rastrear a familia importa para entender o que mudou em cada iteracao.
A lista de metodos suportados tambem cresceu. Esta semana entraram Gated DeltaNet, Kimi Delta Attention e Mamba-2, entre outros. Cada metodo agora lista todos os papers que o citam, o que ajuda quem esta avaliando uma tecnica para producao a ter visao de adocao real.
Compartilhamento e cobertura de evals
O leaderboard ganhou um botao de “copy image” tanto no grafico quanto na tabela — util para quem precisa mostrar o estado de um benchmark em redes sociais ou apresentacoes sem screenshotar manualmente.
Na parte de evals, o numero atual e cerca de 3 mil. A estrategia anunciada e comecar pelos modelos suportados na biblioteca Transformers e crescer a partir dai. Quem quiser, pode encontrar as evals listadas no final de cada pagina de paper, como na de Qwen 3.6.
Como acompanhar e dar feedback
Niels avisou que vai abrir um canal no Discord da Hugging Face para discussao, alem do thread ja existente no GitHub para feature requests. A pagina de submissao publica esta em paperswithcode.co/submit.
O que vale testar primeiro
Para quem trabalha com benchmark comparativo no dia a dia, vale entrar no ClawEval, no Open ASR Leaderboard ou no COCO Object Detection e ver como as multiplas metricas mudam a interpretacao do ranking. E se o seu time publica trabalho que nunca foi ao Arxiv, esta na hora de submeter — o site enriquece o material com IA, sem trabalho manual extra.
Reportado originalmente por Hugging Face Blog em 2026-05-24.



