Qwen3.8-Flash-Next abre os pesos e antecipa a arquitetura do Qwen4

A equipe Qwen, da Alibaba, abriu em 26 de agosto de 2026 os pesos do Qwen3.8-Flash-Next. A cobertura da PC Watch confirma a publicação como modelo multimodal MoE de pesos abertos e prévia da arquitetura do Qwen4, com 125 bilhões de parâmetros no modelo principal, 51 bilhões adicionais em embeddings de N-gram e 6 bilhões ativados por token.
Na mesma data, o repositório oficial no Hugging Face passou a oferecer cerca de 360 GB de arquivos, configurações e processador multimodal sob a Qwen Community License 1.0, além de instruções para Transformers, vLLM e SGLang. O material pode ser inspecionado e executado, mas a própria classificação do repositório como experimental não transforma essa versão na especificação definitiva do Qwen4.
O que os pesos abertos entregam
O Qwen3.8-Flash-Next recebe texto, imagens e vídeo e gera texto. Não há suporte nativo anunciado para áudio, que precisa ser convertido por uma etapa externa antes de entrar no modelo. No caso de vídeo, o motor de inferência extrai e processa quadros; taxa de amostragem, resolução e texto compartilham o orçamento de contexto.
A arquitetura MoE ativa somente uma parcela dos especialistas para cada token, reduzindo a computação matricial de uma passagem. Isso não significa, porém, que a implantação precise armazenar apenas os 6 bilhões de parâmetros ativos: o conjunto principal continua muito maior e inclui a tabela adicional de embeddings. A diferença entre parâmetros totais e ativos é central para estimar memória, transferência de dados e custo operacional.
A licença permite usar, modificar, distribuir, hospedar e adaptar o software, mas impõe condições próprias. Produtos ou serviços comerciais com mais de 100 milhões de usuários ativos mensais ou receita mensal acima de US$ 20 milhões devem exibir o nome do modelo; negócios de Model as a Service ou de assistente de trabalho com IA precisam obter uma licença separada, salvo o uso interno definido no documento. Por isso, “pesos abertos” descreve a disponibilidade técnica dos artefatos, não uma licença Apache 2.0 sem condições adicionais.
A prévia altera atenção, resíduos e embeddings

A divulgação técnica da Qwen apresenta quatro mudanças que poderão sustentar o Qwen4: três de cada quatro camadas usam Gated DeltaNet e a restante emprega Qwen Sparse Attention; o Gated Residual divide o fluxo residual em quatro ramificações; uma tabela de 51 bilhões de embeddings de N-gram pode ficar na memória do host; e partes do treinamento usam o otimizador Muon. O texto também fixa uma janela nativa de 262.144 tokens, extensível a um milhão com YaRN, e declara que os pesos foram publicados antecipadamente para avaliação antes da construção da família completa.
Gated DeltaNet comprime o histórico em um estado de tamanho controlado, enquanto Qwen Sparse Attention procura regiões relevantes do contexto em microblocos. A combinação tenta evitar o custo de aplicar atenção global a toda a sequência em todas as camadas, preservando camadas capazes de recuperar informações distantes com maior precisão.
O embedding de N-gram segue outra estratégia: consulta padrões locais em uma tabela cujas posições podem ser previstas e transferidas antecipadamente da memória do sistema. Essa separação pode poupar memória dos aceleradores, mas depende de largura de banda, prefetch assíncrono e suporte adequado do motor. São componentes efetivamente presentes no modelo publicado; ainda assim, suas proporções e implementações podem mudar até o Qwen4 final.
Texto, imagem e vídeo dividem o mesmo contexto
A janela nativa comporta até 262.144 tokens, e a ampliação para um milhão requer YaRN e configuração específica do servidor. O limite nominal não equivale a uma quantidade fixa de páginas ou minutos de vídeo: imagens e quadros são convertidos em tokens visuais e concorrem com instruções, histórico e resposta pela mesma capacidade.
A extensão também não garante desempenho uniforme em entradas curtas e longas. A documentação alerta que implementações abertas usam YaRN estático, cujo fator permanece constante independentemente do tamanho da entrada e pode afetar tarefas menores. No processamento de vídeo, a amostragem de quadros ainda varia conforme o motor e seus parâmetros.
Os 8,6 vezes dependem de cache e contexto extremos

O maior número de eficiência divulgado é um throughput de prefill 8,6 vezes superior ao do Qwen3.7-Plus, medido pela própria Qwen com contexto de um milhão de tokens e 90% de acerto no cache de prefixo. A empresa também informa aceleração de até 7,6 vezes no kernel de atenção durante o prefill e de até 4,9 vezes no decode nesse comprimento. São métricas do fabricante, não resultados de um teste independente.
Prefill é a etapa em que o servidor processa a entrada antes de gerar a resposta. Com 90% de acerto no cache, quase todo o prefixo já foi calculado em uma solicitação anterior; o sistema precisa trabalhar principalmente sobre a parte nova. Conversas inéditas, prompts curtos ou cargas que reutilizam pouco contexto não reproduzem automaticamente essa vantagem.
Há ainda uma diferença entre acelerar o kernel de atenção e aumentar a vazão do sistema completo. Formato numérico, hardware, paralelismo, tamanho dos lotes, versão do motor, largura de banda entre CPU e GPU e política de cache interferem no resultado final. A comparação de 8,6 vezes deve ser lida como evidência de um cenário controlado de alta reutilização, não como multiplicador geral de velocidade.
Executar é possível; reproduzir a eficiência é outra questão
Transformers oferece uma rota direta para carregar os arquivos e experimentar as modalidades publicadas. Para atendimento concorrente, a documentação recomenda motores dedicados, como vLLM e SGLang, porque a vazão varia significativamente entre frameworks e versões. Compatibilidade com o formato, portanto, não garante suporte a todas as otimizações da arquitetura.
A implantação precisa acomodar os pesos, o cache de contexto e a tabela de N-gram ou transferir parte desse material da memória do host. Quantizações produzidas por terceiros podem reduzir armazenamento e memória, mas adicionam condições que não fazem parte da comparação oficial. Também não há, no anúncio, uma configuração universal de hardware capaz de reproduzir os números em qualquer carga.
O estado confirmado desde 26 de agosto de 2026 é o de uma prévia multimodal executável, com pesos e configurações disponíveis e componentes que a Qwen pretende levar adiante no Qwen4. Permanecem em aberto a arquitetura final da nova família e avaliações independentes dos ganhos em diferentes servidores, comprimentos de contexto e taxas reais de reutilização do cache.
Leia também:
Assine nossa newsletter
Receba as últimas notícias sobre Web3, IA e cripto diretamente no seu e-mail.