Como remover os vocais de uma música (grátis, duas faixas MP3)

Você pode remover os vocais de uma música na Aihangsoft em uma execução: envie a faixa, pressione Separar vocais e baixe dois arquivos MP3, um com o vocal isolado e um com o instrumental. Não é preciso instalar nada nem ter conta, mas um visitante tem uma única execução grátis por dia, limitada a 30 segundos de áudio.

Duas coisas decidem se esta ferramenta serve para você. Primeiro, é uma ferramenta Cloud AI, então seu áudio é enviado ao nosso servidor e encaminhado ao Volcengine AI MediaKit em vez de ser processado no navegador. Segundo, uma execução gratuita é pequena e lenta: 30 segundos de áudio custam 5 créditos, uma conta grátis tem 5 créditos por dia, e até um clipe de 5 segundos leva cerca de 105 segundos porque o serviço adiciona cerca de 100 segundos de custo fixo. As seções abaixo cobrem o que você ganha, quanto custa e os casos em que uma ferramenta diferente é a melhor resposta.

A maioria das pessoas chega com um de dois trabalhos: uma faixa de acompanhamento para karaokê, ou um vocal limpo para um remix, um sample ou uma transcrição. Ambos são possíveis sem instalar nada. O que é fácil de não perceber é que duas saídas são toda a história: sem faixas extras, sem força de separação para ajustar, e sem forma de encaixar uma música inteira de três minutos na cota gratuita.

Removedor de vocais

Divide uma faixa em um acapella e um instrumental como dois arquivos MP3 para download. Uma ferramenta Cloud AI, então seu áudio é enviado para processamento.

Abrir o removedor de vocais

O que você ganha: duas faixas MP3

Cada execução bem-sucedida devolve exatamente dois arquivos, e não uma prévia curta ou um link que desaparece com a página.

SaídaO que há no arquivoPara que as pessoas usam
Vocais (acapella)A linha vocal, com os instrumentos em grande parte removidosRemixes, sampling, conferência de letras, transcrição
Instrumental (faixa de acompanhamento)Bateria, baixo, guitarras, teclados e todo o restoKaraokê, ensaio, gravações de cover

Cada arquivo tem seu próprio reprodutor e botão de download, então você pode pegar um ou ambos. Os nomes vêm do seu upload, então song.mp3 volta como song-vocals.mp3 e song-instrumental.mp3.

Os resultados são temporários: 30 minutos para um visitante, 2 horas para uma conta grátis e 24 horas no Pro. Salve os arquivos antes de fechar a aba, porque depois dessa janela não há um novo download e a única forma de voltar é outra execução.

Esta é uma ferramenta em nuvem, então seu áudio é enviado

A Aihangsoft tem 28 ferramentas que rodam inteiramente no seu navegador: um arquivo é lido para a memória da página, processado ali e devolvido como download, sem nada transmitido. Esta não é uma delas. A separação vocal precisa de um modelo grande demais para rodar em uma aba do navegador, então sua faixa é enviada ao nosso servidor, encaminhada ao Volcengine AI MediaKit, e os dois resultados são gravados de volta para você buscar.

As 45 ferramentas de navegadorEste removedor de vocais
Para onde vai seu áudioFica no seu dispositivoEnviado para o nosso servidor
O que processaSeu navegador, usando Canvas e WebAssemblyVolcengine AI MediaKit, um serviço de IA na nuvem
Por quanto tempo os resultados são mantidosNão armazenado de forma alguma30 minutos como visitante, 2 horas grátis, 24 horas no Pro
ContaNunca necessárioNão obrigatório, mas entrar aumenta a cota diária e o limite de duração
Funciona offlineSim, após o primeiro carregamentoNão

Trate isso como uma janela de retenção, e não como uma promessa sobre registros ou backups. Não envie um master não lançado, um memorando de voz privado ou uma entrevista confidencial, nem qualquer coisa que você não enviaria por e-mail a um desconhecido. Uma música que você comprou, uma demo gravada pela sua própria banda ou um clipe capturado por você é uma troca razoável.

Como remover os vocais de uma música em três passos

  1. Adicione sua faixa. Solte um arquivo de áudio ou vídeo, um de cada vez, de até 30 MB. A duração é lida no navegador primeiro, então um clipe mais longo do que o seu plano permite é sinalizado e o botão é desativado antes de qualquer envio.
  2. Pressione Separar vocais. Não há nada a configurar, então não há uma configuração errada a escolher. A página envia o arquivo, submete a tarefa e depois consulta a cada 3 segundos, imprimindo quanto tempo você esperou.
  3. Baixe as duas faixas. Quando a execução termina, os vocais e o instrumental aparecem com seus próprios reprodutores e botões de download. Salve o que você precisar antes que a janela de retenção feche.

Nada aqui é destrutivo e seu arquivo original permanece intacto. O que você não pode fazer é mudar de ideia no meio do caminho: não há botão de cancelar nem forma de pausar uma tarefa em execução.

Que formatos de áudio e vídeo você pode enviar

O upload aceita tanto áudio quanto vídeo, e o vídeo é convertido em áudio na entrada em vez de pedir que você extraia o som antes.

Tipo de entradaFormatosO que acontece
ÁudioMP3, WAV, M4A, AAC, FLAC, OGGSeparado diretamente
VídeoMP4, MOV, AVI, MKV, WebM, M4V, MPEGA faixa de áudio é extraída e depois separada

O único limite de upload é de 30 MB por arquivo, que um MP3 normal não alcança até cerca da marca de 30 minutos, então a duração é quase sempre o que o impede, e não o tamanho. As duas saídas são MP3, seja o que for que tenha entrado.

O limite de 30 segundos e o que custa uma execução

A duração é medida no servidor com o ffprobe, e não confiada ao navegador, então a duração real do arquivo decide se uma execução é aceita. Nada na página pode mudar isso.

PlanoClipe mais longo em uma execuçãoQuanto custa um clipe de 30 segundosCotaResultados mantidos por
Visitante30 segundosSua única execução grátis do dia1 execução por dia por conexão30 minutos
Conta grátis30 segundos5 créditos5 créditos por dia2 horas
Pro600 segundos (10 minutos)5 créditos1500 créditos por mês24 horas

A cobrança funciona em passos de 30 segundos: o custo é de 5 créditos para cada 30 segundos iniciados, então um clipe de 30 segundos custa 5, um clipe de 31 segundos custa 10, e uma faixa de 10 minutos custa 100. Para uma conta grátis isso significa que 5 créditos por dia compram exatamente uma execução de 30 segundos, sem forma de comprar meia execução ou levar segundos não usados para o dia seguinte.

Um detalhe justo: os créditos só são descontados quando um resultado é de fato produzido. Um arquivo recusado por ser longo demais, ou uma tarefa que falha no serviço, custa tempo mas nada mais, e fechar a página no meio de uma execução não gasta a sua cota.

Quando sua música é mais longa que o limite

Uma música de três minutos não cabe em uma execução de 30 segundos, e não há configuração que mude isso. O caminho viável é cortar a música primeiro.

  1. Corte a seção que você precisa. O cortador de áudio roda inteiramente no navegador, então nada é enviado enquanto você reduz a faixa aos 30 segundos de que precisa.
  2. Separe essa seção. Envie o clipe cortado e baixe as duas faixas assim que a execução terminar.
  3. Repita para outras seções se precisar. Cada passagem é uma execução separada que custa mais 5 créditos por cada 30 segundos iniciados, e juntar as partes em um editor é tarefa sua, porque as emendas dependem de onde você corta.

Por que até um clipe curto leva cerca de dois minutos

A espera não é a sua conexão. O serviço tem um custo fixo de inicialização de cerca de 100 segundos antes que qualquer áudio seja processado, mais um pouco para o próprio áudio. Nas nossas próprias medições, um clipe de 5 segundos é concluído em cerca de 105 segundos e um clipe de 25 segundos em cerca de 125 segundos, então um clipe de 30 segundos fica na ponta lenta da mesma faixa de dois minutos, em vez de ser dramaticamente pior.

A página consulta a tarefa a cada 3 segundos e mostra o tempo decorrido, então uma barra de progresso que quase não se move é esperada, e não um sinal de que algo quebrou. Atualizar não acelera: um recarregamento descarta a referência da tarefa e o resultado não pode mais ser coletado, então deixe a aba aberta e deixe terminar.

Como a separação por IA realmente funciona

A faixa é enviada ao Volcengine AI MediaKit, que roda um modelo treinado de separação de fontes sobre a mixagem. O modelo estima dois sinais, as partes que soam como voz humana e todo o resto, e grava cada um como MP3. Como é uma previsão e não um filtro, ele também funciona em faixas nunca lançadas como instrumental e em gravações mono em que o cancelamento do canal central falha.

Essa mesma propriedade explica por que o resultado não é cirurgicamente limpo. A separação é uma estimativa, então mixagens densas, caudas de reverb longas e vocais distorcidos são os casos mais difíceis, e pequenos vestígios do outro lado podem sobreviver em cada arquivo. Não há um controle deslizante de força para compensar, então se a primeira tentativa soar áspera, tente uma origem mais limpa em vez de procurar uma configuração que não existe.

Para que as duas faixas são usadas

TarefaFaixa que você precisaPor quê
Karaokê ou ensaio de bandaInstrumentalUma faixa de acompanhamento sem caçar um lançamento oficial que pode não existir
Remix, mashup ou sampleVocaisUm acapella limpo entra direto em um editor como um MP3 normal
Letras ou transcriçãoVocaisA música de fundo é o motivo mais comum pelo qual a transcrição automática dá errado

A ferramenta não pode conceder direitos, porém: os direitos autorais da gravação e da composição permanecem com seus donos, então o que você pode publicar ou monetizar depende da sua licença e das regras da plataforma onde você publica.

O que esta ferramenta não pode fazer

  • Ele envia o seu áudio. Esta é uma ferramenta em nuvem, então o arquivo sai do seu dispositivo e é processado por um serviço de IA de terceiros.
  • 30 segundos é um teto rígido para visitantes e contas grátis, aplicado no servidor a partir da duração real, então um clipe mais longo é recusado em vez de cortado para você.
  • A cota gratuita é de no máximo uma execução por dia. Um visitante tem uma única execução, e uma conta grátis tem 5 créditos, o que é exatamente uma execução de 30 segundos.
  • É lento. Cerca de 100 segundos de custo fixo mais um pouco por segundo de áudio, então alguns minutos são normais até para poucos segundos de som.
  • Somente duas faixas. Não há divisão de bateria, baixo, piano ou guitarra. A separação multipista de faixas é uma classe diferente de ferramenta.
  • Sem parâmetros ajustáveis: sem força de separação, sem escolha de partes a manter, e sem forma de corrigir um resultado ruim exceto mudar a origem e gastar outra execução.
  • Um arquivo por execução, sem lote, então uma pasta de faixas precisa ser processada uma de cada vez.
  • Sem reparo manual: sem pincel para apagar vazamentos e sem edição de forma de onda, apenas os dois arquivos finalizados.
  • Os resultados expiram. 30 minutos, 2 horas ou 24 horas dependendo do seu plano, sem novo download depois.

Perguntas frequentes

Envie a faixa ao Removedor de vocais, pressione Separar vocais e espere a execução terminar. A ferramenta devolve dois arquivos MP3, um com o vocal isolado e um com o instrumental, e cada um tem seu próprio reprodutor e botão de download no painel de resultado. Não há nada a configurar, o que também significa que não há configuração a errar. Como visitante, você tem uma execução grátis por dia de até 30 segundos de áudio, e uma conta grátis tem 5 créditos por dia, o que é exatamente uma execução de 30 segundos. Qualquer coisa mais longa precisa ser cortada primeiro, porque o servidor mede a duração real do arquivo e recusa um clipe mais longo antes de o processamento começar. Entrar aumenta tanto a cota diária quanto o limite de duração, até 10 minutos no Pro.
Sim. Esta é uma ferramenta Cloud AI, então seu áudio é enviado ao nosso servidor, encaminhado ao Volcengine AI MediaKit para separação, e os dois resultados são armazenados no nosso servidor para que você os baixe. Isso é o oposto das 45 ferramentas de navegador da Aihangsoft, que nunca transmitem um arquivo. Os resultados são excluídos automaticamente após uma janela definida: 30 minutos para um visitante, 2 horas para uma conta grátis e 24 horas para o Pro. Trate isso como uma janela de retenção, e não como uma promessa sobre registros ou backups, e use a ferramenta como qualquer conversor online. Não envie um master não lançado, um memorando de voz privado, uma entrevista confidencial ou qualquer coisa que você não enviaria por e-mail a um desconhecido. Uma faixa que você possui ou um clipe que você mesmo fez é uma troca razoável.
Um visitante e uma conta grátis podem processar até 30 segundos em uma execução, e o Pro pode processar até 10 minutos. Uma execução custa 5 créditos para cada 30 segundos iniciados, então um clipe de 30 segundos custa 5 créditos, um clipe de 31 segundos custa 10, e uma faixa de 10 minutos custa 100. Um visitante tem uma execução grátis por dia, e uma conta grátis tem 5 créditos por dia, o que é exatamente uma execução de 30 segundos por dia. Os créditos só são descontados quando um resultado é de fato produzido, então um arquivo rejeitado ou uma tarefa falha não custa nada. O limite não é uma sugestão: o servidor lê a duração real com o ffprobe e recusa um clipe mais longo antes de processá-lo, então corte a faixa primeiro em vez de torcer para que ela caiba. O Pro eleva esse teto para 10 minutos, o que é suficiente para separar uma música inteira em uma única passagem.
Não. A saída são duas faixas, vocais e instrumental, e nenhuma outra. O arquivo instrumental contém bateria, baixo, guitarras, teclados e todo o resto misturados, porque é isso que o modelo prevê: as partes que soam como voz humana, e o restante. Não há opção só de bateria, só de baixo ou só de piano, nenhum modo de quatro ou seis faixas, e nenhuma forma de pedir por uma nas configurações. Se o seu trabalho precisa de faixas de instrumentos individuais, esta é a classe errada de ferramenta e você precisa de um software dedicado de separação de faixas ou de uma fonte multipista. Para karaokê, um remix, um sample ou uma transcrição mais limpa, as duas faixas que esta ferramenta produz costumam ser exatamente o que o trabalho precisa. Se você precisa de faixas de instrumentos, procure um serviço dedicado de separação que ofereça um modelo de quatro ou seis faixas, e espere um processo mais lento e mais pesado.
Você pode enviar áudio MP3, WAV, M4A, AAC, FLAC e OGG, ou um arquivo de vídeo em MP4, MOV, AVI, MKV, WebM, M4V ou MPEG. A entrada de vídeo é aceita porque a faixa de áudio é extraída antes da separação, então um videoclipe ou um clipe ao vivo funciona sem que você precise tirar o som antes. Um arquivo por execução, de até 30 MB, e as duas saídas são MP3 independentemente do que entrou. O teto de 30 MB raramente é o problema, já que um MP3 normal só o alcança por volta da marca de 30 minutos; o limite de duração morde primeiro. Se a sua origem estiver em outro contêiner, converta-a para MP3 ou WAV com o conversor de áudio, ou extraia o áudio de um vídeo com o vídeo para MP3, depois envie o resultado. Os dois conversores rodam inteiramente no seu navegador, então nada é enviado até você chegar ao removedor de vocais.

Divida sua música em vocais e instrumental

Dois arquivos MP3 em uma execução. Não precisa de conta para testar um clipe curto.

Abrir o Removedor de vocais