Apoiando a construção de grandes modelos de linguagem necessários para o desenvolvimento e ajuste de motores de tradução de IA e IA generativa.

Desenvolvimento de motores de tradução de IA e IA generativa,
Necessário para a afinação
Construindo Grandes Modelos de Linguagem
Nós vamos te apoiar.

  • Mais de 1 milhão de pares
  • Suporta mais de 10 idiomas
  • Histórico extenso de entregas
Solicite uma amostra aqui

Sobre tradução e perguntas e respostas por IA
Resolvendo suas preocupações com aprendizado de máquina!

  • Quero desenvolver traduções de IA altamente precisas especializadas em áreas específicas

    Especializado em uma área específica
    Tradução de IA de alta precisão
    Quero desenvolver

  • Quero melhorar a precisão dos chatbots multilíngues

    Chatbot multilíngue
    Precisão
    quero aumentar

  • Quero prever o que dizer durante conversas ou sessões de perguntas e respostas

    Durante conversas e sessões de perguntas e respostas,
    Quero prever a declaração.

  • Procurando um corpus paralelo compatível com línguas do Sudeste Asiático

    Línguas dos países do Sudeste Asiático
    correspondiam
    Corpus de Tradução
    Procurando

  • Quer criar um glossário especializado para sua indústria ou área de especialização

    Por indústria ou área especializada
    Especializada
    Consulte o glossário
    Eu quero fazer

Seis Pontos Fortes da Koden Corporation

  • Mais de 40 anos de experiência

    Mais de 40 anos de experiência

    Desde a década de 1980, temos desenvolvido a tradução automática,
    Temos ampla experiência entregando corporações bilíngues para grandes corporações.
    Contribuindo para a resolução de problemas com anos de experiência e conhecimento
    Oferecemos corpus multilíngues.

  • Forte em áreas especializadas

    Forte em áreas especializadas

    Turismo, assistência médica, direito, finanças, propriedade intelectual, etc.
    Mantém corpora paralelos em vários campos.
    Coletivas de imprensa, sessões de perguntas e respostas e outros formatos de diálogo
    Também oferecemos corpus de tradução.

  • Mais de 1 milhão de pares

    Mais de 1 milhão de pares

    Podemos fornecer mais de 1 milhão de pares de corpus de tradução!
    A ferramenta de suporte à tradução que você está usando
    Também pode ser usado como memória de tradução.

  • Língua rara

    Língua rara

    Além dos dados traduzidos do japonês para o inglês,
    Do inglês às línguas do Sudeste Asiático e línguas raras
    Nós mantemos um corpus paralelo traduzido.

  • Expressão natural

    Expressão natural

    O corpus paralelo é determinado por falantes nativos de cada idioma.
    Por ser traduzido, é único para cada idioma.
    Nuances e clichês são refletidos.

  • semi-personalizado

    semi-personalizado

    Além dos campos e tipos de dados,
    Como também gerenciamos as direções de tradução,
    Podemos extrair o corpus de tradução desejado.
    Também oferecemos a criação de termos técnicos multilíngues.

Apoiando áreas especializadas como essa

Conquistas na Implementação

Divisão de pesquisa de uma grande empresa de telecomunicações
/Instituto de Pesquisa de Estações de Radiodifusão
/ Empresa de desenvolvimento de motores de tradução automática baseada em IA
e mais

Perguntas Frequentes

O que é um "corpus paralelo"?
Um corpus paralelo é uma coleção de frases traduzidas em uma combinação de dois ou mais idiomas, um idioma e outro. No desenvolvimento de motores de tradução automática baseados em IA, dados que mantêm o contexto antes e depois são altamente valorizados. No caso de um único idioma com menos de dois idiomas, ele é chamado de corpus de língua única.
Quantas palavras e combinações são comuns no corpus paralelo?
Oferecemos a maior variedade de opções em japonês e inglês. Além disso, suportamos combinações de inglês e chinês, espanhol e francês, e indonésio e português.
Se eu comprar uma empresa paralela, existem restrições de uso?
Sim, existem corpus paralelos que podem ser usados apenas para aprendizado de máquina, e corpora paralelos que podem ser publicados em sites ou materiais educacionais. Neste último caso, discutiremos os termos antes da compra.
Qual é a unidade mínima de compra ou preço para um corpus de tradução?
Diz-se que cerca de 100.000 pares são necessários para aprendizado de máquina, e nossos clientes frequentemente compram nessa unidade. O preço será negociado separadamente dependendo do uso pretendido e da quantidade de compra.
Como o corpus de tradução é entregue?
Podemos entregar arquivos de texto (CSV, TSV, etc.) ou arquivos Excel mediante solicitação.

Pontos-chave para escolher um corpus paralelo

Pontos-chave para escolher um corpus paralelo

A necessidade de um corpus bilíngue no desenvolvimento e ajuste da tradução automática e da IA generativa multilíngue está aumentando constantemente. Além disso, quando tradutores iniciam a tradução em novas áreas, ter memória acumulada interna melhora muito a eficiência do trabalho de tradução. Por outro lado, coletar corpora bilíngues sistemáticos internamente não é fácil; é mais eficiente obter dados externamente e focar no desenvolvimento dos entregáveis pretendidos e do trabalho de tradução.

Os seis pontos seguintes são pontos-chave para selecionar um corpus paralelo.
1) Combinações de Idiomas
2) Campos
3) Qualidade
4) Quantidade
5) Tipos de Dados
6) Presença ou ausência de contexto

A primeira "combinação de idiomas" refere-se a se o par de idiomas que o tradutor traduz ou o par de idiomas treinado no desenvolvimento de tradução automática é japonês e inglês ou japonês e chinês. Da mesma forma, ao registrar a memória de tradução da ferramenta de suporte à tradução que você usa, a "combinação de idiomas" é considerada o fator mais importante. Além disso, ao buscar expressões mais naturais, determinar qual idioma é o texto original também é um fator importante. Por exemplo, mesmo ao chamá-lo de "corpus paralelo japonês-inglês", é natural notar diferenças na fluência das expressões em inglês e no contexto de tradução entre traduzir a fonte japonesa para o inglês e a fonte em inglês para o japonês.

Os "campos" em 2) referem-se a áreas como turismo, saúde, direito, economia, ciência e tecnologia, entre outros. Por meio de aprendizado de máquina de dados de áreas onde se deseja precisão, o desenvolvimento pode ser acelerado. Ao construir modelos de linguagem para melhorar a precisão da tradução automática em áreas específicas, a eficácia estimada é de cerca de 100.000 pares. É óbvio que campos também são importantes ao criar um dicionário de terminologia técnica a partir de um corpus de biling-translation. No nosso caso, as áreas exigidas no Japão já foram focadas no turismo recebente sob o nome de um país orientado ao turismo, enquanto a área médica precisava de um corpus bilíngue para fortalecer o atendimento médico para visitantes e estrangeiros residentes. Além disso, a demanda se deslocou ao longo de vários anos para áreas de negócios que registram materiais de apresentação usados em apresentações e explicações empresariais, palestras em conferências e eventos, e sessões subsequentes de perguntas e respostas.

Na terceira seção, 'qualidade' refere-se à precisão, que depende de como o corpus paralelo foi criado. É preferível que os dados sejam traduzidos por mãos humanas e, se forem traduzidos usando tradução automática e não passaram por inspeção ou correção humana, a qualidade naturalmente diminuirá. Além disso, mesmo em dados de tradução manual, se a tradução de uma frase for traduzida em duas ou mais frases, e for essencial que o texto original e traduzido correspondam a uma única frase, isso afetará a qualidade. Além disso, se a tradução for excessivamente abreviada, não pode ser considerada um corpus paralelo de alta qualidade.

A "quantidade" no ponto 4 é suficiente para que tradutores registrem dezenas de milhares de pares de corpora paralelos em campos específicos para fins de registro na memória de tradução ou nos dicionários de vocabulário das ferramentas de suporte de tradução usadas internamente. Para aprendizado de máquina em áreas específicas, como o desenvolvimento de motores de tradução automática, diz-se que 100.000 pares são suficientemente eficazes. Por outro lado, o desenvolvimento de motores de tradução automática de uso geral é considerado requer dezenas de milhões de pares. Assim, a quantidade necessária de corpora paralelos varia muito dependendo da aplicação.

Na seção 5, "Tipo de Dados" significa que o arquivo usado para criar o corpus paralelo é um dos seguintes: um relatório/white paper, ou uma apresentação/coletiva de imprensa/sessão de perguntas e respostas. Se você quiser aprender linguagem escrita por máquina, use um relatório ou white paper; se quiser aprender linguagem falada por máquina, utilize um corpus de transcrição criado a partir de apresentações, coletivas de imprensa e perguntas e respostas. Nosso corpus paralelo gerencia os atributos em detalhes, então é possível extrair corpus paralelo por tipo de dado.

A "presença ou ausência de contexto" em 6) significa se há uma conexão semântica entre múltiplas frases. Especificamente, frases de exemplo listadas em dicionários incluem apenas palavras-chave específicas e não têm contexto com outros exemplos. Portanto, é julgado como "contextual". Em contraste, relatórios consistem em múltiplas frases descrevendo um evento ou evento específico, então é considerado "contextual". Da mesma forma, em coletivas de imprensa e sessões de perguntas e respostas, vários palestrantes se revezam conversando, então pode-se dizer que "há contexto." Não se limitando à tradução automática, mas para gerar respostas mais precisas com chatbots, agora é mais importante do que nunca ter "contexto" no corpus de transcrição treinado por aprendizado de máquina.

Conclusão
Ao selecionar uma empresa paralela, você precisa considerar os pontos 1) a 6) acima, de acordo com o uso pretendido. Especialmente ao realizar aprendizado de máquina para áreas específicas, é crucial considerar a necessidade de qualidade, tipo de dado e contexto. Para utilizar um corpus paralelo adequado aos seus objetivos, por favor, verifique primeiro nossos dados de amostra gratuita.

Fechar
Leia mais