Especializado em uma área específica
Tradução de IA de alta precisão
Quero desenvolver
Chatbot multilíngue
Precisão
quero aumentar
Durante conversas e sessões de perguntas e respostas,
Quero prever a declaração.
Línguas dos países do Sudeste Asiático
correspondiam
Corpus de Tradução
Procurando
Por indústria ou área especializada
Especializada
Consulte o glossário
Eu quero fazer
Desde a década de 1980, temos desenvolvido a tradução automática,
Temos ampla experiência entregando corporações bilíngues para grandes corporações.
Contribuindo para a resolução de problemas com anos de experiência e conhecimento
Oferecemos corpus multilíngues.
Turismo, assistência médica, direito, finanças, propriedade intelectual, etc.
Mantém corpora paralelos em vários campos.
Coletivas de imprensa, sessões de perguntas e respostas e outros formatos de diálogo
Também oferecemos corpus de tradução.
Podemos fornecer mais de 1 milhão de pares de corpus de tradução!
A ferramenta de suporte à tradução que você está usando
Também pode ser usado como memória de tradução.
Além dos dados traduzidos do japonês para o inglês,
Do inglês às línguas do Sudeste Asiático e línguas raras
Nós mantemos um corpus paralelo traduzido.
O corpus paralelo é determinado por falantes nativos de cada idioma.
Por ser traduzido, é único para cada idioma.
Nuances e clichês são refletidos.
Além dos campos e tipos de dados,
Como também gerenciamos as direções de tradução,
Podemos extrair o corpus de tradução desejado.
Também oferecemos a criação de termos técnicos multilíngues.
Oferecemos precauções importantes para trabalho seguro em fábricas e canteiros de obras, apresentadas em formatos conversacionais específicos do setor.
Abrangemos uma ampla variedade de áreas, desde indústrias primárias como agricultura, silvicultura e pesca até relatórios sobre economia, finanças, TI e energia nuclear.
Fornecemos dados multilíngues necessários para estrangeiros que entram e vivem no Japão, incluindo leis relacionadas a status de entrada e residência e entrevistas médicas em locais médicos.
Divisão de pesquisa de uma grande empresa de telecomunicações
/Instituto de Pesquisa de Estações de Radiodifusão
/ Empresa de desenvolvimento de motores de tradução automática baseada em IA
e mais
A necessidade de um corpus bilíngue no desenvolvimento e ajuste da tradução automática e da IA generativa multilíngue está aumentando constantemente. Além disso, quando tradutores iniciam a tradução em novas áreas, ter memória acumulada interna melhora muito a eficiência do trabalho de tradução. Por outro lado, coletar corpora bilíngues sistemáticos internamente não é fácil; é mais eficiente obter dados externamente e focar no desenvolvimento dos entregáveis pretendidos e do trabalho de tradução.
Os seis pontos seguintes são pontos-chave para selecionar um corpus paralelo.
1) Combinações de Idiomas
2) Campos
3) Qualidade
4) Quantidade
5) Tipos de Dados
6) Presença ou ausência de contexto
A primeira "combinação de idiomas" refere-se a se o par de idiomas que o tradutor traduz ou o par de idiomas treinado no desenvolvimento de tradução automática é japonês e inglês ou japonês e chinês. Da mesma forma, ao registrar a memória de tradução da ferramenta de suporte à tradução que você usa, a "combinação de idiomas" é considerada o fator mais importante. Além disso, ao buscar expressões mais naturais, determinar qual idioma é o texto original também é um fator importante. Por exemplo, mesmo ao chamá-lo de "corpus paralelo japonês-inglês", é natural notar diferenças na fluência das expressões em inglês e no contexto de tradução entre traduzir a fonte japonesa para o inglês e a fonte em inglês para o japonês.
Os "campos" em 2) referem-se a áreas como turismo, saúde, direito, economia, ciência e tecnologia, entre outros. Por meio de aprendizado de máquina de dados de áreas onde se deseja precisão, o desenvolvimento pode ser acelerado. Ao construir modelos de linguagem para melhorar a precisão da tradução automática em áreas específicas, a eficácia estimada é de cerca de 100.000 pares. É óbvio que campos também são importantes ao criar um dicionário de terminologia técnica a partir de um corpus de biling-translation. No nosso caso, as áreas exigidas no Japão já foram focadas no turismo recebente sob o nome de um país orientado ao turismo, enquanto a área médica precisava de um corpus bilíngue para fortalecer o atendimento médico para visitantes e estrangeiros residentes. Além disso, a demanda se deslocou ao longo de vários anos para áreas de negócios que registram materiais de apresentação usados em apresentações e explicações empresariais, palestras em conferências e eventos, e sessões subsequentes de perguntas e respostas.
Na terceira seção, 'qualidade' refere-se à precisão, que depende de como o corpus paralelo foi criado. É preferível que os dados sejam traduzidos por mãos humanas e, se forem traduzidos usando tradução automática e não passaram por inspeção ou correção humana, a qualidade naturalmente diminuirá. Além disso, mesmo em dados de tradução manual, se a tradução de uma frase for traduzida em duas ou mais frases, e for essencial que o texto original e traduzido correspondam a uma única frase, isso afetará a qualidade. Além disso, se a tradução for excessivamente abreviada, não pode ser considerada um corpus paralelo de alta qualidade.
A "quantidade" no ponto 4 é suficiente para que tradutores registrem dezenas de milhares de pares de corpora paralelos em campos específicos para fins de registro na memória de tradução ou nos dicionários de vocabulário das ferramentas de suporte de tradução usadas internamente. Para aprendizado de máquina em áreas específicas, como o desenvolvimento de motores de tradução automática, diz-se que 100.000 pares são suficientemente eficazes. Por outro lado, o desenvolvimento de motores de tradução automática de uso geral é considerado requer dezenas de milhões de pares. Assim, a quantidade necessária de corpora paralelos varia muito dependendo da aplicação.
Na seção 5, "Tipo de Dados" significa que o arquivo usado para criar o corpus paralelo é um dos seguintes: um relatório/white paper, ou uma apresentação/coletiva de imprensa/sessão de perguntas e respostas. Se você quiser aprender linguagem escrita por máquina, use um relatório ou white paper; se quiser aprender linguagem falada por máquina, utilize um corpus de transcrição criado a partir de apresentações, coletivas de imprensa e perguntas e respostas. Nosso corpus paralelo gerencia os atributos em detalhes, então é possível extrair corpus paralelo por tipo de dado.
A "presença ou ausência de contexto" em 6) significa se há uma conexão semântica entre múltiplas frases. Especificamente, frases de exemplo listadas em dicionários incluem apenas palavras-chave específicas e não têm contexto com outros exemplos. Portanto, é julgado como "contextual". Em contraste, relatórios consistem em múltiplas frases descrevendo um evento ou evento específico, então é considerado "contextual". Da mesma forma, em coletivas de imprensa e sessões de perguntas e respostas, vários palestrantes se revezam conversando, então pode-se dizer que "há contexto." Não se limitando à tradução automática, mas para gerar respostas mais precisas com chatbots, agora é mais importante do que nunca ter "contexto" no corpus de transcrição treinado por aprendizado de máquina.
Conclusão
Ao selecionar uma empresa paralela, você precisa considerar os pontos 1) a 6) acima, de acordo com o uso pretendido. Especialmente ao realizar aprendizado de máquina para áreas específicas, é crucial considerar a necessidade de qualidade, tipo de dado e contexto. Para utilizar um corpus paralelo adequado aos seus objetivos, por favor, verifique primeiro nossos dados de amostra gratuita.