Geração de expressão de referência - Referring expression generation
A geração de expressão de referência ( REG ) é a subtarefa da geração de linguagem natural (NLG) que recebeu a maior atenção acadêmica. Enquanto o NLG se preocupa com a conversão de informações não linguísticas em linguagem natural, o REG concentra-se apenas na criação de expressões referenciais (sintagmas nominais) que identificam entidades específicas chamadas alvos .
Esta tarefa pode ser dividida em duas seções. A parte de seleção de conteúdo determina qual conjunto de propriedades distingue o destino pretendido e a parte de realização linguística define como essas propriedades são traduzidas em linguagem natural. Uma variedade de algoritmos foi desenvolvida na comunidade NLG para gerar diferentes tipos de expressões de referência.
Tipos de expressões de referência
Uma expressão referencial (RE), em linguística, é qualquer sintagma nominal , ou substituto de um sintagma nominal, cuja função no discurso é identificar algum objeto individual (coisa, ser, evento ...) A terminologia técnica para identificar difere muito lidar de uma escola de linguística para outra. O termo mais difundido é provavelmente referir , e uma coisa identificada é um referente , como por exemplo na obra de John Lyons . Na linguística, o estudo das relações de referência pertence à pragmática , o estudo do uso da linguagem, embora seja também uma questão de grande interesse para os filósofos, especialmente para aqueles que desejam compreender a natureza do conhecimento , da percepção e da cognição de forma mais geral.
Vários dispositivos podem ser usados para referência: determinantes , pronomes , nomes próprios ... As relações de referência podem ser de diferentes tipos; os referentes podem estar em um mundo "real" ou imaginário, no próprio discurso, e podem ser singulares, plurais ou coletivos.
Pronomes
O tipo mais simples de expressões de referência são pronomes como ele e isso . As comunidades de linguística e de processamento de linguagem natural desenvolveram vários modelos para prever referências de anáforas, como a teoria de centralização, e idealmente a geração de expressões referenciais seria baseada em tais modelos. No entanto, a maioria dos sistemas NLG usa algoritmos muito mais simples, por exemplo, usando um pronome se o referente foi mencionado na frase anterior (ou oração sentencial), e nenhuma outra entidade do mesmo gênero foi mencionada nesta frase.
Frases substantivas definidas
Tem havido uma quantidade considerável de pesquisas sobre a geração de sintagmas nominais definidos, como o grande livro vermelho . Muito disso se baseia no modelo proposto por Dale e Reiter. Isso foi estendido de várias maneiras, por exemplo Krahmer et al. apresentar um modelo teórico de grafos de geração NP definida com muitas propriedades interessantes. Nos últimos anos, um evento de tarefa compartilhada comparou diferentes algoritmos para geração NP definida, usando o corpus TUNA.
Referência espacial e temporal
Recentemente, tem havido mais pesquisas sobre a geração de expressões referenciais para o tempo e o espaço. Tais referências tendem a ser imprecisas (qual é o significado exato desta noite ?), E também a serem interpretadas de maneiras diferentes por pessoas diferentes. Portanto, pode ser necessário raciocinar explicitamente sobre as compensações de falso positivo versus falso negativo e até mesmo calcular a utilidade de diferentes expressões de referência possíveis em um contexto de tarefa particular.
Critérios para boas expressões
Idealmente, uma boa expressão de referência deve satisfazer uma série de critérios:
- Sucesso referencial : deve identificar inequivocamente o referente para o leitor.
- Facilidade de compreensão : O leitor deve ser capaz de ler e entender rapidamente.
- Complexidade computacional : O algoritmo de geração deve ser rápido
- Sem falsas inferências : a expressão não deve confundir ou enganar o leitor ao sugerir falsas implicaturas ou outras inferências pragmáticas. Por exemplo, um leitor pode ficar confuso se lhe disserem Sente-se à mesa de madeira marrom em um contexto onde haja apenas uma mesa.
História
Era pré-2000
REG remonta aos primeiros dias do NLG. Uma das primeiras abordagens foi feita por Winograd em 1972, que desenvolveu um algoritmo REG " incremental " para seu programa SHRDLU . Posteriormente, os pesquisadores começaram a modelar as habilidades humanas para criar expressões referenciais na década de 1980. Essa nova abordagem do tema foi influenciada pelos pesquisadores Appelt e Kronfeld, que criaram os programas KAMP e BERTRAND e consideraram as expressões referenciais como partes de atos de fala maiores.
Algumas de suas descobertas mais interessantes foram o fato de que as expressões referenciais podem ser usadas para adicionar informações além da identificação do referente, bem como a influência do contexto comunicativo e das máximas gregas nas expressões referenciais. Além disso, seu ceticismo em relação à naturalidade das descrições mínimas fez da pesquisa de Appelt e Kronfeld uma base para trabalhos posteriores sobre REG.
A busca por problemas simples e bem definidos mudou a direção da pesquisa no início da década de 1990. Essa nova abordagem foi liderada por Dale e Reiter, que enfatizaram a identificação do referente como o objetivo central. Como Appelt, eles discutem a conexão entre as máximas gregas e as expressões referenciais em seu artigo culminante, no qual também propõem uma definição formal do problema . Além disso, Reiter e Dale discutem os algoritmos Full Brevity e Greedy Heuristics , bem como seu Algoritmo Incremental (IA), que se tornou um dos algoritmos mais importantes no REG.
Desenvolvimentos posteriores
Depois de 2000, a pesquisa começou a levantar algumas das suposições simplificadoras, que haviam sido feitas nas primeiras pesquisas do REG, a fim de criar algoritmos mais simples. Diferentes grupos de pesquisa concentraram-se em diferentes limitações, criando vários algoritmos expandidos. Muitas vezes, estes estendem a IA em uma única perspectiva, por exemplo em relação a:
- Referência a conjuntos como "os usuários de camisetas" ou "as maçãs verdes e a banana à esquerda"
- Descrições relacionais como "a xícara na mesa" ou "a mulher que tem três filhos"
- Dependência de contexto , imprecisão e capacidade de gradação incluem declarações como "o homem mais velho" ou "o carro à esquerda", que muitas vezes não são claras sem um contexto
- Saliência e geração de pronomes são altamente dependentes do discurso, fazendo, por exemplo, "ela" uma referência à "pessoa feminina (mais saliente)"
Muitas suposições simplificadoras ainda existem ou apenas começaram a ser trabalhadas. Além disso, uma combinação das diferentes extensões ainda precisa ser feita e é chamada de "empresa não trivial" por Krahmer e van Deemter.
Outra mudança importante após 2000 foi o uso crescente de estudos empíricos para avaliar algoritmos. Este desenvolvimento ocorreu devido ao surgimento de corpora transparentes . Embora ainda haja discussões sobre quais são as melhores métricas de avaliação, o uso da avaliação experimental já levou a uma melhor comparabilidade de algoritmos, uma discussão sobre os objetivos do REG e pesquisas mais orientadas para tarefas.
Além disso, a pesquisa estendeu sua gama a tópicos relacionados, como a escolha de Frameworks de Representação de Conhecimento (KR) . Nesta área, a questão principal, qual framework KR é mais adequado para o uso em REG, permanece em aberto. A resposta a esta pergunta depende de quão bem as descrições podem ser expressas ou encontradas. Muito do potencial dos frameworks KR não foi utilizado até agora.
Algumas das diferentes abordagens são o uso de:
- Pesquisa gráfica que trata as relações entre alvos da mesma forma que as propriedades.
- Satisfação de Restrições que permite a separação entre a especificação do problema e a implementação.
- Representação de Conhecimento Moderno que oferece inferência lógica em, por exemplo, Lógica de Descrição ou Gráficos Conceituais .
Definição de problema
Dale e Reiter (1995) pensam sobre as expressões referenciais como descrições distintivas.
Eles definem:
- O referente como a entidade que deve ser descrita
- O contexto definido como conjunto de entidades salientes
- O conjunto de contraste ou distratores potenciais como todos os elementos do conjunto de contexto, exceto o referente
- Uma propriedade como referência a um único par de valor de atributo
Cada entidade no domínio pode ser caracterizada como um conjunto de pares de atributo-valor, por exemplo , tipo, cachorro , sexo, fêmea ou idade, 10 anos .
O problema então é definido da seguinte forma:
Deixe ser o referente pretendido e o conjunto de contraste. Então, um conjunto de pares de valor de atributo representará uma descrição distinta se as seguintes duas condições forem mantidas:
- Cada par atributo-valor em se aplica a : ou seja, cada elemento de especifica um atributo-valor que possui.
- Para cada membro de , há pelo menos um elemento de que não se aplica a : ou seja, há um in que especifica um atributo – valor que não possui. é dito que exclui .
Em outras palavras, para gerar uma expressão de referência, busca-se um conjunto de propriedades que se aplicam ao referente, mas não aos distratores.
O problema poderia ser facilmente resolvido combinando todas as propriedades do referente, o que freqüentemente leva a longas descrições que violam a segunda Máxima de Quantidade de Grice . Outra abordagem seria encontrar a descrição mais curta distinta como o algoritmo Full Brevity faz. No entanto, na prática, é mais comum incluir, em vez disso, a condição de que as expressões de referência produzidas por um algoritmo sejam o mais semelhantes possível às produzidas pelo homem, embora isso geralmente não seja mencionado explicitamente.
Algoritmos básicos
Brevidade Completa
O algoritmo Full Brevity sempre encontra uma descrição distintiva mínima, o que significa que não há uma descrição distintiva mais curta em relação às propriedades usadas.
Portanto, ele itera e verifica cada descrição de um comprimento de propriedades até que uma descrição distinta seja encontrada.
Dois problemas surgem dessa maneira de criar expressões referenciais. Em primeiro lugar, o algoritmo tem uma alta complexidade, o que significa que é NP-difícil, o que o torna impraticável de usar. Em segundo lugar, os falantes humanos produzem descrições que não são mínimas em muitas situações.
Heurística gananciosa
O algoritmo Greedy Heuristics aproxima o algoritmo Full Brevity adicionando iterativamente a propriedade mais distinta à descrição. A propriedade mais distinta significa a propriedade que exclui a maioria dos distratores restantes. O algoritmo Greedy Heuristics é mais eficiente do que o algoritmo Full Brevity.
Dale e Reiter (1995) apresentam o seguinte algoritmo para a Heurística Greedy:
Let Ser o conjunto de propriedades a serem realizadas em nossa descrição; deixe ser o conjunto de propriedades conhecidas como verdadeiras de nosso referente pretendido (assumimos que não é vazio); e deixe ser o conjunto de distratores (o conjunto de contraste). As condições iniciais são as seguintes:
all distractors; all properties true of ;
A fim de descrever o referente pretendido em relação ao conjunto de contraste , fazemos o seguinte:
1. Check Success: if then return as a distinguishing description elseif then fail else goto Step 2. 2. Choose Property: for each do: Chosen property is , where is the smallest set. goto Step 3. 3. Extend Description (wrt the chosen ): goto Step 1.
Algoritmo Incremental
O Algoritmo Incremental (IA) de Dale e Reiter foi o algoritmo mais influente antes de 2000. É baseado na ideia de uma ordem preferencial de atributos ou propriedades pelos quais os falantes passam. Portanto, para executar o Algoritmo Incremental, primeiro uma ordem de preferência de atributos deve ser fornecida. Agora, o algoritmo segue essa ordem e adiciona essas propriedades à descrição que excluem quaisquer distratores restantes. Além disso, Dale e Reiter enfatizam o tipo de atributo que sempre está incluído em suas descrições, mesmo que não exclua quaisquer distratores.
Além disso, os valores de tipo fazem parte de uma hierarquia de subsunção, incluindo alguns valores de nível básico . Por exemplo, no domínio animal de estimação, o chihuahua é classificado por cão e cão por animal . Porque cachorro é definido como um cachorro de nível básico, seria o preferido pelos algoritmos, se o chihuahua não descarta qualquer distração.
O Algoritmo Incremental é fácil de implementar e também eficiente computacionalmente em execução em tempo polinomial . A descrição gerada pelo IA pode conter propriedades redundantes que são supérfluas por causa de propriedades adicionadas posteriormente. Os criadores não consideram isso uma fraqueza, mas sim uma forma de tornar as expressões menos "psicolinguisticamente implausíveis".
O algoritmo a seguir é uma versão simplificada do Algoritmo Incremental de Dale e Reiter de Krahmer e van Deemter que leva como entrada o referente r , o D contendo uma coleção de objetos de domínio e uma lista ordenada específica de domínio Pref de atributos preferidos. Na notação L é a descrição, C o conjunto de contexto de distratores e a função RulesOut (⟨A i , V⟩) retorna o conjunto de objetos que possuem um valor diferente de V para o atributo A i .
IncrementalAlgorithm ({r}, D, Pref)
L ← ∅
C ← D - {r}
for each Ai in list Pref do
V = Value(r, Ai)
if C ∩ RulesOut(⟨Ai, V⟩) ≠ ∅
then L ← L ∪ {⟨Ai, V⟩}
C ← C - RulesOut(⟨Ai, V⟩)
endif
if C = ∅
then return L
endif
return failure
Avaliação de sistemas REG
Antes de 2000, a avaliação dos sistemas REG era de natureza teórica, como a feita por Dale e Reiter. Mais recentemente, os estudos empíricos tornaram-se populares e são baseados principalmente na suposição de que as expressões geradas devem ser semelhantes às produzidas pelo homem. A avaliação baseada no Corpus começou bem tarde no REG devido à falta de conjuntos de dados adequados. A avaliação ainda baseada em corpus é o método mais dominante no momento, embora também haja avaliação por julgamento humano.
Avaliação baseada em corpus
Primeiro, a distinção entre corpora textual e corpora experimental deve ser feita. Corpora de texto, como o corpus do GNOME, pode conter textos de todos os tipos de domínios. No REG, eles são usados para avaliar a parte de realização dos algoritmos. A parte de seleção de conteúdo do REG, por outro lado, requer um corpus que contenha as propriedades de todos os objetos do domínio, bem como as propriedades usadas nas referências. Normalmente, aqueles totalmente "semanticamente transparentes" criados em experimentos usando configurações simples e controladas.
Esses corpora experimentais mais uma vez podem ser separados em Corpora de Propósito Geral que foram coletados para outro propósito, mas foram analisados para expressões referenciais e Corpora Dedicados que se concentram especificamente em expressões referenciais. Exemplos de corpora de uso geral são as histórias da pera, o corpus Map Task ou o corpus Coconut, enquanto o corpus Bishop, o corpus Drawer e o corpus TUNA contam para o corpus dedicado. O corpus TUNA que contém dados coletados na web sobre os dois domínios, mobiliário e pessoas, já foi usado em três desafios compartilhados do REG.
Avaliação de métricas
Para medir a correspondência entre corpora e os resultados dos algoritmos REG, várias métricas foram desenvolvidas.
Para medir a parte da seleção de conteúdo, o coeficiente de dados ou a métrica MASI (acordo de medição em itens com valor definido) são usados. Eles medem a sobreposição de propriedades em duas descrições. Em uma avaliação, as pontuações geralmente são calculadas em relação às referências feitas por diferentes participantes humanos no corpus. Às vezes, também, uma medida chamada Porcentagem de Rechamada Perfeita (PRP) ou Precisão é usada, a qual calcula a porcentagem de correspondências perfeitas entre uma referência produzida por algoritmo e uma produzida por humanos.
Para a parte de realização linguística do REG, a sobreposição entre as cordas foi medida usando métricas como BLEU ou NIST . Um problema que ocorre com métricas baseadas em cordas é que, por exemplo, "O macaquinho" é medido mais próximo de "O burro" do que de "O macaquinho".
Uma maneira mais demorada de avaliar algoritmos REG é deixar que os humanos julguem a Adequação (quão clara é a descrição?) E Fluência (A descrição é fornecida em um inglês bom e claro?) Da expressão gerada. Também Belz e Gatt avaliaram expressões de referência usando uma configuração experimental. Os participantes obtêm uma descrição gerada e, em seguida, devem clicar no alvo. Aqui, o tempo de leitura das métricas extrínsecas, o tempo de identificação e a taxa de erro podem ser avaliados.