<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.2 20190208//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:ali="http://www.niso.org/schemas/ali/1.0">
  <front>
<journal-meta>
<journal-id journal-id-type="nlm-ta">Cadernos de Linguística</journal-id>
<journal-title-group>
<journal-title>Revista da Abralin</journal-title>
</journal-title-group>
<issn pub-type="epub">2675-4916</issn>
<publisher>
<publisher-name> Associação Brasileira de Linguística </publisher-name>
</publisher>
</journal-meta>
    <article-meta>
<article-id pub-id-type="doi">10.25189/2675-4916.2021.V2.N1.ID307</article-id>
      <article-categories>
        <subj-group>
          <subject content-type="Tipo de Contribuição">Relato de Experiência </subject>
        </subj-group>
      </article-categories>
      <title-group>
        <article-title><bold id="bold-1">DESAFIOS</bold> DA GESTÃO DE <bold id="bold-2">DADOS LINGUÍSTICOS</bold> E A CIÊNCIA ABERTA</article-title>
      </title-group>
      <contrib-group content-type="author">
        <contrib id="person-3c3c60556173f8d573eb113c2d6e07bd" contrib-type="person" equal-contrib="no" corresp="yes" deceased="no">
          <name>
            <surname>Freitag</surname>
            <given-names>Raquel Meister Ko.</given-names>
          </name>
          <email>rkofreitag@uol.com.br</email>
          <xref ref-type="aff" rid="affiliation-59e5a1663c487e892bc737b74328acd6" />
          <xref ref-type="aff" rid="affiliation-cebc39cbb6f1834bd64f5407ca61b830" />
        </contrib>
        <contrib id="person-213fc19da8e550e3f271beb07a8d6fca" contrib-type="person" equal-contrib="no" corresp="no" deceased="no">
          <name>
            <surname>Martins</surname>
            <given-names>Marco Antonio Rocha</given-names>
          </name>
          <email>marcomartins.ufsc@gmail.com</email>
          <xref ref-type="aff" rid="affiliation-59e5a1663c487e892bc737b74328acd6" />
        </contrib>
        <contrib id="person-03fcfed9ab8afb295850b42981927e06" contrib-type="person" equal-contrib="no" corresp="no" deceased="no">
          <name>
            <surname>Araújo</surname>
            <given-names>Aluiza</given-names>
          </name>
          <email>aluiza.araujo@uece.br</email>
          <xref ref-type="aff" rid="affiliation-d420b44d66fcc8d22a6af6e10e67bc14" />
        </contrib>
        <contrib id="person-2c8e497e7186436406291b59f37dd3bf" contrib-type="person" equal-contrib="no" corresp="no" deceased="no">
          <name>
            <surname>Battisti</surname>
            <given-names>Elisa</given-names>
          </name>
          <email>battisti.elisa@gmail.com</email>
          <xref ref-type="aff" rid="affiliation-b1721700e4a17b695d14615b3d736a79" />
        </contrib>
        <contrib id="person-cdc966de6a309cb185c992e78252e070" contrib-type="person" equal-contrib="no" corresp="no" deceased="no">
          <name>
            <surname>Coelho</surname>
            <given-names>Iandra Maria Weirich da Silva</given-names>
          </name>
          <email>iandrawcoelho@gmail.com</email>
          <xref ref-type="aff" rid="affiliation-8f852671972b7eb61d7d4f78845d8b92" />
        </contrib>
        <contrib id="person-dbff291d936d8bb6022b67273b74568d" contrib-type="person" equal-contrib="no" corresp="no" deceased="no">
          <name>
            <surname>Sousa</surname>
            <given-names>Marta Deysiane Alves Faria</given-names>
          </name>
          <email>professoramarta2018@outlook.com</email>
          <xref ref-type="aff" rid="affiliation-cebc39cbb6f1834bd64f5407ca61b830" />
        </contrib>
        <contrib id="person-3e92fde51bcfdb16bdd5677f28a19e21" contrib-type="person" equal-contrib="no" corresp="no" deceased="no">
          <name>
            <surname>Silva</surname>
            <given-names>Raimundo Gouveia da</given-names>
          </name>
          <email>raimundo.silva@ifac.edu.br</email>
          <xref ref-type="aff" rid="affiliation-8a669684ea5c3038c7ee4f3213ddc7cc" />
        </contrib>
        <contrib id="person-2b276dd1ce721fb20d684d1737bee507" contrib-type="person" equal-contrib="no" corresp="no" deceased="no">
          <name>
            <surname>Lima-Lopes</surname>
            <given-names>Rodrigo Esteves de</given-names>
          </name>
          <email>rll307@unicamp.br</email>
          <xref ref-type="aff" rid="affiliation-00acd9fbca0143d0ff3ae05a9a80bbc2" />
        </contrib>
      </contrib-group>
      <contrib-group content-type="editor">
        <contrib id="person-f6e93de22d5a621eea9c13c16a4230ff" contrib-type="person" equal-contrib="no" corresp="no" deceased="no">
          <name>
            <surname>Oliveira, Jr</surname>
            <given-names>Miguel </given-names>
          </name>
          <email>miguel@fale.ufal.br</email>
          <xref ref-type="aff" rid="affiliation-cacaa336e1c0380ea054bce3cbeed908" />
        </contrib>
        <contrib id="person-bbf699a10b319dd73c8522b6a904fa4c" contrib-type="person" equal-contrib="no" corresp="no" deceased="no">
          <name>
            <surname>Almeida</surname>
            <given-names>René Alain</given-names>
          </name>
          <email>renealain@hotmail.com</email>
          <xref ref-type="aff" rid="affiliation-cebc39cbb6f1834bd64f5407ca61b830" />
        </contrib>
      </contrib-group>
      <aff id="affiliation-59e5a1663c487e892bc737b74328acd6">
        <institution content-type="orgname">Universidade Federal de Santa Catarina (UFSC)</institution>
      </aff>
      <aff id="affiliation-cacaa336e1c0380ea054bce3cbeed908">
        <institution content-type="orgname">Universiade Federal de Alagoas</institution>
      </aff>
      <aff id="affiliation-cebc39cbb6f1834bd64f5407ca61b830">
        <institution content-type="orgname">Universidade Federal de Sergipe (UFS)</institution>
      </aff>
      <aff id="affiliation-d420b44d66fcc8d22a6af6e10e67bc14">
        <institution content-type="orgname">Universidade Federal do Ceará (UFC)</institution>
      </aff>
      <aff id="affiliation-b1721700e4a17b695d14615b3d736a79">
        <institution content-type="orgname">Universidade Federal do Rio Grande do Sul (UFRS)</institution>
      </aff>
      <aff id="affiliation-8f852671972b7eb61d7d4f78845d8b92">
        <institution content-type="orgname">Instituto Federal de Educação, Ciência e Tecnologia do Amazonas (IFAM)</institution>
      </aff>
      <aff id="affiliation-8a669684ea5c3038c7ee4f3213ddc7cc">
        <institution content-type="orgname">Instituto Federal de Educação, Ciências e Tecnologia do Acre (IFAC)</institution>
      </aff>
      <aff id="affiliation-00acd9fbca0143d0ff3ae05a9a80bbc2">
        <institution content-type="orgname">Universidade Estadual de Campinas (UNICAMP)</institution>
      </aff>
      <pub-date date-type="pub" iso-8601-date="26/04/2021" />
      <volume>2</volume>
      <issue>1</issue>
      <issue-title>Linguistas Online</issue-title>
      <elocation-id>10.25189/2675-4916.2021.V2.N1.ID307</elocation-id>
      <history>
        <date date-type="accepted" iso-8601-date="05/11/2020" />
        <date date-type="received" iso-8601-date="24/09/2020" />
      </history>
      <permissions id="permission">
        <license>
          <ali:license_ref>http://creativecommons.org/licenses/by/4.0/</ali:license_ref>
        </license>
      </permissions>
      <abstract>
        <p id="_paragraph-1">O simpósio <italic id="italic-1">Descrição linguística: gestão de dados linguísticos</italic> teve como proposta retomar questões específicas ao gerenciamento de dados linguísticos, quer de fala quer de textos escritos, da atualidade ou históricos, em função das demandas latentes, especialmente face a exigências como as da Ciência Aberta: i) Como atender aos princípios de ciência aberta quanto ao armazenamento, reuso e autoria de conjuntos de dados linguísticos? ii) Como lidar com a tensão entre a transparência e o sigilo de dados de fala? iii) Quais os formatos e as ferramentas mais adequados para a vitalidade dos conjuntos de dados linguísticos? iv) Quais ferramentas permitem o melhor armazenamento e sistemas de interface para consulta e pesquisa? Neste artigo, respondemos a estas questões com o objetivo de motivar a discussão e o compartilhamento de boas práticas com a comunidade científica e sinalizamos as ações propositivas de natureza coletiva: i) a criação de políticas específicas da área para a replicabilidade dos estudos; ii) a adoção dessas políticas por programas de pós-graduação e periódicos; e iii) a criação e manutenção de repositórios de dados. </p>
      </abstract>
      <abstract abstract-type="executive-summary">
        <title>Abstract</title>
        <p id="paragraph-b1f78b6399ed3e5f204e8c85d5ae9d2c">The symposium <italic id="italic-031dd080938a5c1152c66d297bd429f1">Linguistic description: management of linguistic data</italic> aimed to discuss issues regarding the management of linguistic data in its many formats: oral or written, contemporaneous or historical. Such symposium had its central motivation in the latent demands, especially those imposed by the Open Science movement. The participants’ plenaries centred on four main questions: i) How to fulfil the principles of open science concerning the storage, reuse and authorship of linguistic data sets? ii) How to deal with the tension between transparency and confidentiality of language data? iii) Which formats and tools are best suited to make linguistic data sets viable? iv) Which would be best systems and interfaces for storing and accessing language data? In this article, we answered these questions with the aim of motivating the discussion and good practices with the scientific community. As an outcome, the participants proposed some collective measures to ways as promote good practices regarding data use management: i) developing specific protocols in the area, encouraging studies’ replicability; ii) engaging graduate programs and scientific journals in such protocols; and iii) creating and maintaining data repositories.</p>
      </abstract>
      <kwd-group>
        <kwd content-type="">Dados linguísticos</kwd>
        <kwd content-type="">Ciência Aberta</kwd>
        <kwd content-type="">Banco de dados</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <body id="body">
    <sec id="heading-ac5b9ebaf5848a2aebfab7263fa7a046">
      <title>Introdução</title>
      <p id="heading-1d0c6692faff8766ec7536204e1ea5c6">A descrição linguística requer um grande volume de dados para caracterizar fenômenos e dar suporte a generalizações, para validar teorias e definir normas de referência. A já clássica afirmação de Labov (1994, p. 11) no labor da linguística histórica sobre “a arte de fazer bom uso de dados ruins” pode ser estendida a todos os conjuntos de dados de quem trabalha com descrição e análise linguística: nem sempre dispomos de dados de qualidade (dados linguísticos coletados em laboratório vs. dados de campo), e nem sempre os dados são facilmente acessíveis (organização em repositórios assistemáticos, sem ferramentas de busca consolidada vs. anotação e alinhamento dos dados e busca automática). Ademais, se no início das pesquisas na área de linguística até final do século passado, as limitações para constituir amostras de dados, especialmente de fala espontânea, eram decorrentes da tecnologia ainda incipiente, hoje, as limitações são decorrentes de restrições impostas por comitês de ética em pesquisa. E, ainda, a política de transparência com dados abertos requer condições de armazenamento e disponibilização, e novos desafios precisam ser superados, como os custos de manutenção, o sigilo e direito de uso dos dados, dentre outros. Dados linguísticos são base para desenvolvimento de tecnologias assistivas, o que coloca a constituição e a gestão de dados linguísticos em alinhamento com as áreas estratégicas para a ciência no Brasil. </p>
      <p id="paragraph-2">Diferentes perspectivas de análise linguística beneficiam-se de dados armazenados e disponibilizados em <italic id="italic-35c904ae53fe75d5dcf4a4492c2c66e4">corpora</italic>. A coleta de dados linguísticos provenientes de situações autênticas de uso tem sido basilar em pesquisas em abordagens baseadas no uso, como a Sociolinguística (LABOV, 1972), a Linguística de Corpus (MCENERY; HARDIE, 2012; SINCLAIR, 1991), as diferentes correntes do Funcionalismo, dentre outras. Mais recentemente, tal relação se ampliou para a análise de interações em espaços tecnológicos, especialmente em mídias sociais no âmbito da Comunicação Mediada por Computadores (CAMERON; PANOVIĆ, 2014; EMIGH; HERRING, 2005) e da Ciência das Redes (BARABÁSI, 2002; SCOTT, 2000; WATTS, 2004). Em tais perspectivas, a pesquisa baseada em dados empíricos é uma forma de levantar padrões linguísticos e interacionais, que podem ser utilizados como indicativos de questões e representações dos diferentes atores sociais (VAN LEEUWEN, 2008). A utilização de dados é determinante nesse tipo de pesquisa, que se caracteriza por análises exploratórias e empiricamente fundamentadas. </p>
      <p id="paragraph-3">Diferentemente de abordagens que se valem da intuição ou da introspecção, os resultados de descrições empíricas de padrões linguísticos emergem dos levantamentos realizados em <italic id="italic-2">corpora</italic>, que podem tanto ocorrer a partir de categorias pré-estabelecidas (como constituintes fonológicos, morfossintáticos, classes gramaticais ou palavras de valor semântico etc.), como também pela exploração das diferentes relações evidenciadas pelos próprios dados. As unidades de análise podem ser, por exemplo, as da léxico-gramática (STUBBS, 2001), como a instanciação de categorias em um conjunto de textos (BIBER, 2015); ou, como no estudo de questões interacionais, fundamentadas em uma análise que parte do estabelecimento de redes de interação, tomando-se como base o papel que cada indivíduo pode assumir nas diferentes redes de que participa.<xref id="xref-2fd1d228675e56af6d67bcdcc1422675" ref-type="fn" rid="footnote-f0ecd757fd7fc925aa874771fae4684f">1</xref> </p>
      <p id="paragraph-4">Na programação do evento <italic id="italic-3">Abralin Ao Vivo</italic>, diversos pesquisadores trataram da gestão de dados linguísticos, como nas atividades <italic id="italic-4">Grandes Projetos da Linguística em rede: Tycho Brahe, PROHPOR e PHPB</italic> e <italic id="italic-5">Archiving and Language Documentation</italic>, com relatos de experiências e compartilhamento de práticas. No campo da sociolinguística brasileira, a discussão também tem sido travada no âmbito do GT de Sociolinguística, com um simpósio específico sobre o tema no 1º Fórum Internacional de Sociolinguística, e publicações voltadas para a prática (FREITAG; MARTINS; TAVARES, 2012; FREITAG, 2014a, 2015, 2017a, b).</p>
      <p id="paragraph-5">O simpósio <italic id="italic-6">Descrição linguística: gestão de dados linguísticos</italic> no <italic id="italic-7">Abralin Ao Vivo</italic>, que reuniu os autores do presente artigo, teve como proposta retomar questões específicas ao gerenciamento de dados linguísticos, quer de fala quer de textos escritos, da atualidade ou históricos, em função das demandas latentes, especialmente face a exigências como as da Ciência Aberta (seção 2). Com base na experiência dos participantes do simpósio em composição e gestão de bancos de dados, discutiram-se estratégias para superar os seguintes desafios:</p>
      <p id="paragraph-28d7ffcf34dc4280e83bbbe701b4adc6" />
      <p id="paragraph-6">· Como atender aos princípios de ciência aberta quanto ao armazenamento, reuso e autoria de conjuntos de dados linguísticos?</p>
      <p id="paragraph-7">· Como lidar com a tensão entre a transparência e o sigilo de dados de fala?</p>
      <p id="paragraph-8">· Quais os formatos e as ferramentas mais adequados para a vitalidade dos conjuntos de dados linguísticos?</p>
      <p id="paragraph-9">· Quais ferramentas permitem o melhor armazenamento e sistemas de interface para consulta e pesquisa?</p>
      <p id="paragraph-a37f975b3139b21ca52c039e89c2e931" />
      <p id="paragraph-10">As reflexões do simpósio foram sistematizadas e repercutidas (CARDOSO, 2020), e são apresentadas a seguir, no intuito de motivar a discussão e o compartilhamento de boas práticas com a comunidade científica.</p>
    </sec>
    <sec id="heading-3f333f5b0e27cdf1e70a0bb279d4403e">
      <title>1. Movimento Ciência Aberta: uso e reuso de dados</title>
      <p id="heading-bc0a12b1a9920fad7c1ed72be2b29e39">Ciência Aberta é um movimento de ruptura com um aspecto da ciência tradicional, a circulação das ações e resultados da pesquisa, estrita ao ambiente acadêmico. De acordo com Silva e Silveira (2019), essa ruptura incentiva a transparência, desde a concepção da pesquisa, com a publicação aberta do projeto de pesquisa, por exemplo, até seu produto, como o acesso a dissertações e teses, bem como à publicação dos resultados em periódicos científicos de acesso gratuito. Busca-se também por meio da Ciência Aberta um maior detalhamento de metodologias e gerenciamento de dados, de forma que eles possam ser acessados por toda a sociedade.</p>
      <p id="paragraph-0b7c2aa9cb8af5574818714c9693119a">No escopo da Ciência Aberta, o gerenciamento dos dados deve seguir os princípios nomeados pelo acrônimo <italic id="italic-4ee1b361fdf57da42e223b8b41f65eea">FAIR</italic> (WILKINSON <italic id="italic-6e874bd2ffc048ec52f34e280cde6b28">et al., </italic>2016), no qual <italic id="italic-695cc183e0862514dc7a4ce4e4cd725d">F</italic> significa <italic id="italic-64b8ab03da8c307ffc740991f52663e0">findable</italic> (passível de ser encontrado), <italic id="italic-5cfe2ad13cab60473d85aaecbbf1d9b9">A</italic> significa <italic id="italic-4dfb60306b2b5347df925e3ebc4c15f9">accessible</italic> (acessível), I, <italic id="italic-68ceb64b480a997eee49dab07c67da01">interoperable</italic> (interoperável) e <italic id="italic-8">R</italic>, <italic id="italic-9">reusable</italic> (reutilizável). Para a discussão dos desafios que identificamos para a gestão de dados, nos detemos em dois desses princípios: ser acessível e ser reutilizável. Para um conjunto de dados ser considerado acessível, seus (meta)dados devem ser recuperáveis por meio de um identificador padronizado por um protocolo de comunicação aberto, gratuito, que permita autenticação e autorização, e também que, mesmo em caso de os dados não estarem mais disponíveis, seus metadados sejam ainda acessíveis (WILKINSON <italic id="italic-10">et al., </italic>2016). Já para que um conjunto de dados seja considerado reutilizável, os meta(dados) devem ser liberados por meio de uma licença de uso clara e acessível, ter sua procedência detalhada e estar de acordo com domínios relevantes para a comunidade. </p>
      <p id="paragraph-a9582c2acf87e14c4196ff08884a59b1">Ressaltamos, contudo, que os princípios de acessibilidade e reutilização devem ser considerados com cautela, observando sempre os aspectos éticos preconizados por documentos regulatórios no âmbito de cada país. No Brasil, por exemplo, os padrões no que tange a aspectos éticos em pesquisa com seres humanos nas ciências sociais atualmente são estabelecidos pela Resolução Nº 510, de 07 de abril 2016, do Conselho Nacional de Saúde. No artigo 3º, inciso VII, deste documento, é estabelecido que deve haver “garantia da confidencialidade das informações, da privacidade dos participantes e da proteção de sua identidade, inclusive do uso de sua imagem e voz” (BRASIL, 2016, p. 45). Além disso, em seu artigo 9º, inciso V, a resolução (BRASIL, 2016) deixa claro que é direito do participante decidir se sua identidade poderá ser divulgada, e também quais das informações coletadas pelos pesquisadores poderão estar disponíveis ao público. Percebemos por esses artigos a existência de regras que estabelecem como os dados devem ser geridos pelos pesquisadores, assegurando ao participante total controle sobre os dados por ele fornecidos para a condução da pesquisa.</p>
      <p id="paragraph-e14bc6fd8b9e124c433f040bf67a6648">A preocupação com a confidencialidade dos participantes nas pesquisas envolvendo dados linguísticos tem sido abordada em diversos estudos tanto no Brasil (PAIVA, 2005; ABREU, 2014; FREITAG, 2017) quanto no exterior (CALAMAI; FRONTINI, 2018; CASILLAS; CRISTIA, 2019; CHILDS; VAN HERK; THORBURN, 2011). Em comum, todos eles observam as formas de obter os dados de fala e reportá-los em suas pesquisas, mantendo o anonimato dos participantes. O que tem ganhado mais notabilidade é a disponibilização desses dados, visto que, embora possa ser possível apagar dados sensíveis, como nome do entrevistado, lugares e nomes de pessoas de fácil identificação, existe ainda a possibilidade de identificação do participante pela voz. Ao discutir a aplicação dos padrões <italic id="italic-11">FAIR</italic>, Calamai e Frontini (2018), por exemplo, como uma forma de minimizar os danos na disponibilização de dados de fala e considerando o reconhecimento dos participantes pela voz, apontam as licenças de uso e o termo de consentimento como possíveis soluções. Num repositório como o <italic id="italic-12">CLARIN</italic> (<italic id="italic-13">Common Language Resource Infrastructure for Social Sciences and Humanities</italic>), os dados são disponibilizados conforme licenças de uso. No <italic id="italic-14">CHILDES</italic> (<italic id="italic-15">Child Language Data Exchange System</italic>) <italic id="italic-16">corpora</italic>, houve um planejamento para se chegar a um termo de consentimento e se escolherem licenças de uso adequadas, possibilitando inclusive a disponibilização dos dados para a comunidade em geral, mesmo em se tratando de dados obtidos de crianças, que normalmente, como ressaltam as autoras, são mais delicados no que tange a questões legais e éticas.</p>
      <p id="paragraph-cc5f7af5cf2173afaa287c99c4ef0009">No Brasil, Freitag (2017a) apresenta detalhadamente os procedimentos de coleta de dados em entrevistas sociolinguísticas, bem como modelos de termo de consentimento e assentimento livres e esclarecidos. Na redação de ambos, consta o fato de que as interações gravadas serão disponibilizadas para a comunidade acadêmica e também armazenadas em uma base de dados. Essa observação, contida nos termos de consentimento e assentimento, evidencia indícios de uma boa prática a ser padronizada para todos aqueles que se interessarem em participar de uma gestão de dados de fala consorciada, visto que, em conjunto com licenças apropriadas a serem utilizadas, fazem uma combinação semelhante às apresentadas por Calamai e Frontini (2018) acerca da disponibilização de dados de fala em conformidade com os padrões <italic id="italic-17">FAIR </italic>(WILKINSON <italic id="italic-18">et al.</italic>, 2016).</p>
      <p id="paragraph-063b1994678a352da07dcfdefa1698c6">Apesar da crescente visibilidade que áreas como a Sociolinguística e a Linguística de <italic id="italic-19">Corpus </italic>dão ao trabalho com dados empíricos e, consequentemente, ao uso de ferramentas específicas para pesquisa – como pacotes estatísticos ou programas de análise de <italic id="italic-20">corpora</italic> – (FINARDI <italic id="italic-21">et al</italic>., 2020), a reflexão aprofundada sobre metodologias de coleta, processamentos e arquivamento de dados são raras. De maneira geral, há a ideia de que estudos qualitativos de dados empíricos não seriam reproduzíveis, dada sua ancoragem nos processos subjetivos de construção da análise e do objeto. </p>
      <p id="paragraph-2f87152e2e567cc6656a19eddcc22d8c">Por outro lado, Biber et al. (1998) defendem que a interpretação dos dados sempre ocorre a partir de uma perspectiva qualitativa, porque o significado das diferentes categorias poderia apenas ser definido pelo pesquisador, que parte do seu contato com o contexto (e com o texto) como parâmetro analítico. De fato, observamos que tal perspectiva acaba por se inserir naquilo que Johnson, Onwuegbuzie e Turner (2007) definem como métodos mistos, ou seja interpretações subjetivas que partem de dados verificáveis e replicáveis por outros pesquisadores.</p>
      <p id="paragraph-5fd9be5dcb04f9a24801abdb6e571392">No Brasil, o grupo de pesquisa <italic id="italic-22">Mídia, Discurso, Tecnologia e Sociedade</italic><italic id="italic-23"> </italic>(<italic id="italic-24">MiDiTeS</italic>) é um dos poucos que promove essa reflexão acerca de metodologias, processamento e arquivamento de dados linguísticos. As constantes discussões giram em torno de temáticas que podem ser relacionadas aos princípios <italic id="italic-25">FAIR</italic> da Ciência Aberta e se situam em dois eixos inter-relacionados: 1) Letramentos de Dados e 2) Ativismos. No caso do primeiro, destaca-se a preocupação em refletir sobre processos de interação que revelem questões estruturais em nossa sociedade por meio da compreensão, compilação e estrutura de dados. Letrar o indivíduo nesses termos é propor uma abordagem crítica aos diferentes sistemas de dados abertos de forma a possibilitar a criação de novas realidades epistemológicas e sociais distintas (GUTIÉRREZ, 2019; WOLFF <italic id="italic-26">et al</italic>., 2016). No caso do segundo, o enfoque está em entender como a sociedade datificada leva à construção de diferentes formas de interação e propagação ideológica. Isso pode contemplar desde a construção de identidades de resistência (GABARDO; LIMA-LOPES, 2018; LIMA-LOPES; GABARDO, 2019; LIMA-LOPES; PIMENTA, 2017), passando pela propagação de ideologias conservadoras (LIMA-LOPES, 2018) ou mesmo pelo uso dos processos de Comunicação Mediada por Computadores como forma de controle social (MERCURI; LIMA-LOPES, 2020).</p>
      <p id="paragraph-ff54cc125e2ed0b896035570047d452c">A ausência de discussão aprofundada sobre coleta, processamentos e arquivamento de dados, como a promovida pelo <italic id="italic-27">MiDiTes</italic>, tem duas grandes consequências. A primeira atinge os processos de replicabilidade de pesquisa. King (1995), por exemplo, evidencia que a possibilidade de replicar um estudo tem impacto direto em, pelo menos, três níveis: 1) proteção contra erros honestos e falsificação de resultados; 2) facilitação de processos pedagógicos e 3) acúmulo substantivo de conhecimento. Apesar das diferenças entre as áreas, King (1995) trabalha no espectro das ciências humanas, com o qual as ciências da linguagem dividem um lastro comum. A segunda grande consequência da ausência frequente de reflexões sobre a coleta e análise de dados pode ser observada no nível do ensino, nos cursos de graduação e pós-graduação na área: mesmo quando tal discussão está presente, ela é ainda pouco valorizada, e, muitas vezes, tratada por alunos e por parte do corpo docente como menos importante ou relevante. </p>
      <p id="paragraph-1cb60629b73f8123587ecf99fa595107">Orientar-se pelos princípios <italic id="italic-28">FAIR</italic> da Ciência Aberta e promover a discussão sobre a coleta e manuseio dos dados traz benefícios para pesquisadores e sociedade, dos quais destacamos três: i) a conscientização da necessidade de discussões metodológicas claras faz com que o pesquisador cresça em segurança ao afirmar seus resultados e suas assunções sobre os dados; ii) a possibilidade de análise por diferentes perspectivas de um mesmo conjunto de dados pode fazer crescer substancialmente nosso conhecimento sobre um determinado registro, variedade linguística, contexto interacional, entre muitos outros; iii) a possibilidade de refazimentos dos experimentos em contextos como o da sala de aula contribui não apenas para a formação científica dos nossos alunos, mas também para a sedimentação de conhecimentos em nível teórico e prático. Afinal, conforme concordamos com Meie (1995), a replicabilidade é algo importante tanto para trabalhos quantitativos, como também qualitativos, por fazer crescer o cruzamento entre as diversas intersubjetividades.</p>
    </sec>
    <sec id="heading-b2006e0eadaa8a17d62f26ffd1408db1">
      <title>2. Coleta de dados linguísticos em situações de uso: práticas e desafios</title>
      <p id="heading-b71fc4161404e1d1ed6f1e6f8c5f8656">Apresentamos a seguir duas experiências acerca da coleta de dados aos moldes da Sociolinguística Variacionista, abordagem que tradicionalmente se ampara em dados de fala produzidos em situação de entrevista, conforme o protocolo de entrevista sociolinguística (FREITAG, 2014b, 2016). Uma das coletas segue a rotina já tradicionalmente consolidada para a área, com estratificação homogênea (amostra <italic id="italic-1d05bfa0b1224458661b2234ad42fcdd">PORCUFORT</italic> fase 2), e outra parte para uma estratificação que amplia as categorias sociodemográficas incluídas na documentação (<italic id="italic-231cf9ee93197cc311a43b4a675c2f48">LínguaPOA</italic>).</p>
      <p id="paragraph-5fb398a247be24ef68f3b261a18f5adf">Com base na metodologia já tradicionalmente consolidada, especialmente pelo projeto <italic id="italic-a95015cf6939a2df4717d0a0a8e93abb">Norma Urbana Culta </italic>(<italic id="italic-023889e93db9220770b306456400fa78">NURC</italic>), que envolveu UFRGS, USP, UFRJ, UFBA, UFPE nos anos 1970, a fase II do projeto <italic id="italic-160a957027e8c56d49d5a692362b1704">Descrição do Português Oral Culto de Fortaleza </italic>(<italic id="italic-4461fd520578ddc5ce209ab8b70fb1cc">PORCUFORT</italic>) compreende a constituição de uma amostra linguística no período de 2018-2021 (a fase I compreende o período de 1993 a 1995). A fim de garantir a comparabilidade das amostras e possibilitar estudos de mudança linguística em tempo real, a nova fase segue a mesma estratificação do <italic id="italic-7190f863c845d517000a47c9bb7a8bf1">PORCUFORT</italic> – fase I: sexo (masculino e feminino), faixa etária (faixa I - 22 a 35 anos, faixa II - 36 a 55 anos e faixa III - a partir dos 56 anos) e tipo de registro (Diálogo entre Informante e Documentador: DID, Diálogo entre Dois Documentadores: D2 e Elocução Formal: EF). Os participantes da amostra do <italic id="italic-98e0e7d442275be71709d35054b39f0f">PORCUFORT </italic>- fase II, a exemplo do que ocorreu na fase I, apresentam as seguintes características: i) por se tratar de um banco de dados de fala culta, todos os falantes devem ter o nível superior completo em regime presencial; ii) além disso, os falantes devem ser nascidos em Fortaleza-CE; iii) filhos de pais fortalezenses, ou que seus pais, sendo cearenses, tenham vindo morar na cidade com até cinco anos de idade; iv) todos devem residir na capital cearense; além de não terem se afastado da capital por tempo superior a três meses, ou seja, são admitidos falantes que tenham viajado para outras localidades apenas a passeio, pois um período superior a esse pode interferir na fala original do indivíduo. A amostra está estratificada homogeneamente de acordo com as variáveis sociodemográficas sexo e faixa etária, e o tipo de registro (DID, D2 e EF). </p>
      <p id="paragraph-59384019e1e62361e37ce06402c6be4f">Como outros projetos de variação linguística baseados em amostras de fala socialmente estratificadas, o <italic id="italic-e97a11d12505c668fde03c9ef2862b93">LínguaPOA</italic> (UFRGS, <ext-link id="external-link-0baa198acc9e5a859d3504989368046c" xlink:href="https://www.ufrgs.br/linguapoa/">https://www.ufrgs.br/linguapoa/</ext-link>) resultou de um projeto de pesquisa, intitulado <italic id="italic-57b70111e1c2ac3899dd406f047e892b">Variação fonético-fonológica e classe social na comunidade de fala de Porto Alegre </italic>(2015-2019), que buscou: i) investigar a configuração da comunidade de fala de Porto Alegre em termos de normas e características linguísticas partilhadas nas diferentes áreas do espaço geográfico e em seus estratos sociais; ii) esclarecer a estruturação de Porto Alegre em classes sociais, relacionando distinção social à padronização e distinção linguística; iii) verificar as variáveis linguísticas e extralinguísticas condicionadoras da aplicação de processos fonético-fonológicos variáveis no português brasileiro falado em Porto Alegre.</p>
      <p id="paragraph-bd86f31ab8690be5e7eafe8674522cd1">As 103 entrevistas, realizadas em português entre agosto de 2015 e setembro de 2019, contemplam narrativas de experiência pessoal, descrições e apreciações de lugares de Porto Alegre e da vida na cidade, feitas por sujeitos que nasceram em Porto Alegre ou se mudaram para a cidade até 5 anos de idade, tendo nela vivido desde então. Os critérios de estratificação do LínguaPOA são: i) quatro zonas: Centro (Central), Norte, Sul, Leste; ii) dois bairros por zona: renda alta e renda baixa (por renda domiciliar média mensal em salários mínimos); iii) três grupos etários: 20-39 anos, 40-59 anos, 60 ou mais anos; iv) três níveis de escolaridade: fundamental, médio, superior; v) dois gêneros: masculino e feminino. As 103 entrevistas atendem a todos os critérios de estratificação nos níveis médio e superior de escolaridade, mas não no fundamental.</p>
      <p id="paragraph-509b4fa8243bc319dc94aba7553933f4">A constituição do <italic id="italic-5d443865cbadfa9918820ece3a9abb3b">LínguaPOA</italic> conciliou técnicas da Dialetologia Perceptual de Preston (1989) às habitualmente seguidas na constituição de amostras para estudos sociolinguísticos variacionistas, conforme Labov (1972, 1994), e descritas em publicações brasileiras como as de Tarallo (2006), Guy e Zilles (2007), Freitag (2014). Além disso, assumiu o compromisso de comparabilidade, desde que possível, com amostras anteriores da fala de Porto Alegre, como as do <italic id="italic-97c0ee19258f2be8548150ed7a0d5f9f">NURC</italic>, dos anos 1970, e do projeto <italic id="italic-b988d73b82362e51c4467d9771a5cba2">VARSUL</italic> (Variação Linguística na Região Sul do Brasil), que envolveu UFRGS, UFSC, UFTPR, PUCRS, nos anos 1990. A peculiaridade do <italic id="italic-48de7fabd950a85cb45f32e5a9d93ed2">LínguaPOA</italic> está na possibilidade de viabilizar estudos sobre os efeitos de classe social na variação linguística no português falado em Porto Alegre: contempla não só a variável escolaridade, mas também zona de residência e bairro por zona, este selecionado conforme a renda média domiciliar mensal (alta, baixa) das famílias residentes no bairro. Ademais, o <italic id="italic-4b4068da410a65043e5d38465852841c">LínguaPOA </italic>dispõe de informações complementares, registradas na Ficha de Entrevista (profissão e ocupação do participante, a renda mensal de sua família) e no Questionário Econômico, conforme o Critério Brasil de classificação econômica (<ext-link id="external-link-2" xlink:href="http://www.abep.org/criterio-brasil)">http://www.abep.org/criterio-brasil)</ext-link>.</p>
      <p id="paragraph-284faf67f6a5c3bd9550e65c747eb660">A constituição de ambas as amostras de dados linguísticos apresentadas foi permeada por desafios. Na fase de realização das entrevistas para a amostra da fase 2 do<italic id="italic-4f07c9c1c95cfb886856f958f0cc2f7f"> PORCUFORT</italic>, em vários momentos, a equipe defrontou-se com o seguinte problema: como lidar com a tensão entre a transparência e o sigilo? Partindo da experiência com o <italic id="italic-8fd0c18d39aeeb49413aeddb66de0377">PORCUFORT</italic>, algumas estratégias para minimizar este problema, já previstas na literatura sociolinguística, foram adotadas, tais como:</p>
      <p id="paragraph-a18cc0686411ef5e79dc5dd8843cba45" />
      <p id="paragraph-df9adbfc65ae1d2bde9204cc68e5f273">- não revelar, de imediato, a real motivação das entrevistas; </p>
      <p id="paragraph-2cdc6d1328eba967c2447ec62c4380d3">- mencionar que a pesquisa tem o objetivo de documentar a memória do fortalezense acerca de sua cidade, desfocando a atenção do entrevistado acerca de sua própria fala; </p>
      <p id="paragraph-5c1b1b9ad21842673b10bb50bb693855">- saber conduzir a entrevista (de forma descontraída, perguntas nunca formuladas antecipadamente, mas elaboradas de forma simples, clara e precisa); </p>
      <p id="paragraph-7a8b6d06aab2b3db9f373af6b0cbaefb">- instigar os entrevistados a falar de fatos de suas vidas que, de algum modo, os marcaram de forma positiva ou negativa; </p>
      <p id="paragraph-11">- usar gravadores que sejam não só potentes, mas também pequenos, portáteis, discretos e de fácil manuseio;</p>
      <p id="paragraph-12"> - fornecer ao documentador não só o Termo de Consentimento Livre e Esclarecido (TCLE), mas também uma carta de apresentação com assinatura e carimbo da pesquisadora responsável, além da assinatura do coordenador do curso de graduação do aluno voluntário ou bolsista; </p>
      <p id="paragraph-13">- solicitar do participante, no próprio TCLE, liberação do uso da entrevista para fins científicos e de estudos (livros, artigos e <italic id="italic-d0144f82005294661eae41479ffc1d27">slides</italic>), em favor dos pesquisadores, obedecendo ao que está previsto na Resolução 510/2016/CNS; </p>
      <p id="paragraph-14">- pedir ao entrevistado autorização, no TCLE, para que a interação fique disponível no banco de dados acima referido para ser utilizada em pesquisas futuras; </p>
      <p id="paragraph-15">- realizar a gravação no dia, local e hora da conveniência do participante; </p>
      <p id="paragraph-16">- apresentar-se como aluno perante o entrevistado, gerando empatia com o participante;</p>
      <p id="paragraph-17">- apresentar-se para o entrevistado como amigo ou conhecido de um familiar ou amigo/colega seu, promovendo aproximação entre o pesquisador e o participante; </p>
      <p id="paragraph-18">- garantir que o entrevistado pode inutilizar a gravação ao seu término ou durante a entrevista; - não permanecer no recinto onde a gravação está sendo realizada, o que dá maior liberdade de fala aos participantes, no caso das entrevistas do tipo D2.</p>
      <p id="paragraph-a07ed0669028474a1b485803da8973e5" />
      <p id="paragraph-19">No caso do <italic id="italic-7fcbfc8c77c0f477a5c9022c5eb39158">LínguaPOA</italic>, observar todos os critérios de amostragem revelou-se uma tarefa complexa, especialmente no que diz respeito à escolaridade, bairro por zona e idade: por exemplo, em centros urbanos como Porto Alegre, jovens apenas com nível fundamental de escolaridade tendem a habitar bairros periféricos e de baixa renda. Além disso, e provavelmente porque a equipe de pesquisadores acionou sua rede de contatos para recrutar participantes, apenas nos níveis médio e superior de escolaridade localizaram-se porto-alegrenses para preencher todas as células por grupo etário e gênero nos dois tipos de bairro em cada uma das quatro zonas. Esses fatos revelam, portanto, i) a não ortogonalidade entre escolaridade, zona e bairro por zona e ii) os limites impostos à amostra pelo recrutamento via rede de contatos dos pesquisadores. Mesmo assim, reforça-se a ideia de que o valor do <italic id="italic-495991df0a9836c159832e6dbc74a524">LínguaPOA</italic> esteja em sua comparabilidade com bancos de dados anteriores (<italic id="italic-8f6ecb4c31b1f3e4a16f26de43440e1b">NURC</italic>, <italic id="italic-d8491e8f4cfcc5d726f110ac9a3ad8c3">VARSUL</italic>) e em seu potencial para viabilizar a realização de análises de variação linguística e classe social. </p>
      <p id="paragraph-20">Em relação à tensão entre a transparência e o sigilo, apontamos aqui algumas estratégias tomadas frente a esse desafio: as transcrições das entrevistas do <italic id="italic-4a996a434184fa61e6a2a6963a54204a">LínguaPOA</italic> (com o <italic id="italic-ef0fda24415ae2be6fac71c0540b3107">software</italic> ELAN) e os respectivos áudios são anonimizados, ou seja, nomes de pessoas e de certos lugares que identificariam os participantes são trocados nas transcrições e silenciados nos arquivos de áudio, para atender a demandas éticas. Além das transcrições e áudios das entrevistas, compõem o acervo do <italic id="italic-6a3d7a14e0cf42f62de68e1ca7ebdc66">LínguaPOA</italic> os documentos referentes a cada participante – Termo de Consentimento Livre e Esclarecido, Ficha de Entrevista, Questionário Econômico, estes dois últimos disponibilizados em versão anonimizadas.</p>
    </sec>
    <sec id="heading-8b41659d173a0cd233aee7ee24d295e4">
      <title>3. Armazenamento, uso e reuso</title>
      <p id="heading-e78c2726b7d6ee2e89dd2f38a2faeaa3">As amostras referidas na seção anterior foram resultado de desenvolvimento de projetos de descrição linguística. Outras amostras, também constituídas pensando na replicabilidade, são geradas em projetos de outra natureza. É o caso do <italic id="italic-b95763535cc8b6f7d51e021e93e1b407">Banco de Dados Linguísticos Reci</italic>, compilado durante os anos de 2016 e 2017.</p>
      <p id="paragraph-aa68999f037232a479a8afaac3300e45">O <italic id="italic-d2cb3e279c8661dacd16016f00e290b2">Banco Reci</italic> é composto por entrevistas com 36 falantes do núcleo da Reserva Extrativista Cazumbá-Iracema, localizado no Acre, em uma amostra estratificada quanto às variáveis sociodemográficas sexo, escolaridade e idade. Além de ser uma das poucas amostras linguísticas da região Norte do país, ainda subdocumentada no que diz respeito às variedades do português, este banco de dados tem a peculiaridade de ter sido gerado como produto educacional, oriundo de uma pesquisa realizada no Mestrado Profissional em Ensino Tecnológico, do Instituto Federal do Amazonas (SILVA, 2017). Sua organização serviu como material de referência para a elaboração de uma proposta de ensino e aprendizagem dos paradigmas verbais, indicativo e subjuntivo da língua portuguesa, com ênfase no trabalho da variação linguística. Por tratar-se de uma modalidade profissional, a produção e aplicação dos conhecimentos são orientados para a prática e resolução de problemas, por meio do planejamento, implementação e avaliação de processos e produtos educacionais (BARROS; VALENTIM; MELO, 2005). Assim, o produto educativo deve ser utilizado “em condições reais de sala de aula ou de espaços não formais ou informais de ensino, em formato artesanal ou em protótipo” (BRASIL, 2013, p. 24-25). </p>
      <p id="paragraph-9087eb892b5c898d17b10dfba70e06de">Levando em conta a necessidade de uso e reuso do <italic id="italic-1e7a5812fa821a6320f53f35b15f27c8">Banco Reci</italic>, ampliando assim o acesso aberto, esse produto foi organizado em dois formatos: um <italic id="italic-ff196214280fe09581f5218973ab5d55">corpus</italic> oral e um escrito. A amostra oral possui cerca de 3h de gravações, digitalizadas e armazenadas eletronicamente, e conta com 36 falantes do núcleo da Reserva. O <italic id="italic-ebd703b7e5b3e70f9b8463912c566ca0">corpus</italic> escrito possui um acervo de 30.798 palavras, constituído por amostras de fala que foram gravadas, transcritas e, posteriormente, armazenadas eletronicamente. Posteriormente, a amostra foi compilada como uma versão do produto educacional em duas modalidades, restrita e irrestrita. Na modalidade restrita, em formato de DVD, há fichas técnicas específicas, contendo informações relevantes sobre o produto e permitindo consultas na biblioteca da instituição. </p>
      <p id="paragraph-8f26b93f5008a4d252b59cd5a269cd43">A outra versão do produto, de modalidade irrestrita, teve como objetivo principal ampliar a reutilização dos dados linguísticos em contextos de ensino e aprendizagem de Língua Portuguesa, de forma que o reuso desse produto educacional possa suscitar novas práticas pedagógicas, baseadas no fomento à utilização de dados reais. Para tanto, essa base foi transcrita, mantendo-se o anonimato e substituição dos nomes dos entrevistados e então disponibilizada no repositório institucional em formato de um produto educacional, com reconhecimento de produção técnica e de autoria pelos organizadores<xref id="xref-2f394d222cd3c7c40aeca84242e2f9ce" ref-type="fn" rid="footnote-505fef96a09ce59d9d09dd03f0baacac">2</xref>. (SILVA, R; COELHO, 2018)</p>
      <p id="paragraph-ed1476e2f34c6ba58cfb3df132fb8e22">Para ampliar a visibilidade, o impacto e o reuso, por meio do acesso aberto, esse e outros produtos que foram gerados a partir da pesquisa encontram-se disponíveis no <italic id="italic-76e83e48d6bc68f71a5a0ccb9ab616c0">site:</italic> <ext-link id="external-link-15cde2366e1f86f5366e76ba99c6cdfc" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">http</ext-link><ext-link id="external-link-3" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">://</ext-link><ext-link id="external-link-4" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">ppget.ifam.edu.br/dissertacoes-defendidas</ext-link><ext-link id="external-link-5" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">/</ext-link>. Essa prática de compartilhamento público e aberto da amostra escrita compilada, desenvolvida e validada em formato de produto educacional, teve como objetivos: i) servir como fonte para a elaboração de processos e produtos didáticos relacionados ao ensino e aprendizagem de fenômenos da Língua Portuguesa; ii) contribuir para estudos descritivos da variação linguística, no âmbito das línguas naturais; iii) fomentar propostas diferenciadas de ensino e aprendizagem da Língua Portuguesa, inserindo no contexto de sala de aula novas possibilidades educativas com o uso de bancos de dados; iv) potencializar a preservação e a salvaguarda da realidade linguística brasileira e os aspectos sociais que a circunscrevem e v) constituir e ampliar os bancos de dados linguísticos com populações tradicionais.</p>
      <p id="paragraph-fb9957e9152905ab45ef8f34a5c6680a">Entre esses objetivos, leva-se em conta o efetivo trabalho com dados autênticos, ressaltando não apenas o potencial uso de dados linguísticos nas práticas de ensino e aprendizagem, mas a importância das variedades linguísticas e de aspectos como a valorização da região amazônica, com destaque especial para a relação estreita que há entre os povos tradicionais e o ecossistema Amazônico e a vinculação da população que habita tradicionalmente esse diverso ecossistema, evidenciando a representatividade de grupos sociais específicos.</p>
      <p id="paragraph-184d78803fb9604157bfba7ebd571ae1">Apesar de não terem sido concebidos como produtos, como a amostra <italic id="italic-405686eadd6bd2d2348fbd2934a10ddf">Banco Reci</italic>, cuidados com reuso e autoria são presentes na gestão de dados decorrentes de coletas aos moldes sociolinguísticos, como o <italic id="italic-dabea22dcfff00d194cc149fc03923db">PORCUFORT</italic> e o <italic id="italic-d379b999b24ec9e76c7da63ca755b7b6">LínguaPOA</italic>. Mesmo que via e-mail, é regra solicitar a autorização. </p>
      <p id="paragraph-08bc92b16c5fbf2b0433419b90f98ccb">Diferentemente do <italic id="italic-0cdb50bde5751d564b2f850b6d1eb5a4">Banco Reci</italic>, cujos produtos estão disponíveis no <italic id="italic-50d4e74c3890bd66d1a6f001f892e7a0">site </italic>da instituição de origem, o armazenamento de amostras como a do <italic id="italic-63e255d0ce93f82c0a65b2d3aaa80f8b">PORCUFORT</italic> e a do <italic id="italic-b4516b34c6f9ca7fb40ad2adc18a06c0">LínguaPOA</italic> é um desafio. Todo o material do <italic id="italic-1c2fb9bf61839a42ab4977d65da31167">LínguaPOA</italic>, assim como as demais amostras de dados linguísticos que conhecemos, vem sendo armazenado em <italic id="italic-f047ac389ce6d048e721299a8c4a5703">drives</italic> custeados e mantidos pelos próprios pesquisadores, já que suas instituições não possuem espaço, quer nas máquinas físicas, quer nas virtuais, para armazenar e disponibilizar a um grande público essas amostras. Vêm daí boa parte dos desafios enfrentados na gestão de acervos como o <italic id="italic-986caeb2360bfe77b48588e2487de1f3">LínguaPOA</italic> e por bancos de dados linguísticos em geral, o de manter e gerir os dados após a coleta e a realização dos primeiros estudos, diretamente vinculados à pesquisa dos responsáveis pelos projetos.</p>
      <p id="paragraph-5ed10e912174e46cf08166e632e8494e">Há questões relativas à salvaguarda (armazenamento e proteção/preservação) das amostras e ao acesso aos dados que requerem solução. Sem amparo institucional, acervos como o <italic id="italic-fe4cae190c4f4d147d9c371917102280">LínguaPOA</italic> e o <italic id="italic-fe345a0ac4a15bf6310e2277a4477b75">PORCUFORT</italic> podem ter seu uso restrito aos responsáveis e membros da equipe de pesquisa; sua preservação pode estar condicionada a possibilidades e interesses individuais. Isso faz com que os dados, que deveriam ser públicos, tornem-se exclusivos a um certo grupo de usuários; e cria o risco de “desaparecimento” dos acervos em função, por exemplo, de alterações nas iniciativas dos pesquisadores responsáveis ou de fatos prosaicos como sua aposentadoria, por exemplo. Desvirtua-se, desse modo, o propósito original dos bancos: servir de fonte permanente de dados para pesquisa linguística ou afins, disponíveis a toda a comunidade de pesquisadores. </p>
      <p id="paragraph-12189c110f84cbd6a9266f5524694ddd">Os mesmos problemas e questões encontrados na constituição de amostras e bancos de dados de fala são uma constante em <italic id="italic-ca800c3f5c3552715d9083058face22d">corpora</italic> do português escrito em sincronias passadas: dificuldades de armazenamento, uso e reuso e livre acesso via rede mundial. Algumas amostras estão disponibilizadas na rede mundial, como as dos <italic id="italic-7dc356bf7ff687f7d5a9b65abb337e29">Projeto para a História do Português Brasileiro</italic> (<italic id="italic-7de6413be47eab6c663b8c2ac6bf2ce7">PHPB</italic>) (https<ext-link id="external-link-e43598faba9b5e1899fb210725ac7522" xlink:href="https://sites.google.com/site/corporaphpb/">://sites.google.com/site/corporaphpb/</ext-link>)<xref id="xref-af8471a3bcc587a40d8ec2a58d5f7bc5" ref-type="fn" rid="footnote-2435130b94eff541ac7a6eb2da2726e1">3</xref> e os projetos estaduais vinculados ao <italic id="italic-f571b5a4e24e892298d42c4f96db1d2b">PHPB </italic>nacional, incluindo o <italic id="italic-d14ecbff0ff886f2a81b26bf03ca8bce">Corpus do Laboratório de História do Português</italic> (<ext-link id="external-link-3b1d796ab08ed03252bbf663e2c84309" xlink:href="https://laborhistorico.letras.ufrj.br/">https://laborhistorico.letras.ufrj.br/</ext-link>) coordenado por Célia Lopes na UFRJ; <italic id="italic-fe85ba3c6ed9a1093af891eedf2dafff">Programa para a História da Língua Portuguesa</italic> (<italic id="italic-2e33ae325b11792ead7b2b1da73650df">PROHPOR</italic>) (<ext-link id="external-link-7b988008915978881c4dce7e774248e5" xlink:href="https://www.prohpor.org/bit-prohpor">https://www.prohpor.org/bit-prohpor</ext-link>); <italic id="italic-090b42c55aaf4930198a751efb91897e">Corpus Eletrônico de Documentos Históricos do Sertão (CE-DOHS)</italic> (<ext-link id="external-link-7859187c8b8a300dd3b52d7f6413e6f8" xlink:href="http://www.tycho.iel.unicamp.br/cedohs/corpora.html">http://www.tycho.iel.unicamp.br/cedohs/corpora.html</ext-link>); <italic id="italic-b54f313bcd1930ad9b043961b595a157">Corpus Histórico do português Tycho Brahe</italic> (<ext-link id="external-link-6" xlink:href="http://www.tycho.iel.unicamp.br/corpus/">http://www.tycho.iel.unicamp.br/corpus/</ext-link>) (e essa não é uma lista exaustiva, naturalmente).</p>
      <p id="paragraph-f1627fe4f68c40b596b85a48769b4be3">Desses <italic id="italic-7355c50362a271b92291ffbf9592b5b4">corpora </italic>históricos, é importante destacar a relevância e pioneirismo do <italic id="italic-08b7c114f84b7beb5ae3bebde5971c51">Programa para a História da Língua Portuguesa (PROHPOR)</italic>, atualmente sob a coordenação de Tania Lobo, que foi fundado em 1990 e permaneceu por muitos anos sob a coordenação de Rosa Virgínia Mattos e Silva, na Universidade Federal da Bahia. Além do <italic id="italic-c43d58d14944fb2cc5f568edba83c1f6">PROHPOR</italic>, outro importante projeto desenvolvido em universidades na Bahia, para documentação de textos históricos do português escrito no Brasil, é o <italic id="italic-69164f7d9a351e2116f857382774c5d2">Corpus Eletrônico de Documentos Históricos do Sertão (CE-DOHS)</italic>, em Feira de Santana/BA, coordenado por Zenaide Carneiro e Mariana Oliveira.</p>
      <p id="paragraph-1e768df1074e53353d0a56cb93e97083">O <italic id="italic-40b0620a1b5f91935a6856cf97649cd5">Corpus histórico Tycho Brahe, </italic>fruto de um importante projeto coordenado por Charlotte Galves, está anotado sintaticamente com textos em português escritos por autores diversos nascidos entre 1380 e 1881 (<ext-link id="external-link-7" xlink:href="http://www.tycho.iel.unicamp.br/corpus/">http://www.tycho.iel.unicamp.br/corpus/</ext-link>). A plataforma desse <italic id="italic-51f1a6ff3a5e63e7c07eb6d5610b7f65">corpus</italic> permite realizar buscas de estruturas sintáticas automáticas em grande quantidade de dados nos textos que estão anotados via programa <italic id="italic-cfbb2aca7d51282a3b84c7764b99082a">E-Dictor</italic>, desenvolvido pelos pesquisadores do projeto Pablo Faria, Fábio Kepler e Maria Clara Paixão de Sousa.</p>
      <p id="paragraph-48d97244aaa558a5cead569bf7aa5d85">O <italic id="italic-2d8bc975f4755eaa458bfc20d24a7bde">corpus </italic>em elaboração pelo projeto <italic id="italic-aac7d4d4fa14daf00ed6ac8d15c0503a">PHPB</italic> disponibiliza textos impressos e manuscritos escritos no Brasil dos séculos XIX e XX com livre acesso. De acordo com Barbosa (2019, p. 18), a plataforma <italic id="italic-dd9d7098afa9827adcd51597d7c1627d">PHPB</italic> apresenta “uma sistematização de todos os materiais editados pelos membros do Projeto até o Censo de <italic id="italic-29">corpora do PHPB</italic> em junho de 2010”. </p>
      <p id="paragraph-5fbb4b842c32c90a72ef5e6d2699c90b">Outro <italic id="italic-30">corpus </italic>de língua escrita é o <italic id="italic-31">PROCORP</italic> (<italic id="italic-32">Corpus de Redações do ProFIS</italic>), ainda em processo de compilação. Iniciativa de Ines Signorini e Rodrigo Esteves de Lima-Lopes, tem por objetivo a categorização e disponibilização das redações realizadas por alunos do ProFIS, um programa de integração universitária de alunos oriundos das escolas de Campinas e mantido pela universidade desde 2011. Quando compilado, o corpus oferecerá a possibilidade de estudar o trajeto de formação e letramento acadêmico, com ênfase na aquisição escrita, de centenas de alunos durante os dois anos que participam do programa.</p>
      <p id="paragraph-358cb60191597f061dda55b7abb0ff40">De um modo geral, esses <italic id="italic-beec9b8d3e535f2680349d1d1d74abbc">corpora</italic>, com livre acesso, como dito, disponibilizam textos em português escritos em diferentes períodos por autores portugueses e brasileiros (quando possível identificar os dados sociais) e estão organizados em gêneros textuais/discursivos vários. Mas um grande impasse para a pesquisa e coleta de dados linguísticos em número expressivo, na maioria desses <italic id="italic-e01fcc8dde055fa853c634861d839e3e">corpora</italic>, é que eles armazenam textos em arquivos *.doc ou *.pdf que podem ser baixados, mas não permitem uma busca rápida de dados específicos, sistematizada por gênero textual/discursivo ou período. A exceção desse modo de armazenamento dos textos são os <italic id="italic-97245f624dd8e1ec86051a4fb3bd5a29">Corpus</italic> <italic id="italic-709bf5556d50682db44505f311740e1d">Tycho Brahe</italic> e o <italic id="italic-71b00199323e05914873c7602bd541d9">DEDOHS</italic>, que estão sintaticamente anotados e são os únicos, dos aqui citados, que disponibilizam uma versão dos documentos editados em *.xml. A amostra do <italic id="italic-a9a989631cebebf2de32a2c0d7f044ee">PHPB</italic> é disponibilizada em arquivos, organizados em gêneros e regiões, que podem ser baixados e as buscas de dados devem ser manuais.</p>
      <p id="paragraph-a2aa3808c20db203343c95f955365388">Com o objetivo de elaborar e disponibilizar uma plataforma interativa, com programas de interface e ferramentas para busca e tratamento de dados de textos escritos em português no Brasil, em diferentes sincronias, o projeto <italic id="italic-6cd22bee4a33cc8c90979a84500caee9">PB-Corpus Histórico</italic> está sendo desenvolvido na Universidade Federal de Santa Catarina, em parceria com a Universidade de Colônia/Alemanha. O objetivo dessa plataforma é armazenar e disponibilizar textos escritos no Brasil no curso dos séculos XVIII a XXI de diferentes corpora, de modo que interfaces interativas e ferramentas operacionais permitam buscas de dados para estudos de diferentes fenômenos linguísticos. </p>
      <p id="paragraph-efa4ab3fc76bf2e81bad657fcb5b3265">Na organização da plataforma, buscam-se reunir materiais de diferentes gêneros textuais/discursivos: da esfera dos textos impressos de jornais: anúncios, cartas de leitores e cartas de redatores/editoriais; da esfera dos textos manuscritos: cartas privadas; e da esfera dos textos literários: peças de teatro. Os textos estão organizados por coleções que preservam as informações das fontes de onde foram extraídos os textos e estão dispostos em: (a) séculos, separados por intervalo de tempo de 50 anos (1701 a 1750; 1751 a 1800; 1801 a 1850; 1851 a 1900; 1901 a 1950; 1951 a 2000; e a partir de 2001); e isso permite uma pesquisa de dados que considere a data de publicação de cada texto individual ou a data de nascimento dos autores (quando for o caso de essa informação estar disponível); (b) regiões e Estados, e, até o momento, conta com textos do Sul – Rio Grande do Sul, Santa Catarina e Paraná; Sudeste – São Paulo, Rio de Janeiro e Minas Gerais; e Nordeste – Bahia, Pernambuco, Rio Grande do Norte e Ceará; Norte – Amazonas e Pará; e Centro-Oeste – Mato Grosso do Sul.</p>
      <p id="paragraph-126693ad7bbfe2bec4aeb1f1faeef9d5">O diferencial do <italic id="italic-ac46f30b57c5614d09abfbb93110f1df">PB-Corpus Histórico</italic> em relação às amostras citadas reside no fato de constituir uma plataforma de armazenamento que permite a interatividade no manuseio dos textos e buscas de dados linguísticos por sistemas de interfaces. Neste momento, em fase de testes, foi elaborado e implementado um programa de interface na Plataforma que permite a coleta de sentenças com pronomes clíticos, o que possibilita a coleta e categorização para análise de um número robusto de dados (MARTINS, 2020).</p>
    </sec>
    <sec id="heading-6fc63263875deca5c6e02137d1630409">
      <title>4. Perspectivas</title>
      <p id="heading-d5124d9d52daa60f52f2ce9cdd92bcbc">A gestão dos dados linguísticos é uma questão em aberto. O simpósio <italic id="italic-2b7b7f042a6c23565eec557d2d5afbae">Descrição linguística: gestão de dados linguísticos</italic> discutiu práticas e experiências em nível individual ou de grupos de pesquisa que, reunidas, indicam ações propositivas de natureza coletiva:</p>
      <p id="paragraph-480a18a3fb643f0d7b316085933e6b76" />
      <p id="paragraph-863e2407d6fbf2bfb8f3eb81fce61934">1) a criação de políticas específicas da área para a replicabilidade dos estudos; </p>
      <p id="paragraph-cd12a58e52f45c45d32975784dc28195">2) a adoção dessas políticas por programas de pós-graduação e periódicos; </p>
      <p id="paragraph-f4527171535e59a682244eab42cd6556">3) a criação e manutenção de repositórios de dados. </p>
      <p id="paragraph-6e63a1154f337e0b49a0f131e1061225" />
      <p id="paragraph-4385449a4cf0ae0cfc1d6ca4c46ce5f5">A primeira ação passaria por discussões de caráter abrangente entre as diferentes associações de pesquisa na área, de forma a construir padrões a serem seguidos pelos diferentes tipos de estudo, tanto qualitativo como quantitativo. A segunda refere-se à efetiva adoção dessas políticas pelos atores formadores de pesquisadores. A terceira trata da construção de repositórios e modelos de licença que permitam o compartilhamento dos dados. As associações de pesquisa teriam um papel seminal na execução dessas ações, por permitirem visualizar a abrangência e qualidade na distribuição dos dados.</p>
      <p id="paragraph-d1844f10fe698c0ec78d0ac4c63b2811">Acervos como o <italic id="italic-cf42bca08839c84886b3ee24e9d2ab9a">LínguaPOA</italic>, <italic id="italic-2ff53f0d8d8ab0851e61461345b3ace1">PORCURFORT</italic> e outros tantos precisam ser articulados, e organizados em uma forma de gestão consorciada. A um só tempo, essa articulação daria visibilidade aos bancos de dados linguísticos ora existentes no Brasil, salvaguardaria os dados e viabilizaria formas de acesso a eles, garantindo seu adequado uso por um número amplo de pesquisadores. Sabemos, no entanto, que iniciativas como essas certamente teriam implicações de ordem operacional com repercussão financeira (profissionais dedicados, equipamentos etc.).</p>
      <p id="paragraph-d65ba67e76856753222ed53070eea021">Um passo inicial rumo à gestão consorciada poderia ser providenciar o mapeamento dos bancos brasileiros de dados linguísticos, para traçar um panorama de quantos e quais são os bancos de dados existentes, e qual a natureza dos dados que os compõem. O resultado do mapeamento, por seu turno, seria divulgado nos sites das associações nacionais, como a ABRALIN e a ANPOLL, e internacionais, como a ALFAL, informando, de forma padronizada, as características gerais das amostras, os pesquisadores responsáveis e uma forma de contato. </p>
      <p id="paragraph-e0cfecbf4bdfdcb3467abfdef35d0c90">Com esse primeiro passo, seria possível sensibilizar os gestores de amostras linguísticas quanto às vantagens de ações articuladas. Além disso, essa ação<strike id="strike-through-1"> </strike>sensibilizaria todos os envolvidos – gestores dos bancos de dados e pesquisadores –<strike id="strike-through-2"> </strike>para o conjunto de práticas esperadas pela Ciência Aberta, como a disponibilização de dados com licenças de uso claras e acessíveis. Apoiado nesse primeiro passo, viria um segundo, necessário para viabilizar o armazenamento dos dados e sua disponibilização eletrônica: a elaboração de um projeto coletivo para obtenção de apoio financeiro junto a órgãos de fomento.</p>
      <p id="paragraph-f5fae3910c7fc340a58eff56b70a4513">Sabemos que a gestão consorciada é complexa e que as soluções para desafios pontuais de uso e manutenção dos dados poderiam ser mais facilmente encontradas pelas equipes locais. Mas a ação articulada dos responsáveis torna-se vantajosa para todos os bancos de dados linguísticos se considerada a circulação mais ampla do conhecimento. Para isso, precisamos dar um primeiro passo, aquele proposto aqui ou outro. Um passo que desencadeie acreditar na articulação dos bancos de dados como algo possível e positivo, tanto para os pesquisadores quanto para a sociedade.</p>
    </sec>
    <sec id="heading-384055e4dc08c222ac2e8f622e2aeb2b">
      <title>Referências</title>
      <p id="heading-b04d63c2b5eb2c15be050c5973378977">ABREU, R. N. Aspectos legais envolvidos na coleta de dados linguísticos. <italic id="italic-8583c9664997414f2c66cc2cbbeba9b9">In</italic>: Raquel Meister Ko. Freitag. (Org.). <bold id="bold-fec46afccab377b403e6bd2e3e439f1d">Metodologia de Coleta e Manipulação de Dados em Sociolinguística</bold>. São Paulo: Editora Edgard Blücher, 2014.</p>
      <p id="paragraph-e63c06e95bc8d498c144155427b71b2a">BARABÁSI, A.-L. <bold id="bold-61a106019b4a36094fdef62216799d2c">Linked</bold>: The New Science of Networks. Cambridge: Perseus Pub, 2002. </p>
      <p id="paragraph-b7513cc9777b2ed2563ae60947e8675c">BARBOSA, A. G. A Plataforma de <italic id="italic-fb61131fab82e728af66bd4a380d238b">corpora</italic> do PHPB: uma apresentação ad infinitum. In: CASTILHO, A, T de. (Org.) <bold id="bold-3">História do Português Brasileiro</bold> – corpus diacrônico do português brasileiro. São Paulo: Contexto, 2019, p. 16-67.</p>
      <p id="paragraph-8611232dc1007e66b3a058b99b3141ac">BARROS, E. C.; VALENTIM, M. C.; MELO, M. A. A. O debate sobre o mestrado profissional na Capes: trajetória e definições. <bold id="bold-4">Revista Brasileira de Pós-graduação</bold>, Brasília, v. 2, n. 4, p. 124-138, 2005. Disponível em: http://ojs.rbpg.capes.gov.br/index.php/rbpg/article/view/84/80. Acesso em: 7 mar. 2020.</p>
      <p id="paragraph-bef7aa6dc99a1d374243dff7261324ee">BIBER, D. Corpus-Based and Corpus-Driven Analyses of Language Variation and Use. <italic id="italic-0b7c62d16ea5bf0e464b69599125a866">In:</italic> HEINE, B.; NARROG, H. (Eds.). <bold id="bold-5">The Oxford Handbook of Linguistic Analysis</bold>. Oxford University Press, 2015, p.-193-224.</p>
      <p id="paragraph-04b0f415c1120a402c73e517bae7e390">BIBER, D.; CONRAD, S.; REPPEN, R. <bold id="bold-6">Corpus Linguistics</bold>: Investigating Language Structure and Use. Cambridge; New York: Cambridge University Press, 1998. </p>
      <p id="paragraph-d01773fa6b9a279390a46d14706eedc8">BRASIL. Ministério da Educação. <bold id="bold-7">Documento de área 2013</bold>. Brasília: Fundação CAPES, 2013. Avaliação trienal 2013. Disponível em <ext-link id="external-link-b3c89f5c36f2ae4c2b044d481f672039" xlink:href="http://capes.gov.br/component/content/article/44-avaliacao/4670-ensino">http://capes.gov.br/component/content/article/44-avaliacao/4670-ensino</ext-link> </p>
      <p id="paragraph-b8536b516851ace03a0244c859383ab9">BRASIL. Resolução do Conselho Nacional da Saúde nº 510, de 07 de abril de 2016. <bold id="bold-8">Diário Oficial [da] República Federativa do Brasil</bold>, Poder Executivo, Brasília, DF, 24 maio 2016. Seção 1, p. 44-46. </p>
      <p id="paragraph-ba92b7b9346c7b19d18a2b30d46248db">CALAMAI, S. FRONTINI, F. FAIR data principles and their application to speech and oral archives. <bold id="bold-9">Journal of New Music Research</bold>, v. 47, n. 4, 339–354, 2018. https://doi.org/10.1080/09298215.2018.1473449</p>
      <p id="paragraph-b83e115aecef0a4e8505e8ad120bd0c7">CAMERON, D.; PANOVIĆ, I. Computer-Mediated Discourse Analysis. <italic id="italic-72da3d400478738edffd5f24efe558aa">In</italic>: CAMERON, D.; PANOVIĆ, I. (Eds.). <bold id="bold-10">Working with Written Discourse</bold>. London: SAGE, 2014. p. 112–129. </p>
      <p id="paragraph-21">CARDOSO, P. B. O paradoxo entre a transparência dos dados e a privacidade dos informantes na gestão de dados linguísticos. <bold id="bold-11">Revista da ABRALIN</bold>, v. 19, n. 2, p. 1-9, 24 ago. 2020.</p>
      <p id="paragraph-23">CASILLAS, M.; CRISTIA, A. A step-by-step guide to collecting and analyzing long-format speech environment (LFSE) recordings. <bold id="bold-12">Collabra: Psychology</bold>, v. 5, n,1, p.1-21. DOI http://doi.org/10.1525/collabra.209</p>
      <p id="paragraph-25">CHILDS, B.; VAN HERK, G.; THORBURN, J. Safe harbour: Ethics and accessibility in sociolinguistic corpus building. <bold id="bold-13">Corpus Linguistics and Linguistic Theory</bold>, v. 7, n., p. 163–180, 2011. DOI http://doi. org/ 10.1515/CLLT.2011.008. </p>
      <p id="paragraph-27">EMIGH, W.; HERRING, S. C. Collaborative Authoring on the Web: A Genre Analysis of Online Encyclopedias<bold id="bold-14"> Proceedings of the 38th Annual Hawaii International Conference on System Science</bold>s, v. 4, 2005, Big Island, HI, USA, 2005. <bold id="bold-15">Proceedings […]. </bold>Big Island, HI, USA: IEEE, 200.5p. 99a-99a. DOI: 10.1109/HICSS.2005.149.</p>
      <p id="paragraph-29">FINARDI, K. R. et al. uma rodada de perguntas com os membros do grupo de trabalho Linguagem e Tecnologias (ANPOLL). <bold id="bold-16">Revista Linguagem em Foco</bold>, v. 12, n. 2, p. 1-31, 28 ago. 2020. DOI: 10.46230/2674-8266-12-3859.</p>
      <p id="paragraph-31">FREITAG, R. M. K. (Org.). <bold id="bold-17">Metodologia de coleta e manipulação de dados em sociolinguística</bold>. São Paulo: Editora Edgard Blücher, 2014a.</p>
      <p id="paragraph-33">FREITAG, Raquel Meister Ko. Dissecando a entrevista sociolinguística: estilo, sequência discursiva e tópico.  In: GORSKI, Edair; COELHO, Izete Lehmkuhl; DE SOUZA, Christiane Maria Nunes (Ed.). <bold id="bold-18">Variação estilística</bold>: reflexões teórico-metodológicas e propostas de análise. Florianópolis: Insular, 2014b, p. 125-141.</p>
      <p id="paragraph-35">FREITAG, Raquel Meister Ko. Sociolinguística no/do Brasil. <bold id="bold-19">Cadernos de Estudos Linguísticos</bold>, v. 58, n. 3, p. 445-460, 2016.</p>
      <p id="paragraph-37">FREITAG, R. M. K. <bold id="bold-20">Documentação sociolinguística</bold>: coleta de dados e ética em pesquisa. São Cristóvão: Editora UFS, 2017a. </p>
      <p id="paragraph-39">FREITAG, R. M.K. A dadidade (ou dadidão) do dado, <bold id="bold-21">Linguística Rio</bold>, v.3, n.1, p.1-10, 2017b.</p>
      <p id="paragraph-41">FREITAG, R. M. K.; MARTINS, M. A.; TAVARES, M. A. Banco de dados sociolinguísticos do português brasileiro e os estudos de terceira onda: Potencialidades e limites. <bold id="bold-22">Alfa</bold>, 56(3), p. 917-944, 2012.</p>
      <p id="paragraph-43">GABARDO, M.; LIMA-LOPES, R. E. DE. Ni una menos: ciência das redes e análise de um coletivo feminista. <bold id="bold-23">Humanidades &amp; Inovação</bold>, v. 5, n. 3, p. 44-58, 2018. </p>
      <p id="paragraph-45">GUTIÉRREZ, M. Participation in a Datafied Environment: Questions about Data Literacy. <bold id="bold-24">Comunicação e sociedade</bold>, v. 36, p. 37-55, 2019. </p>
      <p id="paragraph-47">GUY, G. R.; ZILLES, A. <bold id="bold-25">Sociolinguística quantitativa</bold> – instrumental de análise. São Paulo: Parábola Editorial, 2007.</p>
      <p id="paragraph-49">JOHNSON, R. B.; ONWUEGBUZIE, A. J.; TURNER, L. A. Toward a Definition of Mixed Methods Research. <bold id="bold-26">Journal of Mixed Methods Research</bold>, v. 1, n. 2, p. 112–133, abr. 2007. </p>
      <p id="paragraph-51">KING, G. Replication, Replication. <bold id="bold-27">PS: Political Science and Politics</bold>, v. 28, n. 3, p. 444-452, 1995.</p>
      <p id="paragraph-53">LABOV, W. <bold id="bold-28">Principles of linguistic change</bold> – Volume 1: Internal factors. Malden/Oxford: Blackwell, 1994.</p>
      <p id="paragraph-55">LABOV, W. <bold id="bold-29">Sociolinguistic patterns</bold>. Philadelphia: University of Pennsylvania Press, 1972.</p>
      <p id="paragraph-57">LIMA-LOPES, R. E. de; GABARDO, M. Ni una menos: a luta pelos direitos das mulheres na argentina e suas representações no Facebook. <bold id="bold-30">Revista Brasileira de Linguística Aplicada</bold>, v. 19, n. 4, p. 801–824, 2019. </p>
      <p id="paragraph-58">LIMA-LOPES, R. E. de. O Conservadorismo Como Ideologia: Contribuições Da Ciência Das Redes Para a Linguística Sistêmico Funcional. <bold id="bold-31">Letras</bold>, v. 28, n. 56, p. 43–69, 2018. </p>
      <p id="paragraph-60">LIMA-LOPES, Rodrigo Esteves de; PIMENTA, Izadora Silva. #MULHERESNOFUTEBOL: transitividade e avaliatividade na identificação de padrões sexistas. <bold id="bold-32">Revista Humanidades &amp; Inovação</bold>, v. 4, n. 6, p. 116-131, 2017. </p>
      <p id="paragraph-62">MARTINS, M. A. R. A plataforma PB-Corpus Histórico e uma investigação da ordem de clíticos e de sujeitos em jornais brasileiros oitocentistas. <bold id="bold-33">Revista Letras</bold>, v. 60, p.179-200, 2020.</p>
      <p id="paragraph-64">MCENERY, T.; HARDIE, A. <bold id="bold-34">Corpus Linguistics</bold>: Method, Theory and Practice. Cambridge: Cambridge University Press, 2012. </p>
      <p id="paragraph-66">MEIE, K. J. Replication: A View From the Streets. <bold id="bold-35">PS: Political Science and Politics</bold>, v. 28, n. 3, p. 456–459, 1995. </p>
      <p id="paragraph-68">MERCURI, K. T.; LIMA-LOPES, R. E. de. Discurso de Ódio Em Mídias Sociais Como Estratégia de Persuasão Popular. <bold id="bold-36">Trabalhos em Linguística Aplicada</bold>, v. 59, n. 2, p. 1216-1238, 2020. </p>
      <p id="paragraph-70">PAIVA, V. L. M. O. Reflexões sobre ética e pesquisa. <bold id="bold-37">Revista Brasileira de Linguística Aplicada</bold>, v. 5, n. 1, p.43-61, 2005. </p>
      <p id="paragraph-72">PRESTON, D. <bold id="bold-38">Perceptual Dialectology</bold>: nonlinguists’ views of Areal Linguistics. Dordrecht – Holanda /Providence: Foris Publications, 1989.</p>
      <p id="paragraph-74">SCOTT, J. <bold id="bold-39">Social Network Analysis</bold>: A Handbook. 2. ed. London/Thousand Oaks/Calif: SAGE Publications, 2000. </p>
      <p id="paragraph-76">SCOTT, J. <bold id="bold-40">What is social network analysis?</bold> London; New York: Bloomsbury Academic, 2013. </p>
      <p id="paragraph-78">SILVA, F. C. C.; SILVEIRA, L. O ecossistema da Ciência Aberta. <bold id="bold-41">Transinformação</bold>, v. 31, e190001, 2019. http://dx.doi.org/10.1590/2318-889201931e190001. </p>
      <p id="paragraph-80">SILVA, R. G. da; COELHO, I. M. W da S. <bold id="bold-42">Tutorial para o uso do banco de dados linguísticos RECI</bold>. 2018. 28 f. Disponível em: <ext-link id="external-link-d73e85a8deb1a559d7f3e972837e5e50" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">http</ext-link><ext-link id="external-link-05ee8fce7449751af85a828bca685d3f" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">://</ext-link><ext-link id="external-link-24fa14db7c236c950f9a2be8e4b8cab3" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">ppget.ifam.edu.br/dissertacoes-defendidas</ext-link><ext-link id="external-link-e00f561b50c08eca59d33d0263c98f65" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">/</ext-link>. Acesso em: 15 set. 2020.</p>
      <p id="paragraph-82">SILVA, R. G. da; COELHO, I. M. W. da S.<bold id="bold-43"> Banco de Dados Línguísticos RECI:</bold> corpus Oral, 2017, 1 DVD (218 min.43s) WAV. Disponível em: <ext-link id="external-link-f945b0e665a9d6ecc7c493e6397db87d" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">http</ext-link><ext-link id="external-link-135e36a158a0a64e7c0e05804a13cfa3" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">://</ext-link><ext-link id="external-link-8" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">ppget.ifam.edu.br/dissertacoes-defendidas</ext-link><ext-link id="external-link-9" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">/</ext-link>. Acesso em: 15 set. 2020.</p>
      <p id="paragraph-84">SILVA, R. G. da. <bold id="bold-44">Variação linguística na língua portuguesa</bold>: uma proposta de ensino dos modos verbais com uso de banco de dados linguísticos. Dissertação (Mestrado Profissional em Ensino Tecnológico) – Instituto Federal de Educação, Ciências e Tecnologia do Amazonas, Campus Manaus Centro, 2017. Disponível em: <ext-link id="external-link-10" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">http</ext-link><ext-link id="external-link-11" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">://</ext-link><ext-link id="external-link-12" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">ppget.ifam.edu.br/dissertacoes-defendidas</ext-link><ext-link id="external-link-13" xlink:href="http://ppget.ifam.edu.br/dissertacoes-defendidas/">/</ext-link>. Acesso em 15 set. 2020.</p>
      <p id="paragraph-3be7e69d35300ecb4066846ce3ae78ce">SILVA, R. G.; COELHO, I. M. W. da S. Banco de Dados Linguísticos Reci – <bold id="bold-661e0bb55d092f89c4a7f2c88e935af0">Corpus escrito</bold>: 30.798 palavras, 2017. DVD (PDF) Digital. Disponível em: https://drive.google.com/file/d/1YekKfpwDUZ23VMZG-mOqE1PWZmUmOQ_w/view. Acesso em: 15 set. 2020.</p>
      <p id="paragraph-6a55111894106eec1aab69105a5bb7af">SINCLAIR, J. <bold id="bold-12f0b010e3124b5077b106e4247fb2b0">Corpus, Concordance, Colocation</bold>. Oxford: Oxford University Press, 1991. </p>
      <p id="paragraph-364807dfda25eb92227e6ce1df73ff94">STUBBS, M. <bold id="bold-f367fe5f7441787506e11ae5b9f5e661">Words and Phrases</bold>: Corpus Studies of Lexical Semantics. Oxford; Malden: Blackwell Publishers, 2001. </p>
      <p id="paragraph-e19e43b8054fdd81b901428ec811f692">TARALLO, F. <bold id="bold-d41a073a212494e70968d2e249fe4a53">A pesquisa sociolinguística</bold>. 7.ed. São Paulo: Ática, 2006.<ext-link id="external-link-081f73d06c33604939ae10dddb006024"/></p>
      <p id="paragraph-2a8f6090b8b20d42079b22fe0b8c9e5a">VAN LEEUWEN, T. <bold id="bold-3a8e85626fbea54cbb34db65a923a180">Discourse and Practice</bold>: New Tools for Critical Discourse Analysis. Oxford: Oxford University Press, 2008. </p>
      <p id="paragraph-db557ab56d236a0d607f1cc34b9c0088">WATTS, D. J. <bold id="bold-bdab60ce3bb7675227ac43f36ea9f783">Six Degrees</bold>: The Science of a Connected Age. New York: Norton, 2003. </p>
      <p id="paragraph-35d41e11bc27aa87437b9c90c770e730">WATTS, D. J. The “New” Science of Networks. <bold id="bold-6db8f98e2ae347d80eb141112554c434">Annual Review of Sociology</bold>, v. 30, n. 1, p. 243–270, 2004. </p>
      <p id="paragraph-f2fed0cd80b5106521109bbe96601460">WILKINSON, M., et al. The FAIR Guiding Principles for scientific data management and stewardship. <bold id="bold-f4663543de5dd2db165751a96eb5bc9b">Sci Data</bold>, v.3, n. 160018, 2016. https://doi.org/10.1038/sdata.2016.18. </p>
      <p id="paragraph-774c22d205a3d90cacb06ea6284125b7">WOLFF, A. <italic id="italic-fc5ff0d9adbf0c65932668ce83069897">et al</italic>. Creating an Understanding of Data Literacy for a Data-driven Society. <bold id="bold-1838eac304c9eed3aead13e9bc493202">The Journal of Community Informatics</bold>. v. 12, n. 3, p. 9–26, 2016. </p>
    </sec>
  </body>
  <back>
    <fn-group>
      <fn id="footnote-f0ecd757fd7fc925aa874771fae4684f">
        <label>1</label>
        <p id="paragraph-06f6f820d598643591d92fdf66ddfbdc">Aqui, importantes métricas podem ser estabelecidas a partir das conexões e relações topográficas apresentadas pela análise de redes (SCOTT, 2013), as quais podem representar nossa assinatura social (WATTS, 2003).</p>
      </fn>
      <fn id="footnote-505fef96a09ce59d9d09dd03f0baacac">
        <label>2</label>
        <p id="paragraph-e455a9d665a6c1d0ef2a0a00cfcc516d">O corpus escrito pode ser acessado por meio do link: <ext-link id="external-link-1" xlink:href="https://drive.google.com/file/d/1YekKfpwDUZ23VMZG-mOqE1PWZmUmOQ_w/view">https://drive.google.com/file/d/1YekKfpwDUZ23VMZG-mOqE1PWZmUmOQ_w/view</ext-link></p>
      </fn>
      <fn id="footnote-2435130b94eff541ac7a6eb2da2726e1">
        <label>3</label>
        <p id="paragraph-a3ec522d6860c02c6ea54abb59266d24">É importante dizer que os <italic id="italic-c740e97e461ef4e142ba9b6491e8630d">corpora</italic> do PHPB não estão mais disponíveis na Plataforma, acesso em 25 de nov. de 2020.</p>
      </fn>
    </fn-group>
  </back>
</article>