Název: English Dataset For Automatic Forum Extraction
Další názvy: Anglický dataset pro automatickou extrakci diskuzních fór
Autoři: Sido, Jakub
Konopík, Miloslav
Pražák, Ondřej
Citace zdrojového dokumentu: SIDO, J., KONOPÍK, M., PRAŽÁK, O. English Dataset For Automatic Forum Extraction. Computación y Sistemas, 2019, roč. 23, č. 3, s. 765-771. ISSN 1405-5546.
Datum vydání: 2019
Nakladatel: Instituto Politecnico Nacional
Typ dokumentu: článek
article
URI: 2-s2.0-85076633364
http://hdl.handle.net/11025/36716
ISSN: 1405-5546
Klíčová slova: Extrakce informací;webové diskuze
Klíčová slova v dalším jazyce: Information retrieval;web discussion
Abstrakt: Tento článek popisuje proces sbírání a tvorby anglického datasetu pro trénování algoritmů pro automatickou extrakci informací z diskuzních fór. Dataset se skládá z ručně označených příspěvků skládajících se z jména uživatele, data publikování, textu příspěvku a citací/reakcí. Dataset obsahuje 79 rozdílných webových serverů s minimálně 500 stránek z každého. Každá webová stránka se skládá z struktury HTML tagů. Také jsou popsány prvotní experimenty se základními architekturami neuronových sítí a SVM.
This paper describes the process of collecting, maintaining and exploiting an English dataset of web discussions. The dataset consists of many web discussions with hand-annotated posts in the context of a tree structure of a web page. Each post consists of username, date, text, and citations used by its author. The dataset contains 79 different websites with at least 500 pages from each. Each web page consists of a tree structure of HTML tags with texts taken from selected web pages. In the paper, we also describe algorithms trained on the dataset. The algorithms employ basic architectures (such as a bag of words with an SVM classifier and an LSTM network) to set a baseline for the dataset.
Práva: Plný text je přístupný v rámci univerzity přihlášeným uživatelům.
© Instituto Politecnico Nacional
Vyskytuje se v kolekcích:Články / Articles (NTIS)
Články / Articles (KIV)
OBD

Soubory připojené k záznamu:
Soubor VelikostFormát 
Sido,Pražák 3259-6745-1-PB.pdf199,11 kBAdobe PDFZobrazit/otevřít  Vyžádat kopii


Použijte tento identifikátor k citaci nebo jako odkaz na tento záznam: http://hdl.handle.net/11025/36716

Všechny záznamy v DSpace jsou chráněny autorskými právy, všechna práva vyhrazena.

hledání
navigace
  1. DSpace at University of West Bohemia
  2. Publikační činnost / Publications
  3. OBD