1xBET

文本分析软件Leximancer支持的多说话职能

欢迎您接见环中1xBET!

Leximancer能够处置除了英语以表的其他说话的文本。当前软件支持的说话列在侧边栏中。

?

默认说话支持

英语, 丹麦语, 德语, 芬兰语, 希腊语, 西班牙语, 法语, 克罗地亚语, 印度尼西亚语, 意大利语, 马来语, 荷兰语, 波兰语, 葡萄牙语, 俄语, 塞尔维亚语, 瑞典语, 土耳其语

?

支持新说话

若是在所需说话中有明确的单词和句子分隔象征,Leximancer可能支持新说话。必须假造所需说话的常用术语的“停用词列表”(例如“和”、“the”、“but”等),以便将这些词排除在概想候选人的处置之表。

?

能够在统一Leximancer分析/地图中建模多种说话吗?

能够,但了局可能不是您所想要的。Leximancer不执行自动翻译,因而分歧说话中意思一样的两个概想在通例文本数据中不会自动归并。了局地图将拥有各自说话的大部门独立概想群集。您能够手动在说话之间归并主题概想,若是归并足够多,说话群集将归并。

?

1xBET·Signup(中国区)-官方网站

?

要在统一项目中映射来自多种说话的数据,您必须执行两项工作:

  • 在选择数据集时为每个数据集指定说话;
  • 对于每衷熹他说话,必须在停用词编纂器中加载停用词列表(使用顶部的“加载说话”按钮)。

?

为什么非英语说话文档的停用词依然存在于项目中?

要自动增长文档说话的停用词列表,应在将源文本文档增长到项目之前选择下拉说话列表中的说话。若是在运行项主张任一步骤之前未选择说话,则Leximancer将设置默认的停用词列表,通常为英语。停用词列表不会再进行自动更改。

?

要在项目运行任一步骤后增长新说话或更新特定停用词条款,应使用停用词列表编纂对话框D芄煌ü 按钮从文本处置设置对话框中使用此对话框D芄淮幽抢镌龀ば碌耐S么仕祷。编纂Leximancer项目停用词列表。

?

跨说话概想

有一种特殊的数据大局会自动发现跨说话概想,这可能很有趣。所需的数据称为逐字翻译 - 每个句子的一个说话中有该句子的翻译,紧接在其后。要处置此类数据,您必要创建一个特殊的多说话停用词列表,其中所有停用词在列表中共享一样的文字说话代码。

?

是否必要特殊版正本支吃熹他说话?

Leximancer内置了对多种说话的支持。

?

若何为文档选择说话?

将每个数据文件拖入文本选择面板时,必须为其选择说话代码。若是将鼠标悬停在列表中的代码上,您能够看到每种说话的全名。您可能必要更改字符集(字符编码)以及默认的utf-8。此字符编码是您数据的属性。

?

说话差距的特殊当苦衷项是什么?

使用非英语说话时有几个当苦衷项。以下是总结:

? ? 1、停用词删除

????2、大写单词

????3、词干提取

?

若何编纂支持的说话的停用词列表?

您能够在项目节造的预处置阶段设置中编纂停用词列表。您可能还必要增长到我们默认列表中的其他停用词。保留编纂后的停用词列表后,您能够再次打开它,并使用下载按钮将您建悔改的停用词列表保留到本地磁盘。您能够使用停用词编纂器中的上传按钮将其上传到其他项目中。

?

支持的说话有哪些?

当前支持的说话列表可在上方找到。目前无法与Leximancer一路使用没有 readily identifiable word spacing的说话(例如,中文)。

?

支持的字符集是哪些?

  • ISO-8859-1, ISO Latin Alphabet No. 1,
  • US-ASCII, American Standard Code for Information Exchange,
  • UTF-8, Eight-bit UCS Transformation Format,
  • WINDOWS-1252, Windows Western Alphabet,
  • MacRoman, Apple Standard Roman,
  • UTF-16, Sixteen-bit UCS Transformation Format, byte order identified by an optional byte-order mark,
  • UTF-16BE, Sixteen-bit UCS Transformation Format, big-endian byte order,
  • UTF-16LE, Sixteen-bit UCS Transformation Format, little-endian byte order,
  • WINDOWS-1250, Windows Eastern European,
  • WINDOWS-1251, Windows Cryillic,
  • WINDOWS-1253, Windows Greek,
  • WINDOWS-1254, Windows Turkish,
  • WINDOWS-1257, Windows Baltic,
  • ISO-8859-2, ISO Latin Alphabet No. 2,
  • ISO-8859-4, ISO Latin Alphabet No. 4,
  • ISO-8859-5, Latin/Cyrillic Alphabet,
  • ISO-8859-7, Latin/Greek Alphabet,
  • ISO-8859-9, ISO Latin Alphabet No. 5,
  • ISO-8859-13, ISO Latin Alphabet No. 7,
  • ISO-8859-15, ISO Latin Alphabet No. 9,
  • KOI-R, KOI8-R Russian
  • KOI8-R, KOI8-R Russian

?

?

有关文章?
更多文章 →

?

  • ?
查看Leximancer软件详情

热点资讯

2024-05-06 11:00
首页    技术文档    文本分析软件Leximancer支持的多说话职能
【网站地图】