NLP 输入流水线实验台
改变规范化与切分策略,观察同一段文字如何变成不同的模型输入。结果会随目标任务一起变化。
输入与处理决策
原始文本
可以保留 HTML、全角字符、标点和表情,看看每一步怎样处理。
<p>小王在上海的银行办卡。后来他说:“这里效率很高!”</p>
处理开关
清理标记
去除 HTML 标签,但保留正文。
Unicode 兼容规范化
把全角字母、兼容字符等折叠为常用形式;真实项目要先检查是否损失差异。
丢弃标点
分类可能受益,句界检测和语气分析却可能失去信号。
使用小词典做最长匹配
关闭后按单字切分,用来比较“词”边界的影响。
目标任务
实体抽取
情感分类
搜索匹配
运行流水线
恢复示例
逐层结果
0
句子
0
词元
0
未登录片段
为什么这不是固定配方?