对比赛方给出的任务进行分析——天池医疗对话意图识别
比赛背景
随着"互联网+医疗"的迅速发展,在线问诊平台逐渐兴起,在线问诊是指医生通过对话和患者进行病情的交流、 疾病的诊断并且提供相关的医疗建议。在政策和疫情的影响之下,在线问诊需求增长迅速。然而医生资源是稀缺的,由此促使了**自动化医疗问诊**的发展,以人机对话来辅助问诊过程。为了促进智能医疗咨询系统(Intelligent Medical Consultation System, IMCS),我们构建了 IMCS21 数据集,该数据集收集了真实的在线医患对话,并进行了多层次(Multi-Level)的人工标注,包含**命名实体**、**对话意图**、**症状标签**、**医疗报告**等,我们将该数据集接入2021中文医疗信息处理挑战榜_CBLUE_智慧医疗 - 阿里云天池评测平台,希望可以共同促进智能医疗、医学语言理解等领域的发展。
对话意图识别(IMCS-DAC) 任务:
任务定义
IMCS-MGR 任务的目标是自动从话语中 识别医生或者患者的意图,该任务的输入输出示例如下。
| Input(对话中的某个话语) | Output(意图) |
| 医生:你好,咳嗽是连声咳吗?有痰吗?有没流鼻涕,鼻塞? | Request-Symptom |
医疗诊疗对话意图识别挑战赛_学习赛_赛题与数据_天池大赛-阿里云天池的赛题与数据
IMCS-DAC_dev.json, 有 616 条数据
IMCS-DAC_test.json, 有 818 条数据
IMCS-DAC_train.json,有 1824条数据
数据样例:

标签分析
该数据集共包含16种对话意图,除了“诊断”和“其他”这两个特殊标签以外,剩余14种标签为“A-B”的分层形式,并且可以发现是A和B的笛卡尔积(指对两个集合或数据库表进行所有可能元素组合的运算)的形式。我们可以将这14种标签进行拆分:
将A称为意图标签,其有2个取值分别为“提问”和“告知”;
将B称为行为标签,其有7个取值分别为“症状”和“病因”等。
对于特殊标签来说,我们简单地将它们视为“诊断-诊断”和“其他-其他”,并分别放入A和B这两个集合中。

提交格式:
{
"example_id1": { # 测试集样本id
"sentence_id1": "Request-Symptom",
"sentence_id2": "Inform-Symptom",
...
},
"example_id2":{
...
}
...
}


评价方法:IMCS-DAC 任务采用准确率 Acc 作为评价指标,详细见文件 imcs21-cblue/task4/eval_task4.py at main · lemuria-wchen/imcs21-cblue · GitHub
基线模型:
| Model | Acc | Link |
| TextCNN | 0.7893 | imcs21-cblue/task4/DNN-DAC at main · lemuria-wchen/imcs21-cblue |
| TextRNN | 0.7846 | imcs21-cblue/task4/DNN-DAC at main · lemuria-wchen/imcs21-cblue |
| TextRCNN | 0.7949 | imcs21-cblue/task4/DNN-DAC at main · lemuria-wchen/imcs21-cblue |
| DPCNN | 0.7791 | imcs21-cblue/task4/DNN-DAC at main · lemuria-wchen/imcs21-cblue |
| BERT | 0.8165 | imcs21-cblue/task4/BERT-DAC at main · lemuria-wchen/imcs21-cblue |
| ERNIE | 0.8191 | imcs21-cblue/task4/BERT-DAC at main · lemuria-wchen/imcs21-cblue |
这个目录包含了用于对话行为分类(DAC)任务的 TextCNN、TextRNN、FastText、TextRCNN、BiLSTM_Attention 和 DPCNN 模型的代码。
使用Bert,ERNIE,进行中文文本分类
GitHub - 649453932/Bert-Chinese-Text-Classification-Pytorch: 使用Bert,ERNIE,进行中文文本分类
基线模型的作用包括:
- 提供基准性能: 基线模型可以提供一个问题的基准性能水平,即在没有使用复杂模型的情况下,系统或算法的性能如何。这有助于确保更复杂的模型确实提供了比基线更好的性能。
- 评估模型效果: 将更高级的模型的性能与基线模型进行比较,可以评估这些模型相对于简单方法的效果。如果一个模型不能明显优于基线模型,那么它可能并不是一个有效的解决方案。
- 简化问题: 在解决复杂问题之前,建立基线模型有助于简化问题。通过首先尝试一种简单的方法,可以更好地理解问题的本质,而不至于过早地陷入过于复杂的模型。
- 迅速验证概念: 基线模型可以帮助迅速验证问题的可行性。如果一个简单的模型能够取得令人满意的结果,那么可能不需要更复杂的模型。
- 指导模型选择: 通过了解基线模型的表现,可以更明智地选择适用于特定问题的更高级模型。这有助于避免在不必要的模型选择上花费过多的时间和计算资源。
参考资料:
https://zhuanlan.zhihu.com/p/501295857
更多推荐



所有评论(0)