文本生成评估指标，BLUE的缺点BLEU BLEU （Bilingual Evaluation Understudy，双

BLEU

BLEU （Bilingual Evaluation Understudy，双语评估辅助工具）可以说是所有评价指标的鼻祖，它的核心思想是比较候选译文和参考译文里的 n-gram 的重合程度，重合程度越高就认为译文质量越高。unigram用于衡量单词翻译的准确性，高阶n-gram用于衡量句子翻译的流畅性。实践中，通常是取N=1~4，然后对进行加权平均。

BLEU 需要计算译文 1-gram，2-gram，...，N-gram 的精确率，一般 N 设置为 4 即可，公式中的 Pn 指 n-gram 的精确率。
Wn 指 n-gram 的权重，一般设为均匀权重，即对于任意 n 都有 Wn = 1/N。
BP 是惩罚因子，如果译文的长度小于最短的参考译文，则 BP 小于 1。
BLEU 的 1-gram 精确率表示译文忠于原文的程度，而其他 n-gram 表示翻译的流畅程度。

不过BLEU对词重复和短句有着非常不好的表现，所以改进的BLEU分别使用 改进的多元精度（n-gram precision） 和短句惩罚因子进行了优化。

3. 优点

它的易于计算且速度快，特别是与人工翻译模型的输出对比；
它应用范围广泛，这可以让你很轻松将模型与相同任务的基准作对比。

4. 缺点

它不考虑语义，句子结构
不能很好地处理形态丰富的语句（BLEU原文建议大家配备4条翻译参考译文）
BLEU 指标偏向于较短的翻译结果（brevity penalty 没有想象中那么强）

ROUGE

英文全称Recall-Oriented Understudy for Gisting Evaluation，可以看做是BLEU 的改进版，专注于召回率而非精度。换句话说，它会查看有多少个参考译句中的 n 元词组出现在了输出之中。

ROUGE大致分为四种（常用的是前两种）：

ROUGE-N （将BLEU的精确率优化为召回率）
ROUGE-L （将BLEU的n-gram优化为公共子序列）
ROUGE-W （将ROUGE-L的连续匹配给予更高的奖励）
ROUGE-S （允许n-gram出现跳词(skip)）

ROUGE 用作机器翻译评价指标的初衷是这样的：在 SMT（统计机器翻译）时代，机器翻译效果稀烂，需要同时评价翻译的准确度和流畅度；等到 NMT （神经网络机器翻译）出来以后，神经网络脑补能力极强，翻译出的结果都是通顺的，但是有时候容易瞎翻译。

ROUGE的出现很大程度上是为了解决NMT的漏翻问题（低召回率）。所以 ROUGE 只适合评价 NMT，而不适用于 SMT，因为它不管候选译文流不流畅