华英网 Chinese in UK
生活The Independent· 媒体·

内政部在难民申请中使用的 AI 摘要工具准确率存疑,抽查显示错误率较高

AI tool used in thousands of asylum claims failing basic accuracy tests

内政部自今年四月在难民申请处理中推广使用名为 Asylum Case Summarisation(ACS)的 AI 工具以加快审核,但内部抽查发现摘要存在较高错误率:203 次初审中有 45 次(22%)不合格,56 次二次复审中有 30 次(54%)被评为不合格。

详细解读

内政部自四月开始向决策人员推广使用 Asylum Case Summarisation(ACS)工具,目的是通过自动为长达数十页的难民面谈记录生成摘要,从而缩短每案审理时间。内部文件显示,ACS 使用 GPT‑4 模型,政府在试点阶段曾估计该工具可使月均处理量达到 17,515 案,但实际运行期间平均每月约生成 7,000 份 AI 摘要,且是否采纳由决策人员决定。

官方对部分 AI 生成摘要进行了专家抽查。数据称共有 259 次由主题专家(Subject Matter Experts)进行的核查记录,其中 203 次为初审,56 次为复审。初审中有 45 次(22%)被判定不符合准确性标准,另有 19 次被标记为需进一步复核;复审中有 30 次(54%)被认定为不合格。摘要被判失败的理由包括“包含多个事实错误或歪曲”,或“与面谈实录事实严重不一致”,以及对案情无用等情形。

国会议员与慈善组织对在决定性、可能涉及生死的难民案件中使用存在明显错误率的 AI 表示担忧。多名议员要求内政部提供更多透明度,说明 AI 在难民决定中具体扮演的角色、有多少错误未被发现以及采取的纠正措施。民间组织如 Open Rights Group 指出,获取相关信息耗时且仍有矛盾与未公布的关键细节。

官方回应强调,难民决定仍由受训的决策人员作出,AI 工具仅为案员提供支持,并称决策者必须继续阅读全文档案。不过文中也提到,申请人在其个案被使用 AI 摘要时并未被告知。关于另一个名为 Asylum Policy Search(APS)的工具,内政部曾对其进行试点并停止了主题专家的抽查,但仍有其他周期性测试在进行。