直接回答
Deep Past Challenge - Translate Akkadian to English 适合AI、语言学、数字人文、Computer Science等专业。围绕低资源 Seq2Seq 与数据增强,可以形成文本清洗与数据审计工具、翻译基线及候选选择实验及可复查的实验记录。
比赛任务是什么?
训练语料少、文本有缺损和专名,古代文书的转写形式也不统一。项目需要清洗与对齐文本,训练 Seq2Seq 模型并评估隐藏句子的英文译文。
输入
- 古亚述语 transliteration 与训练英文译文
- 连字符、专名、大小写和缺损标记等文本信息
输出
- submission.csv:每个 id 一条英文单句翻译
- BLEU/chrF++、专名与缺损文本错误报告
用一个例子理解项目
输入:一条包含连字符、专名和 <gap> 的古亚述语转写。
输出:输出 id 对应的一条英文译文。
格式示意,没有虚构古语与标准译文配对;真正质量需用参考译文与专家检查评估。

评价指标与验证
DPI BLEU / chrF++
在全语料上计算 BLEU 与 chrF++,取几何平均;越高越好,同时检查词级与字符级重合。
固定数据划分、评估器版本和资源条件,记录基线与对照结果,并解释错误样本。
技术路线
- 审计
清洗转写和句对
保留专名与缺损标记,检查对齐质量。
- 基线
训练 Seq2Seq
固定验证集和文本规范化策略。
- 实验
比较数据增强
对比清洗、补充语料和候选生成。
- 评价
联合词与字符指标
记录专名、缺损和句子长度的错误。
适合专业与项目难度
古语转写与翻译连接语言学、数字人文;Seq2Seq 对应 AI/机器学习,语料清洗、对齐和评估对应计算机与数据科学。
为什么评为进阶?
需要处理低资源句对、转写规范、缺损与专名,训练生成模型并在离线 Notebook 时间限制下完成推理。
等级说明:需要专业建模方法、可靠验证或多个工程环节,并完成可解释的对照实验。
建议具备的基础
- Python 与文本处理
- Seq2Seq 训练/推理基础
- 语料划分与翻译评价
可以从哪里开始
先完成转写规范化、句对审计和小规模翻译基线,再增加数据增强与候选选择。
专业与难度由本站根据项目文档分析,面向基线复现与对照实验;具体门槛取决于承担的任务和项目深度。 这不是 Kaggle 官方评级。
可以形成的成果
- 文本清洗与数据审计工具
- 翻译基线及候选选择实验
- BLEU/chrF++ 与人工错误分析
- 双语示例、README 与数据来源说明
成果预览与验收方式
下面展示建议的成果结构,实际内容由本人运行、实验和整理后形成。
- 01读取数据与检查格式
- 02运行并记录基线
- 03完成一项对照实验
- 04整理 README、错误分析与贡献说明
本项目重点验收:submission.csv:每个 id 一条英文单句翻译;BLEU/chrF++、专名与缺损文本错误报告。
如何把公开方案变成自己的项目?
先注明来源与许可,再复现可运行基线,增加数据审计、方法对照和错误分析。README 应写清环境、数据、复现步骤、本人改动与局限;公开作者的分数和竞赛经历应单独归属。
- 如何验证低资源 Seq2Seq 与数据增强的实际效果?
- 如何验证转写规范化和句对对齐的实际效果?
- 如何验证专名、缺损标记与生成约束的实际效果?
留学、科研与求职如何使用?
留学申请
展示 AI 与语言、历史文献的交叉选题。
考研 / 科研
研究数据质量、专名保真和低资源泛化。
求职 / 作品集
展示文本工程、生成模型和可复现评价。
公开 Notebook、方案与讨论
以下入口来自项目文档中的公开资料,适合阅读和设计复现实验。
公开材料的运行环境、许可和作者结论请结合原页面复核。
- Geometric Mean of BLEU and chrF++ ↗
公开学习材料;运行条件和许可需复核,作者成绩不代表本站或用户成果。
- K-Ltepe tablets with Gemini Flash ↗
公开学习材料;运行条件和许可需复核,作者成绩不代表本站或用户成果。
- DPC A08 Inference RM ↗
公开学习材料;运行条件和许可需复核,作者成绩不代表本站或用户成果。
- Akkadian Translation Competition - Community Knowledge Synthesis ↗
公开讨论中的方法与经验;作者自报结论需通过自己的实验验证。
- Welcome to the Deep Past Initiative Machine Translation Challenge ↗
公开讨论中的方法与经验;作者自报结论需通过自己的实验验证。
- Insights from the Akkademia Codebase & PNAS Paper ↗
公开讨论中的方法与经验;作者自报结论需通过自己的实验验证。
- DPC 1st: Data Quality Dictates Everything ↗
公开讨论中的方法与经验;作者自报结论需通过自己的实验验证。
- 2nd Place: Data-Centric Akkadian NMT ↗
公开讨论中的方法与经验;作者自报结论需通过自己的实验验证。
- 3rd: Synthetic Data to Teach OA Fundamentals ↗
公开讨论中的方法与经验;作者自报结论需通过自己的实验验证。
- 训练 Notebook ↗
公开学习材料;运行条件和许可需复核,作者成绩不代表本站或用户成果。
常见问题
Deep Past Challenge - Translate Akkadian to English 项目适合什么专业?
古语转写与翻译连接语言学、数字人文;Seq2Seq 对应 AI/机器学习,语料清洗、对齐和评估对应计算机与数据科学。
Deep Past Challenge - Translate Akkadian to English 可以形成什么成果?
文本清洗与数据审计工具、翻译基线及候选选择实验、BLEU/chrF++ 与人工错误分析、双语示例、README 与数据来源说明;以本人实际运行、记录和能够解释的工作为准。
翻译看起来通顺就表示正确吗?
不一定。专名、数字、缺损和事实关系可能被改写,需要同时检查 BLEU/chrF++ 与具体错误样本。
如何从公开方案形成自己的项目?
先标明代码与数据来源,实际运行基线,再完成一项可复查的对照实验、错误分析和个人贡献记录。公开作者的分数不能作为自己的成绩。
公开来源与个人贡献边界
文档记录的历史状态用于项目规划,非实时赛事信息。数据、代码、模型许可及单场 Rules 以官方最新页面为准。本人贡献需有运行与实验记录,公开方案和他人成绩保留原作者归属。
Kaggle 官方竞赛与任务说明 ↗ · 赛题、数据、评估与状态以官方页面为准。
单场比赛 Rules ↗ · 复用数据、代码与模型前检查许可和适用规则。
规划适合你的项目深度
结合目标、专业、已有基础和时间,确定基线、对照实验与成果表达的范围。