なぜセグメント単位の機械翻訳は2026年に規制対象文書で失敗するのか

セグメント単位の機械翻訳は、1文を読み、翻訳し、次の文を読む前にそれを忘れます。チャットのメッセージなら、それで問題ありません。しかし40ページの取扱説明書、防衛入札、あるいは臨床安全性要約では、その忘却こそが欠陥です。1つの用語が3ページにわたって3通りに訳される、代名詞が誤った名詞を指す、禁忌の「しない」が抜け落ちる。どれも誤りには見えませんが、そのいずれもが監査で不合格になり得ます。
AD VERBUMは、まさにこの種の規制対象コンテンツのために、ISO 18587とISO 42001に基づき、認証を受けた専門家レビューを伴う文書単位・顧客チューニング型のLLM翻訳をEUホスト環境で運用する翻訳会社です。当社がこのワークフローを構築したのは、旧来のセグメント単位のエンジンが文書をまとめきれなかったからです。2026年、あなたのファイルを読むのは通知機関と調達当局であり、彼らは全体を読みます。
セグメント単位の機械翻訳が実際に行うこと
古典的なニューラル機械翻訳は、ファイルをセグメント、通常は1文ずつに分割し、それぞれを単独で翻訳します。エンジンは決定論的で、速く、安価であり、長年その取引は割に合っていました。代償はコンテキストです。セグメント47はセグメント12が何を決めたか知りません。ある機器のマニュアルがある箇所で部品を「リード」と呼び、エンジンが後で電池のそばで同じ語に出会っても、以前の選択を引き継ぐものは何もありません。
この設計は変わっていません。変わったのは代替手段です。大規模言語モデルは文書全体を視野に入れて翻訳するため、いま扱っている文は、それが置かれている段落によって形づくられます。
規制業務で問題になる誤り
セグメント単位のエンジンが規制対象ファイルに出会うとき、4つの失敗パターンが繰り返し現れます。
用語のドリフト。同じ管理対象用語が1つの文書内で3通りに出力され、レビュアーは2つの箇所が同じことを指しているのか判別できません。
リンク切れの参照。「4.2項参照」は残りますが、「それ」や「当該機器」が何を指すかは文の境界ごとにリセットされ、意味もそれにつれて曲がります。
無言の脱落と数値の取り違え。禁忌における否定語の欠落、あるいは6.0 mmを60 mmと読むことは、あらゆる流暢さのチェックを通過し、完璧に読めます。それでも単純に誤りです。
責任も記録もない。生のエンジン出力には、それに署名した名前のある人間がいません。それはISO 18587監査が最初に尋ねる事項です。
どれもスペルチェックには現れません。すべて、通知機関や調達担当者の前では高くつきます。

規制対象ファイルで誤りが効いてくる場所
言語義務は具体的であり、リスクも同様です。MDR第10条(11)および附属書I 23.1(d)により、取扱説明書とラベルは機器が提供される各加盟国の公用語で正確でなければならず、製造業者の品質システムはそれらを正確に保たなければなりません。IVDRは体外診断用医療機器に同じ義務を課します。取扱説明書の用語の取り違えは文体の問題ではなく、CEマーキングを遅らせることがあります。
防衛調達はさらに賭け金を上げます。指令2009/81/ECに基づく入札は適合マトリクスで評価され、1つの誤訳された技術要件が契約を失わせ得ます。誤ったファイルを誤ったエンジンに送れば、管理対象技術の電子的送信をそれ自体として移転とみなす規則(EU)2021/821第2条にも抵触しかねません。
なぜ文書単位のLLM翻訳がファイルをまとめるのか
文書単位のモデルは文をまたいで読むため、1つの用語を1ページ目から40ページ目まで一貫して保ち、「それ」が何を指すかを解決できます。研究もこれを裏づけます。2023年の研究は、大規模言語モデルが文書単位のコンテキストを用いて、文単位のシステムに比べて誤訳や不整合を減らす一方で、重大な誤りは依然としてすり抜けると報告しました。まさにこの最後の一節が、人間を工程に入れる論拠のすべてです。モデルは一貫した下書きを渡します。署名済みの成果物は渡しません。

規格は消えていない:ISO 18587
ISO 18587は、機械翻訳出力の完全な人手ポストエディットの要件を定め、ポストエディターが備えるべき力量を挙げます。生の出力が旧来のエンジンからかLLMからかを問わず適用されます。2026年10月に予定される改訂はそれを明確にし、機械翻訳、AI生成出力、ポストエディット作業の間により明確な線を引き、人手翻訳のISO 17100とより緊密に整合させます。
EU AI法(規則(EU)2024/1689)は透明性の層を加えます。2026年8月2日から、第50条はAI生成コンテンツをそのように表示することを求めます。規制対象の翻訳では、ワークフローのAI工程を隠すのではなく文書化しなければならないということです。
AD VERBUMでの運用方法
当社AD VERBUMは、空のエンジンではなく、お客様の翻訳メモリと用語ベースから始めます。当社のLangOps Systemは、その用語に限定した顧客チューニング型オープンウェイトモデルで出力を生成し、認証を受けた専門家翻訳者がISO 18587に従ってポストエディットを行い、パイプライン全体はISO 27001およびISO 42001認証を受けた、公開クラウドを経由しないEUホスト環境で稼働します。それが、速い下書きと、あなたが弁明できる文書との違いです。
当社の機械翻訳・LLM翻訳サービス
規制対象分野向けの当社翻訳サービスは、コア処理に公開クラウドツールを用いず、ISO 27001およびISO 42001認証を受けたEUホスト環境で稼働します。すべてのプロジェクトは当社のAI+HUMANハイブリッドワークフローを通ります。まずお客様の翻訳メモリと用語ベースを取り込み、当社独自のLLMベースのLangOps Systemが顧客チューニング型オープンウェイトモデルで顧客用語に制約された出力を生成し、認証を受けた専門家が技術的正確性と規制順守をレビューします。当社のQAはISO 17100およびISO 18587に整合し、必要に応じてISO 18587のポストエディット規律とISO 42001のAIマネジメントガバナンスを適用します。当社はライフサイエンス、法務、金融、防衛、製造の各分野のお客様に、150以上の言語と3,500人超の専門翻訳者で対応します。監査に敏感なコンテンツを扱うチームは、お問い合わせいただき、セキュリティおよびコンプライアンス要件を直接ご相談ください。
FAQ
セグメント単位の機械翻訳が規制対象文書に許容されることはありますか。
粗い初稿を作ることはできますが、それ単体では許容される成果物ではありません。ISO 18587は、最終テキストの責任を負う有資格の言語専門家による完全な人手ポストエディットを求め、MDR第10条(11)は公開される言語版が正確であることを求めます。生のセグメント単位の出力はいずれも満たしません。
NMTとLLM翻訳の違いは何ですか。
ニューラル機械翻訳は、より広い文書の記憶を持たずにセグメント単位で処理します。大規模言語モデルは文書全体をコンテキストに入れて翻訳し、用語と参照を一貫して保ちます。LLM出力も、規制対象ファイルで使用する前にISO 18587に従うポストエディットが必要です。
EU AI法は機械翻訳に適用されますか。
はい、その透明性規定を通じて適用されます。規則(EU)2024/1689第50条により、2026年8月2日から適用され、AI生成またはAI支援のコンテンツはそのように表示しなければなりません。LLMを用いる規制対象の翻訳ワークフローは、その工程を文書化しなければなりません。
医療機器の取扱説明書の言語はどの規則が定めますか。
MDR第10条(11)は、附属書I 23.1(d)と併せて読むと、機器が提供される各加盟国の公用語での取扱説明書とラベルを求めます。IVDRは体外診断について同等の義務を定めます。製造業者の品質システムがそれらの版を正確に保たなければなりません。
防衛入札に公開の機械翻訳ツールを使ってよいですか。
使うべきではありません。指令2009/81/ECに基づく入札は正確性で評価され、管理対象の技術データを公開エンジンにアップロードすることは、管理対象技術の電子的送信を許可の要る移転として扱う規則(EU)2021/821第2条に抵触し得ます。代わりに、管理されたインフラ上で審査済みの言語専門家を使ってください。
機械翻訳されたテキストの誤りには誰が責任を負いますか。
ISO 18587では、最終翻訳の責任を負うのはエンジンではなく、有資格の人手ポストエディターです。まさにその名前のある責任こそ、規制対象の購買者が生の機械出力ではなく認証されたポストエディットプロセスを求める理由です。


