metadata- 撮影日時2018-03-10 14:05
- 位置Mapillary の補正位置GPSの値との差 3.7m
- カメラの向き151°
- 写真1920×1080
写真の外の事実(撮影の記録)
市民が撮った東京の街路写真 1,914,490枚を、AIが1枚ずつ読み、通りや町丁目にまとめ、年ごとに比べて公開しています。どこまでが撮影の記録で、どこからがAIの推定か。読み違いをどう扱っているか。9つの図で、順に説明します。
図の数字と実例は、本番のAPI(release 2026-09-13-r1)と、公開している資料から取っています。
写真は、市民や事業者が撮影して Mapillary に公開したものです(CC BY-SA 4.0)。東京都全域から、同じ場所・同じ向き・同じ年の写真を代表の1枚に絞り、1,914,490枚を読みました。
| 撮影年 | 枚数 |
|---|---|
| 2013年以前(1986〜2013年) | 3,660 |
| 2014年 | 2,198 |
| 2015年 | 7,619 |
| 2016年 | 67,330 |
| 2017年 | 69,432 |
| 2018年 | 176,355 |
| 2019年 | 220,163 |
| 2020年 | 187,194 |
| 2021年 | 254,972 |
| 2022年 | 253,694 |
| 2023年 | 272,682 |
| 2024年 | 159,434 |
| 2025年 | 150,318 |
| 2026年(集めた時点まで) | 89,400 |
代表の1枚は、ます目・向き・撮影年の組ごとに選びます。同じ交差点を別の年に撮った写真は別々に残るので、あとで年どうしを比べられます(07 時間)。
23区が約74%(1,408,888枚)、多摩が約24%(463,445枚)、島しょが約2%(37,935枚)。23区は過去の年の写真も含み、多摩・島しょは最新の年が中心です。撮影されていない道はデータになく、0件は「撮影がない」という意味で、「何もない」ではありません。
撮影年は1986〜2026年で、99.8%は2014年以降です。2013年以前の写真には、カメラの時計がずれたものが混ざっている可能性があります。どの記述も撮った時点の様子で、いまの状態ではありません。
出典: 公開データ release 2026-09-13-r1。区市町村ごとの枚数と撮影年の注記は Hugging Face のデータセット説明、撮影年ごとの枚数は同じ版のデータベースの集計(2026-09-17)から。
1枚の写真について、性質の違う3つの層を別々に持ち、別々に返します。どこまでが事実で、どこからがAIの推定かを、読む人の注意に頼らず、データの形で分けるためです。
1枚の写真ごとに、3つの層を別々に返します。APIでは include=metadata,machine,analysis で選べます(何も指定しなければ解釈の層だけ)。
metadata写真の外の事実(撮影の記録)
machine同じ入力なら、いつも同じ値
analysis読んだAI: クラウドVLM(gpt-5.6-terra)
層を分けておくと、食い違いに気づけます。 この写真の季節は、計算の層では「春」(3月の撮影なので)、解釈の層では「不明」。AIは写真から季節を決めきれず、埋めませんでした。
撮影の記録の側が間違うこともあります。カメラの時計がずれて、真昼の写真が23時台と記録されていた例があったため、時間帯は記録よりAIの見立てを優先しています。
写真の中に北は写っていません。AIには「右手前」のように画面の中の位置だけを書かせ、方角は撮影の向きから計算します(例: 右の電柱 → 南西)。
決まった手順なので、何度計算しても同じ値です。AIの「並木が続く」という記述と緑の割合がそろえば、記述の確からしさをデータの中で確かめられます。
人や車の数のように、すぐ変わるものは数えさせません。設備・構造・路面など、時間がたっても変わりにくいものを中心に書かせています。
どの写真を、いつの撮影で、どのAIが読み、どの版として公開したか。1,914,490件すべてに同じ形の名札を付けています。引用するときも、あとから確かめるときも、名札から元の写真まで遡れます。
gen2-qwen-local ・ 95.9%
クラウドVLM77,676gen1-codex ・ 4.1%
ローカルVLM: 自前のGPUで動かす Qwen系(Qwen3.8-27B・Qwen3.6-27B)。クラウドVLM: GPT系(gpt-5.6-terra・gpt-5.6-sol)。VLM は、画像を読むAIのことです。
snapshot(データの版)と license(利用の条件)が付くので、どの版に問い合わせた結果かを後から特定できます。撮影日時が1970年になっているなど、明らかに異常な39枚は、検索と集計から外しています。IDを指定すれば取り出せ、外した件数は /v1/meta で公開しています。
位置は、Mapillary が写真の重なりから計算し直した値を使い、それがないときだけGPSの値を使います。どちらを使ったかを1件ごとに記録しています(99%以上が計算し直した位置)。
AIは読み違えます。だから、AIへの指示の段階で「埋めない」ことを決めています。分からないことは分からないまま、写っていないことは写っていないまま返します。
数値には、根拠と確度を付けます。 車道の幅は「約3.2m・確度 低」。根拠は「中央走行部は普通車幅1.7〜1.8mの約1.8倍に見え、両側の緑色帯を除いた概算。」 物差しにした物を書かせ、測った値ではないことを確度で示します。
判断できない項目は「不明」のまま返します。ありそうだからと、写っていないものを埋めることはさせません。夜や逆光で評価できない項目は、評価できないと書かせます。
幅などの推定には、物差しにした物(普通車の幅、横断歩道の白線、ブロック塀の目地など)と確度(高・中・低)を必ず付けます。どれも画像からの推定で、測量の値ではありません。
駐車車両・コーン・工事などは、恒久的な物と分けて書きます。人や車の数は数えません。どの記述も撮影した時点の様子です。
使うときの約束(データの読み方より)。このデータは、いまの状態や安全性を判定するものではありません。
全件の正解を確かめることはできません。そこで、同じ写真を同じAI・同じ指示で2回読ませ、答えがどれだけ一致するかを項目ごとに数えました。これは正解率ではなく、読み取りの安定度です。
| 項目 | 一致率 | 補足 |
|---|---|---|
| 天気 | 98.1% | 晴・曇・雨など |
| 撮影手段 | 96.8% | 車・徒歩・自転車など |
| 舗装の種類 | 94.1% | アスファルト・ブロックなど |
| 道の種別 | 88.4% | 一般道路か、自動車専用道路か |
| 道の構造 | 85.6% | 平面か、高架・橋の上か |
| 通学路の標識 | 80.3% | あり・なし・不明 |
| 歩道の有無 | 75.3% | 左側。右側は76.8% |
| ひび割れの程度 | 72.1% | 「不明」と「該当なし」の行き来が多い |
| 車道の幅 | 57.3% | 数値が完全に一致した割合。差の平均は0.9m |
天気 98%・撮影手段 97%・舗装の種類 94%。道の種別や構造も 86〜88% がそろいます。
歩道の有無は 75%。食い違いの多くは「画角外不明」「不明」との行き来で、「ある」と「無い」が正反対に入れ替わったのは、左の歩道で 166枚(0.5%)でした。
車道の幅が完全に一致したのは 57%(差の平均 0.9m)。自由に書いた文章は、毎回ちがう言い回しになります。2回とも同じように間違えることもあるので、一致しても正しいとは限りません。
1枚ずつの読み取りを、通り(線)と町丁目(面)の単位に集め、その集計にあることだけを文章(カルテ)にしました。写真が少ない所には、文章を付けません。
1道に当てはめる写真を、交差点で区切った道(辺)に当てはめます。向きが合い、25m以内のものだけ。
2通りと町丁目にまとめる写真が15枚以上ある辺を、同じ名前・同じ区市町村でつないで「通り」に。町丁目は国勢調査2020の区域です。
3分母つきで数える率は「判定できた数」を分母にします。写っていない側は数に入れません(図は晴海通りの歩道)。
4書いて、照らし合わせる集計だけを渡して文章を書かせ、数値・年・固有名が集計にあるかを機械で確かめます。合わなければ書き直し。
| A | B | C | D(文章なし) | 合計 | |
|---|---|---|---|---|---|
| 通り | 1,394 | 936 | 1,233 | 2,685 | 6,248 |
| 町丁目 | 1,474 | 1,552 | 1,708 | 522 | 5,256 |
| 等級 | 通り | 町丁目 |
|---|---|---|
| A | 写真100枚以上・撮影の走行5本以上・延長の60%以上に写真 | 写真300枚以上・走行10本以上・車道の延長の40%以上 |
| B | 40枚以上・3本以上・40%以上 | 100枚以上・5本以上・25%以上 |
| C | 15枚以上・2本以上 | 30枚以上・2本以上 |
| D | C に届かない。文章は付けず、数値だけを返す | |
本番のAPIから: 通りのカルテ
区全体より幅の広い複数車線の車道が北西へ延び、両側に高層のオフィスビルやマンションが並ぶ通り。
判定できた1,906側のうち約98%に車道と分離された歩道があり、ひび割れはまれで、歩道通行可の標示や自転車の専用通行帯が写っている。無電柱化の率は約23%で、区全体より低い。
来歴: opus55-v12-xhigh・2026-09-24 / 被覆はA(2013〜2026年、写真1,739枚・走行121本、延長の100%)。
同じ場所の年の違う写真を比べ、「変わった」と言えるものを探します。視点が数メートルずれたり季節が違ったりするだけで変わって見えるため、いちばん読み違えやすい作業です。そこで、見つけた変化を別のAIセッションに崩しにいかせ、崩れなかったものだけを載せています。
1組にする同じ区間を、2年以上離れた年に撮った写真を組にします。向きが比べられるものだけ。
2違いを書き出すAIが2つの年を見比べ、変わった点を根拠つきで書き出します。
3崩しにいく文脈を分けた別のセッションのAIが、「本当に同じ場所か」「視点や季節の違いではないか」と反証を試みます。
4残す反証に耐えた変化だけを収録します。崩れたものと、判定できないものは載せません。
2022年の第3画像では、左手前の丸みを帯びた建物脇の交差点から交差点先にかけて、横断歩道・車線境界・進行方向矢印はいずれも白色で、青色の矢印状誘導表示は見当たらない。対応する2026年の第6画像では、同じ丸みを帯びた建物前の交差点内から進行先の車線に青色の矢印状表示が複数連続している。
AIが書いた根拠の原文(1件目)。位置は変化した物そのものではなく、道のまとまりの中心です。
この確かめ方の限界。見つける役と確かめる役は、同じ系列のモデル(gpt-5.6-sol)の別セッションで、独立した第三者の検証ではありません。系列に共通するくせは残りえます。94.8%は正解率ではなく、反証に耐えた割合です。どれも撮影年どうしの比較で、いまの状態を保証するものではありません。
どの入口も登録・APIキーは不要で、読み取り専用です。観測データは CC BY 4.0 で、AIの回答・アプリの表示・転記に出典は要りません。データとして配り直すときだけ出典を表示します。写真そのものは撮影者の CC BY-SA 4.0 です(出典・ライセンス)。
1つのIPから、APIは1分あたり300回、MCPは120回まで。稼働の保証(SLA)はありません。MCPのツールの説明には、答える前に「その場所にデータがあるか」を確かめる手順が入っています。
座標・通り・町丁目・経年変化を引ける REST API。OpenAPI の定義もあります。このサイトの画面も、同じデータで動いています。
APIリファレンス →Claude などのAIエージェントから、会話の中で街の様子を引けます。ツールは11個(被覆の確認・地点の描写・写真1枚・通り・町丁目・経年変化など)。
AIから使う →Hugging Face で Parquet 形式の一括配布。区市町村ごとのファイルで、3つの層と名札がそろっています。
Hugging Face ↗街路写真1枚を、見えたもの(観測)と推し量ったこと(解釈)に分けて書く、みちよみ専用のモデルを実験版として公開しました(2026-10-03、Apache-2.0)。いまの公開データは、これまでの本番の手順で作ったもので、OddEye では作っていません。
項目の意味、設計の考え方、知られている限界は、ドキュメントにまとめています。