
画像: Pexels
CrowdMath: クラウドソーシングされた数学研究討論のデータセット
ニュース概要
大規模言語モデルは数学的推論において大きな進展を遂げていますが、既存のベンチマークは最終答案、段階的な解法、または完全な証明といった確定的な問題を評価するのが一般的です。本研究は、参加者が部分的な議論を提案し、先行する段階の不備を特定し、不完全な推論を修正し、段階的な貢献を徐々に統合していくという、協調的なオープン問題解決のプロセスをとらえた新しいデータセット「CrowdMath」を紹介します。これはMIT PRIMES--Art of Problem Solving (AoPS) CrowdMathプログラム(2016-2025)から164個の専門家による注釈付きの進捗チェーンで構成されており、その討論は査読済み論文に至っています。各チェーンはオープン問題の陳述から完成した証明まで、複数の参加者によるフォーラム討論の過程を追跡しています。投稿は部分的進捗、証明の完成、誤った推論、誤りの特定を含む、進化する解答プロセスにおける機能的役割によってラベル付けされています。
ニュースタイムライン
2026年6月30日
臨床トレーニングのためのフランス語OSCE対話データセットと制御可能な仮想患者システムarXiv cs.CL
2026年7月1日
競合最適化による複数ソースデータセットからの支配的部分微分方程式の共同発見arXiv cs.LG
2026年7月3日
イオンセンス-QKG:リチウムイオン電池データセット発見のための量子対応メタデータフレームワークarXiv cs.LG
2026年7月7日
Amazon Quick SightのマルチデータセットTopicでデータセットを横断する統一セマンティックレイヤーを構築AWS Machine Learning Blog
2026年7月7日
Amazon Quick Sightのチャット機能における複数データセットのトピックベストプラクティスAWS Machine Learning Blog
記事AI質問チャット
PREMIUMこの記事についてAIが質問に答えます。背景・要約・影響まで深堀り。
ログインして利用関連記事
こんな記事も読まれています
この記事について疑問がありますか?
事実誤認や不適切な内容について通報できます (要ログイン)。
異議申し立て・通報










